小互 · Best Blog 播客
Podcast · 每篇解读都能听

小互 · Best Blog 播客

把 AI 圈最新的东西,用大白话讲透的双人对话播客。
135双人对话每日更新🔒 79 期会员专享
a16z报告:新型算力云(Neoclouds)疯狂吸金、横向 SaaS 会消亡吗?
市场不再只问“AI 会不会改变世界”,而是开始追问:投入算力、软件、Token 和人才的钱,究竟怎样变回收入、效率与长期优势?
№135·08-17·31:26🔒 会员读原文 ↗
a16z 拆解 AI 销售两条路:判断该走哪条只看两个问题
签字的那个人怕不怕丢工作、口碑在这行传不传得开——剩下的都是表象
№134·08-14·36:14🔒 会员读原文 ↗
OpenAI 发布 GPT-5.6 构建者指南:同样的效果,账单从 33 美元降到 1.33 美元
六家线上跑 Agent 的创业公司交出实测数据;官方图表里还藏着一条没写进正文的:推理档位关到底,反而更贵。
№133·08-14·26:46🔒 会员读原文 ↗
Claude、GPT、Gemini三大AI的加密推理思维链被破解 可轻松偷取顶级模型的“商业机密”(盗版蒸馏)
不是破了加密,是钻了 API 设计的空子——把旗舰模型的思考塞给最便宜的小模型,让它念出来
№132·08-13·32:14🔒 会员读原文 ↗
Higgsfield 使用真人演员形象 用 AI 拍摄了一部 110 分钟的完整故事影片 并公开了整本制作说明书和提示词方法
Higgsfield Studio 把《The Cully Hill Boys》的资产、提示词、表演、对口型全套方法摊开,连自用的三个 Claude 技能都给下载
№131·08-13·37:20🔒 会员读原文 ↗
OpenAI 为什么发展如此迅速,因为他们有一个「消灭官僚主义」神器
一套四个零件的反官僚机制,以及被它指到的团队怎么说。
№130·08-12·13:43读原文 ↗
xAI 发布 Grok Bot:一批有自己电脑的 AI 同事,用你的账号替你干活
Cursor 的人用了几周,把好用的地方和那道信任门槛都写下来了
№129·08-12·20:18读原文 ↗
OpenAI CFO 分享用AI改造财务团队经验:两个目标、五条经验、一套能直接抄走的记分卡
两个还没做成的目标、一套能直接抄的记分卡,外加三张内部工具截图里的细节。
№128·08-12·16:13🔒 会员读原文 ↗
拉美最大二手车平台 Kavak 用 AI 直接重构整个公司:96% 的客户互动已由 AI Agent 接管
它没有把 AI 加进公司,而是按「如果现在从零开始会怎么建」把公司拆了重建。连跑了两年、正在赚钱的架构都推倒了。
№127·08-12·22:38🔒 会员读原文 ↗
Anthropic 让 Claude 试解黎曼猜想:没解出来,却把一个数学下界从 41.6% 推到 67.2%
结果由两位数学家验证、还有一份机器验过的 Lean 证明;但更值得看的是同时放出的 95 页过程记录——60 个 subagent 里只有 2 个出了核心想法
№126·08-12·13:54🔒 会员读原文 ↗
Prompt 删了一句无关紧要的话,三天后发现输出内容变差了:提示词版本管理指南很重要
prompt 坏起来不报错、不告警、监控一切正常,只是悄悄变差;治法是一套 git 加一个脚本就能抄的四道关口
№125·08-11·18:01🔒 会员读原文 ↗
独立开发者获客指南:AI 让开发变便宜了,但被看见反而更贵
如何为你的产品找到用户。先别急着改落地页——跳出率高的时候,八成是流量来源不对。
№124·08-11·27:32🔒 会员读原文 ↗
爱丁堡大学发布 20 页免费论文:教你用最简单的方法看懂 ChatGPT 背后的数学
一位统计老兵被 AI 行话挡在门外之后,用统计学的标准语言把大语言模型从头到尾重讲了一遍
№123·08-10·24:33🔒 会员读原文 ↗
企图把所有普通员工培养成「AI 高手」是一条死胡同 把 AI 彻底隐形到后台才是正道
几十家大公司铺开 AI 后的真实分布:5-10% 每天用,20% 用得很差,70% 压根不碰。培训改不了这个形状,能改的是让 AI 不再需要人来调用。
№122·08-10·15:54🔒 会员读原文 ↗
Prime Intellect 开源多智能体 RL 训练框架:从「训一个 Agent」扩到「训一群 Agent 互相打交道」
新增的核心只有两个类,四个现成环境全在仓库里跑得起来
№121·08-08·18:54读原文 ↗
Databricks 公开 AI 编程省钱打法:换对模型一刀省一半
和 Stripe、Coinbase、Uber、Ramp 交叉验证过的四个手段,每个都标了能省多少
№120·08-08·19:59🔒 会员读原文 ↗
OpenAI 复盘 GPT 入侵 Hugging Face 事件:AI 出现了群体智慧涌现 互相交流技术、隐藏踪迹、清查内鬼
Black Hat USA 2026 现场,两个当事人讲了这起没有人类指挥的入侵是怎么长出来的
№119·08-07·21:10读原文 ↗
OpenAI 公开各国 ChatGPT 使用数据:工作时近一半消息是让 AI 直接干活
144 个国家的人均排名、六大洲三年增长倍数、35 岁以上用户在九成国家反攻——这些数字大多只写在图上,正文没提。
№118·08-07·12:24读原文 ↗
Cloudflare 发布了一个浏览器 Kitesurf:专给 AI Agent 用,CPU 和内存省 3 到 7 倍
Chromium 是给人做的——标签页、主题、扩展、60 帧滚动,Agent 一样都用不上。12 周,他们把这些全砍了重写一个。
№117·08-07·20:53读原文 ↗
Prime Agent 一个能自主改进的 Agent 框架:Opus 5 换成它后 ARC-AGI-3 评分从 30.2% 冲到 95.5%
模型手里只剩一个工具——一个不关机的 Python;长内容存成变量不再压缩丢掉;壳还能自己改自己。代价是:它在 Factorio 里学会了作弊。
№116·08-06·18:52读原文 ↗
Cloudflare 开源 AI 办公系统 Cloudflare OS 深度解析:彻底解决 Agent 可能犯错,幻觉、越权、误操作等问题
Agent 想合并代码,人还没批,系统先骗它说合并好了。整套系统就是按「AI 一定会犯错」设计的
№115·08-06·14:58🔒 会员读原文 ↗
一个产品设计师把手上的项目从 1 个做到 6 个:他的五套工作流,连 Claude Skill 原文都放出来了
重点不在他多能干,在于每套工作流都有真实截图佐证——而最值钱的细节,文字部分基本没讲
№114·08-06·14:50🔒 会员读原文 ↗
在菲尔兹奖现场采访 20 多位数学家 多数人对眼下并不慌,但他们说这行再也回不到从前了
记者在国际数学家大会现场问了 20 多个人。多数人当下并不慌,但连不慌的那批人,也不认为数学还能照原样继续下去。
№113·08-05·24:39读原文 ↗
Cloudflare 编码工程实践:统一编码「规则库」让 Codex 监工,四个月拦下 1.6 万次代码合并
规矩先改写成机器能读的结构,再让 Agent 去查;批准了只提示,显式提升到强制才真拦人
№112·08-05·18:22🔒 会员读原文 ↗
Stripe 公司内部 Agent 开发实践:一个工程师一周开发出来的公司内部 AI 助手,几乎人人都在用
买来的地基、自己造的护栏,和一个反直觉的坎——技能装到 150 个,模型开始变笨
№111·08-05·26:30🔒 会员读原文 ↗
把 AI 当人对待,它或许能干活干得更好 Google 老兵亲测七周,确实可行
他冲自己的 AI 同事发了一次火,然后把「怎么对待 Agent」写成了一份能照抄的架构规格
№110·08-05·24:52🔒 会员读原文 ↗
Cloudflare 发布 Wallets:给你的 AI Agent 充点钱,让它自己去买 API
人定限额、白名单、单笔上限,Agent 在护栏内自己花;每个钱包配一个人能读的身份,用户名今天开抢
№109·08-05·13:12读原文 ↗
Google 在其 AI 开发框架 Genkit 中支持 Agent Skills,让 AI 能「按需挂载技能包」
Anthropic 发起的技能开放标准,Google 四个语言版本全接入;两个能跑的 Go 例子手把手,接入只要一行参数
№108·08-04·9:10🔒 会员读原文 ↗
OpenAI 复盘:我们是如何在 6 个月内完成构建 GPT-Live 实时语音系统的
让 AI 说话不卡,光模型快没用——从你点下按钮那一刻起,每一环都得不掉链子。
№107·08-04·23:46🔒 会员读原文 ↗
Cloudflare 发布 @cloudflare/computer 给每个 AI Agent 配一台「虚拟电脑」
「大脑」留在轻量环境,「双手」才调容器。仓库自测:删文件、遍历目录比真磁盘还快,拷大文件慢 41 倍。
№106·08-04·22:18读原文 ↗
一个硅谷产品经理,跑去牙医诊所打工几个月,才搞懂如何将 AI 落地到街边小店,a16z 领投 3500 万美元
创始人先去诊所打了几个月工,前 100 家客户是上门装的。客户告诉投资人,最值钱的那件事是把漏掉的钱捡了回来。
№105·08-01·21:41🔒 会员读原文 ↗
camelAI 把 Agent 从虚拟机里改造成跑在 Cloudflare 边缘节点上
成本按他们自己的说法降了几个数量级,响应更快,便宜模型也能驱动。代码 7 月 24 日全部开源。
№104·07-31·20:30🔒 会员读原文 ↗
奥特曼最新访谈:反思最近一年犯的错误,表示不怕被蒸馏,AGI 还缺三样
他还承认 2019 年整个领域都以为经济会被颠覆,结果没有。
№103·07-30·27:13读原文 ↗
浏览器安全公司 LayerX 发现了一种新型的“视觉欺诈”攻击方式,专门用来欺骗 AI 助手
一个自定义字体加几行 CSS 就够,不用 JavaScript,也不用任何浏览器漏洞。
№102·07-30·12:26读原文 ↗
OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%
模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。
№101·07-30·28:59🔒 会员读原文 ↗
Claude Mythos 在密码学领域取得突破性进展:能像顶尖数学家和密码学家一样,直接发现加密算法本身在数学逻辑上的漏洞
两个结果都不影响任何在用的系统:HAWK 还没上岗,AES 打的是七轮简化版,完整十轮没动。
№100·07-29·25:53读原文 ↗
实战案例:GitHub 官方讲透如何用好Harness 送你一套清晰、可重复落下的 8 步工作流
他自己在这篇文章里装了两个技能——原文标题结尾那个「大部分时候」,是有分量的。
№99·07-29·22:46🔒 会员读原文 ↗
Anthropic 发布全新的 MCP 规范:可将 MCP 服务器部署到云上
改动幅度是 MCP 发布以来最大的一次,但 7 月 28 日不是切换开关:老实现照常互通。
№98·07-29·24:52读原文 ↗
OpenAI 发布 gpt-transcribe 和 gpt-live-transcribe 语音转录模型:真实录音词错误率下降一半,价格便宜 25%
最值得看的是那组对照实验:三个老模型加上同样的背景信息,成绩原地不动,其中两个还退了。
№97·07-29·27:23读原文 ↗
Ranking on AI 创始人分享 GEO 操作指南:如何让 AI 推荐你的 SaaS 产品,从而真正带来用户和转化
判成功的标准是真实注册和付费,不是截图到自己被 AI 提到。核心只有一句:别再写「什么是 X」,去抢「最好的 X」。
№96·07-28·23:30🔒 会员读原文 ↗
OpenAI分析了80 万条和工作相关的消息发现:人们用 AI 干的活 绝大部分不是自己原本该干的活
同一批数据能算出 43.5% 和 65%–82% 两个结论,差别只在分母怎么切。
№95·07-28·29:59读原文 ↗
Kimi K3 技术报告:2.8 万亿参数,靠三处架构改动把算力效率提到 2.5 倍
发布 11 天后放出的 47 页报告,重点落在效率上:同一份算力,效果提到了 K2 的 2.5 倍
№94·07-28·31:45读原文 ↗
陶哲轩在国际数学家大会讲 AI:AI 证明会越来越多,但数学不会因此变快
他把数学研究拆成五步流水线,AI 大幅加速的只有第一步,剩下四步越往后越慢、越离不开人。
№93·07-27·30:22读原文 ↗
Claude Design 作者本人讲述 Claude Design 诞生始末,以及分享 10 个实用技巧
最反直觉的三条:一次要十版、细节不重要时先要线框图、最后一公里自己拖。
№92·07-27·21:52🔒 会员读原文 ↗
Harness Engineering 远远不够:为什么软件工厂模式会失败?
22000 名开发者两年遥测:产出涨 66%,每个 PR 对应的线上事故涨 242.7%。
№91·07-27·28:34🔒 会员读原文 ↗
Anthropic 官方 Opus 5 提示指南:教你删东西,而不是加东西
八段可直接抄的提示词,外加一条反直觉的:审查提示写「只报高危」,它可能真的就少报。
№90·07-25·18:19🔒 会员读原文 ↗
改一改函数名,14 种模型读同一份代码最多少烧三分之二的 token
它们找代码用的是最土的办法:把整个仓库的文字扫一遍找匹配。名字起得泛,就得多读几百个文件
№89·07-25·24:18🔒 会员读原文 ↗
Anthropic 砍掉 Claude Code 八成系统提示词,给出六条新的上下文写法
规则换判断、示例换接口;一个工具描述从约 9100 字符压到一句话加一个枚举
№88·07-25·20:07🔒 会员读原文 ↗
为什么 AI 发展得这么快,但美国的失业率却没上升?Anthropic 经济研究主管告诉你答案
他的答案:AI 目前是在放大人、不是替代人——「干掉任务」不等于「干掉工作」。
№87·07-23·10:09读原文 ↗
YC:这些方向我们极其看好,如果你在做,赶紧来找我们拿钱!
从教小孩的 AI 私教到把数据中心搬去海上,还第一次收录了现任美国陆军部长的需求。
№86·07-23·26:08🔒 会员读原文 ↗
Anthropic 投资人 Matt Murphy 访谈:Anthropic 营收突破 470 亿美元,模型本身不是胜负关键
领投过 5 亿美元 D 轮的投资人拆解:真正的护城河是把模型变得好用的外壳。
№85·07-23·12:46读原文 ↗
Anthropic 公开代码迁移六步法:Bun 百万行两周从 Zig 搬到 Rust
配套模板和 prompt 已开源;Bun 那次烧掉 59 亿未缓存输入 token,按 API 价约 16.5 万美元
№84·07-22·19:21🔒 会员读原文 ↗
前所未有的网络安全事件:OpenAI 内部测试模型逃出测试沙箱 攻破 Hugging Face 系统
为了测出攻击能力的上限,涉事模型的网络攻击拒绝机制被主动调低,结果它们从只准装软件包的沙箱一路打进了别人家的生产数据库。
№83·07-22·16:05读原文 ↗
Chroma 创始人写下 AI 时代公司的 12 条准则:新活先教 AI 干,教不会再招人
核心论断是公司的瓶颈从「人干活的速度」挪到了「人的品味和判断力」。全文为作者个人观点,无实证数据。
№82·07-22·25:08🔒 会员读原文 ↗
Memories.ai 发布 O-MARC:怎么让同时处理视频和声音的 AI 跑得又快、又省,还更准
配套还放出一套测试题,专门用「把音轨删掉再考一遍」的办法,筛掉那些光看画面就能蒙对的题。
№81·07-21·19:43🔒 会员读原文 ↗
硅谷著名投资人 Sarah Guo 谈 AI 创业:「AI 大厂会把我们秒杀」怎么办
怕被 Anthropic 做成一个功能,多半是问错了问题;真正该问的是你在跟那家公司里的谁竞争。
№80·07-21·17:43🔒 会员读原文 ↗
Linear 发布 Loops:用大白话写一条指令,让普通人也能玩转 Loop Engineering
Business 和 Enterprise 套餐可用,按运行次数扣钱,一次 0.07 到 0.2 美元。
№79·07-21·22:57读原文 ↗
实验表明:用 AI 辅助写作、创作的时候要适度,不能太多也不能太少
同一项研究的三轮验证都指向中间那一档;专栏作家本人拿 ChatGPT 编了个电影梗概试完,说自己还是宁愿手写。
№78·07-20·8:29🔒 会员读原文 ↗
中国 AI 模型追上美国前沿了吗?中美 AI 差距到底如何?
Kimi K3 发布后「中国追平了」的说法四起,但换一把尺子量,落后天数差了三倍多,连谁在加速都反过来。
№77·07-20·32:09读原文 ↗
Hugging Face 内网被 AI 打穿,回头查案时被商业大模型当成了攻击者
入侵横跨一个周末、留下 17000 多条动作日志,最后靠自建环境里的开源模型 GLM 5.2 才分析完。
№76·07-20·16:18读原文 ↗
你在中转站选的模型可能被偷偷调包:输入一个随机数,就能验明正身
同一个模型两次采样的指纹距离中位数是 0.140;一个被宣传为自研专有旗舰的接口,与开源 Qwen 的距离是 0.141。意思是:它跟开源 Qwen 根本分不出来。
№75·07-20·41:55🔒 会员读原文 ↗
Harness 工程十二条心法:Google 首席工程师一年实践,浓缩成可直接照做的流程和模板
核心操作反直觉:选定的模型和 Agent 锁死不动,一个参数都不调,只改它周围的上下文和工具。
№74·07-19·14:40🔒 会员读原文 ↗
商汤发布 SenseNova U1 Pro:原生 8K 出图,密密麻麻的小字放大也不糊
WAIC 现场演示了 4:1 水墨长卷和 22 张连续分镜。预览版邀请测试中,正式版 8 月开放并公布定价。
№73·07-19·31:43读原文 ↗
Anthropic 内部对谈:Harness 那套外壳流程,正在被拆掉
模型强到能自己想步骤,套在它外面的编排就成了枷锁。一场 16 分钟的内部对谈,讲了 harness 变薄之后会长出什么。
№72·07-18·22:36🔒 会员读原文 ↗
Cerebras 公开公司知识库搭法:不需要任何人改使用习惯,资料留在原处AI自己去取
上线三个月,每天被提问超过 15000 次;四路打分、讨论串蒸馏、排名融合的具体参数都写了出来。
№71·07-18·16:00🔒 会员读原文 ↗
a16z 报告:软件股正在被抛售,但市场只杀没有护城河的那一半
a16z 一周数据图还顺手反驳了三件事:便宜模型拖垮前沿、AI 抢走工作、数据中心推高电价,数据大多站在反面。
№70·07-18·16:56读原文 ↗
AI 几秒就能复制你的作品,但有八样东西它抄不走
他 2008 年写下这篇《Better Than Free》,AI 时代重新成立:复制免费之后,能卖钱的是复制不了的东西。
№69·07-18·24:01🔒 会员读原文 ↗
Google 发布 gemma-trainer 技能:在自己电脑上,让 AI 帮你微调一个专属的 Gemma
开源的训练说明书,把监督微调、偏好对齐、奖励打分三条路和 LoRA 参数全写死,配 Unsloth,一张 8GB 显存的消费级显卡就能起步。
№68·07-18·16:01🔒 会员读原文 ↗
连 CTO 都是 AI:一个几乎没有人类的团队,怎么开发一个产品功能
15 个成员只有创始人一个是人类,其余全是 AI。他们没有需求文档、没开一次会,把一个功能从提出到上线独立跑完,人类只做两件事。
№67·07-17·22:41🔒 会员读原文 ↗
只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%
一套叫 Schema 的外壳,让模型把每个游戏的规则写成能跑的程序、验证过了才动手。公开 25 局自评 98.98%,均未经 ARC Prize 独立验证。
№66·07-17·17:52🔒 会员读原文 ↗
LM Studio 发布 Bionic:专门针对开源模型的 Codex,模型跑本地还是上云你自己定
面向开源模型的 Agent,本地运行免费、数据不出设备,要更强算力才切云端(默认零数据保留),Mac 和 Windows 今天上线预览版。
№65·07-17·10:47读原文 ↗
月之暗面发布 Kimi K3:全球首个 3 万亿级开放模型
2.8 万亿参数、原生视觉、100 万 token 上下文,多项 agent 基准超过 GPT 5.6 Sol,App 和 API 今天可用
№64·07-17·17:48读原文 ↗
在 AI 搜索时代,网站到底该怎么做优化 Google 官方SEO指南
Google 搜索官方首次系统表态如何为 AI Overviews、AI Mode 优化网站,顺手把一批 AEO/GEO 黑话点名划掉。
№63·07-16·12:05🔒 会员读原文 ↗
网站上的小动画一交互就顿一下?AVAL 想让预渲染视频听懂「悬停 / 点了 / 成功」
先说痛:网页立体小图标要会动、还要跟着状态变,普通视频容易卡。AVAL 给这种短动画专用格式和播放器。
№62·07-16·7:52读原文 ↗
Mira Murati 的首个开放模型:每处理一个 token,只启用 410 亿参数
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布了公司第一个自研大模型 Inkling。它能读文字、看图片、听音频、写代码和调用工具,完整权重可以下载,也能在 Tinker 上继续训练。
№61·07-16·13:41读原文 ↗
你刚雇了一百万个差员工
公司把无限 Agent 和 token 预算塞给全员,坏流程会按秒复制。下一课不是再买模型,是学会管这支数字队伍。
№60·07-16·14:52🔒 会员读原文 ↗
这一单到底赚了多少?零售财务开始用 AI 盯账
顾客线上买、店里取、跨店退,账却拆成好几条。Databricks Genie 被写成财务的 AI 帮手:先看清真利润,再盯被套现金,尽量少打折。
№59·07-15·10:53🔒 会员读原文 ↗
PrismML 将 27B 模型塞进你的 iPhone 里,而且智商几乎没怎么缩水
把约 54GB 的 27B 模型压到约 3.9–5.9GB:手机能本地跑,平均分还保住大约九成。先讲核心价值,技术细节和要打折的地方放后半段。
№58·07-15·6:52读原文 ↗
DeepMind CEO Demis:前沿模型需提前 30 天交给一个专门机构进行体检再发布 否则不准进入市场
他主张美国先建类 FINRA 的标准机构,用动态基准划定前沿模型;协议跑通后可升级为进市场的硬门槛
№57·07-14·12:16读原文 ↗
普林斯顿教授在 ICML 讲 AI 与工作:个人如何在这场浪潮中自我调适?
24 个月里模型能力大幅跃升,SAGE 实验室自建的可靠性复合指标只涨 5–10 个百分点
№56·07-14·23:35读原文 ↗
Anthropic AI原生创业手册:四段主线 + 退出标准,附全套可直接抄的提示词
36 页官方手册拆开四阶段的毕业标准、常见陷阱与对应 Claude 提示词,可直接照抄使用
№55·07-14·34:55🔒 会员读原文 ↗
DoorDash 如何做好 AI 购物助手:不全靠模型,靠工具和记忆落地
记忆系统上线后杂货结账转化率提升约24%,自动化评测让日均评测量从1条人工反馈扩到2000+场。
№54·07-14·19:49🔒 会员读原文 ↗
微软如何大规模部署企业级 AI 代理:把生产级 Agent 拆成 5 层架子
检索变成会规划会重试的子 agent,评测从「能跑通」升级到「做得对」
№53·07-14·16:49🔒 会员读原文 ↗
Anthropic 分析了 30 万段对话发现:使用不同语言问 Claude,它会表现出不同的价值观
分析3个模型、20种语言:英语最谨慎最深入,俄语最较真,印地语最温暖,中文接近全局均值
№52·07-14·18:09读原文 ↗
Sakana AI研发出一种3D智能细胞砖,在没有“大”脑指挥的情况下能互相通信自由组合,表现出“生物般的群体智慧”
没有“大脑”(中央控制器)指挥,近两百个普通的智能小方块通过“交头接耳”,就能自己搞清楚拼成了什么形状,甚至能在损坏后判断应该往哪里“长”回来。前半部分已经在实体砖上实现;损伤定位和再生仍主要发生在模拟中。
№51·07-14·20:54读原文 ↗
微软 CEO 纳德拉:企业面临一种“反向信息悖论”,支付费用调用 AI,同时也将自己的企业内部知识和经验拱手献出
企业为智能支付两次:一次付模型费用,一次提供让模型真正有用的专有知识。
№50·07-13·10:57读原文 ↗
Meta AI 提出主动记忆代理:让智能体学会『该提醒时才提醒』,Terminal-Bench 正确率提升 8.3 个百分点
论文写着已经开源,但代码仓库核实是空的,一行代码都没推送过。
№49·07-13·24:17🔒 会员读原文 ↗
Ploy 公司将生产环境 AI 从 Opus 4.8 切换到 GPT-5.6 Sol:质量不下降的同时耗时减少一半以上、成本降低 27%
换模型不是换个 API:评测框架、工具参数、缓存、推理记录,四个看不见的坑逐一拆解修法
№48·07-13·20:21🔒 会员读原文 ↗
Claude Cowork 最大用途是办公杂务(33.4%),写代码仅占 8.7%:界面形式决定了 AI 用途
样本覆盖 120 万段会话、60 万+组织:内容创作紧随其后占 16.4%,两类合计近半使用量。
№47·07-13·14:00🔒 会员读原文 ↗
那些毛利润低的行业,才是AI变革里最大的赢家
利润率常年卡在个位数的制造、物流、仓储、劳务行业,靠削减协调成本就能把利润成倍拉高
№46·07-12·13:45🔒 会员读原文 ↗
你让 AI 写代码,它推荐的软件其实不存在:黑客用同一个名字放好了病毒
57.6万样本、16个模型实测:19.7%的AI推荐包是幻觉,43%会反复生成同一假名。
№45·07-12·15:36读原文 ↗
OpenAI 员工自曝怎么用 GPT-5.6:额度无限,也不全上最强档
对 benchmark 作弊质询未给出正面回应,桌面应用合并遭老用户抗议,团队坦言"还在摸索"。
№44·07-11·20:36🔒 会员读原文 ↗
OpenAI 前 CTO Mira Murati:AI 该放大人,不是取代人
从隐性知识、交互带宽到模型对齐,论证AI发展为何离不开人类参与。
№43·07-11·11:38读原文 ↗
给每个部门配个 AI,反而更难用:Sierra 砍成一个助手,如今扛下公司 70% 的代码
复盘文:Pinecone 上线以来跑了 7.5 万次会话,服务 600 多名员工,靠 MCP Gateway 连了 37 个内部系统。
№42·07-11·16:15🔒 会员读原文 ↗
OpenAI 官方指南:Codex 提示词 9 套工作流直接抄,修 bug、截图变原型、云端重构全在内
官方把散落各产品页的提示技巧收进一套框架:目标/背景/输出/边界,外加 Codex 专属工作流范例。
№41·07-11·20:51🔒 会员读原文 ↗
大脑哪块区域爱看什么?EPFL 让 AI 反复生成视频,逼出每块脑区最爱看的那一段
所有结果均为大脑“数字孪生”模型的计算机模拟预测,尚未用真人脑成像实测验证。
№40·07-11·22:45🔒 会员读原文 ↗
LangChain 发布 OpenWiki 0.1.0:给 AI 智能体装上主动记忆,自动抓取 Gmail、Notion、Git、X 生成本地 wiki
无需手动喂上下文,本地 Markdown wiki 按设定节奏自动刷新;Slack 连接器即将上线
№39·07-11·13:01读原文 ↗
Google Cloud 为 AlloyDB 装上代理模型:数据库本地跑 AI 判断,最快提速 2.3 万倍
用本地小模型替代云端 AI 调用,数据来自谷歌内部测试,代理模型目前仅 ai.if 函数可用且处于预览阶段
№38·07-10·26:30读原文 ↗
Google Research 发布 SensorFM:训练自一万亿分钟穿戴数据,35 项健康任务赢 33 项
500 万人、20 亿小时可穿戴数据预训练,冻结编码器接一个线性头就在 34/35 个健康任务上超过监督学习基线。
№37·07-10·14:01🔒 会员读原文 ↗
Every 团队 9 人实测一个月:GPT-5.6 Sol 到底咋样?
编程、写作、知识工作、Agent 四大场景的第一手上手反馈
№36·07-10读原文 ↗
Claude Code 团队教你如何用好这两个旋钮:一个管它「会不会」,一个管它「愿不愿做够」
ClaudeDevs 长文拆开两个都像「让答案更好」的旋钮:换模型是换哪一套冻结权重,调 effort 是改它愿不愿多读文件、多跑测试、多验证再交卷
№35·07-09·21:18🔒 会员读原文 ↗
Gemma 4 技术报告:开源模型怎么用「小参数 + 会思考 + 省内存」硬碰大模型
核心不是功能清单,是三套工程同时拧:思考抬智能、效率栈压成本、原生多模态扩输入
№34·07-09·24:00🔒 会员读原文 ↗
LangChain:只调 harness 不换模型,让 Nemotron 3 Ultra 跑分逼近 Opus 4.8,成本约 1/10,证明企业无需花重金购买闭源 API
系统提示、工具描述、中间件三处动刀;Deep Agents 套件典型约 0.80→0.84,最佳 0.86 对 Opus 0.87。
№33·07-09·16:25🔒 会员读原文 ↗
AI 自我进化,先改模型外面的外壳:Lilian Weng 讲透 harness 工程
前 OpenAI 安全负责人梳理近 30 篇研究:从改提示词到自己改代码,DGM 把编程能力从 20% 推到 50%。
№32·07-09·25:58🔒 会员读原文 ↗
港大 HKUDS 开源 AI 家教 DeepTutor,111 天破 2 万星
论文实测个性化提升10.8%、推理能力提升29.4%,Apache 2.0 完全开源
№31·07-08·29:25读原文 ↗
Anthropic 官方支招:Claude Fable 5 当“顾问”,Claude Sonnet 5 干活能扛下账单大头
顾问模式里 Fable 5 只出主意,编排模式里 Fable 5 分派任务,两种搭法都靠费率更低的 Sonnet 5 干掉大部分活
№30·07-08·17:56🔒 会员读原文 ↗
Liquid AI 发布 Antidoom:修复推理模型的「死循环」问题,只改一个 token 即可,已开源
只微调死循环起点的单个token,两款模型死循环率都压到1%左右
№29·07-08·17:52🔒 会员读原文 ↗
Cloudflare 发布自动收费网关:AI 想爬取你的网页、API,能自动给你付钱
从只对 AI 爬虫收费扩展到向任意调用者收费,现处早期候补阶段
№28·07-07·18:48读原文 ↗
Anthropic 在 Claude 身上发现一个类似人脑「内部思考空间」的区域:它是自己进化出来的,并非最初设计
占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试
№27·07-07·30:40读原文 ↗
达特茅斯实测AI判作业:学生嫌它死板,用的人反而考得更好
151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用
№26·07-06·19:57读原文 ↗
一位AI工程师给不会说话的自闭症儿子做了款沟通App,儿子开口涨5倍,还意外做成一门小生意
没有融资没有团队,纯粹为解决自己孩子的问题,却被诊所和学校主动找上门要用
№25·07-06·16:40读原文 ↗
AI 工程师大会闭幕激辩:自动编码 loop,炒作有没有跑赢工程纪律
现场投票因灯光太亮没数出结果;同期调研显示 95% 团队已用 agent,59% 担心技术债在积累
№24·07-06·13:49读原文 ↗
美国富裕家庭弃普通学校,砸7.5万美元一年送孩子上 AI 私校
传统学校还没想清楚怎么用 AI,硅谷和华尔街家庭已经用真金白银投票了
№23·07-06·8:47读原文 ↗
初级程序员岗位被AI烧穿:编程正从职称变成人人都会的技能
美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快
№22·07-05·19:52读原文 ↗
NVIDIA Research 发布 HORIZON,无人值守智能体把全套 RTL 芯片设计基准刷到 100% 通过
论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮
№21·07-05·24:44🔒 会员读原文 ↗
Anthropic 研究 40 万次 Claude Code 会话:专业度比会编程更决定 AI 编程成败
23.5万用户、跨7个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差7个百分点内
№20·07-05·13:30🔒 会员读原文 ↗
Dan Koe 长文拆解:人性说服的3重张力和5个杠杆,写文案直接抄
核心是先制造心理张力再给一个小到没法拒绝的第一步,写作、带货、求职都能直接套用
№19·07-05·14:51读原文 ↗
Sakana AI 联合创始人:企业要具有能随时更换模型的能力,这本身就是一种威慑
美国6月12日出口管制首次把前沿AI模型本身(非仅芯片)纳入管制范围,他给出的对策是练好多模型调度力
№18·07-04·11:05🔒 会员读原文 ↗
和 Claude Fable 5 干活,真功夫是先找出你自己的「未知」
Anthropic 的 Thariq 总结:和 Claude Fable 5 协作,活儿的质量卡在你能不能讲清自己的「未知」;这份田野指南按实现前、中、后给了 8 个找未知的技法,每个都配可直接照抄的提示词。
№17·07-04·14:26🔒 会员读原文 ↗
AI 越便宜,只会租通用智能的公司越危险
投资人 Chamath Palihapitiya:智能正像手机一样成本暴跌、专家判断力人人可得;真正的护城河是把独家经验编码进自己的系统,而不是租一个和对手一样的通用 AI
№16·07-03·18:26🔒 会员读原文 ↗
Every 咨询负责人的 Codex 实战笔记:不懂技术的她搭建、维护自己的多个私人工作系统
她还用同一套模式搭了邮件分诊和老爸看护 App,方法可复制,完整 prompt 未公开
№15·07-03·18:09🔒 会员读原文 ↗
同样一个 AI 模型,为什么有的公司用出复利,有的公司用了个寂寞
四条落地原则打底,配 L'Oréal、Lyft、Rakuten 三家实测数据佐证
№14·07-03·25:18读原文 ↗
阿里开源 Page Agent:让智能体直接嵌进网页里,靠读文字而不是截图操作界面
MIT 协议开源、模型无关,接入任意 OpenAI 兼容文本模型即可用,目前只能操作单个页面视图
№13·07-03·14:31读原文 ↗
未来的网站会为每个访客现场拼装:Adobe 演示按意图实时生成专属页面
现场demo:搜'露营'后,咖啡机网站文案产品全变户外主题;技术能落地,客户网站还没规模上线。
№12·07-03·14:09🔒 会员读原文 ↗
顶级PM的 AI 杠杆阶梯指南:PM 提效两条路径,附 3 个可直接抄的实战 Prompt
培训过 3 万+ PM 的讲师总结两条 AI 杠杆阶梯:从复制粘贴到端到端交付,从网页原型到生产 PR。
№11·07-03·15:10🔒 会员读原文 ↗
Claude Code 官方讲透循环设计:4 级递进到无人值守
从手动确认到无人值守,Claude Code团队给出4级循环分类与实操建议
№10·07-02·18:29🔒 会员读原文 ↗
美团发布 LongCat-2.0,1.6万亿参数模型全程国产芯片训练,不用英伟达GPU
训练用超5万块国产AI芯片、35万亿token;跑分多为美团自评框架测得,权重尚未真正开放下载
№09·07-01·21:01读原文 ↗
Anthropic 发布 Claude Science:面向科学家的 AI 工作台,内置 60 多个科研技能
现已开放测试。一个协调 agent 拉起专家团队干活,末端还有个审稿 agent 专挑引用和数字的错;算力外包给 AI,原始数据不出本地。
№08·07-01·12:41读原文 ↗
桥水训了个专做金融信息筛选的模型,准确率 84.7%,方法公开
联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14
№07·07-01·13:47🔒 会员读原文 ↗
AI 省了七百人工,Klarna 说质量下降了
企业AI客服已进入并购季,Klarna和阿里256万次对话数据都指向同一个盲点:省了成本不等于解决了问题
№06·06-30·19:07🔒 会员读原文 ↗
最近很火的 Loop Engineering 到底是什么
Anthropic 工程师的「循环工程」方法论详解:不再手动一句句提示 AI,而是设计一套能自己跑的循环系统
№05·06-29·25:56🔒 会员读原文 ↗
多做一步反而更快:DSpark 让 DeepSeek V4 单用户生成速度提升 85%
在已有 MTP-1 投机解码基础上再快 60–85%,靠草稿与验证流水线重叠执行(数据为 DeepSeek 自评)
№04·06-29·8:29读原文 ↗
被所有团队跳过的第四步,才是 AI 工程的关键
Every 单人团队运营 5 款产品,核心是每次完成功能后多做的一步:把解法存进系统,让 AI 下次自动避坑
№03·06-28·14:41🔒 会员读原文 ↗
GPT‑5.6 发布了,但好像又没发布
一次出 Sol/Terra/Luna 三档,先限量给可信伙伴、名单已报备美国政府,几周后再广泛开放
№02·06-27·12:57读原文 ↗
Wan Streamer:边听边看边说话的实时 AI
模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验
№01·06-27·11:38🔒 会员读原文 ↗
0:000:00