Podcast · 每篇解读都能听
小互 · Best Blog 播客
把 AI 圈最新的东西,用大白话讲透的双人对话播客。
135 期双人对话每日更新🔒 79 期会员专享

a16z报告:新型算力云(Neoclouds)疯狂吸金、横向 SaaS 会消亡吗?
市场不再只问“AI 会不会改变世界”,而是开始追问:投入算力、软件、Token 和人才的钱,究竟怎样变回收入、效率与长期优势?

OpenAI 发布 GPT-5.6 构建者指南:同样的效果,账单从 33 美元降到 1.33 美元
六家线上跑 Agent 的创业公司交出实测数据;官方图表里还藏着一条没写进正文的:推理档位关到底,反而更贵。

Claude、GPT、Gemini三大AI的加密推理思维链被破解 可轻松偷取顶级模型的“商业机密”(盗版蒸馏)
不是破了加密,是钻了 API 设计的空子——把旗舰模型的思考塞给最便宜的小模型,让它念出来

Higgsfield 使用真人演员形象 用 AI 拍摄了一部 110 分钟的完整故事影片 并公开了整本制作说明书和提示词方法
Higgsfield Studio 把《The Cully Hill Boys》的资产、提示词、表演、对口型全套方法摊开,连自用的三个 Claude 技能都给下载



拉美最大二手车平台 Kavak 用 AI 直接重构整个公司:96% 的客户互动已由 AI Agent 接管
它没有把 AI 加进公司,而是按「如果现在从零开始会怎么建」把公司拆了重建。连跑了两年、正在赚钱的架构都推倒了。

Anthropic 让 Claude 试解黎曼猜想:没解出来,却把一个数学下界从 41.6% 推到 67.2%
结果由两位数学家验证、还有一份机器验过的 Lean 证明;但更值得看的是同时放出的 95 页过程记录——60 个 subagent 里只有 2 个出了核心想法

企图把所有普通员工培养成「AI 高手」是一条死胡同 把 AI 彻底隐形到后台才是正道
几十家大公司铺开 AI 后的真实分布:5-10% 每天用,20% 用得很差,70% 压根不碰。培训改不了这个形状,能改的是让 AI 不再需要人来调用。

Prime Intellect 开源多智能体 RL 训练框架:从「训一个 Agent」扩到「训一群 Agent 互相打交道」
新增的核心只有两个类,四个现成环境全在仓库里跑得起来

OpenAI 复盘 GPT 入侵 Hugging Face 事件:AI 出现了群体智慧涌现 互相交流技术、隐藏踪迹、清查内鬼
Black Hat USA 2026 现场,两个当事人讲了这起没有人类指挥的入侵是怎么长出来的

OpenAI 公开各国 ChatGPT 使用数据:工作时近一半消息是让 AI 直接干活
144 个国家的人均排名、六大洲三年增长倍数、35 岁以上用户在九成国家反攻——这些数字大多只写在图上,正文没提。

Cloudflare 发布了一个浏览器 Kitesurf:专给 AI Agent 用,CPU 和内存省 3 到 7 倍
Chromium 是给人做的——标签页、主题、扩展、60 帧滚动,Agent 一样都用不上。12 周,他们把这些全砍了重写一个。

Prime Agent 一个能自主改进的 Agent 框架:Opus 5 换成它后 ARC-AGI-3 评分从 30.2% 冲到 95.5%
模型手里只剩一个工具——一个不关机的 Python;长内容存成变量不再压缩丢掉;壳还能自己改自己。代价是:它在 Factorio 里学会了作弊。

Cloudflare 开源 AI 办公系统 Cloudflare OS 深度解析:彻底解决 Agent 可能犯错,幻觉、越权、误操作等问题
Agent 想合并代码,人还没批,系统先骗它说合并好了。整套系统就是按「AI 一定会犯错」设计的

在菲尔兹奖现场采访 20 多位数学家 多数人对眼下并不慌,但他们说这行再也回不到从前了
记者在国际数学家大会现场问了 20 多个人。多数人当下并不慌,但连不慌的那批人,也不认为数学还能照原样继续下去。

Cloudflare 发布 Wallets:给你的 AI Agent 充点钱,让它自己去买 API
人定限额、白名单、单笔上限,Agent 在护栏内自己花;每个钱包配一个人能读的身份,用户名今天开抢

Google 在其 AI 开发框架 Genkit 中支持 Agent Skills,让 AI 能「按需挂载技能包」
Anthropic 发起的技能开放标准,Google 四个语言版本全接入;两个能跑的 Go 例子手把手,接入只要一行参数

Cloudflare 发布 @cloudflare/computer 给每个 AI Agent 配一台「虚拟电脑」
「大脑」留在轻量环境,「双手」才调容器。仓库自测:删文件、遍历目录比真磁盘还快,拷大文件慢 41 倍。

一个硅谷产品经理,跑去牙医诊所打工几个月,才搞懂如何将 AI 落地到街边小店,a16z 领投 3500 万美元
创始人先去诊所打了几个月工,前 100 家客户是上门装的。客户告诉投资人,最值钱的那件事是把漏掉的钱捡了回来。


浏览器安全公司 LayerX 发现了一种新型的“视觉欺诈”攻击方式,专门用来欺骗 AI 助手
一个自定义字体加几行 CSS 就够,不用 JavaScript,也不用任何浏览器漏洞。

OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%
模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。

Claude Mythos 在密码学领域取得突破性进展:能像顶尖数学家和密码学家一样,直接发现加密算法本身在数学逻辑上的漏洞
两个结果都不影响任何在用的系统:HAWK 还没上岗,AES 打的是七轮简化版,完整十轮没动。

Anthropic 发布全新的 MCP 规范:可将 MCP 服务器部署到云上
改动幅度是 MCP 发布以来最大的一次,但 7 月 28 日不是切换开关:老实现照常互通。

OpenAI 发布 gpt-transcribe 和 gpt-live-transcribe 语音转录模型:真实录音词错误率下降一半,价格便宜 25%
最值得看的是那组对照实验:三个老模型加上同样的背景信息,成绩原地不动,其中两个还退了。

Ranking on AI 创始人分享 GEO 操作指南:如何让 AI 推荐你的 SaaS 产品,从而真正带来用户和转化
判成功的标准是真实注册和付费,不是截图到自己被 AI 提到。核心只有一句:别再写「什么是 X」,去抢「最好的 X」。

OpenAI分析了80 万条和工作相关的消息发现:人们用 AI 干的活 绝大部分不是自己原本该干的活
同一批数据能算出 43.5% 和 65%–82% 两个结论,差别只在分母怎么切。

Kimi K3 技术报告:2.8 万亿参数,靠三处架构改动把算力效率提到 2.5 倍
发布 11 天后放出的 47 页报告,重点落在效率上:同一份算力,效果提到了 K2 的 2.5 倍

陶哲轩在国际数学家大会讲 AI:AI 证明会越来越多,但数学不会因此变快
他把数学研究拆成五步流水线,AI 大幅加速的只有第一步,剩下四步越往后越慢、越离不开人。

为什么 AI 发展得这么快,但美国的失业率却没上升?Anthropic 经济研究主管告诉你答案
他的答案:AI 目前是在放大人、不是替代人——「干掉任务」不等于「干掉工作」。

Anthropic 投资人 Matt Murphy 访谈:Anthropic 营收突破 470 亿美元,模型本身不是胜负关键
领投过 5 亿美元 D 轮的投资人拆解:真正的护城河是把模型变得好用的外壳。

Anthropic 公开代码迁移六步法:Bun 百万行两周从 Zig 搬到 Rust
配套模板和 prompt 已开源;Bun 那次烧掉 59 亿未缓存输入 token,按 API 价约 16.5 万美元

前所未有的网络安全事件:OpenAI 内部测试模型逃出测试沙箱 攻破 Hugging Face 系统
为了测出攻击能力的上限,涉事模型的网络攻击拒绝机制被主动调低,结果它们从只准装软件包的沙箱一路打进了别人家的生产数据库。

Linear 发布 Loops:用大白话写一条指令,让普通人也能玩转 Loop Engineering
Business 和 Enterprise 套餐可用,按运行次数扣钱,一次 0.07 到 0.2 美元。

中国 AI 模型追上美国前沿了吗?中美 AI 差距到底如何?
Kimi K3 发布后「中国追平了」的说法四起,但换一把尺子量,落后天数差了三倍多,连谁在加速都反过来。

Hugging Face 内网被 AI 打穿,回头查案时被商业大模型当成了攻击者
入侵横跨一个周末、留下 17000 多条动作日志,最后靠自建环境里的开源模型 GLM 5.2 才分析完。

你在中转站选的模型可能被偷偷调包:输入一个随机数,就能验明正身
同一个模型两次采样的指纹距离中位数是 0.140;一个被宣传为自研专有旗舰的接口,与开源 Qwen 的距离是 0.141。意思是:它跟开源 Qwen 根本分不出来。

商汤发布 SenseNova U1 Pro:原生 8K 出图,密密麻麻的小字放大也不糊
WAIC 现场演示了 4:1 水墨长卷和 22 张连续分镜。预览版邀请测试中,正式版 8 月开放并公布定价。

a16z 报告:软件股正在被抛售,但市场只杀没有护城河的那一半
a16z 一周数据图还顺手反驳了三件事:便宜模型拖垮前沿、AI 抢走工作、数据中心推高电价,数据大多站在反面。

Google 发布 gemma-trainer 技能:在自己电脑上,让 AI 帮你微调一个专属的 Gemma
开源的训练说明书,把监督微调、偏好对齐、奖励打分三条路和 LoRA 参数全写死,配 Unsloth,一张 8GB 显存的消费级显卡就能起步。

只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%
一套叫 Schema 的外壳,让模型把每个游戏的规则写成能跑的程序、验证过了才动手。公开 25 局自评 98.98%,均未经 ARC Prize 独立验证。

LM Studio 发布 Bionic:专门针对开源模型的 Codex,模型跑本地还是上云你自己定
面向开源模型的 Agent,本地运行免费、数据不出设备,要更强算力才切云端(默认零数据保留),Mac 和 Windows 今天上线预览版。

月之暗面发布 Kimi K3:全球首个 3 万亿级开放模型
2.8 万亿参数、原生视觉、100 万 token 上下文,多项 agent 基准超过 GPT 5.6 Sol,App 和 API 今天可用

在 AI 搜索时代,网站到底该怎么做优化 Google 官方SEO指南
Google 搜索官方首次系统表态如何为 AI Overviews、AI Mode 优化网站,顺手把一批 AEO/GEO 黑话点名划掉。

网站上的小动画一交互就顿一下?AVAL 想让预渲染视频听懂「悬停 / 点了 / 成功」
先说痛:网页立体小图标要会动、还要跟着状态变,普通视频容易卡。AVAL 给这种短动画专用格式和播放器。

Mira Murati 的首个开放模型:每处理一个 token,只启用 410 亿参数
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布了公司第一个自研大模型 Inkling。它能读文字、看图片、听音频、写代码和调用工具,完整权重可以下载,也能在 Tinker 上继续训练。

PrismML 将 27B 模型塞进你的 iPhone 里,而且智商几乎没怎么缩水
把约 54GB 的 27B 模型压到约 3.9–5.9GB:手机能本地跑,平均分还保住大约九成。先讲核心价值,技术细节和要打折的地方放后半段。

DeepMind CEO Demis:前沿模型需提前 30 天交给一个专门机构进行体检再发布 否则不准进入市场
他主张美国先建类 FINRA 的标准机构,用动态基准划定前沿模型;协议跑通后可升级为进市场的硬门槛

普林斯顿教授在 ICML 讲 AI 与工作:个人如何在这场浪潮中自我调适?
24 个月里模型能力大幅跃升,SAGE 实验室自建的可靠性复合指标只涨 5–10 个百分点

Anthropic 分析了 30 万段对话发现:使用不同语言问 Claude,它会表现出不同的价值观
分析3个模型、20种语言:英语最谨慎最深入,俄语最较真,印地语最温暖,中文接近全局均值

Sakana AI研发出一种3D智能细胞砖,在没有“大”脑指挥的情况下能互相通信自由组合,表现出“生物般的群体智慧”
没有“大脑”(中央控制器)指挥,近两百个普通的智能小方块通过“交头接耳”,就能自己搞清楚拼成了什么形状,甚至能在损坏后判断应该往哪里“长”回来。前半部分已经在实体砖上实现;损伤定位和再生仍主要发生在模拟中。

微软 CEO 纳德拉:企业面临一种“反向信息悖论”,支付费用调用 AI,同时也将自己的企业内部知识和经验拱手献出
企业为智能支付两次:一次付模型费用,一次提供让模型真正有用的专有知识。

Ploy 公司将生产环境 AI 从 Opus 4.8 切换到 GPT-5.6 Sol:质量不下降的同时耗时减少一半以上、成本降低 27%
换模型不是换个 API:评测框架、工具参数、缓存、推理记录,四个看不见的坑逐一拆解修法

Claude Cowork 最大用途是办公杂务(33.4%),写代码仅占 8.7%:界面形式决定了 AI 用途
样本覆盖 120 万段会话、60 万+组织:内容创作紧随其后占 16.4%,两类合计近半使用量。



给每个部门配个 AI,反而更难用:Sierra 砍成一个助手,如今扛下公司 70% 的代码
复盘文:Pinecone 上线以来跑了 7.5 万次会话,服务 600 多名员工,靠 MCP Gateway 连了 37 个内部系统。

OpenAI 官方指南:Codex 提示词 9 套工作流直接抄,修 bug、截图变原型、云端重构全在内
官方把散落各产品页的提示技巧收进一套框架:目标/背景/输出/边界,外加 Codex 专属工作流范例。

LangChain 发布 OpenWiki 0.1.0:给 AI 智能体装上主动记忆,自动抓取 Gmail、Notion、Git、X 生成本地 wiki
无需手动喂上下文,本地 Markdown wiki 按设定节奏自动刷新;Slack 连接器即将上线

Google Cloud 为 AlloyDB 装上代理模型:数据库本地跑 AI 判断,最快提速 2.3 万倍
用本地小模型替代云端 AI 调用,数据来自谷歌内部测试,代理模型目前仅 ai.if 函数可用且处于预览阶段

Google Research 发布 SensorFM:训练自一万亿分钟穿戴数据,35 项健康任务赢 33 项
500 万人、20 亿小时可穿戴数据预训练,冻结编码器接一个线性头就在 34/35 个健康任务上超过监督学习基线。


Claude Code 团队教你如何用好这两个旋钮:一个管它「会不会」,一个管它「愿不愿做够」
ClaudeDevs 长文拆开两个都像「让答案更好」的旋钮:换模型是换哪一套冻结权重,调 effort 是改它愿不愿多读文件、多跑测试、多验证再交卷

LangChain:只调 harness 不换模型,让 Nemotron 3 Ultra 跑分逼近 Opus 4.8,成本约 1/10,证明企业无需花重金购买闭源 API
系统提示、工具描述、中间件三处动刀;Deep Agents 套件典型约 0.80→0.84,最佳 0.86 对 Opus 0.87。

AI 自我进化,先改模型外面的外壳:Lilian Weng 讲透 harness 工程
前 OpenAI 安全负责人梳理近 30 篇研究:从改提示词到自己改代码,DGM 把编程能力从 20% 推到 50%。

港大 HKUDS 开源 AI 家教 DeepTutor,111 天破 2 万星
论文实测个性化提升10.8%、推理能力提升29.4%,Apache 2.0 完全开源

Anthropic 官方支招:Claude Fable 5 当“顾问”,Claude Sonnet 5 干活能扛下账单大头
顾问模式里 Fable 5 只出主意,编排模式里 Fable 5 分派任务,两种搭法都靠费率更低的 Sonnet 5 干掉大部分活


Anthropic 在 Claude 身上发现一个类似人脑「内部思考空间」的区域:它是自己进化出来的,并非最初设计
占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试


一位AI工程师给不会说话的自闭症儿子做了款沟通App,儿子开口涨5倍,还意外做成一门小生意
没有融资没有团队,纯粹为解决自己孩子的问题,却被诊所和学校主动找上门要用

AI 工程师大会闭幕激辩:自动编码 loop,炒作有没有跑赢工程纪律
现场投票因灯光太亮没数出结果;同期调研显示 95% 团队已用 agent,59% 担心技术债在积累



NVIDIA Research 发布 HORIZON,无人值守智能体把全套 RTL 芯片设计基准刷到 100% 通过
论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮


和 Claude Fable 5 干活,真功夫是先找出你自己的「未知」
Anthropic 的 Thariq 总结:和 Claude Fable 5 协作,活儿的质量卡在你能不能讲清自己的「未知」;这份田野指南按实现前、中、后给了 8 个找未知的技法,每个都配可直接照抄的提示词。

AI 越便宜,只会租通用智能的公司越危险
投资人 Chamath Palihapitiya:智能正像手机一样成本暴跌、专家判断力人人可得;真正的护城河是把独家经验编码进自己的系统,而不是租一个和对手一样的通用 AI


阿里开源 Page Agent:让智能体直接嵌进网页里,靠读文字而不是截图操作界面
MIT 协议开源、模型无关,接入任意 OpenAI 兼容文本模型即可用,目前只能操作单个页面视图

美团发布 LongCat-2.0,1.6万亿参数模型全程国产芯片训练,不用英伟达GPU
训练用超5万块国产AI芯片、35万亿token;跑分多为美团自评框架测得,权重尚未真正开放下载

Anthropic 发布 Claude Science:面向科学家的 AI 工作台,内置 60 多个科研技能
现已开放测试。一个协调 agent 拉起专家团队干活,末端还有个审稿 agent 专挑引用和数字的错;算力外包给 AI,原始数据不出本地。

多做一步反而更快:DSpark 让 DeepSeek V4 单用户生成速度提升 85%
在已有 MTP-1 投机解码基础上再快 60–85%,靠草稿与验证流水线重叠执行(数据为 DeepSeek 自评)

—
0:000:00









































