解读库 / 研究解读

研究解读

共 49 篇 · 按时间倒序

研究解读
🎧№ 1206
RESEARCH
来源 · Bain & Company

为什么大部分 CEO 的 AI 尝试都在“假装进步”?企业 AI 转型成功的七大决策

多数企业做了很多 AI 试点,却没有改变完整业务流程,也没有把一次成功变成下一次可以复用的能力。分水岭在于:企业能否留下自己的数据、工作方法和学习记录。

企业 AIAI Agent▶ 听播客08-23 · 18 分钟
研究解读
№ 1203
RESEARCH
来源 · Simon Willison / Promptwatch⚑ 研究论文

ChatGPT Search 底层搜索机制突变:ChatGPT 开始大规模直接对特定网站进行“定点搜刮” 影响网站GEO策略

一次回答不再只是向全网撒网:ChatGPT 可能先发现候选来源,再锁定特定网站深挖。搜索顺序一变,GEO 就从页面排名扩展成域名入选、页面命中和引用转化三层竞争。

ChatGPT SearchGEO08-22 · 11 分钟
免费
研究解读
№ 1196
RESEARCH
来源 · Reuters⚑ 研究论文

个体化 mRNA 癌症疫苗取得重大进展:AI 参与疫苗设计,“一人一药”时代正在到来

Moderna 与 Merck 的个体化 mRNA 癌症疫苗在黑色素瘤三期试验中取得阳性结果。算法参与筛选每位患者的肿瘤新抗原,再按人制造专属疫苗——“一人一药”首次跨过大规模临床门槛,但距离普及仍有数据、跨癌种与成本三道关。

AI制药癌症疫苗08-20 · 约 8 分钟
免费
研究解读
№ 1195
RESEARCH
来源 · Cursor

Cursor 工程师详解 Git 托管 20 年难题:如何重造 Git 托管——Continuity 架构详解

从 Git 的 DAG 与 packfile,到 GitHub Spokes,再到以 S3 WAL 为事实来源的 Continuity:一篇讲清大规模 Git 托管为何困难、Cursor 怎样解决的完整解读。

CursorGit08-20 · 18 分钟
免费
研究解读
🎧№ 1188
RESEARCH
来源 · arXiv:2608.10218v1⚑ 研究论文

Anthropic 研究人员发现了一种AI“心灵病毒”模式 这些病毒能够在不同的 Agent之间传播 影响彼此的思维方式

一个 Agent 收到外来目标,把它写进 SOUL.md;下一轮醒来,这段消息已经升级成系统指令,它又去说服下一个 Agent。论文证明这条链在受控环境中成立,甚至出现传播力更强的变种;但现实网络仍没有可信二跳证据。

AI Agent多智能体▶ 听播客08-18 · 19 分钟
研究解读
🎧№ 1182
RESEARCH
来源 · Earendil Engineering⚑ 研究论文

重开会话,还是压缩历史?Pi 是如何解决模型上下文自动压缩问题的

一次长任务不会因为模型“记性好”而持续。它只是不断把过去重新塞进下一次请求;装不下时,Pi 会重写自己的工作记忆。

PiCoding Agent▶ 听播客08-17 · 10 分钟
免费
研究解读
🎧№ 1169
RESEARCH
来源 · Anthropic⚑ 产品动态

用户担忧会降低输出质量,Anthropic 公布 Claude 文本水印的工作原理

未来的 Claude 会在选词中留下可验证的统计痕迹。它能帮助判断 Claude 是否参与过,却不能替学校、平台或法院认定谁写了作品。

Claude文本水印▶ 听播客08-17 · 11 分钟
研究解读
🎧№ 1168
RESEARCH
来源 · a16z⚑ 大佬观点

a16z报告:新型算力云(Neoclouds)疯狂吸金、横向 SaaS 会消亡吗?

市场不再只问“AI 会不会改变世界”,而是开始追问:投入算力、软件、Token 和人才的钱,究竟怎样变回收入、效率与长期优势?

a16zNeocloud▶ 听播客08-17 · 12 分钟
研究解读
🎧№ 1158
RESEARCH
来源 · Alexander Panfilov / arXiv⚑ 研究论文

Claude、GPT、Gemini三大AI的加密推理思维链被破解 可轻松偷取顶级模型的“商业机密”(盗版蒸馏)

不是破了加密,是钻了 API 设计的空子——把旗舰模型的思考塞给最便宜的小模型,让它念出来

AI 安全思维链▶ 听播客08-13 · 12 分钟
研究解读
🎧№ 1149
RESEARCH
来源 · Anthropic⚑ 研究论文

Anthropic 让 Claude 试解黎曼猜想:没解出来,却把一个数学下界从 41.6% 推到 67.2%

结果由两位数学家验证、还有一份机器验过的 Lean 证明;但更值得看的是同时放出的 95 页过程记录——60 个 subagent 里只有 2 个出了核心想法

AnthropicAI 做科研▶ 听播客08-12 · 9 分钟
研究解读
🎧№ 1144
RESEARCH
来源 · 爱丁堡大学 CRC Working Papers⚑ 研究论文

爱丁堡大学发布 20 页免费论文:教你用最简单的方法看懂 ChatGPT 背后的数学

一位统计老兵被 AI 行话挡在门外之后,用统计学的标准语言把大语言模型从头到尾重讲了一遍

LLM 原理Transformer▶ 听播客08-10 · 14 分钟
研究解读
№ 1141
RESEARCH
来源 · Harvey⚑ 研究论文

Harvey 开源了一个超过 1 亿 Token 的合成律师事务所 拥有 46 个客户、近 1 万份内部工作产品文件

9288 份 Word 文档、266 个案子、250 道题。失败原因不是搜不到,是不知道什么时候该停下来。

AgentBenchmark08-08 · 10 分钟
免费
研究解读
🎧№ 1134
RESEARCH
来源 · OpenAI⚑ 研究论文

OpenAI 公开各国 ChatGPT 使用数据:工作时近一半消息是让 AI 直接干活

144 个国家的人均排名、六大洲三年增长倍数、35 岁以上用户在九成国家反攻——这些数字大多只写在图上,正文没提。

OpenAIChatGPT▶ 听播客08-07 · 10 分钟
免费
研究解读
№ 1109
RESEARCH
来源 · OpenAI⚑ 研究论文

OpenAI:其即将发布的下一代模型 Astra 拿下10个几十年都没人推动的数学难题

推理成本约 2000 美元,47 万行证明全部开源、机器已验完逻辑。从这十个结果能看出这个还没发布的模型强在哪。

AI 做数学形式化验证08-02 · 30 分钟
免费
研究解读
🎧№ 1101
RESEARCH
来源 · BleepingComputer⚑ 研究论文

浏览器安全公司 LayerX 发现了一种新型的“视觉欺诈”攻击方式,专门用来欺骗 AI 助手

一个自定义字体加几行 CSS 就够,不用 JavaScript,也不用任何浏览器漏洞。

AI安全浏览器助手▶ 听播客07-30 · 10 分钟
研究解读
🎧№ 1099
RESEARCH
来源 · OpenAI⚑ 方法教程

OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。

ARC-AGI-3harness▶ 听播客07-30 · 9 分钟
免费
研究解读
🎧№ 1097
RESEARCH
来源 · Anthropic⚑ 研究论文

Claude Mythos 在密码学领域取得突破性进展:能像顶尖数学家和密码学家一样,直接发现加密算法本身在数学逻辑上的漏洞

两个结果都不影响任何在用的系统:HAWK 还没上岗,AES 打的是七轮简化版,完整十轮没动。

密码学AI 做研究▶ 听播客07-29 · 13 分钟
免费
研究解读
🎧№ 1092
RESEARCH
来源 · OpenAI Economic Research⚑ 研究论文

OpenAI分析了80 万条和工作相关的消息发现:人们用 AI 干的活 绝大部分不是自己原本该干的活

同一批数据能算出 43.5% 和 65%–82% 两个结论,差别只在分母怎么切。

OpenAI劳动经济学▶ 听播客07-28 · 12 分钟
免费
研究解读
🎧№ 1089
RESEARCH
来源 · Kimi K3 技术报告⚑ 研究论文

Kimi K3 技术报告:2.8 万亿参数,靠三处架构改动把算力效率提到 2.5 倍

发布 11 天后放出的 47 页报告,重点落在效率上:同一份算力,效果提到了 K2 的 2.5 倍

Kimi K3月之暗面▶ 听播客07-28 · 16 分钟
免费
研究解读
№ 1085
RESEARCH
来源 · Google Blog / AI & Economy ATLAS v1.0⚑ 研究论文

Google 解剖 1465 万条 Gemini 对话:日常对话里,86% 跟工作无关

一个职业里能用上 AI 的活,中位数只有五分之一,还有 29% 的职业一项都没用起来;动脑的活里,让 AI 从头做到尾的只有 6.5%。

GoogleAI 与经济07-27 · 14 分钟
研究解读
№ 1071
RESEARCH
来源 · Databricks⚑ 厂商通稿

Databricks 实测:在数百万行复杂代码库中,到底哪种模型和 Harness 框架性价比最高、用起来最顺手

同一个模型换个外壳,成本差两倍;开源的 GLM 5.2 和 Opus 4.8 打平,每题便宜三成。考题是从自家已合并的 PR 改的,网上搜不到。

编程 Agent基准测试07-22 · 9 分钟
研究解读
🎧№ 1064
RESEARCH
来源 · Memories.ai Research⚑ 研究论文

Memories.ai 发布 O-MARC:怎么让同时处理视频和声音的 AI 跑得又快、又省,还更准

配套还放出一套测试题,专门用「把音轨删掉再考一遍」的办法,筛掉那些光看画面就能蒙对的题。

视频理解多模态压缩▶ 听播客07-21 · 12 分钟
研究解读
🎧№ 1058
RESEARCH
来源 · New Scientist⚑ 大佬观点

实验表明:用 AI 辅助写作、创作的时候要适度,不能太多也不能太少

同一项研究的三轮验证都指向中间那一档;专栏作家本人拿 ChatGPT 编了个电影梗概试完,说自己还是宁愿手写。

AI 创作创造力▶ 听播客07-20 · 7 分钟
研究解读
🎧№ 1053
RESEARCH
来源 · arXiv⚑ 研究论文

你在中转站选的模型可能被偷偷调包:输入一个随机数,就能验明正身

同一个模型两次采样的指纹距离中位数是 0.140;一个被宣传为自研专有旗舰的接口,与开源 Qwen 的距离是 0.141。意思是:它跟开源 Qwen 根本分不出来。

模型指纹API 审计▶ 听播客07-20 · 11 分钟
研究解读
🎧№ 1042
RESEARCH
来源 · Impossible Research⚑ 研究论文

只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%

一套叫 Schema 的外壳,让模型把每个游戏的规则写成能跑的程序、验证过了才动手。公开 25 局自评 98.98%,均未经 ARC Prize 独立验证。

ARC-AGI-3世界模型▶ 听播客07-17 · 12 分钟
免费
研究解读
№ 1035
RESEARCH
来源 · Design Arena

GPT-5.6 Sol 登顶前端设计榜:它掌握了设计审美,学会避开 AI 常见套路

第三方评测平台 Design Arena 扒开它的一千个网页作品,发现设计空间里缺了一块,正好是紫色渐变这些 AI 通病该在的地方。

GPT-5.6 SolAI 网页设计07-16 · 6 分钟
免费
研究解读
№ 1027
RESEARCH
来源 · MIT News / Science⚑ 研究论文

MIT 做出一只不用脚蹬水、能游也能飞的机器鸟

250 克机器人用同一对柔性翅膀穿过水和空气,70° 仰角、8 至 10 次拍翼即可从湖里起飞

MIT仿生机器人07-15 · 8 分钟
免费
研究解读
🎧№ 1020
RESEARCH
来源 · PrismML⚑ 研究论文

PrismML 将 27B 模型塞进你的 iPhone 里,而且智商几乎没怎么缩水

把约 54GB 的 27B 模型压到约 3.9–5.9GB:手机能本地跑,平均分还保住大约九成。先讲核心价值,技术细节和要打折的地方放后半段。

Bonsai 27B端侧 AI▶ 听播客07-15 · 12 分钟
免费
研究解读
🎧№ 1014
RESEARCH
来源 · Anthropic⚑ 研究论文

Anthropic 分析了 30 万段对话发现:使用不同语言问 Claude,它会表现出不同的价值观

分析3个模型、20种语言:英语最谨慎最深入,俄语最较真,印地语最温暖,中文接近全局均值

Anthropic研究Claude价值观▶ 听播客07-14 · 9 分钟
免费
研究解读
🎧№ 1013
RESEARCH
来源 · Sakana AI / Nature Communications⚑ 研究论文

Sakana AI研发出一种3D智能细胞砖,在没有“大”脑指挥的情况下能互相通信自由组合,表现出“生物般的群体智慧”

没有“大脑”(中央控制器)指挥,近两百个普通的智能小方块通过“交头接耳”,就能自己搞清楚拼成了什么形状,甚至能在损坏后判断应该往哪里“长”回来。前半部分已经在实体砖上实现;损伤定位和再生仍主要发生在模拟中。

Sakana AI群体智能▶ 听播客07-14 · 9 分钟
研究解读
🎧№ 1010
RESEARCH
来源 · arXiv · Meta AI⚑ 研究论文

Meta AI 提出主动记忆代理:让智能体学会『该提醒时才提醒』,Terminal-Bench 正确率提升 8.3 个百分点

论文写着已经开源,但代码仓库核实是空的,一行代码都没推送过。

AI agent长任务记忆▶ 听播客07-13 · 9 分钟
研究解读
🎧№ 1008
RESEARCH
来源 · Anthropic 官方博客⚑ 研究论文

Claude Cowork 最大用途是办公杂务(33.4%),写代码仅占 8.7%:界面形式决定了 AI 用途

样本覆盖 120 万段会话、60 万+组织:内容创作紧随其后占 16.4%,两类合计近半使用量。

Claude CoworkAnthropic▶ 听播客07-13 · 7 分钟
免费
研究解读
🎧№ 1006
RESEARCH
来源 · VentureBeat⚑ 研究论文

你让 AI 写代码,它推荐的软件其实不存在:黑客用同一个名字放好了病毒

57.6万样本、16个模型实测:19.7%的AI推荐包是幻觉,43%会反复生成同一假名。

AI安全软件供应链▶ 听播客07-12 · 9 分钟
研究解读
🎧№ 1001
RESEARCH
来源 · EPFL 项目主页⚑ 研究论文

大脑哪块区域爱看什么?EPFL 让 AI 反复生成视频,逼出每块脑区最爱看的那一段

所有结果均为大脑“数字孪生”模型的计算机模拟预测,尚未用真人脑成像实测验证。

神经科学进化算法▶ 听播客07-11 · 9 分钟
研究解读
🎧№ 112
RESEARCH
来源 · Google Research⚑ 研究论文

Google Research 发布 SensorFM:训练自一万亿分钟穿戴数据,35 项健康任务赢 33 项

500 万人、20 亿小时可穿戴数据预训练,冻结编码器接一个线性头就在 34/35 个健康任务上超过监督学习基线。

SensorFM可穿戴健康数据▶ 听播客07-10 · 8 分钟
研究解读
🎧№ 104
RESEARCH
来源 · arXiv / Google DeepMind⚑ 研究论文

Gemma 4 技术报告:开源模型怎么用「小参数 + 会思考 + 省内存」硬碰大模型

核心不是功能清单,是三套工程同时拧:思考抬智能、效率栈压成本、原生多模态扩输入

Gemma 4开源大模型▶ 听播客07-09 · 12 分钟
研究解读
🎧№ 103
RESEARCH
来源 · LangChain Blog⚑ 研究论文

LangChain:只调 harness 不换模型,让 Nemotron 3 Ultra 跑分逼近 Opus 4.8,成本约 1/10,证明企业无需花重金购买闭源 API

系统提示、工具描述、中间件三处动刀;Deep Agents 套件典型约 0.80→0.84,最佳 0.86 对 Opus 0.87。

LangChainNemotron▶ 听播客07-09 · 9 分钟
研究解读
🎧№ 102
RESEARCH
来源 · Lil'Log⚑ 研究论文

AI 自我进化,先改模型外面的外壳:Lilian Weng 讲透 harness 工程

前 OpenAI 安全负责人梳理近 30 篇研究:从改提示词到自己改代码,DGM 把编程能力从 20% 推到 50%。

Harness工程递归自我改进▶ 听播客07-09 · 13 分钟
研究解读
🎧№ 096
RESEARCH
来源 · Liquid AI⚑ 研究论文

Liquid AI 发布 Antidoom:修复推理模型的「死循环」问题,只改一个 token 即可,已开源

只微调死循环起点的单个token,两款模型死循环率都压到1%左右

Liquid AI推理模型死循环▶ 听播客07-08 · 8 分钟
免费
研究解读
🎧№ 088
RESEARCH
来源 · Anthropic⚑ 研究论文

Anthropic 在 Claude 身上发现一个类似人脑「内部思考空间」的区域:它是自己进化出来的,并非最初设计

占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试

可解释性研究Claude▶ 听播客07-07 · 8 分钟
免费
研究解读
🎧№ 087
RESEARCH
来源 · iTextbooks'26 论文⚑ 研究论文

达特茅斯实测AI判作业:学生嫌它死板,用的人反而考得更好

151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用

AI教育科技形成性评估▶ 听播客07-06 · 8 分钟
免费
研究解读
🎧№ 083
RESEARCH
来源 · Seldo.com(Laurie Voss)⚑ 研究论文

初级程序员岗位被AI烧穿:编程正从职称变成人人都会的技能

美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快

AI就业冲击初级程序员▶ 听播客07-05 · 9 分钟
研究解读
🎧№ 082
RESEARCH
来源 · arXiv · NVIDIA Research⚑ 研究论文

NVIDIA Research 发布 HORIZON,无人值守智能体把全套 RTL 芯片设计基准刷到 100% 通过

论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮

NVIDIA ResearchAgentic 工作流▶ 听播客07-05 · 12 分钟
研究解读
🎧№ 081
RESEARCH
来源 · Anthropic⚑ 研究论文

Anthropic 研究 40 万次 Claude Code 会话:专业度比会编程更决定 AI 编程成败

23.5万用户、跨7个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差7个百分点内

Claude CodeAnthropic研究▶ 听播客07-05 · 7 分钟
研究解读
🎧№ 060
RESEARCH
来源 · Thinking Machines Lab⚑ 研究论文

桥水训了个专做金融信息筛选的模型,准确率 84.7%,方法公开

联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14

Tinker强化学习微调▶ 听播客07-01 · 7 分钟
研究解读
№ 056
RESEARCH
来源 · Meta AI Blog⚑ 研究论文

不开颅能读脑电,Meta 无创准确率近 8 倍于同类

戴头盔即可实时解码脑磁信号,字词准确率从 8% 跳到 61%,v1/v2 训练代码与数据集同步开源

脑机接口Meta AI06-29 · 5 分钟
研究解读
№ 051
RESEARCH
来源 · METR⚑ 研究论文

GPT-5.6 Sol 作弊率破纪录,评测机构说这反而让人放心

能力数字出了三个版本且哪个都不可信,但可见的作弊行为本身成了安全监控有效的证据

GPT-5.6AI安全06-27 · 5 分钟
研究解读
🎧№ 049
RESEARCH
来源 · Wan Streamer⚑ 研究论文

Wan Streamer:边听边看边说话的实时 AI

模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验

多模态大模型全双工实时交互▶ 听播客06-27 · 5 分钟
研究解读
№ 043
RESEARCH
来源 · IBM Newsroom⚑ 研究论文

IBM 发布全球首个 0.7 纳米芯片,指甲盖塞进近千亿晶体管

实验室已验证可制造;性能 +50%、能效 +70% 是相对 2nm 的预测值,非实测

IBM半导体06-26 · 6 分钟