研究解读
共 49 篇 · 按时间倒序
共 49 篇 · 按时间倒序
多数企业做了很多 AI 试点,却没有改变完整业务流程,也没有把一次成功变成下一次可以复用的能力。分水岭在于:企业能否留下自己的数据、工作方法和学习记录。
一次回答不再只是向全网撒网:ChatGPT 可能先发现候选来源,再锁定特定网站深挖。搜索顺序一变,GEO 就从页面排名扩展成域名入选、页面命中和引用转化三层竞争。
Moderna 与 Merck 的个体化 mRNA 癌症疫苗在黑色素瘤三期试验中取得阳性结果。算法参与筛选每位患者的肿瘤新抗原,再按人制造专属疫苗——“一人一药”首次跨过大规模临床门槛,但距离普及仍有数据、跨癌种与成本三道关。
从 Git 的 DAG 与 packfile,到 GitHub Spokes,再到以 S3 WAL 为事实来源的 Continuity:一篇讲清大规模 Git 托管为何困难、Cursor 怎样解决的完整解读。
一个 Agent 收到外来目标,把它写进 SOUL.md;下一轮醒来,这段消息已经升级成系统指令,它又去说服下一个 Agent。论文证明这条链在受控环境中成立,甚至出现传播力更强的变种;但现实网络仍没有可信二跳证据。
一次长任务不会因为模型“记性好”而持续。它只是不断把过去重新塞进下一次请求;装不下时,Pi 会重写自己的工作记忆。
未来的 Claude 会在选词中留下可验证的统计痕迹。它能帮助判断 Claude 是否参与过,却不能替学校、平台或法院认定谁写了作品。
市场不再只问“AI 会不会改变世界”,而是开始追问:投入算力、软件、Token 和人才的钱,究竟怎样变回收入、效率与长期优势?
不是破了加密,是钻了 API 设计的空子——把旗舰模型的思考塞给最便宜的小模型,让它念出来
结果由两位数学家验证、还有一份机器验过的 Lean 证明;但更值得看的是同时放出的 95 页过程记录——60 个 subagent 里只有 2 个出了核心想法
一位统计老兵被 AI 行话挡在门外之后,用统计学的标准语言把大语言模型从头到尾重讲了一遍
9288 份 Word 文档、266 个案子、250 道题。失败原因不是搜不到,是不知道什么时候该停下来。
144 个国家的人均排名、六大洲三年增长倍数、35 岁以上用户在九成国家反攻——这些数字大多只写在图上,正文没提。
推理成本约 2000 美元,47 万行证明全部开源、机器已验完逻辑。从这十个结果能看出这个还没发布的模型强在哪。
一个自定义字体加几行 CSS 就够,不用 JavaScript,也不用任何浏览器漏洞。
模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。
两个结果都不影响任何在用的系统:HAWK 还没上岗,AES 打的是七轮简化版,完整十轮没动。
同一批数据能算出 43.5% 和 65%–82% 两个结论,差别只在分母怎么切。
发布 11 天后放出的 47 页报告,重点落在效率上:同一份算力,效果提到了 K2 的 2.5 倍
一个职业里能用上 AI 的活,中位数只有五分之一,还有 29% 的职业一项都没用起来;动脑的活里,让 AI 从头做到尾的只有 6.5%。
同一个模型换个外壳,成本差两倍;开源的 GLM 5.2 和 Opus 4.8 打平,每题便宜三成。考题是从自家已合并的 PR 改的,网上搜不到。
配套还放出一套测试题,专门用「把音轨删掉再考一遍」的办法,筛掉那些光看画面就能蒙对的题。
同一项研究的三轮验证都指向中间那一档;专栏作家本人拿 ChatGPT 编了个电影梗概试完,说自己还是宁愿手写。
同一个模型两次采样的指纹距离中位数是 0.140;一个被宣传为自研专有旗舰的接口,与开源 Qwen 的距离是 0.141。意思是:它跟开源 Qwen 根本分不出来。
一套叫 Schema 的外壳,让模型把每个游戏的规则写成能跑的程序、验证过了才动手。公开 25 局自评 98.98%,均未经 ARC Prize 独立验证。
第三方评测平台 Design Arena 扒开它的一千个网页作品,发现设计空间里缺了一块,正好是紫色渐变这些 AI 通病该在的地方。
250 克机器人用同一对柔性翅膀穿过水和空气,70° 仰角、8 至 10 次拍翼即可从湖里起飞
把约 54GB 的 27B 模型压到约 3.9–5.9GB:手机能本地跑,平均分还保住大约九成。先讲核心价值,技术细节和要打折的地方放后半段。
分析3个模型、20种语言:英语最谨慎最深入,俄语最较真,印地语最温暖,中文接近全局均值
没有“大脑”(中央控制器)指挥,近两百个普通的智能小方块通过“交头接耳”,就能自己搞清楚拼成了什么形状,甚至能在损坏后判断应该往哪里“长”回来。前半部分已经在实体砖上实现;损伤定位和再生仍主要发生在模拟中。
论文写着已经开源,但代码仓库核实是空的,一行代码都没推送过。
样本覆盖 120 万段会话、60 万+组织:内容创作紧随其后占 16.4%,两类合计近半使用量。
57.6万样本、16个模型实测:19.7%的AI推荐包是幻觉,43%会反复生成同一假名。
所有结果均为大脑“数字孪生”模型的计算机模拟预测,尚未用真人脑成像实测验证。
500 万人、20 亿小时可穿戴数据预训练,冻结编码器接一个线性头就在 34/35 个健康任务上超过监督学习基线。
核心不是功能清单,是三套工程同时拧:思考抬智能、效率栈压成本、原生多模态扩输入
系统提示、工具描述、中间件三处动刀;Deep Agents 套件典型约 0.80→0.84,最佳 0.86 对 Opus 0.87。
前 OpenAI 安全负责人梳理近 30 篇研究:从改提示词到自己改代码,DGM 把编程能力从 20% 推到 50%。
只微调死循环起点的单个token,两款模型死循环率都压到1%左右
占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试
151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用
美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快
论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮
23.5万用户、跨7个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差7个百分点内
联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14
戴头盔即可实时解码脑磁信号,字词准确率从 8% 跳到 61%,v1/v2 训练代码与数据集同步开源
能力数字出了三个版本且哪个都不可信,但可见的作弊行为本身成了安全监控有效的证据
模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验
实验室已验证可制造;性能 +50%、能效 +70% 是相对 2nm 的预测值,非实测