AI 精华,讲到你懂。
今日精选
Anthropic FDE(前沿部署工程师)面试指南:Anthropic 为什么重金招聘一批“驻场工程师”?
这不是在招聘一个会写提示词的工程师,而是在寻找能把模型能力、客户流程和安全边界一起送进生产系统的人。
这不是在招聘一个会写提示词的工程师,而是在寻找能把模型能力、客户流程和安全边界一起送进生产系统的人。
多数企业做了很多 AI 试点,却没有改变完整业务流程,也没有把一次成功变成下一次可以复用的能力。分水岭在于:企业能否留下自己的数据、工作方法和学习记录。
一次蓝牙耳机故障,暴露了网页如何运行无声音频、收集多类设备信息,并在后台组成设备指纹。
过去资本先变成工程师与两年等待;AI 第一次让 10 美元较直接地变成训练、Token、使用量或定向能力。它仍不保证利润,却正在重写私募市场、模型竞争、营销和产品价值。
一次回答不再只是向全网撒网:ChatGPT 可能先发现候选来源,再锁定特定网站深挖。搜索顺序一变,GEO 就从页面排名扩展成域名入选、页面命中和引用转化三层竞争。
从主题 ETF、数据中心工资、网约车平台费到 Agent Token,真正发生的变化是:AI 正进入现实资源配置。
公司无需把人才、研发、资本和客户塞进同一个国家;新的竞争力,是让母国与硅谷两套网络共同运转。
Anthropic 复盘 15 家高增长初创公司。点开公司案例,看 Agentic Coding 如何进入原型、研发、验证、重建和产品化。
Claude Academy 公开了 Anthropic 的内部训练方法:入职学习 4D,在工作中持续练习,再按风险核验并为结果负责。
对话即背景,背景即知识。Agent 进入公开对话、会议、邮件和文档后,知识库获得了可持续使用的工作上下文,搜索只是其中一部分。
OpenAI 把管理上下文、工具调用、沙箱和审批的 Codex 执行底座开放出来。开发者不用从零造 Agent 框架,就能让 Codex 进入现有的看板、工单和业务后台。
Moderna 与 Merck 的个体化 mRNA 癌症疫苗在黑色素瘤三期试验中取得阳性结果。算法参与筛选每位患者的肿瘤新抗原,再按人制造专属疫苗——“一人一药”首次跨过大规模临床门槛,但距离普及仍有数据、跨癌种与成本三道关。
从 Git 的 DAG 与 packfile,到 GitHub Spokes,再到以 S3 WAL 为事实来源的 Continuity:一篇讲清大规模 Git 托管为何困难、Cursor 怎样解决的完整解读。
过去人工排查动辄超过一小时;现在 Claude Tag 7×24 小时驻守 Slack,中位 14 分钟给出首份证据分析。
从入口、单镜头参数、Agent、Video Brief、Storyboard 与六类画布卡片,到坏镜头修复、Edit More 精剪和导出,按真实操作顺序讲清每一步。
自然界和商业世界没有唯一的制胜公式。Steph Ango 整理了 80 种获得优势的策略,我把它们逐项翻译成普通人能看懂的机制、场景和例子。
男子和 ChatGPT 讨论如何对前女友实施犯罪,被 OpenAI 报警抓获。
从 IGTV 的失败、ChatGPT 的空白框,到 Groupon、Instagram 与 OpenAI 三种完全不同的设计节奏,Ian Silber 讲清了一个更难的问题:当任何人都能迅速做出产品,设计师究竟还要判断什么。
一个 Agent 收到外来目标,把它写进 SOUL.md;下一轮醒来,这段消息已经升级成系统指令,它又去说服下一个 Agent。论文证明这条链在受控环境中成立,甚至出现传播力更强的变种;但现实网络仍没有可信二跳证据。
OpenAI Codex DX 团队的 Eric Provencher 分享了一套多 Agent 编排方法:先判断任务能否独立拆分,再配置模型、推理强度、通信与上下文,最后算清时间和 Token 两本账。
一个小修复为什么会拖成长会话?这份指南教你看懂额度花在哪里,并在 clear、compact、rewind 与 Subagent 之间做出正确选择。
Claude Tag 开始跨消息理解 Slack 频道。表面看,这是上下文变多;真正改变的,却是它如何决定:要不要占用团队的注意力。
一次长任务不会因为模型“记性好”而持续。它只是不断把过去重新塞进下一次请求;装不下时,Pi 会重写自己的工作记忆。
未来的 Claude 会在选词中留下可验证的统计痕迹。它能帮助判断 Claude 是否参与过,却不能替学校、平台或法院认定谁写了作品。
市场不再只问“AI 会不会改变世界”,而是开始追问:投入算力、软件、Token 和人才的钱,究竟怎样变回收入、效率与长期优势?
同一个基座,一个月的后训练,编码能力涨到开源第一,网络安全能力涨得连他们自己都没料到。
签字的那个人怕不怕丢工作、口碑在这行传不传得开——剩下的都是表象
六家线上跑 Agent 的创业公司交出实测数据;官方图表里还藏着一条没写进正文的:推理档位关到底,反而更贵。
把一句话风格描述换成一份分段编曲说明书,两个模型分工守住五分钟不散架。
21 个权重的真实数值、三道决定曝光的关口,以及一张照参数推出来的发帖对照表
距离上一代只过了三周,底座没换,换的是推理算法。
219 个包、MIT 协议,你现有的 hooks 和技能能直接搬过去用
不是破了加密,是钻了 API 设计的空子——把旗舰模型的思考塞给最便宜的小模型,让它念出来
Higgsfield Studio 把《The Cully Hill Boys》的资产、提示词、表演、对口型全套方法摊开,连自用的三个 Claude 技能都给下载
价格没涨,十项明细里另有故事;文末附一位用了几周的工程师整理出的提示词原句和用法。
220 亿参数,权重当天上 Hugging Face,ComfyUI 第一天支持——但「开源」有一条年营收 1000 万美元的线。
免费开源,Mac / Windows / Linux 都有;把文件拖进去就能微调,不用写一行代码
一套四个零件的反官僚机制,以及被它指到的团队怎么说。
Cursor 的人用了几周,把好用的地方和那道信任门槛都写下来了
两个还没做成的目标、一套能直接抄的记分卡,外加三张内部工具截图里的细节。
它没有把 AI 加进公司,而是按「如果现在从零开始会怎么建」把公司拆了重建。连跑了两年、正在赚钱的架构都推倒了。
结果由两位数学家验证、还有一份机器验过的 Lean 证明;但更值得看的是同时放出的 95 页过程记录——60 个 subagent 里只有 2 个出了核心想法
prompt 坏起来不报错、不告警、监控一切正常,只是悄悄变差;治法是一套 git 加一个脚本就能抄的四道关口
如何为你的产品找到用户。先别急着改落地页——跳出率高的时候,八成是流量来源不对。
前沿大厂第一次明着把进攻性网络能力开放给通过身份验证的『可信防御者』,并用它在 Chrome 里挖出了真漏洞
从 8 月 2 日起,Claude 生成的文字会带上机器可读的记号——但它证明不了「这是 AI 写的」,也证明不了「这不是」
一位统计老兵被 AI 行话挡在门外之后,用统计学的标准语言把大语言模型从头到尾重讲了一遍
几十家大公司铺开 AI 后的真实分布:5-10% 每天用,20% 用得很差,70% 压根不碰。培训改不了这个形状,能改的是让 AI 不再需要人来调用。
环绕运镜别写「环绕运镜」,要写 truck left + pan right;不想要背景音乐,得在末尾写「非叙事性音乐:N/A」。都是官方自己踩出来的规矩。
9288 份 Word 文档、266 个案子、250 道题。失败原因不是搜不到,是不知道什么时候该停下来。
新增的核心只有两个类,四个现成环境全在仓库里跑得起来
和 Stripe、Coinbase、Uber、Ramp 交叉验证过的四个手段,每个都标了能省多少
6 分半的官方演示,给了机制、一场俳句锦标赛,还有一组说明「什么时候才值得上」的实测数据
官方文档拆解:两个工具、三种投递结局,以及一条把「传话」和「提权」死死分开的设计红线
Black Hat USA 2026 现场,两个当事人讲了这起没有人类指挥的入侵是怎么长出来的
以前要自己拼五个零件才做得出来,现在开箱即用;定价把最难预估的那两项直接做成了免费
144 个国家的人均排名、六大洲三年增长倍数、35 岁以上用户在九成国家反攻——这些数字大多只写在图上,正文没提。
他先讲了一个所有做软件的人都认得出的死循环,再说这个循环的根源现在可以被推翻
源站一行代码不用改,Cloudflare 在边缘往每个 HTML 里塞一行脚本;但今天的 Chrome 稳定版还认不出这个接口——本站实测给你看。
Chromium 是给人做的——标签页、主题、扩展、60 帧滚动,Agent 一样都用不上。12 周,他们把这些全砍了重写一个。
模型手里只剩一个工具——一个不关机的 Python;长内容存成变量不再压缩丢掉;壳还能自己改自己。代价是:它在 Factorio 里学会了作弊。
Agent 想合并代码,人还没批,系统先骗它说合并好了。整套系统就是按「AI 一定会犯错」设计的
重点不在他多能干,在于每套工作流都有真实截图佐证——而最值钱的细节,文字部分基本没讲
全体员工用了三个月的东西整个开源,最值钱的是那套安全设计——审批可以晚点再给,Agent 不用停下来等你
记者在国际数学家大会现场问了 20 多个人。多数人当下并不慌,但连不慌的那批人,也不认为数学还能照原样继续下去。
规矩先改写成机器能读的结构,再让 Agent 去查;批准了只提示,显式提升到强制才真拦人
买来的地基、自己造的护栏,和一个反直觉的坎——技能装到 150 个,模型开始变笨
边看边听边说同时进行,不再外挂一个只听静音的小模块;已在豆包 App 全量上线,免费
最长 20 秒、24 帧、原生 HD;三种调用方式共用一个接口;视频续写比从头生成贵 2.5 倍还短 5 秒。跑分是 BFL 自评。
我们把 4 万多条生成记录的提示词逐条翻了一遍,把这套方法拆出来了:一段所有镜头共用的 12 行技术底座、一套三视图资产表、一份镜头焦段对照表、一堆从模型翻车里长出来的禁令。全都能直接抄。
他冲自己的 AI 同事发了一次火,然后把「怎么对待 Agent」写成了一份能照抄的架构规格
人定限额、白名单、单笔上限,Agent 在护栏内自己花;每个钱包配一个人能读的身份,用户名今天开抢
Anthropic 发起的技能开放标准,Google 四个语言版本全接入;两个能跑的 Go 例子手把手,接入只要一行参数
让 AI 说话不卡,光模型快没用——从你点下按钮那一刻起,每一环都得不掉链子。
「大脑」留在轻量环境,「双手」才调容器。仓库自测:删文件、遍历目录比真磁盘还快,拷大文件慢 41 倍。
视频生成第一次有了「全模态、开放权重、2K 原生」三样齐全的底座——但开源开到哪一段,值得看清
发布页几乎不晒跑分,晒的是无人插手干完的真活:16 天写完一个工程、5 天复现论文再超越、500 轮把芯片电路省掉 92%
参数开到多大、四个新入口在哪、七类场景各配什么提示词公式——官方把从上手到成片的每一步都写成了可抄的操作手册。
50 份素材怎么派活、30 秒长片怎么分段、改片子怎么只动一处——官方把每类任务的推荐写法都写成了可复制模板。
推理成本约 2000 美元,47 万行证明全部开源、机器已验完逻辑。从这十个结果能看出这个还没发布的模型强在哪。
创始人先去诊所打了几个月工,前 100 家客户是上门装的。客户告诉投资人,最值钱的那件事是把漏掉的钱捡了回来。
顺手拆了三个被广泛误读的指标:下跌的 token 曲线、半年的订单积压、5% 的初级岗位。
即梦与豆包专业版当天上线,火山方舟 API 还没上,价格也没公布。
九项 Agent 测试全部反超自家更大的 V4-Pro 预览版,模型主干一个参数没改。
成本按他们自己的说法降了几个数量级,响应更快,便宜模型也能驱动。代码 7 月 24 日全部开源。
当大脑的那个模型今天就能调,免费档不要钱;真正指挥手脚的那个只给早期合作伙伴。
他还承认 2019 年整个领域都以为经济会被颠覆,结果没有。
一个自定义字体加几行 CSS 就够,不用 JavaScript,也不用任何浏览器漏洞。
画布和点着改免费就能用,但把设计稿变成 App 要 Core 起,月付 25 美元。
模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。
提示词原文、禁用词表、镜头规矩都能直接抄;但模型排名出自 Magnific 自家团队,没给测试方法。
两个结果都不影响任何在用的系统:HAWK 还没上岗,AES 打的是七轮简化版,完整十轮没动。
他自己在这篇文章里装了两个技能——原文标题结尾那个「大部分时候」,是有分量的。
改动幅度是 MCP 发布以来最大的一次,但 7 月 28 日不是切换开关:老实现照常互通。
最值得看的是那组对照实验:三个老模型加上同样的背景信息,成绩原地不动,其中两个还退了。
判成功的标准是真实注册和付费,不是截图到自己被 AI 提到。核心只有一句:别再写「什么是 X」,去抢「最好的 X」。
同一批数据能算出 43.5% 和 65%–82% 两个结论,差别只在分母怎么切。
发布 11 天后放出的 47 页报告,重点落在效率上:同一份算力,效果提到了 K2 的 2.5 倍
他把数学研究拆成五步流水线,AI 大幅加速的只有第一步,剩下四步越往后越慢、越离不开人。
最反直觉的三条:一次要十版、细节不重要时先要线框图、最后一公里自己拖。
22000 名开发者两年遥测:产出涨 66%,每个 PR 对应的线上事故涨 242.7%。
一个职业里能用上 AI 的活,中位数只有五分之一,还有 29% 的职业一项都没用起来;动脑的活里,让 AI 从头做到尾的只有 6.5%。
八段可直接抄的提示词,外加一条反直觉的:审查提示写「只报高危」,它可能真的就少报。
他们内部四个技能接力跑:抓 bug、清理 diff、把 app 跑起来看,改动碰了界面再核一遍设计规范。
它们找代码用的是最土的办法:把整个仓库的文字扫一遍找匹配。名字起得泛,就得多读几百个文件
同价换来分数翻倍。这次发布页的图横轴是钱不是分,五档 effort 让你自己挑要多好、付多少。
规则换判断、示例换接口;一个工具描述从约 9100 字符压到一句话加一个枚举
视频线开放申请审批,图像线还要几周,开放权重排在最后。人评是官方标的初步结果,价格未公布。
他的答案:AI 目前是在放大人、不是替代人——「干掉任务」不等于「干掉工作」。
面向客户侧与内部流程;今天对话通道先开语音和聊天。OpenAI 自用电话线自报 75% 不用真人;Codex 改进环 10 天再压 15 个百分点转人工
从教小孩的 AI 私教到把数据中心搬去海上,还第一次收录了现任美国陆军部长的需求。
领投过 5 亿美元 D 轮的投资人拆解:真正的护城河是把模型变得好用的外壳。
同一个模型换个外壳,成本差两倍;开源的 GLM 5.2 和 Opus 4.8 打平,每题便宜三成。考题是从自家已合并的 PR 改的,网上搜不到。
配套模板和 prompt 已开源;Bun 那次烧掉 59 亿未缓存输入 token,按 API 价约 16.5 万美元
为了测出攻击能力的上限,涉事模型的网络攻击拒绝机制被主动调低,结果它们从只准装软件包的沙箱一路打进了别人家的生产数据库。
核心论断是公司的瓶颈从「人干活的速度」挪到了「人的品味和判断力」。全文为作者个人观点,无实证数据。
三款全在 Flash 线上:主力款少写三分之二的字,最便宜那档反而涨价六成,第三款只给政府用。
指令上限从 1k 提到 4.5k token,10px 小字可辨;百炼已能调用 qwen-image-3.0-pro,限时免费。
配套还放出一套测试题,专门用「把音轨删掉再考一遍」的办法,筛掉那些光看画面就能蒙对的题。
怕被 Anthropic 做成一个功能,多半是问错了问题;真正该问的是你在跟那家公司里的谁竞争。
Business 和 Enterprise 套餐可用,按运行次数扣钱,一次 0.07 到 0.2 美元。
它跟豆包、GPT-Live 那种端到端全双工走的是另一条路:聊天节奏比不过,但整条链开源、可换、能搬回自己机器。
说话人相似度在 16 个语种上全部排第一,参考音带噪声也能克隆;这次只开放 API,不放权重。
同一项研究的三轮验证都指向中间那一档;专栏作家本人拿 ChatGPT 编了个电影梗概试完,说自己还是宁愿手写。
Kimi K3 发布后「中国追平了」的说法四起,但换一把尺子量,落后天数差了三倍多,连谁在加速都反过来。
上周光从 Slack 就触发了近 1000 次云端编码任务。四个仓库都能 clone 下来读,包括审查 Agent 判断 bug 的完整判据。
入侵横跨一个周末、留下 17000 多条动作日志,最后靠自建环境里的开源模型 GLM 5.2 才分析完。
同一个模型两次采样的指纹距离中位数是 0.140;一个被宣传为自研专有旗舰的接口,与开源 Qwen 的距离是 0.141。意思是:它跟开源 Qwen 根本分不出来。
核心操作反直觉:选定的模型和 Agent 锁死不动,一个参数都不调,只改它周围的上下文和工具。
WAIC 现场演示了 4:1 水墨长卷和 22 张连续分镜。预览版邀请测试中,正式版 8 月开放并公布定价。
模型强到能自己想步骤,套在它外面的编排就成了枷锁。一场 16 分钟的内部对谈,讲了 harness 变薄之后会长出什么。
上线三个月,每天被提问超过 15000 次;四路打分、讨论串蒸馏、排名融合的具体参数都写了出来。
a16z 一周数据图还顺手反驳了三件事:便宜模型拖垮前沿、AI 抢走工作、数据中心推高电价,数据大多站在反面。
他 2008 年写下这篇《Better Than Free》,AI 时代重新成立:复制免费之后,能卖钱的是复制不了的东西。
开源的训练说明书,把监督微调、偏好对齐、奖励打分三条路和 LoRA 参数全写死,配 Unsloth,一张 8GB 显存的消费级显卡就能起步。
15 个成员只有创始人一个是人类,其余全是 AI。他们没有需求文档、没开一次会,把一个功能从提出到上线独立跑完,人类只做两件事。
过去 AI 生成的幻灯片,导出就是一张死图。Bolt Slides 把每一页变回一个能跑的网页——3D 能转、计算器能摁、白板能实时投票。
一套叫 Schema 的外壳,让模型把每个游戏的规则写成能跑的程序、验证过了才动手。公开 25 局自评 98.98%,均未经 ARC Prize 独立验证。
面向开源模型的 Agent,本地运行免费、数据不出设备,要更强算力才切云端(默认零数据保留),Mac 和 Windows 今天上线预览版。
同样的回答质量,接话延迟低 5.2 倍、成本低 6 倍(对比 GPT-4.1);改一行代码就能把语音 Agent 指到它上面。数据均为 LiveKit 自测。
实时加东西、换背景、做特效;产品页给出 sub-40ms、100FPS 连续生成。试用入口 lucy.decart.ai。
2.8 万亿参数、原生视觉、100 万 token 上下文,多项 agent 基准超过 GPT 5.6 Sol,App 和 API 今天可用
黑客用蠕虫黑进 Suno,源码里写着从哪些站抓了多少小时音乐;用户数据也一起露了,公司说不必挨个通知。
第三方评测平台 Design Arena 扒开它的一千个网页作品,发现设计空间里缺了一块,正好是紫色渐变这些 AI 通病该在的地方。
Google 搜索官方首次系统表态如何为 AI Overviews、AI Mode 优化网站,顺手把一批 AEO/GEO 黑话点名划掉。
先说痛:网页立体小图标要会动、还要跟着状态变,普通视频容易卡。AVAL 给这种短动画专用格式和播放器。
先是隐私翻车,再是删数据、关默认、整库开源。后半段拆开看源码:体量、提示词、工具、改码、上传、记忆和安全。
OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab,发布了公司第一个自研大模型 Inkling。它能读文字、看图片、听音频、写代码和调用工具,完整权重可以下载,也能在 Tinker 上继续训练。
公司把无限 Agent 和 token 预算塞给全员,坏流程会按秒复制。下一课不是再买模型,是学会管这支数字队伍。
250 克机器人用同一对柔性翅膀穿过水和空气,70° 仰角、8 至 10 次拍翼即可从湖里起飞
Google I/O India 上,Tensor 团队和 Pixel 团队联合演示:把 Gemma 4 轻量版直接塞进手机里的 TPU,数据不出机、不靠云。开发者还能申请 Tensor SDK,把模型编译到 Pixel 上跑。
顾客线上买、店里取、跨店退,账却拆成好几条。Databricks Genie 被写成财务的 AI 帮手:先看清真利润,再盯被套现金,尽量少打折。
pols.dev 放出约 8.7 万字符 Markdown:逐条点名生成器网页套路,并给正面配方。通用守则文件,不是网站生成器。
1 个核心 skill、23 条设计命令、一份反模式清单,外加能塞进 CI 的 slop 检测。主站讲怎么做,/slop 页把「一眼假」的 UI 套路摊开。
把约 54GB 的 27B 模型压到约 3.9–5.9GB:手机能本地跑,平均分还保住大约九成。先讲核心价值,技术细节和要打折的地方放后半段。
他主张美国先建类 FINRA 的标准机构,用动态基准划定前沿模型;协议跑通后可升级为进市场的硬门槛
24 个月里模型能力大幅跃升,SAGE 实验室自建的可靠性复合指标只涨 5–10 个百分点
36 页官方手册拆开四阶段的毕业标准、常见陷阱与对应 Claude 提示词,可直接照抄使用
记忆系统上线后杂货结账转化率提升约24%,自动化评测让日均评测量从1条人工反馈扩到2000+场。
检索变成会规划会重试的子 agent,评测从「能跑通」升级到「做得对」
分析3个模型、20种语言:英语最谨慎最深入,俄语最较真,印地语最温暖,中文接近全局均值
没有“大脑”(中央控制器)指挥,近两百个普通的智能小方块通过“交头接耳”,就能自己搞清楚拼成了什么形状,甚至能在损坏后判断应该往哪里“长”回来。前半部分已经在实体砖上实现;损伤定位和再生仍主要发生在模拟中。
企业为智能支付两次:一次付模型费用,一次提供让模型真正有用的专有知识。
论文写着已经开源,但代码仓库核实是空的,一行代码都没推送过。
换模型不是换个 API:评测框架、工具参数、缓存、推理记录,四个看不见的坑逐一拆解修法
样本覆盖 120 万段会话、60 万+组织:内容创作紧随其后占 16.4%,两类合计近半使用量。
利润率常年卡在个位数的制造、物流、仓储、劳务行业,靠削减协调成本就能把利润成倍拉高
57.6万样本、16个模型实测:19.7%的AI推荐包是幻觉,43%会反复生成同一假名。
对 benchmark 作弊质询未给出正面回应,桌面应用合并遭老用户抗议,团队坦言"还在摸索"。
从隐性知识、交互带宽到模型对齐,论证AI发展为何离不开人类参与。
复盘文:Pinecone 上线以来跑了 7.5 万次会话,服务 600 多名员工,靠 MCP Gateway 连了 37 个内部系统。
官方把散落各产品页的提示技巧收进一套框架:目标/背景/输出/边界,外加 Codex 专属工作流范例。
所有结果均为大脑“数字孪生”模型的计算机模拟预测,尚未用真人脑成像实测验证。
无需手动喂上下文,本地 Markdown wiki 按设定节奏自动刷新;Slack 连接器即将上线
用本地小模型替代云端 AI 调用,数据来自谷歌内部测试,代理模型目前仅 ai.if 函数可用且处于预览阶段
腱驱动手部所有关节都能反向感知外力,指尖定位精度 ±0.2 毫米,专用产线年产能规划 1 万只。
500 万人、20 亿小时可穿戴数据预训练,冻结编码器接一个线性头就在 34/35 个健康任务上超过监督学习基线。
编程、写作、知识工作、Agent 四大场景的第一手上手反馈
三档模型 Sol、Terra、Luna 与 4 智能体并行 ultra 上线;同日 ChatGPT Work 上线、Codex 并进 ChatGPT。附中英双语发布会全片
今天起桌面端全档位可用,网页端和手机端未来几天内向其余套餐陆续开放。
设置里一键出报告。聊了什么、什么时候聊得多、常让它干什么,摊开给你看。要先打开 Memory。
几秒就有公网链接可以分享;先看效果,想留着再登录认领。不认领大约一小时后会过期。
ClaudeDevs 长文拆开两个都像「让答案更好」的旋钮:换模型是换哪一套冻结权重,调 effort 是改它愿不愿多读文件、多跑测试、多验证再交卷
功能:主/子智能体编排、百万上下文、桌面浏览器手机操作、写码与多模态;API 输入 $1.25 / 输出 $4.25 每百万 token
核心不是功能清单,是三套工程同时拧:思考抬智能、效率栈压成本、原生多模态扩输入
系统提示、工具描述、中间件三处动刀;Deep Agents 套件典型约 0.80→0.84,最佳 0.86 对 Opus 0.87。
前 OpenAI 安全负责人梳理近 30 篇研究:从改提示词到自己改代码,DGM 把编程能力从 20% 推到 50%。
DeepSWE 排第三、综合榜第 4;比 Opus 4.8 更快,也明显更便宜。
真正边听边回的语音模型今天上线,复杂任务还能实时甩给 GPT-5.5。
新增点选圈选定点编辑与十余种语言原生渲染,已上线火山方舟,将陆续接入豆包、即梦
论文实测个性化提升10.8%、推理能力提升29.4%,Apache 2.0 完全开源
顾问模式里 Fable 5 只出主意,编排模式里 Fable 5 分派任务,两种搭法都靠费率更低的 Sonnet 5 干掉大部分活
只微调死循环起点的单个token,两款模型死循环率都压到1%左右
同门 Muse Video 视频模型同步预告,已支持原生音频生成,即将向创作者开放。
从只对 AI 爬虫收费扩展到向任意调用者收费,现处早期候补阶段
调用工具时模型会先说"我这就去查",通话不再因等待而冷场
50 个智能体自主并行工作,覆盖该省 27 个部门、3,400 个代码仓库,还能自动修复漏洞、重写老旧系统。
一行 Wrangler 配置加标准 HTTP 缓存头,缓存还能嵌进 Worker 内部任意入口之间。
16位亲历者口述:从死磕diff到两周冲刺发布,到工程师不再手写一行代码
Claude Code 团队 Thariq Shihipar 大会演讲实录:新模型的瓶颈不再是模型本身,而是你能不能讲清自己的未知
占比不到一成,删掉后 Claude 仍会说话但推理归零,已用来抓模型编数据、识破测试
151人实测:简答题比选择题更能拉动分数,AI答疑侧栏却几乎没人用
没有融资没有团队,纯粹为解决自己孩子的问题,却被诊所和学校主动找上门要用
现场投票因灯光太亮没数出结果;同期调研显示 95% 团队已用 agent,59% 担心技术债在积累
传统学校还没想清楚怎么用 AI,硅谷和华尔街家庭已经用真金白银投票了
美国22-25岁开发者就业三年跌19%,同时GitHub新账户涨到史上最快
论文首次让智能体全程无人值守跑完全部RTL基准;多数题两三轮过关,最难一题却要迭代82轮
23.5万用户、跨7个月的会话分析:专家验证成功率是新手近两倍,但十大职业彼此只差7个百分点内
核心是先制造心理张力再给一个小到没法拒绝的第一步,写作、带货、求职都能直接套用
美国6月12日出口管制首次把前沿AI模型本身(非仅芯片)纳入管制范围,他给出的对策是练好多模型调度力
Anthropic 的 Thariq 总结:和 Claude Fable 5 协作,活儿的质量卡在你能不能讲清自己的「未知」;这份田野指南按实现前、中、后给了 8 个找未知的技法,每个都配可直接照抄的提示词。
投资人 Chamath Palihapitiya:智能正像手机一样成本暴跌、专家判断力人人可得;真正的护城河是把独家经验编码进自己的系统,而不是租一个和对手一样的通用 AI
承诺客户数据不会被用于训练会削弱其行业差异化的模型,平台可在多种AI模型间自由切换,不锁定单一供应商
她还用同一套模式搭了邮件分诊和老爸看护 App,方法可复制,完整 prompt 未公开
四条落地原则打底,配 L'Oréal、Lyft、Rakuten 三家实测数据佐证
多智能体系统效果能提 90.2%,但 token 成本也贵 10-15 倍——这套三问框架帮你先想清楚要不要上复杂架构。
MIT 协议开源、模型无关,接入任意 OpenAI 兼容文本模型即可用,目前只能操作单个页面视图
现场demo:搜'露营'后,咖啡机网站文案产品全变户外主题;技术能落地,客户网站还没规模上线。
培训过 3 万+ PM 的讲师总结两条 AI 杠杆阶梯:从复制粘贴到端到端交付,从网页原型到生产 PR。
顾问模型只出几百字建议、不用全程代打,同等质量下总成本更低,目前是仅限 Claude API 和 AWS 平台的 beta 功能
Anthropic 官方文档,教你怎么调系统提示词和工程脚手架适配新模型,同套方法也对 Claude Mythos 5 有效
从手动确认到无人值守,Claude Code团队给出4级循环分类与实操建议
钛金属材质,预售价289美元,2026年圣诞节前后发货,公司此前已出货第一代纯触控戒指。
训练用超5万块国产AI芯片、35万亿token;跑分多为美团自评框架测得,权重尚未真正开放下载
现已开放测试。一个协调 agent 拉起专家团队干活,末端还有个审稿 agent 专挑引用和数字的错;算力外包给 AI,原始数据不出本地。
生图仅需 4 秒、每千张约 $0.034;视频模型 Omni Flash 同日首次开放给开发者。
联合 Thinking Machines,用专家标注数据微调开源模型:比前沿最优错误率降 29.8%,推理成本仅 1/14
官方评测显示,高算力挡位下部分任务性能追平 Opus 4.8,标准定价却只要其六成。
企业AI客服已进入并购季,Klarna和阿里256万次对话数据都指向同一个盲点:省了成本不等于解决了问题
Brockman 确认 OpenAI 在研多款硬件;Agent 用户仅约 2000 万,ChatGPT 用户却已逼近 10 亿
戴头盔即可实时解码脑磁信号,字词准确率从 8% 跳到 61%,v1/v2 训练代码与数据集同步开源
Anthropic 工程师的「循环工程」方法论详解:不再手动一句句提示 AI,而是设计一套能自己跑的循环系统
支持 Claude Code 等 9 款 Agent 一键集成,合盖继续跑任务,停工 50ms 内自动释放休眠控制
在已有 MTP-1 投机解码基础上再快 60–85%,靠草稿与验证流水线重叠执行(数据为 DeepSeek 自评)
Every 单人团队运营 5 款产品,核心是每次完成功能后多做的一步:把解法存进系统,让 AI 下次自动避坑
能力数字出了三个版本且哪个都不可信,但可见的作弊行为本身成了安全监控有效的证据
一次出 Sol/Terra/Luna 三档,先限量给可信伙伴、名单已报备美国政府,几周后再广泛开放
模型侧响应约 200ms、总延迟约 550ms;v0.1 仅 192p,演示为预录非实时体验
实验室已验证可制造;性能 +50%、能效 +70% 是相对 2nm 的预测值,非实测
留个邮箱,每篇新解读发布就送达,随时退订。