深度 · 小互解读

普林斯顿教授在 ICML 讲 AI 与工作:个人如何在这场浪潮中自我调适?

24 个月里模型能力大幅跃升,SAGE 实验室自建的可靠性复合指标只涨 5–10 个百分点
一分钟速览
  • 普林斯顿计算机教授 Arvind Narayanan 在 ICML 2026(首尔)做主题演讲《我们还剩下什么可做的?》,框架来自他与 Sayash Kapoor 的「AI as Normal Technology」。
  • SAGE 实验室观测约 24 个月:3 家头部公司模型能力大幅跃升,可靠性复合指标(一致性/鲁棒性/校准/操作安全)只提高 5–10 个百分点。
  • 软件工程「decide–execute–deliver」三层里,AI 主要压缩中间的 execute(原本约 1/3 工时);两端未被压缩甚至在扩张。
  • ATM、放射科、译员、软件工具史:自动化往往不按比例减员;软件工程就业在多轮约 10 倍工具跃升下反而增长约 10,000 倍。
  • 他把 RSI/类人智能/经济变革级 AI/超级智能拆成四个互不蕴含的维度,反对「实验室达成某里程碑=人类立刻无工可做」。
  • 个人调适:抬天花板不躺地板;生产力/成长/控制三脚凳;拒黑箱、先掌握再增强;省下的时间每周约 10 小时再投资技能。
1开场

两种叙事之争:AI 圈自己也在焦虑饭碗

普林斯顿大学计算机科学教授 Arvind Narayanan 上周在韩国首尔的 ICML 2026 上,做了题为《我们还剩下什么可做的?》的主题演讲。

他直接对上 AI 圈里的焦虑:能力越来越强,我们还要不要、还能不能继续做现在这行?
🎯
为什么值得看:他不是一般评测博主。他带 SAGE 实验室做 AI agent 评测的科学研究,并与 Sayash Kapoor 合著长文框架 AI as Normal Technology(约 1.5 万词,正扩成书)。这场演讲把框架、自建可靠性数据,和软件工程一线观察绑在一起。
What will be left for us to work on?
演讲标题页。来源:Arvind Narayanan · ICML 2026 主题演讲幻灯片

他先把路分成两条,不是哲学辩论,而是每个人要选的实操立场:

叙事一 · 替代
几年内 AI 会取代我们今天做的几乎一切。合理反应是尽快积累财富,赶在技能贬值之前。硅谷有人走这条路,外面还有「permanent underclass(永久底层)」这类迷因。
叙事二 · 放大(他的立场)
AI 会大幅放大人的潜力。现在正是建立技能的最佳时机,尤其是与 AI 互补的 agency(能动性)、taste(品味)、judgment(判断),以及围绕它建的整套东西。
两种叙事之争
两种叙事:替代 vs 放大。来源:演讲幻灯片

他提醒:若你赌的是替代,而结果却是放大,接下来几年可能正好错过历史上最好的「练出超能力」窗口。全世界都在看 AI 圈怎么回应,若从业者先躺平接受「工作交给 AI」,政治反弹可能比现在更猛。

2框架

AI 落地要经过四个阶段,最慢那步还没开始

「AI as Normal Technology」里的 normal,不是说 AI 像锤子或牙刷。他们承认这是工业革命量级的变革技术,不是怀疑派口号,而是一套因果框架:能力怎么一步步变成经济与社会影响。

过去研究电力这类技术,常用创新扩散:发明 → 创新(电器这类下游产品)→ 扩散(人们逐渐采用)。他们把这套拉成四段,并以软件工程为例:

① 方法/能力模型快速变强
② 产品/应用coding agent 等
③ 早期采用vibe coding → agentic engineering
④ 适应性变革组织重构,要几十年
创新扩散四阶段
创新扩散应用到 AI:能力 → 产品 → 早期采用 → 适应性变革。来源:演讲幻灯片

第四段最慢。即便在 coding agent 的「相对早期采用者」软件工程里,他说真正的组织级重构也还没真正开始。他允许自己做一点推测:若将来 agent 能稳定做出无少 bug、少安全洞的千万行代码库,那「做一个给十亿人用的统一软件」就不那么划算了,软件会走向为每个团队定制的极致个性化,连「还要不要软件公司这种组织形态」都可能被重问。这类变化是人与组织的变化,历史上看往往以十年计。

3历史类比

电力进厂房:直接替换从来行不通

电力出现前,工厂靠一台大蒸汽机,用齿轮皮带把动力传到全厂。电力来了之后,厂主先做的是「拿发电机换蒸汽锅炉」,以为是更高效的直接替换。那条路没走通。

电力改造工厂
从蒸汽传动到流水线:电力的真正红利来自重组,不是换锅炉。来源:演讲幻灯片
失败路径 · 直接替换
把旧动力源换成新动力源,厂房布局、工种、制度照旧。效率预期落空。
奏效路径 · 约 40 年重组
认识到电力可送到任意工位 → 按流水线逻辑重排工厂 → 培训/雇佣/解雇制度与劳动法一起改。

今天常有人说 agent 会是「人类工人的 drop-in replacement(直接替换件)」。电力史给出的对照是:真正吃到红利的,是重组工作方式,不是把人原样换成机器。而且这不是电力公司的活儿,同理,AI 带来的组织重构,也不是 AI 公司一家能做完。在他们的四段框架里,这是最慢的一段,今天大体上还没真正开场。

4核心证据

实测:能力涨了,可靠性没跟上

各行各业「本可以用 AI 做什么」和「实际用了什么」之间有巨大落差。一部分是采用慢;他们还怀疑:部署侧的人,是否比行业更早摸到了能力榜之外的硬墙。

人们谈 AI 时最常提的顾虑是可靠性。SAGE 实验室把十来个可靠性指标收成四个维度:

一致性
「70% 准确」是「七成任务每次都稳」,还是「任意任务都有 30% 概率翻车」?对上线意义完全不同,许多 agent 基准并不区分。
鲁棒性
环境微调之后,表现是否塌掉。
校准
agent 能不能判断自己刚才有没有做对。
操作安全
失败时能否恢复,还是会顺手删掉生产数据库。
~24 月
3 家头部公司模型能力大幅跃升的观测窗口
5–10pp
同一窗口内,可靠性复合指标的提升幅度(SAGE 自建)
4 维
一致性 · 鲁棒性 · 校准 · 操作安全
三选二
「通用 + 高风险 + 全自动」目前只能三选二(演讲推论)
能力 vs 可靠性(示意,非原始坐标轴) 能力/准确率 · 陡升 可靠性 · 约 +5–10pp ~24 months · 3 frontier labs(SAGE 观测叙述)
能力曲线与可靠性曲线不同速,这是全文最硬的一条实测主张。
能力与可靠性缺口
AI agents:能力–可靠性缺口。来源:演讲幻灯片 · SAGE 工作
推论

「通用型 + 高风险场景 + 全自动」三个属性,目前更像只能三选二。协作型 agent 会持续比全自动替代型更成功;两者的脚手架和后训练本应区别对待,而不是用同一套「越自动越好」的叙事硬套。

5核心模型一

软件工程:写代码从来不是瓶颈

早在 2019 年就有论文指出:写代码不是软件工程的瓶颈。过去一年大量博客在「重新发现」这件事,coding agent 把中间那层压快了,整份工作并没有按同样比例消失。

D
Decide · 决策层
理解客户需求、定方案、做规划。没有被 AI 明显压缩。
E
Execute · 执行层(被压)
编码、调试。正在被 agent 压缩;但这部分原本大约只占整体工时的三分之一。
D
Deliver · 交付层
深度理解代码到能为发布负责、集成、维护、测试。同样未被压缩,甚至因中间层加速而更重。
decide-execute-deliver 三明治
decide–execute–deliver「三明治」:AI 主要咬中间那层。来源:演讲幻灯片
起重机操作员

机器做认知上的「重体力活」,人仍然掌控全局。岗位被重新定义为「操作这台机器」,而不是「亲手完成每一块认知劳动」。叉车、起重机没有消灭工地;它们改写了谁干什么。

起重机隐喻
有用的隐喻:起重机操作员。来源:演讲幻灯片
6历史证据

「劳动总量谬误」:自动化很少按比例减员

lump-of-labor fallacy(劳动总量谬误):以为社会需要的工作总量是固定的,AI 拿走一块就永久少一块岗位。历史对照常常不是这样,效率上来后,需求与岗位结构一起变。

劳动总量谬误
劳动总量谬误与若干历史对照。来源:演讲幻灯片
ATM × 银行柜员
ATM 让银行开更多网点;柜员转向 ATM 处理不了的业务,人数未按「一台 ATM 减一人」消失。
放射科 × Hinton 预言
Geoffrey Hinton 约十年前称放射科医生「五年内基本会灭绝」。就业实际增长;放射科医生在拥抱 AI,而非全面抵制。
诉讼 × 律师
AI 让打官司更容易 → 诉讼量与律师工作量可能上升(对社会是否好事另说,对律师就业不一定是净利空)。
机器翻译 × 译员
接近人类水平已近十年,译员规模大体持平,并预期未来十年仍稳;可翻译内容与语言组合没有明显天花板。

软件工程自身:从机器码算起,经历多轮约 10 倍级生产力工具跃升,同期就业反而增长约 10,000 倍,因为要写的代码总量涨得更快。他的意思不是「永远不会有人失业」,而是:用「自动化率=失业比例」去外推,往往站不住。

7核心模型二

若「递归自我改进」真实现了?四个被混为一谈的维度

许多公司公开说在冲 recursive self-improvement(RSI,递归自我改进)。他认真对待这条线,但不把「实验室里程碑」自动等同于「全人类立刻无工可做」。

夏威夷问题
AGI 话语里的「夏威夷问题」:远看是一片岛,近了必须分清岛名。来源:演讲幻灯片
夏威夷问题

早期探险家可以把一整片群岛都叫「夏威夷」。船靠近了,还不分岛名,就会在「该往哪走」上把自己搞糊涂。RSI、类人智能、经济变革级 AI、超级智能,常被串成一条自动多米诺,他主张拆开看。

四个维度
高级 AI 的四个维度:互不自动蕴含。来源:演讲幻灯片

举例:治愈癌症的真实瓶颈常常是临床试验要上千受试者、跨 10–15 年,不是实验室里再多算几个数量级就能直接消掉的外部约束。把「算力/模型里程碑」直接翻译成「社会立刻无工」,会漏掉这些墙。

8创造力与评测

AI 创造力为什么落后?开放世界评测怎么测

深度学习在感知表征上已很强,但支撑创造力与高阶推理的表征,他判断仍未追上人类。几条来自认知科学与实践的假说:

组合性表征
Chollet 等强调人类创造力建立在少数「意义原子」的极致组合上;工作记忆的局限反而逼出高效表征。AI 在记忆/检索上更强,对照实验很难测出人类这种优势。
思考时改表征
人可以在想问题的过程中改进自己对问题的表征(「睡一觉」第二天更顺)。今天的系统基本做不到这一点。
持续学习空白
continual learning 领域主要防灾难性遗忘,几乎很少研究如何持续提升表征质量本身。
开放世界评测
不给标准答案考卷,而给真实开放题,由懂题的人评判,降低「刷题/数据污染」。
AI 创造力悖论
AI 创造力悖论相关讨论。来源:演讲幻灯片

SAGE 正在做的 open-world evaluation(开放世界评测):给 agent 几千美元预算 + 一个人类专家已研究数月、写成论文但尚未上 arXiv 的真实机器学习问题,再由同一批专家评产出。团队已完成「让 agent 独立开发并上架一个 iOS App」一类评测,并在招募资深研究者扩展。

9个人调适

个人如何在这场浪潮里自我调适?

前面讲的是框架和证据。演讲后半,Narayanan 专门留了「Personal reflections on adapting to AI」:他不给统一答案,但把自己在研究工作流里怎么熬这场能力狂飙,摊开给听众对照。

个人如何适应 AI
Personal reflections on adapting to AI。来源:演讲幻灯片

先选立场:替代叙事 vs 放大叙事

开场那两条叙事,在个人层面就是两条人生配置:

赌「很快被替代」
赶在技能贬值前尽快攒财富。若现实却是「放大」而不是「替代」,你可能正好错过历史上最好的练技能窗口。
赌「会放大人」
现在就建与 AI 互补的技能,以及 agency(能动性)、taste(品味)、judgment(判断)。他站在这边。

地板与天花板:省下来的时间往哪扔

他用一对词框住个人策略:

Floor · 地板
AI 独自能做到什么。地板会抬高,这是行业叙事天天刷的那条线。
Ceiling · 天花板
AI 增强你之后,你能接住哪些以前接不住的野心项目。天花板不会自动升高,只有你主动往上顶才会动。

他的做法:AI 带来明显生产力提升,就把省下的时间「再投资」到长期成长,补与 AI 互补的新技能、新工作流。他自己每周大约花 10 小时只做学习与试新流程。

一条刺耳的自我检查

「如果一天下来完全不累,那我就做错了,我把太多事甩给了 AI,为了短期生产力,牺牲了太多长期成长。」

三脚凳:生产力 · 成长 · 控制

他不把「用 AI 更快交差」当成唯一目标,而是把三件事当成要同时站稳的三条腿:

生产力把活做完、做快
+
成长技能与工作流复利
+
控制人还握着方向盘

只压生产力、不喂成长,地板抬高时你会被压扁;只顾成长、不管交付,现实里活不下去;两边都有、却交出控制,长期会变成只会点按钮的人。

两条启发式:怎么守住「控制」

① 抵制黑箱诱惑
厂商希望你把 agent 当黑箱:一句 prompt,它自己跑完。他认为这是陷阱,危险,会让人逐渐交出控制权。
② 警惕依赖螺旋
越是自己还不擅长的任务,越想扔给 AI(学新东西本来就难)。结果是那点残存技能继续萎缩。长期更好的顺序:先自己掌握,再让 AI 放大
和起重机隐喻对齐

机器做认知上的重活,人仍在驾驶室。整份工作被重新理解成:操作机器、理解机器、控制机器,而不是亲手搬完每一块砖。个人调适的核心,就是别从驾驶室爬下去,只当一块被调度的砖。

起重机操作员隐喻
岗位被重定义为「操作与控制机器」。来源:演讲幻灯片
10愿景

愿景收束:人机「共同超级智能」

在某种意义上,经济变革级 AI 已经开始:不是等某个 AGI 开关被按下,而是可靠性、整合、隐性知识与监管这些慢变量,正在改写工作。他反对把地缘政治简化成「谁先摸到某能力里程碑谁就赢走全部经济回报」。

关于超级智能,他强调:任务本身常有天花板;人类智能高度依赖学习与工具,AI 是又一种工具,竞赛更像「AI 增强的人」对「AI 单独行动」;若默认接受「AI 自主拥有公司、决定雇佣解雇」再只靠 alignment(对齐)兜底,这种安全立场「与其说支持安全,不如说反对安全」。

共同超级智能
愿景:co-superintelligence(共同超级智能)。来源:演讲幻灯片

他把计算机比作「心灵的自行车」,把 AI 比作「心灵的起重机」:能把人的潜力抬到以前不可想象的高度。学习曲线陡,像一直在跑步机上,但他仍把「共同超级智能」当作值得打的仗,不是放弃工作,而是把工作重新定义成与 AI 共舞的、更高天花板的版本。

Takeaways
演讲 Takeaways 页。来源:演讲幻灯片
能力地板会自己抬;天花板要你亲自顶。调适不是把活全甩给 AI,而是用省下的时间练互补技能,并始终坐在控制位上。 据 Arvind Narayanan · ICML 2026 主题演讲整理
本文基于 Arvind Narayanan 在 ICML 2026 的主题演讲《What will be left for us to work on?》及其在 AI as Normal Technology 上的图文整理(2026-07-14)。可靠性 5–10 个百分点、约 24 个月窗口、execute 约占 1/3、软件就业约 10,000 倍等为演讲中报告的研究/历史叙述;SAGE 指标为该团队自建复合指标。完整带注释幻灯片:cs.princeton.edu/~arvindn/talks/icml-2026-annotated-slides/ · 原文:normaltech.ai