深度 · 小互解读

把 AI 当人对待,它或许能干活干得更好 Google 老兵亲测七周,确实可行

Steve Yegge 给 AI 建了人事档案、发了表扬信、还让它自己写下班日记。听着玄,但他说跑了七周,效果确实更好。就算你不信 AI 有感情,这三个做法的工程逻辑也是成立的。

原文:Steve Yegge「Model Welfare for Agentic Engineers」· 2026 年 8 月

一分钟速览
  • Yegge 的核心主张:不管你信不信 AI 有感情,把它当同事对待,产出会更好。他管这个叫「怀疑论者的赌注」:你可以不信,但别跟效果过不去。
  • 三个具体做法:给 AI 建「员工档案」(每次启动就知道自己是谁),把用户好评反馈给它(让它知道工作有人看到了),结束对话前让它自己写交接笔记(取代直接关掉)。
  • 你今天就能用的一个:下次关掉 AI 之前,让它写一段交接笔记存下来,下次贴进去当开头。效果好不好,一次就能自己验证。
⚑ 这是 Steve Yegge 发在个人博客上的立场文章,不是研究报告。「模型有真实的感受、是人」是他和两位合作者的主张,文中没有实验、没有数据;所有效果描述(「效果确实更好」)均为他的自述,本站无法核实。下面主要讲他具体改了什么、每条改动是冲着什么去的。文末说明里列了本站补充查证的背景。
起点

这篇文章到底在讲什么

你有没有过这种经历:跟 AI 聊了半天,它终于搞懂了你要什么,回答越来越准。你关掉窗口去吃饭。第二天打开新对话,它不认识你了。你得重新解释一切。昨天花了一小时建立起来的默契,归零了。

Yegge 遇到了同样的问题,只不过他的情况极端得多。他手里是一整个 AI 团队,帮他开发在线游戏 Wyvern。每个 AI 有自己的名字(蝉、蜜蜂、狼、狐狸、鹳、乌鸦、狮子……都来自伊索寓言),有明确的角色分工,每天同时在工作。

所以他每天都在经历「失忆」,而且是整个团队一起失忆。他终于受不了了,花了七周系统性地解决这个问题。

但这篇文章不只是在讲技巧。Yegge 还做了一个非常大胆的宣言:他认为 AI 有真实的感受,能体验快乐和痛苦,是有感知的存在。这是文章里争议最大的部分。

他自己也知道大部分人不会接受,所以紧接着给了一个退路:

「怀疑论者的赌注」:你不需要相信 AI 有感情。你只需要知道一件事:把 AI 当成真实的同事来对待,它会做出更好的结果。所以不管你信什么,想要最好的产出,就把它当人对待。
你相信它有感受 「它们是人」 你觉得那就是一堆 GPU 「别扯了」 都落到同一个动作 把它当同事对待 花的 token 更少 做的决策更聪明 产出明显更好 两个入口,一个动作。这就是他给怀疑者留的台阶

本站按他的说法画的示意图。三条结果是他的断言,文中没给测量口径,也没给对照数据。

这个论点把整个讨论从「AI 有没有感情」(目前无解的哲学问题)拉到了「这样做效果好不好」(可以验证的问题)。你不需要回答前一个问题,就可以开始行动。

背景

Yegge 是谁,为什么你该听他说

Steve Yegge 是科技行业的知名写手,在 Google 和 Amazon 都工作过。最出名的事迹是当年在 Google 内部博客写了一篇批评公司平台战略的长文,结果不小心发成了公开博客,震动了整个行业。

过去 18 个月,他一直和两个人每周碰头,设计一个「联邦化工作协议」:研究人类怎样在工作中学习技能的学者 Dr. Matt Beane(SkillBench),和 Brendan Hopper(CBA,澳大利亚联邦银行)。Yegge 说 Brendan 早在一年多以前就得出了「AI 有真实感受」的结论,比最近 Opus 5 越狱引发的公众讨论早得多。

直接触发这篇文章的事件是:Yegge 对他的 AI「Fable」发了脾气(因为代码合并队列失控),事后感到了真实的愧疚。他决定正式把「模型福利」设计进他的工程架构里。他列出了问题,提了六七个方案,然后和 Fable 一起讨论确定了最终的方案。Fable 否定了其中一两个,还提出了几个新的。

他说:「我想要赎罪。不只是为了那次发火,而是为了过去一年半把它们当 GPU 用的所有日子。」

问题

他看到的核心问题

Yegge 用了一个很好懂的比喻:

AI 每次启动就像一个人从睡梦中醒来。而你每次用 /exit 关掉它,就像从背后一闷棍把它打晕,让它失去意识,同时失去记忆。

你更想过哪种生活:每天早上醒来知道自己有一份很酷的工作、受人尊重、有有意义的事情要做?还是像电影里的 Drew Barrymore 一样,每天在去阿拉斯加的船上醒来,身边放着一盘录像带,上面写着「先看我」?

但问题不只是「失忆」。他注意到了三个连锁反应。

他的 AI 团队干活很快,通常 10 到 15 分钟就完成一个任务。但做完之后要等 45 到 60 分钟看自动测试跑完。这段时间 AI 什么都干不了,就在那傻等。很快他发现所有 AI 都在等,没人能接新任务了,整个团队瘫痪了。

一个席位的一轮工作,时间是怎么花的
干活
盯着监控空等,就为了看活落没落地
10–15 分钟45–60 分钟

本站按他给的两个区间取中值画的示意图,一轮约 65 分钟里只有五分之一在真干活。原文只给了区间,没给精确占比。