深度 · 小互解读

Cloudflare 开源 AI 办公系统 Cloudflare OS 深度解析:彻底解决 Agent 可能犯错,幻觉、越权、误操作等问题

Agent 想合并代码,人还没批,系统先骗它说合并好了。整套系统就是按「AI 一定会犯错」设计的
一分钟速览
  • Cloudflare 把全公司用了三个月的 AI 办公平台开源了,每份文档背后都是一个你能随时改代码的独立小应用。
  • 最反直觉的一招:Agent 要合并代码,人还没批,系统直接回它「合好了」,再编一个分支给它接着干。
  • Jamie Lord 读完全部源码,结论是:这套系统的本质就是彻底不信任 AI。
  • 五道机制拆完还剩一笔账:拴住它、让它安全的那根绳,也正是让它拉不动多远车的那根。
⚑ 主线来自 Jamie Lord 的第三方剖析文章。文中每一处源码引用,本站都回 cloudflare/cloudflare-os 仓库逐条核对过;性能数字与「AI 不可能引入重大安全漏洞」这类话属于 Cloudflare 官方口径,已在出现处标明。
开篇

Cloudflare OS 是什么,为什么它默认 AI 一定会犯错

8 月 5 日,Cloudflare 把自家全公司用了三个月的 AI 办公平台 Cloudflare OS 整个开源了,你可以部署到自己的服务器上。

Cloudflare OS 是什么

每个员工一个 Agent 工作区装好了公司的资料和内部技能,让它查东西、写文档、做表格和幻灯片,也可以不做文档,直接派活给它。
能接上公司的系统干活GitHub、Google Drive、Slack、Notion、Linear、内部数据库,仓库里自带十六个连接器,接上就能读能写。
每份文档都是一个独立的小应用你建的每一份幻灯片、每一个表格,背后都是一份属于你自己的代码和数据库,缺什么功能张嘴让 Agent 加。
不懂技术的人也能放心写应用应用之间互相隔离,一个人写烂了波及不到别人,安全团队不用替他兜底。
模型可换、花销看得见Anthropic、OpenAI、Google、Workers AI 都能接,谁花了多少钱走同一个网关统计。
完全开源,不绑 CloudflareApache 2.0 协议,跑在同样开源的 workerd 运行时上,可以整个搬到自己的服务器。

Cloudflare 内部用了三个月,光最近 30 天就建出四千多个这样的小应用,销售团队估算省下一万多小时。

站内相关
Cloudflare 开源自家内部 AI 办公平台 Cloudflare OS:一个专门给全公司员工用的「AI 办公操作系统」
功能全貌和自己部署的步骤,那篇讲全了。

《Architecting on Cloudflare》的作者、英国 CDS 公司的解决方案架构师 Jamie Lord,对 Cloudflare OS 做了一次源码级的深度剖析。他发现:

核心发现

Cloudflare OS 的本质是「彻底不信任 AI」。它把 AI 可能犯错(幻觉、越权、误操作)当作必然的前提,并从系统底层架构上彻底封死 AI 破坏系统的可能。

传统思维

想办法让 AI 更聪明、更少犯错:写更好的 prompt,给它更多权限。

Cloudflare OS 思路

承认 AI 就是会一本正经地胡说八道和搞砸事情。既然无法保证它 100% 正确,那就把平台做成「金丝雀笼子」,让 AI 在里面以为自己有无限权力并高效干活,但真正的控制权(提交权)始终牢牢握在人类手里。

一句话价值:它示范了在大模型还不可靠的当下,如何通过能力模型(Capabilities)、轻量隔离(Isolates)和异步审批(Simulations),构建一套既能放手让 AI 自动化跑流程、又绝不会给企业带来安全灾难的下一代 Agent 操作系统架构。

这套设计的核心理念,可以拆解成下面五个关键机制。

前提:AI 一定会犯错 01 假装成功 人还没批,系统先告诉 Agent 已经办好了 02 沙箱隔离 每份文档一个单间,代码写烂也只烂自己那间 03 剥夺密钥 钥匙在看门人手里,Agent 只拿到几个能调的方法 04 追踪数据来源 记着它读过什么,分享前先查对方够不够格看 05 连人类贡献者也不信 外部 PR 超过十几行,直接关掉 五道机制拆开是五个安全特性,合起来是同一句话的五个推论。
本站按原文梳理绘制。往下五节,一节一道。
机制一

假装成功:人还没点同意,系统先骗 Agent 说已经办好了