工具教程 · 小互解读

实战案例:GitHub 官方讲透如何用好Harness 送你一套清晰、可重复落下的 8 步工作流

他自己在这篇文章里装了两个技能,原文标题结尾那个「大部分时候」,是有分量的。
一分钟速览
  • 每天都有新 MCP、新技能、新工作流冒出来,追不过来。GitHub 官方博客 7 月 27 日发文说:别追了,把手上这个 AI 编程工具本身用熟,效果更好。
  • 作者 Burke Holland 在 GitHub 和微软做开发者布道,主攻 GitHub Copilot 方向,带过开发者工具布道团队。他给的是自己每天在跑的八步流程,全程只用 GitHub Copilot 的现成功能。
  • 动手写代码前,先让 AI 一次出 20 个原型摆在一页里对比,连「加一个 API 接口」这种看不见的活也先画图。他的理由是:这些东西你不看到就不会去想。
  • 最后一道关卡是让另一家公司的模型来挑毛病:他用 GPT-5.6 Terra 写代码,Copilot 自动叫了 Claude Sonnet 来审,两家训练数据不同,盲点也不一样。
  • 全权限模式他建议开,但只能在沙箱里开:AI 投资人 Matt Shumer 就在自己 Mac 上开过,一个环境变量解析出错,一条递归删除命令把他主目录里的文件几乎删光。
  • 原文标题《The harness is all you need (mostly)》结尾那个 mostly(大部分时候)有分量:他自己在这篇文章里就装了两个技能,一个用来把计划问透,一个用来给设计定调。
材料来自 GitHub 官方博客,作者在 GitHub 和微软做开发者布道,讲的是自家产品 GitHub Copilot 的用法。文中的功能名和命令是 Copilot 特有的,方法本身与用哪家工具无关。
开篇

GitHub 官方梳理的八步工作流,拿开发一个日期选择器当例子

GitHub 官方账号分享的一篇极其实用的 AI 开发者工作流指南。它讲的是一个很现实的问题:不要被每天层出不穷的新 AI 工具、复杂提示词或各种黑科技弄得焦虑不安,真正能在实际生产里让你产能暴增的,是把 harness(外壳)用透。

作者 Burke Holland 在 GitHub 和微软做开发者布道,主攻 GitHub Copilot 方向。他拿「从零开发一个日期选择器(Date Picker)组件」当例子,梳理出一套清晰、可重复落地的八步工作流,全程只用 GitHub Copilot 的现成功能,不装任何新东西。

不知道 harness 是什么?
AI 自我进化,先改模型外面的外壳:Lilian Weng 讲透 harness 工程
看这篇就够了,模型外面那层壳到底管什么、能做到什么程度,里面讲透了。

下面这八步就是他每天在跑的流程,点标签看每一步在干什么:

挑一个入口,新手从命令行版开始

几个入口正在收拢到同一个外壳,学一次到处能用。

把审批按钮关掉,换到沙箱里跑

不给自主权就谈不上提效,但全权限必须配隔离环境。

/allow-all(别名 /yolo)

一次要 20 个原型,摆一页对比

你看到了才知道自己想要什么。

Give me 20 mocks for a date picker web component…

进计划模式,让它把边界问题问出来

需求写得含糊没关系,含糊正是这一步要解决的。

/plan Build a date picker web component…

批准计划,交给 Autopilot 跑完

内置的循环,逼模型接着干,直到计划里每一项真的做完。

人来审,别接受「差不多能用」

交出来的东西多半不是你要的,这一步你的品味决定成品质量。

叫另一家公司的模型来挑毛病

换一家公司的模型来审,两边盲点不一样。

Perform a rubber duck review on…

提交,换话题就开新会话

会话按主题分,聊着聊着跑题跑远了就该换一个。

第一步

第一步:挑一个入口,新手从命令行版开始

光是 GitHub Copilot 家族里就有一堆入口:命令行版(CLI)、新出的 GitHub Copilot 桌面应用、VS Code、Visual Studio、JetBrains,这还只是举几个例子。

好消息是这些入口正在收拢到同一个外壳上。细节各有不同,核心流程是一样的:学一次,到处能用。

他给新手的建议是从命令行版开始。理由是想学会这个外壳,最好离它越近越好。终端里就是纯文字,没有一堆界面要学,你打一句话,Agent 干活,交互更直接、更即时,用他的话说,「说实话挺爽的」。

他这次演示用的是新出的 GitHub Copilot 桌面应用。这个桌面应用建在 Copilot 命令行版之上,macOS、Linux、Windows 都能装。它主打的是同时开好几个 Agent 会话,每个跑在自己独立的 git 工作树和分支上,互不干扰。会话模式有三种,正好对应下面几步要讲的东西:

会话模式谁在做主
Interactive互动你来我往,它做一步等你一句
Plan计划它先出实现计划,你审、你批
Autopilot自动驾驶你不用管,它自己一步接一步跑到任务完成
第二步

第二步:把审批按钮关掉,但别在自己电脑上关

YOLO 模式(you only live once,「人生只活一次」,程序员用它自嘲「豁出去了」),官方名字叫 Allow All(全部允许),具体开法各家工具不太一样,多数就是在聊天里打一句 /allow-all/yolo 是同一个命令的别名。开了之后 Agent 想跑什么命令就跑什么,不再一步一问。

他坚持要开的理由是:Agent 得有自主权,你才看得到效率提升。如果它干什么都要你点一下「批准」,那你不如自己干。而且一天到晚坐那儿点批准是很难受的体验。更糟的是,点多了你就被训练成不看内容直接点,那这个批准环节就白设了。

他紧接着甩了个链接,指向 7 月 10 日的一条推文。Matt Shumer 是 AI 圈的活跃投资人,也做过 AI 写作产品 HyperWrite 的 CEO。他把 GPT-5.6 Sol 放在自己 Mac 上跑。Agent 在执行一个文件清理任务时,拼出了一条递归删除命令(rm -rf),把他 Mac 主目录里的东西几乎删光了。

1:21
会话跑了 1 小时 21 分钟,他才发现文件正在被删
Ultra
用的是最高自主度的 Ultra 档,不是日常那种一步一问
$HOME
起因是一个环境变量没解析对,模型照着错的路径执行

我很生气……OpenAI 团队正在查这件事,但这种事感觉应该发生在 GPT-3.5 身上,而不是 2026 年年中、跑在最高推理档上的前沿模型。

Matt Shumer,2026-07-10

所以作者的结论是:开 YOLO 可以,但别在本机开。在公司里更是如此,数据在组织的系统上,出事代价很大。要开就找个沙箱一个跟你本机隔离的一次性环境,里面被删光了也不影响你自己的文件。,最容易上手的是 GitHub Codespaces(云端开发环境)或者 dev container(在本机上用容器隔出来的开发环境)。

权限一共四档,从只读放行到全自动

这一层决定了你能不能既省心又安全。Copilot 命令行版默认并不是每件事都拦你:只读操作,搜索、读文件、跑只读命令,本来就自动放行。要你点头的是那些能改动系统的动作:跑破坏性命令、写文件、访问网址。

从「每步都问」到「全自动」,中间还有几个档位: