深度 · 小互解读

Claude Fable 5 官方提示指南:十几条可直接抄的调法,从治过度规划到治假进度汇报

Anthropic 官方文档,教你怎么调系统提示词和工程脚手架适配新模型,同套方法也对 Claude Mythos 5 有效
一分钟速览
  • Anthropic 发布了针对 Claude Fable 5 和 Claude Mythos 5 的官方提示工程指南,列出这一代模型相对 Claude Opus 4.8 的行为差异,以及对应该怎么改提示词和工程脚手架
  • 指南给出十几段可以原样粘进系统提示词的指令文本,分别用来治过度规划、拦住自作主张的重构、压缩啰嗦输出、划定该停下问用户的边界
  • 一段专门的审计式指令要求模型汇报进度前对照本轮会话里的工具调用结果核实,Anthropic 表示这在专门设计来诱导编造的测试任务中几乎消除了虚假状态汇报
  • 指南建议给长程异步 agent 加一个 send_to_user 工具,让必须原样展示给用户的内容跳过总结直接送达
  • 文档提醒:如果提示词要求模型把内部推理过程复述进回复文本,可能触发 Fable 5 的 reasoning_extraction 拒答类别,导致请求被自动降级到 Claude Opus 4.8
立场提示:这是 Anthropic 官方发布的产品文档,目的是教你用好自家新模型。文中的能力描述,以及「几乎消除」「单次做对」这类结论,来自厂商内部测试和早期测试者反馈,未经第三方验证。下文只如实转述文档内容和可原样复用的指令原文。
1背景 · 是什么

这篇文档要解决什么问题

Anthropic 近期发布了 Claude Fable 5 与 Claude Mythos 5 的官方提示工程指南,总结了这一代模型相对 Claude Opus 4.8 的行为变化,以及需要跟着调整的提示词和工程脚手架写法。

说白了这是一份调参说明书:新模型更能干,但几个默认行为变了,老提示词和老工程框架照搬会踩坑。文档把每个变化都配上一段可以原样粘进系统提示词的指令,让你照着改。

🎯为什么值得看:它不是泛泛谈技巧,而是给出十几段拿来即用的指令原文,其中一段审计式指令,在官方内部专门设计来诱导模型编造进度的测试任务里,把虚假状态汇报几乎清零。你不用自己反复试错调参。
lowmedhighxhigh
先把效力挡位选对
再伺候它跑长活:分钟级到数小时,每报一步先核对证据。这两件事,就是整份指南的主轴

先看它比上一代强在哪(一笔带过)

文档列了七项相对 Claude Opus 4.8 的提升,这里逐条一句话带过,不展开:

  • 长程自主:没人盯着也能连着干几小时到几天,长复杂任务里不断线、不忘原本要干什么
  • 首次即中:一些过去要反复迭代数天才跑通的系统,早期测试者反馈单次就实现正确(测试者口径)
  • 视觉理解:读密集技术图、网页应用、详细截图更准,输出还更省 token,会用 bash 和裁剪工具处理翻转、模糊、噪点图
  • 企业工作流:财报分析、表格、幻灯片、文档上更守指令、不跑题、产出更专业
  • 代码审查调试:找 bug 的召回率明显高于 Opus 4.8(网络安全领域除外),能跨代码库和历史记录搜索
  • 歧义处理:给一堆多线程的复杂请求、让它自己定下一步,也能接住
  • 子代理协作:更敢并行派发子代理,也更稳地维持和长跑子代理、同级 agent 的异步通信

另外它跑安全分类器,会拦三类请求:攻击性网络安全(做 exploit、恶意软件、攻击工具)、生物与生命科学(实验方法、分子机制),以及提取模型内部的总结思考。良性的相关工作也可能被误触。可以配置服务端或客户端 fallback,让被拒的请求自动回退到 Claude Opus 4.8。

2治过度规划

治过度规划:一句话让它够了就干

任务一模糊、effort 一调高,Fable 5 就容易想太多:把对话里已经确定的事实再推一遍,把它压根不会采纳的方案也罗列一遍,铺垫拖得老长。下面这段指令就是让它有信息就直接动手。

不加指令
  • 反复复述已知事实、把讨论过的决定再拿出来掰
  • 罗列一堆它根本不会走的方案
  • 长篇解释根因,铺垫远多于结论
加了「够了就干」
  • 有足够信息就直接动手
  • 要权衡时给一个推荐,而不是穷举清单
  • 先给结论,思考过程留在 thinking 块里
拦它别过度规划、别复述已知事实、别啰嗦不会采纳的方案
When you have enough information to act, act. Do not re-derive facts already established in the conversation, re-litigate a decision the user has already made, or narrate options you will not pursue in user-facing messages. If you are weighing a choice, give a recommendation, not an exhaustive survey. This does not apply to thinking blocks.

顺带一个工程侧的提醒,和这节配套:长任务能力(long-horizon autonomy)指模型能在没人盯着的情况下连续工作很久,几小时甚至几天不断线。代价是单次请求会变长,在较高 effort 下、任务需要收集上下文加自我验证时,一次请求可能跑几十分钟,自主运行可能延续数小时。迁移前先把客户端超时时间、流式展示、用户侧进度指示都调好,最好把工程框架改成定时异步轮询任务状态,别用阻塞等待硬等它返回。

3效力挡位

效力挡位怎么调,怎么防止它自作主张重构代码

effort(效力挡位)是 Fable 5 上平衡「聪明、慢、贵」的主控开关,分 low、medium、high、xhigh 四档。默认用 high,最吃能力的任务用 xhigh,常规活调 medium 或 low。关键是:这代的低档也常常超过上一代的 xhigh。任务做完了但比需要的慢,就降档。点下面四个挡位看各自定位。

low
最快最省,用来跑常规轻活。想要更快、更接近对话式的互动手感时降到这里,表现依旧不弱,还常常超过上代的 xhigh。
智能
延迟
成本
medium
常规工作的另一档选择。任务能完成但比需要的慢时,从 high 降到这里换速度。
智能
延迟
成本
high(默认)
大多数任务的默认挡。已经能拿出很好的验证行为、复杂推理和最严谨的产出。副作用是常规活上会收集上下文、思考得比任务需要的更多。
智能
延迟
成本
xhigh
留给最吃能力的任务。最聪明也最慢最贵,同时最容易在常规活上过度深思。
智能
延迟
成本
三条相对位置示意,非官方数值,仅表达「越高档越聪明也越慢越贵」的单调关系
打个比方

effort 像相机的对焦模式:平时用 auto 挡就够用,最难拍的那一张才切到手动精细挡。挡位不是越高越好,是越难的活才往上推。

挡位调高有个副作用:Fable 5 会在高 effort 下顺手多干活,主动加功能、做重构、加没必要的校验。想拦住这种「自作主张收拾一遍」,加下面这段: