Ploy 公司将生产环境 AI 从 Opus 4.8 切换到 GPT-5.6 Sol:质量不下降的同时耗时减少一半以上、成本降低 27%
- Ploy 把旗下建站 AI agent 的默认模型从 Claude Opus 4.8 换成了当天上线的 GPT-5.6 Sol
- 自评测显示:完成同类建站任务,耗时从 8 分 0 秒降到 3 分 42 秒,成本从 3.06 美元降到 2.22 美元,视觉评分从 0.936 升到 0.970
- 迁移中发现 GPT-5.6 会在工具调用里对用不上的参数编造默认值(如
offset: 0),一度导致 52% 到 64% 的文件读取悄悄返回空内容 - OpenAI 的 prompt 缓存机制和 Anthropic 完全不同,改用 workspace 级 cache key 重新设计缓存分层后,首次调用缓存命中率从 0% 提升到 83.7%
- 团队还发现自家评测框架本身对用惯的旧模型有隐性偏袒,需要先修评测框架才能信评测结果
Ploy 把默认模型换成了 GPT-5.6 Sol
AI 建站产品 Ploy 在 2026 年 7 月 9 日,把旗下 agent 的默认模型从 Claude Opus 4.8 换成了 OpenAI 当天发布的 GPT-5.6 Sol。
换模型这件事,比换一个 API 端点复杂得多。Ploy 的 agent 要规划页面、读代码库、写组件、生成配图、给自己的成果截图,再判断到底做完没有。把这套流程从 Claude 搬到 GPT-5.6,团队是一个评测失败接一个评测失败地发现:那些被当成"模型"的东西,其实是各家服务商各自的行为习惯,整个技术栈早就悄悄围着旧模型长成了特定形状。

下面是它品牌页重建评测套件里的一组样本,agent 要照着参考设计把品牌主页重做一遍:
| 每次完成建站,平均 | Claude Opus 4.8(n=11) | GPT-5.6(n=10) |
|---|---|---|
| 成本 | $3.06 | $2.22 |
| 耗时 | 8 分 00 秒 | 3 分 42 秒 |
| 输入 token | 2.60M | 1.70M |
| 输出 token | 33.0K | 17.1K |
| 视觉评分 | 0.936 | 0.970 |
GPT-5.6 写的代码更省。一组配对样本里,Opus 生成了 17,957 字符、174 个 CSS 变量(大段色阶其实没用上)的 globals.css,GPT-5.6 只用 2,508 字符、45 个变量,就渲染出相当(有时更好)的页面。
先看评测框架公不公平,再看模型强不强
拿两个模型的分数直接比之前,得先问一句:评测框架本身公不公平。Ploy 把同一套评测套件横跨两个模型家族跑了一遍,最意外的发现是,评测框架早就为旧模型调过了,团队自己却没察觉。
头一次跨模型跑,具体偏在这几处:


