深度 · 小互解读

Databricks 公开 AI 编程省钱打法:换对模型一刀省一半

和 Stripe、Coinbase、Uber、Ramp 交叉验证过的四个手段,每个都标了能省多少
一分钟速览
  • AI 写代码确实管用,有的团队产出直接翻了十倍。可 token 账单也在指数级往上涨,几乎每家大规模用起来的公司都撞了这堵墙。
  • 四招里最大的一刀是换模型。Stripe 实测新版 Opus 没变强还更贵,直接拒绝了内部上架。
  • 最反直觉的一条:没有一家公司把硬性额度当日常工具用,断供这招留着,但只当最后手段。为什么,下面有两个很实在的理由。
⚑ 这篇出自 Databricks 官方博客,作者是公司内部负责这套系统的五位工程与产品负责人。文中的节省幅度、实测数据、工具选型均为 Databricks 自己的口径,摘要表的数字他们注明是「方向性估计,来自对开发团队的非正式调研」。文末致谢里写明 Uber、Stripe、Coinbase、Ramp 的基础设施负责人审阅过此文。
痛点

效率涨上去了,账单涨得更快

Databricks 最近公开了一份极其实用的成本治理复盘:AI 写代码这件事,他们内部跟踪的每一项速度指标都测出了提升,有的团队产出直接翻了一个数量级。但账单也跟着指数级往上涨。

这条曲线撑不下去,放任不管,迟早会超过公司的营收。于是企业被卡在一个很拧巴的位置上:一边想尽可能推 AI 转型,把最好的工具塞到每个员工手里;一边又得面对一个总成本,而这个总成本正在吞掉、甚至反过来抵消 AI 带来的效率收益。

好在最早大规模铺开的那批公司已经摸出了一套办法,同时做到两件事:让所有人几乎没有阻力地用上 AI 工具,同时把人均成本锁在一个大致固定的范围内。这套办法的材料,来自 Databricks 自己的实践,外加和 Stripe、Coinbase、Uber、Ramp 几家公司的交流。

四个手段,各自能省多少:

Databricks 原图:AI 成本管理的四个关键手段及各自节省幅度
原文摘要图「Key Techniques in AI Cost Management」,四个手段从左到右分别标注约 50%+、约 30%、约 10%、约 10% 的节省幅度。来源:Databricks。
手段具体做什么能省
换更低成本的模型开源模型 + 更高效的新模型50%+
智能路由模型和工具动态调度~30%
支出管控费用可见、超额警告、预算绊线~10%
上下文优化压缩、砍工具冗余、调缓存~10%

有些手段用现成软件就能落地,另一些要动基础设施,尤其是那些要改开发者本地工具、要在多个模型之间搬运流量的。Databricks 把自己这套的两个关键部件都放出来了:给开发者用的统一入口 Omnigent,和管流量的 Unity AI Gateway,一个开源、一个免费。

地基

日常写代码用不着最聪明的模型

大家平时说的「前沿模型」,指的是最聪明的那个;各大实验室卷的方向也是智能的天花板,现在的顶尖模型已经能解开数学难题,能发现新的安全问题。

但当 AI 铺到全公司几千个开发者手上,另一条前沿才是要紧的:效率前沿(efficiency frontier)。它指的是在同一个智能水平上,价格最便宜的那批模型

打个比方

解一道顶尖数学难题,你得请爱因斯坦;但把一个组件从 X 改名成 Y、把重复的样板代码补齐,请爱因斯坦来干就是纯烧钱。日常写代码的绝大部分工作属于后者,它们只要模型跨过工程质量的及格线就够用了,聪明的上限再高也吃不到。

所以真正决定公司账单的,是那些刚好够用的模型卖多少钱。而这条效率前沿,推进速度比智能前沿快得多:几乎每周都有新模型发布,同样一块钱能买到的智能比上一批更多。

智能前沿 最强的模型能到多强 一年一个台阶,慢慢爬 效率前沿 同样够用的活要花多少钱 几乎每周被刷新一次 时间 →
本站示意图:上半是智能上限,一年一个台阶;下半是同等够用智能的价格,每周都有新的点把这条线往下拽。省钱最大的杠杆,是持续迁到下面这条线上的新点,而不是砍用量。
第一招

换模型最省钱,但公共跑分不能信

四招里最大的一刀就在这儿:快速换到更新、更高效的模型上,省下来的比其他任何手段都多。但要吃到这个红利,公司先得知道,到底哪个新模型真的比手上这个强。