研究解读 · 小互解读

Harvey 开源了一个超过 1 亿 Token 的合成律师事务所 拥有 46 个客户、近 1 万份内部工作产品文件

9288 份 Word 文档、266 个案子、250 道题。模型搜得到东西,只是不知道自己什么时候该停下来。
一分钟速览
  • Harvey 凭空造了一家律师事务所,266 个案子的全部档案放上 GitHub,让 AI 进去找答案。
  • 两个顶尖模型单条评分点都能答对七八成,但要求「一条不漏」时,只剩 24.4% 和 36.0%。
  • 标准答案超过 16 条的题,全对率直接归零,而它们在难题上并没有变笨。
本文跑分数据全部来自 Harvey 官方发布的基线测试,是厂商自评。数据集本身开源可查,本文引用的任务定义、评分代码、文档样本均为本站从仓库核对所得。
开篇

这家律所是假的,规模是真的

法律 AI 公司 Harvey 开源了一整间律所的档案:266 个案子、9288 份 Word 文档、1.08 亿 token 全部放上 GitHub,配 250 道题让 AI 进去找答案。档案、题目、评分标准、跑分结果全部公开可查。

为什么要建这个数据集?在真正的律师事务所里,律师查资料非常痛苦:文件浩如烟海,而且很多关键信息没有固定的关键词可以拿去搜。过去的法律考题都是「给你一份合同,回答一个问题」,材料喂到嘴边,测不出这件事。这份数据集是 Harvey 的法律 Agent 测试集 LAB 的新扩展包。

46
个客户
266
个案子
9,288
份文件
1.08 亿
token 总量
250
道题

先得搞明白律所是怎么组织工作的,因为整份数据就是照这个搭的。律所的工作只靠两个关系串起来:客户(给谁干活)和 matter(给这个客户干的具体一件事)。46 个客户横跨 15 个业务领域,一个客户可以有很多个 matter,一个 matter 可能要拉好几个领域的律师一起上。

这 46 个客户里公司和个人都有,而且是故意挑得五花八门的:一家 PE 基金要的法律服务,和一家工业制造商要的完全是两回事,客户越杂,能覆盖的业务种类才越多。266 个案子有的已经结了,有的还在进行中。

matter 是什么

律所给某一个客户干的一件具体的活,从签合同到结案的所有文件都归在它名下。它像项目管理软件里的一个「项目」文件夹,只不过在律所里,它同时还是账单单位和档案柜的一格。文件夹编号就是「客户号-序号」,1003-00001 是 1003 号客户的第一个案子。

Calderwood & Harkness 的三层结构:事务所、客户、案子
这家假律所叫 Calderwood & Harkness。事务所往下分客户(每个客户一个四位数编号),客户往下分案子,每个案子标着装了多少份文档,最下面一行从 36 份到 88 份不等。图片来源:Harvey

一个案子里的文件覆盖它的完整生命周期:怎么接下这单活(委托)、分几个阶段怎么推进、中间做过哪些重大决定、最后是什么结果。案子内部按文件夹分类,但故意不做统一标准,每个案子的文件夹长得都不一样,取决于案子类型、合伙人习惯、以及这案子实际是怎么打下来的。真实律所就是这个乱法,谁也没规定过档案该怎么码。

造法

每份文件都从 1000 字剧本长出来

这么大一堆档案不可能一份份手写。Harvey 的办法是:每个案子先写一份约 1000 token 的「剧本」,交代两件事,给哪个客户、这项目大概什么形状。然后往剧本里塞具体事实:可能很细,比如「这份协议里托管金是 10%」「竞业禁止期两年」;也可能是结构性的,比如「这个诉讼被驳回了」或者「和解了」。

SPEC · 约 1000 token · 客户:Harrowgate PE · 类型:反垄断申报 · 事实:收到二次问询 合成管线 engagement-letter hsr-form-draft strategy-memo closing-memo meeting-prep-memo 10–200 份,视案子大小 事实钉在这一份上 出题和判卷都只看剧本
1000 字的剧本进去,一叠 Word 文档出来。每个事实点都钉死在某一份具体文档上,能追到「哪个案子、哪个文件」两级。本站示意图