Harvey 开源了一个超过 1 亿 Token 的合成律师事务所 拥有 46 个客户、近 1 万份内部工作产品文件
- Harvey 凭空造了一家律师事务所,266 个案子的全部档案放上 GitHub,让 AI 进去找答案。
- 两个顶尖模型单条评分点都能答对七八成,但要求「一条不漏」时,只剩 24.4% 和 36.0%。
- 标准答案超过 16 条的题,全对率直接归零,而它们在难题上并没有变笨。
这家律所是假的,规模是真的
法律 AI 公司 Harvey 开源了一整间律所的档案:266 个案子、9288 份 Word 文档、1.08 亿 token 全部放上 GitHub,配 250 道题让 AI 进去找答案。档案、题目、评分标准、跑分结果全部公开可查。
为什么要建这个数据集?在真正的律师事务所里,律师查资料非常痛苦:文件浩如烟海,而且很多关键信息没有固定的关键词可以拿去搜。过去的法律考题都是「给你一份合同,回答一个问题」,材料喂到嘴边,测不出这件事。这份数据集是 Harvey 的法律 Agent 测试集 LAB 的新扩展包。
先得搞明白律所是怎么组织工作的,因为整份数据就是照这个搭的。律所的工作只靠两个关系串起来:客户(给谁干活)和 matter(给这个客户干的具体一件事)。46 个客户横跨 15 个业务领域,一个客户可以有很多个 matter,一个 matter 可能要拉好几个领域的律师一起上。
这 46 个客户里公司和个人都有,而且是故意挑得五花八门的:一家 PE 基金要的法律服务,和一家工业制造商要的完全是两回事,客户越杂,能覆盖的业务种类才越多。266 个案子有的已经结了,有的还在进行中。
律所给某一个客户干的一件具体的活,从签合同到结案的所有文件都归在它名下。它像项目管理软件里的一个「项目」文件夹,只不过在律所里,它同时还是账单单位和档案柜的一格。文件夹编号就是「客户号-序号」,1003-00001 是 1003 号客户的第一个案子。
一个案子里的文件覆盖它的完整生命周期:怎么接下这单活(委托)、分几个阶段怎么推进、中间做过哪些重大决定、最后是什么结果。案子内部按文件夹分类,但故意不做统一标准,每个案子的文件夹长得都不一样,取决于案子类型、合伙人习惯、以及这案子实际是怎么打下来的。真实律所就是这个乱法,谁也没规定过档案该怎么码。
每份文件都从 1000 字剧本长出来
这么大一堆档案不可能一份份手写。Harvey 的办法是:每个案子先写一份约 1000 token 的「剧本」,交代两件事,给哪个客户、这项目大概什么形状。然后往剧本里塞具体事实:可能很细,比如「这份协议里托管金是 10%」「竞业禁止期两年」;也可能是结构性的,比如「这个诉讼被驳回了」或者「和解了」。
