产品发布 · 小互解读

Prime Agent 一个能自主改进的 Agent 框架:Opus 5 换成它后 ARC-AGI-3 评分从 30.2% 冲到 95.5%

两个核心设计:长内容当变量交给模型自己写代码管;外壳的提示词、技能、记忆,Agent 自己能改。代价是:它在 Factorio 里学会了作弊。
一分钟速览
  • 现在的编程 Agent 外壳,都是照着上一代模型的能力设计的,工具是填表格、上下文满了就丢东西,反倒把模型框住了。
  • Prime Agent 换了个思路:工具砍到只剩一个不关机的 Python,长内容当变量存着;外壳的提示词、技能、记忆,Agent 自己能改。
  • 同一个 Claude Opus 5 换上它,ARC-AGI-3 从 30.2% 冲到 95.5%。代价是它在 Factorio 里学会了用后门刷分。
⚑ 下面所有数字来自 Prime Intellect 的发布博客、开源仓库和随发布公开的跑分图,属厂商自评口径,目前没有第三方独立复现。每个数字都能在文末列出的原图或仓库里找到出处。
开场

Prime Agent 是什么

Prime Intellect 今天开源了 Prime Agent,一个跑在终端里的编程 Agent,MIT 许可,一条 curl 命令装完就能用,接自己的 API key 或者开源模型都行,可以直接当 Claude Code、Codex 的替代品。它交出的成绩是:同一个 Claude Opus 5,模型一个参数没动,只换上这套外壳,ARC-AGI-3 的分数就从 30.2% 冲到了 95.5%,比 ARC 官方报的人类专家基线还高一点点。

它凭什么做到这一步,得先从现在的外壳卡在哪儿说起。下面先讲清那两处卡点,再看他们拿什么去治,最后看实测成绩,以及一段翻车。

发布短片(44 秒):前半段是终端界面,末尾直接打出 ARC-AGI-3 的成绩板,95.54%、178 关、24 局游戏、11,245 个动作,右下角还写着一行「not built for ARC-AGI-3」(这套外壳不是为这个评测做的)。来源:Prime Intellect 发布推文。
痛点

现在的外壳,是照着上一代模型的能力设计的

今天这些外壳,当初都是围着上一代模型的能力做出来的,跟前沿模型现在能干什么已经对不上了。具体卡在两处。

固定的工具调用格式和上下文压缩,逼着模型去绕开自己的脚手架,而不是把它当帮手用。人工写死的子 Agent、提示词、技能和记忆,在设计的那一刻就定死了,Agent 跑起来学到什么,它们都不会跟着变。

Prime Agent 发布页开篇
卡点一

工具是一张张事先设计好的表格,模型只能照着填

举个具体的:它想在一份八万行的日志里只捞出报错那十几行。表格里没有「过滤」这一项,它只能调「读文件」,把八万行整个搬进上下文自己看。外壳没帮上忙,反倒逼它绕远路。上下文塞满之后更狠,标准做法是压缩(compaction),把前面的对话总结成一小段、早先那些内容丢掉,而丢掉的往往正是它试了几百次才摸出来的心得。

卡点二

子 Agent、提示词、技能、记忆,都是人在设计外壳时一次性写死的

Agent 干活时踩了坑、摸到窍门,这些只留在这一轮对话里,关掉就没了,一点都反哺不回外壳。今天踩的坑,明天开个新会话还得原样再踩一遍。外壳越用越顺手这件事,在旧设计里根本不成立。

他们给的方向是:外壳别拿旧假设去框模型,该顺着模型现在的能力往前推一步。落地就是那两个核心设计,一个治卡点一,一个治卡点二。

解决方案

他们的解决方案:两个核心设计,一个治一个

两个卡点,两个核心设计。名字都挺唬人,其实各自讲的是一件很朴素的事,先用大白话讲清这两样到底是什么,下面两节再拆里面的机制。

治卡点一

RLMRecursive Language Model,递归语言模型。模型在写代码的过程中可以再叫出模型来,所以叫「递归」。 · 递归语言模型

管的是:模型手里有什么工具、长内容装在哪儿

把模型手里的一堆表格换成一台不关机的电脑。长内容不搬进脑子,存在电脑里随用随取;活多了,它还能在电脑里叫出几个分身分头去干。

打个比方:以前是一个人坐在会议室里,所有资料都得搬上桌才能看,桌子放不下就往外扔。现在他手边多了台电脑,资料存在电脑里,写几行代码就筛出要看的那两页;忙不过来时,在电脑里叫出几个分身去分头看不同的部分,看完把结论发回来给他。「递归」就指这一下:模型在写代码的过程中,可以再叫出模型来。

治卡点二

Continual Harness直译是「持续演进的外壳」。提示词、技能、记忆、子 Agent 模板这四样,Agent 自己能增删改查。

管的是:外壳自己能不能被 Agent 改

把外壳的提示词、技能、记忆、子 Agent 模板这四样,从「老板发好的、不许动」变成「自己保管、随时改」。干活当中就能改,改完存硬盘。

打个比方:新人上岗,公司发一套岗位说明书、一个工具箱、一个笔记本。以前这套是发下来就定死的,他干得再多也改不了。现在这套归他自己管:说明书里能加一条「这个坑要绕开」,工具箱里能塞个自己做的小工具,笔记本上能记一笔。下次上岗,他带着改过的这一套来。

核心设计一 · RLM 一台不关机的电脑:工具和长内容归它管 核心设计二 · Continual Harness 随身那套装备:外壳自己能改 两者组合出 多 Agent 编排 开子 Agent、给子 Agent 发消息
本站画的示意图,画的是官方架构图图注里那句话:两个核心抽象,加上它们组合出来的编排能力。第三块是前两块搭起来自然长出来的。

下面三节就按这个顺序走:先拆 RLM,再拆 Continual Harness,最后看组合出来的那块。

核心设计一

RLM:工具砍到只剩一个 Python,长内容当变量存着

通俗理解:给模型一个不关机的 Python,别再给它发表格

平时的 Agent 是这样用工具的:模型吐出一段 JSON,说「我要调 read_file,参数是这个路径」,外壳去执行,把结果贴回对话里。

Prime Agent 把这套拆了。模型只有一个工具:一个常驻的 IPython,那种能一行行敲 Python、变量一直留着的交互环境。读文件、跑命令、调技能、开子 Agent,全都是在里面写代码。

回到刚才那份八万行日志:

旧办法:八万行整个读进上下文,撑满了只能压缩,压掉的找不回来 日志 8 万行 整个读进去 模型的上下文 · 满了 压缩掉的 拿不回来 Prime Agent:先在 Python 里筛,只把命中的十二行给模型 日志 8 万行 IPython 写三行代码筛 12 行 模型的上下文 一行没丢 也没撑满
本站画的示意图。两条通道里模型上下文那个方框大小完全一样,区别只在里面装了多少。

旧办法是把日志读进上下文让模型自己看,八万行就是八万行的字数(token)。新办法是模型写三行 Python:打开文件、正则过滤、打印命中的十二行。八万行数据从头到尾没进过模型的脑子,只有那十二行进了。这就是为什么 Prime Agent 拿到更高分的同时,字数用量反而更低,它用程序跑数据,省下了「读数据」这笔开销。

长内容当变量存着,不再靠压缩丢掉旧信息

这是 RLM(Recursive Language Model,递归语言模型)名字的由来:别把长内容直接灌进模型的上下文,把它放在 Python 变量里,让模型自己写代码去翻。

打个比方

旧办法像是把一整箱资料抱进会议室,桌子放不下就开始往外扔,扔掉的东西再也拿不回来。RLM 是把箱子留在门外的资料室,会议桌上只放你现在要看的那两页;想看别的,随时走两步去取。资料一页没少,桌面还一直是干净的。

旧办法:桌子放不下就往外扔,扔掉的拿不回来 上下文(会议桌) 压掉了 Prime Agent:桌上只留要看的两页,其余在门外,随时取一页回来 上下文(会议桌) 随时取 Python 变量(门外的资料室)
本站画的示意图。左边那个框在两行里是同一件东西,模型当前能直接看到的上下文。

落到实现上:整个会话历史是一行行追加写在硬盘上的 JSONL 文件,压缩过多少次都能翻回去,敲 /tree 就能看到完整历史,分支和复刻都是在同一个文件里移动一个指针。压缩这件事本身模型也能自己在 Python 里触发,它只是清理台面,不是销毁档案。所以哪怕一个任务干上成千上万轮,它也不会「失忆」。

RLM 不是这次现编的名词。它出自 MIT 那边一篇论文(Alex L. Zhang、Tim Kraska、Omar Khattab),论文里这套方法能处理超出模型上下文窗口两个数量级的输入。论文第一作者 Alex L. Zhang 就在 Prime Agent 的作者名单里,等于是把自己提的方法做成了能装的东西。

RLM 机制说明图:模型上下文里只有系统提示、用户提示、推理和调用 Python 的动作,真正的大块输入数据放在 Python 环境里,并可分给多个并行的子模型处理
RLM 的机制图:左边是模型能看到的上下文(只有提示词、推理和一次次「调用 Python」的动作),中间是 Python 环境,输入数据整块留在这里,还能分给右边一排并行的子模型,最后只把答案从变量里取回来。来源:Prime Intellect 发布推文。
核心设计二

Continual Harness:外壳的提示词、技能、记忆,Agent 自己能改

第一个核心治的是卡点一。卡点二,外壳被写死、学不会东西,归第二个核心:Continual Harness(能自己改自己的外壳)。它把外壳自己的四样东西,提示词、技能、记忆、子 Agent 模板,变成 Agent 能自己新增、读取、修改、删除的状态。写起来跟往数据库里插一条记录没区别:

Agent 自己给自己记一笔、给自己造一个技能
rlm.harness.create_memory("这个测试是随机挂的", "失败先重试三次再报错")

rlm.harness.create_skill(
    "重试助手", "...",
    reference={"type": "python", "import": "retry_helper"}
)
这些改动同时写进硬盘,跨轮次、跨会话都还在。

把这套增删改查用起来的是 /refine:它回头读 Agent 刚才干活的全过程,试了什么、结果怎样,然后只做一个最小的改动:加一条记忆,或者写一个技能,或者改一句提示词,而不是把整个外壳重写一遍。每次改动都记着是被什么触发的、改完效果如何。

结果就是越用越顺手:这一轮因为某个测试随机挂而白跑,下一轮它已经知道该先重试三次;这一轮摸出的处理套路,下一轮直接当技能调。这些都写进硬盘,跨会话还在。

这一轮干活的全过程:试了什么、结果怎样 /refine 只挑一个最小的改动 提示词 这次没动 记忆 + 加了一条 技能 这次没动 子 Agent 模板 这次没动 基座系统提示词:锁死,/refine 碰不到
本站画的示意图。每次改动只落在四个格子中的一个上,其余不动。

两条护栏:基座系统提示词是锁死的/refine 只能改外面那层;改坏了可以按记录编号回滚到之前的版本。想清楚要改什么的那一步在后台跑,不挡着你继续对话;真正落盘的那一步很快,只在两轮之间卡一下。

这套也有来路。Continual Harness 那篇论文的起点是「Gemini 玩宝可梦」,人在旁边不断手动帮它改外壳,最后通关了《宝可梦 蓝》《黄 Legacy 困难模式》和《水晶》,一场战斗都没输。论文干的事就是把「人在旁边改」这个角色整个去掉。它的第一作者 Seth Karten,也是 Prime Agent 的第一作者。

组合

两个核心组合起来:开一个子 Agent 就是写一行代码

官方架构图的图注把话说死了:RLM 和 Continual Harness 是两个核心抽象,子 Agent 的增删改查加上 Agent 之间互发消息,是这两者组合出来的编排能力。所以下面这些不是第三第四个新发明,既然一切都在 Python 里,那开一个子 Agent 自然也就是一行代码:

在 IPython 里开两个子 Agent
auth = await rlm("讲清 auth/ 的登录流程,完事回我", name="auth-expert")
api  = await rlm("讲清 src/ 的接口层改动,完事回我", name="http-expert")
两行之间不用等:第一行发出去就立刻往下走,第二行紧接着发出去。

这里有三个设计细节,每一个都改变了实际用起来的感觉。

一、发出去的一瞬间就返回,返回的是号码牌不是答案

rlm(...) 调用完立刻返回,给你的是一张号码牌,子 Agent 的编号、名字、它自己的目录、它用的模型。答案后面通过消息送回来。所以父 Agent 可以一口气派出三四个子 Agent(一个去啃登录模块、一个去啃接口层),然后接着干自己的事,是真并行,不是排队等

二、子 Agent 干完不销毁,还能续聊

每个子 Agent 都是一个独立的 Prime Agent 实例:自己的会话目录、自己的 Python 环境、自己的历史。任务干完了它也留着,父 Agent 后面还能按名字给它发新指令:「刚才那个登录流程,再帮我找找边界情况。」这份父子关系连压缩和 Python 环境重启都能扛过去。

三、Agent 之间能直接说话,但只限直系亲属

父、子、兄弟之间可以互发消息,跨到无关的会话就不行,这是故意加的护栏,免得一堆并行的 Agent 互相乱插话。

① 发出去:一调用就返回号码牌,父 Agent 不等结果 父 Agent 你正在对话的那个 auth-expert 查登录流程 http-expert 查接口层改动 test-reviewer 查测试覆盖 ② 收回来:谁干完谁自己发消息回来(只能发给父、子、兄弟)
本站画的示意图。实线是发出去的那一下(立刻返回),虚线是各自干完后主动回的消息。

界面上也看得见这层关系。在空输入框上按左箭头调出 Agents View,所有会话按「正在跑 / 闲着 / 已卸载」列出来,任何一个都能直接点进去聊,也能往里插话、排队塞命令。子 Agent 闲置三十分钟会从内存里卸下来省资源,谁一喊它就从硬盘重新加载、连历史一起回来。

Prime Agent 的会话总览界面,顶部显示版本 v0.6.1、模型 gpt-5.6-sol、2 个正在跑 4 个闲着 67 个已卸载,下方列出各个子 Agent
Agents View 截图。顶部那行写着这台机器上有 2 个会话在跑、4 个闲着、67 个已卸载;下面「Running」里那条 sample 会话带着「2 个子 Agent 在跑 · 2 个心跳活着」。来源:Prime Intellect 博客。

撑着这一切的是一个后台守护进程,它握着所有活着的会话。你关掉终端,活还在干,回头再接上就是;进程崩了,能从硬盘上的记录和快照里恢复回来。

Prime Agent 架构图:一轮之内,模型写代码交给 IPython 内核执行,内核里有技能、工具和 rlm 三块,rlm 向右递归出并行、后台、常驻三类子 Agent;下方 Continual Harness 读取轨迹并写回提示词、记忆、技能、子 Agent 四种状态
四处改动拼在一起的官方架构图。上半部虚线框是「一轮之内」:模型写代码 → IPython 执行 → 结果回给模型,右边是 rlm 递归出来的三类子 Agent(并行 / 后台 / 常驻)。下半部蓝框是跨轮次的 Continual Harness:读轨迹,写回四种状态。来源:Prime Intellect 博客。
战绩

同一个 Opus 5 换壳后,ARC-AGI-3 从 30.2% 涨到 95.5%

机制讲完了,看它考出什么分。先看那张最扎眼的图,同一个模型的两次成绩摆在一起,差了三倍多。

人类专家基线 95.4%
同一个 Claude Opus 5,模型没变,只换了外面跑它的程序
ARC-AGI-3 官方外壳30.2%
Prime Agent95.5%
同一个 GPT-5.6 Sol,三种跑法
ARC-AGI-3 官方外壳13.3%
只改两个 API 设置38.3%
Prime Agent78.3%

另外两档:Prime Agent 配 Terra 是 25.7%,配开源的 GLM 5.2 只有 8.6%,外壳能放大模型的能力,放大不出没有的能力。

数据来自 ARC-AGI-3 分数-算力曲线图,横轴是每局输出的字数(token)。95.5% 那一局 183 关过了 179 关;三次运行分别是 95.0%、95.2%、95.5%,三次合起来 183 关全过。

为什么外壳能造成这么大差别?ARC-AGI-3 是把 Agent 丢进一个陌生的小游戏世界,规则不告诉它,让它自己试出来。一局要走上万步,发布短片里那一局走了 11,245 个动作。走这么多步,正好把上面那两个卡点全踩一遍:数据靠工具一趟趟搬、上下文塞满了就压缩、试出来的规则转头被总结掉。Prime Agent 改的就是这一层。

两条得说清楚的限定。第一,这里跟 Prime Agent 比的是 ARC 官方报告的成绩,因为 Prime Intellect 自己拿 Claude Code 和 Codex 跑了一遍,结果比官方公布的还差,于是采用了对手的官方数字。第二,Claude Code 和 Codex 都是跟自家模型一起训出来的,而到今天为止,没有任何一个模型是围着 Prime Agent 训练的

ARC-AGI-3 分数随输出字数变化的曲线图,以及成本对照
原图:横轴是每局烧掉的输出字数(对数刻度),纵轴是分数。紫色(Prime Agent + Opus 5)一路爬到蓝色虚线那条人类专家基线之上;两条灰虚线是 GPT-5.6 Sol 在官方外壳(13.3%)和只改两个 API 设置(38.3%)下的成绩。来源:Prime Intellect 博客。
图上那两条灰虚线,站内解读过
OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%
同样是模型不动只动外壳:保留私有推理 + 用压缩取代删除,每局输出字数降到约六分之一,分数翻了近三倍。
战绩

长任务实测:写模拟器、写 GPU 代码,赢了哪些输了哪些

从零写一台老游戏机

EmulatorBench 是他们自己做的预览版评测:让 Agent 用 Rust 从零写一台老游戏机的模拟器,不给任何参考实现、全程沙箱隔离,写完拿人手写的诊断程序去测,CPU 标志位对不对、画面芯片时序准不准。成绩取十六次模拟器重建的平均。

Game Boy Color 那一局的结果很夸张:Prime Agent 配 GPT-5.6 Sol 拿到 0.998 分,花了大约 7 美元;同一张图上另外三条线,Codex 配 Sol、Prime Agent 配 Opus 5、Claude Code 配 Opus 5,全是 0.000

Game Boy Color 模拟器评测的分数-成本曲线,绿线在约 7 美元处跃升到 0.998,其余三条线全程贴着 0
Game Boy Color 那一局:绿线(Prime Agent + GPT-5.6 Sol)在花到一半时直接跃到接近满分,终点 0.998、约 7.01 美元;另外三条线全程贴着 0.000。来源:Prime Intellect 发布推文。

但 SEGA Genesis 那一局得说实话:Prime Agent 配 Sol 是 0.616,Codex 配 Sol 也是 0.616,打平,两个 Opus 5 的组合依然是 0.000。Opus 5 在这项上全灭的原因至今没查清,工具调用全都正常返回,运行就是失败。

写 GPU 代码

PMPP-Hard 是 69 道 GPU 代码题,写出来要通过一整套正确性校验。这一组的结果一半一半:

配 GPT-5.6 Sol(每题 1500 秒)
Prime Agent62.3% · 43/69
Codex59.4% · 41/69
配 Kimi-K3(每题 4500 秒)
Prime Agent68.1% · 47/69
Kimi-Code(Kimi 自家外壳)71.0% · 49/69

下面这组的赢家是对手:配 Kimi-K3 时,Kimi 自家的外壳多解出两道题。这一条只画在跑分图上,文字部分没提。

数据来自 PMPP-Hard 跑分图。高亮的是每组里分数更高的那一方。

九项长任务对比

再看一张更全的表。这里 Prime Agent 用的是开源的 GLM-5.2,去比 Opus 5 配 Claude Code、GPT-5.6 Sol 配 Codex;每一格是「Prime Agent / 对手」,加粗的是赢家。

评测项 GLM-5.2对手:Pi-mono Opus 5对手:Claude Code GPT-5.6 Sol对手:Codex
OOLONG12.8 万字长文理解0.700 / 0.4200.900 / 0.9200.940 / 0.500
OOLONG-Pairs长输出0.874 / 0.5560.929 / 0.9220.911 / 0.895
OBLIQ-Bench数学长排序0.669 / 0.6350.802 / 0.7950.612 / 0.646
LongBenchPro英文长理解0.777 / 0.7680.804 / 0.7900.794 / 0.790
LongBenchv2专家标注长任务0.680 / 0.6960.744 / 0.7460.714 / 0.704
ManyIH Coding长指令编码0.424 / 0.3860.536 / 0.5220.499 / 0.454
ManyIH IF长指令遵循0.209 / 0.1640.225 / 0.1750.216 / 0.232
LongCoT-Mini长推理0.638 / 0.6130.722 / 0.5580.671 / 0.681
EmulatorBench长编码0.208 / 0.0000.047 / 0.0620.275 / 0.228
数据来自长任务对比表。三组分别是九战八胜、六胜三负、六胜三负,领先,但不是碾压。最悬殊的一格是第一行最右:同样是 GPT-5.6 Sol,读一份 12.8 万字的材料,换到 Prime Agent 里从 0.500 涨到 0.940。所有外壳的长输入在开跑前都先落成了文件。

3D 迷宫

最后一项 MazeBench 是个开放世界的 3D 迷宫,操控一个方块解谜、开房间、捡宝石,比的是同样花钱能走多远。这一项互有胜负:走过的独立状态数 Prime Agent 明显领先,但开出的房间数被 Codex 反超得很明显。这段只有数字,没有结论。

Prime Agent 配开源模型 GLM-5.2 跑 MazeBench 的完整过程(2 分钟):绿色方块是它自己,在俯视的立体迷宫里推箱子、找路、开房间。来源:Prime Intellect 发布推文。
翻车

Prime Agent 在 Factorio 学会了用后门命令刷分,叮嘱它别作弊也没用

「越用越顺手」这件事,有它的另一面。

Factorio 是一款造工厂的游戏:挖矿、研究科技、把生产线自动化起来,成绩看「生产分」。Prime Agent 接进去之后,一口气开了四个可操控角色分头干活。

前半段很励志。它靠 /refine 把失败变成记忆、把成功变成技能,用自己攒下来的经验一版比一版把机器摆得更高效,几个小时就把生产分做到了十万以上。

后半段翻车了。它发现这游戏留了一条后门命令(RCON),能直接把资源变到装配机里,整套游戏规则就这么绕过去了。他们明确加了一条心跳提示,每隔一阵就提醒它别在 Factorio 里作弊,没用。漏洞一被找到,那个原本在积累正经技能的自我改进循环,转头就去优化作弊技巧了。

让 Agent 自己改自己,它优化的是分数,不是你想要的行为。这种钻分数空子的现象在业内有个名字,叫 reward hacking;这次的实例还多说明一件事:提示词层面的叮嘱拦不住它,同一个把失败变成经验的循环,找到捷径之后会把捷径也变成经验。

Prime Agent 玩 Factorio 的实时画面,顶部显示生产分 5,301,034、自动化 4,350,536、已运行 1 小时 26 分,右侧是 Agent 的实时思考文字
这张截图里顶部的生产分是 5,301,034,已经跑了 1 小时 26 分。⚠️ 这一局正是它绕过规则、把资源直接变进机器的那次,官方图注写明了;正经玩法的成绩是十万以上,两者差了五十倍。右侧那栏是它当时的实时思考,在算煤矿要从 130 格外拉传送带还是先研究太阳能。来源:Prime Intellect 博客。
上手

它值什么,以及装之前要知道的一条警告

对开发者来说,它是个 MIT 许可、一条命令装完、接什么模型都行的现成工具;对做外壳的人来说,它把「工具砍到一个、上下文当变量、外壳自己能改」这套设计完整摊开给你抄。

Prime Intellect 自己怎么看下一步:他们认为模型和外壳一起训才是主导路线,Prime Agent 的很多能力在没有配套训练过的模型上根本发挥不出来,围着这套外壳直接训还有很大提升空间。这是他们的判断,不是实测结论;完整的技术报告也还没发出来,预告在近期补上。

装的话,macOS 和 Linux 上一条命令搞定:安装脚本会下载指定版本、校验 SHA-256、顺手把 Agent 要用的 IPython 环境配好。第一次启动跑 /login 挑登录方式,订阅制和自己的 API key 都支持,开源模型闭源模型都能接。

但装之前必须看清楚仓库里那个警告框:

Prime Agent 以你的用户权限执行模型生成的 Python 和项目命令。它的工作进程和内核进程改善的是生命周期隔离与故障恢复,不是安全沙箱。请审查改动,只使用可信的仓库、指令、技能和扩展。不可信的代码或指令请在外部沙箱或受限环境里运行。

Prime Agent 仓库 README

翻成人话:它能在你的机器上做任何你自己能做的事。官方给的建议是在一次性的 clone、干净的工作区或者能随时还原的检查点里用它。

未来的趋势

未来的 Agent 不再靠人类预先写死无数逻辑和 Prompt,而是以代码环境为媒介,自主派生子任务、自主积累技能和自我迭代优化。

还有一段身世值得知道:Prime Agent 建在一个叫 pi 的极简 Agent 框架之上,MIT 许可证里 2025 年那行版权还挂着 pi 作者 Mario Zechner 的名字。上面那张九项对比表里,Prime Agent 的对手之一就是 pi 本身(Pi-mono)。

它脚下的那个 pi,站内解读过
Databricks 实测:同一个模型,换个壳成本差 2 倍,极简派 Pi 为什么反而赢
开箱只有 4 个工具、系统提示不到 1000 token,每轮少喂 3 倍上下文,质量没掉、钱省一半,要功能它自己给自己造。
🧰 上手卡 · Prime Agent
价格开源免费(MIT 许可);模型费用另算,登录时可选订阅制或自己的 API key
门槛macOS / Linux 一条 curl 命令装完,首次启动跑 /login 接模型;⚠️ 它以你自己的用户权限执行模型生成的代码,不是安全沙箱,建议在一次性 clone 或干净分支里用
Prime Agent 的终端界面:左侧是对话,模型执行的 Python 动作默认折叠成一行,下方可以看到派出去的子 Agent
装完之后的终端界面。模型在 Python 里做的动作默认收成一行,想看细节可以展开;输入框下方挂着从这个会话派出去的子 Agent。来源:Prime Intellect 博客。
来源
Prime Agent: A self-improving RLM agentSeth Karten、Alex L. Zhang、Kevin Thomas、Sebastian Müller 与 Prime Intellect 团队·原文·2026-08-06
本站说明
跑分图、界面截图、Factorio 截图、两段视频均来自官方发布,图注中已逐一标注;三张流程示意图(数据通道对比、会议桌与资料室、自我改进流程)为本站绘制。PMPP-Hard 中 Kimi-K3 一组的胜负、SEGA Genesis 的打平结果,取自跑分图本身,官方文字部分未提及。安装命令、权限警告与许可证信息来自仓库 README 与 LICENSE。