DAILY OPEN SOURCE · 第 123 期
PrimeIntellect/prime-agent:6.3k Star 的自改进编码 Agent,把 Harness 自己变成可 CRUD 的对象
一个 MIT 开源的 RLM 自进化编码 Agent,用"持久化 IPython + Continual Harness"双抽象,把 Agent 的工具、提示、技能、记忆、子代理全部变成可读可写可删的对象,让 Agent 在跑任务的同时反向修改自己的脚手架。
🔥 GitHub Trending🧬 Self-Improving🐍 Persistent REPL🔁 Continual Harness🤖 Agent2Agent📜 MIT
📌 平台提示:本工具依赖境外云(Prime Intellect 官方仓库 + OpenRouter/Vercel 等 Provider),部分平台在中国大陆需合规网络环境。运行前请在隔离或受限环境中测试陌生仓库、Skill 和扩展。
📌 项目速览
🎯 Prime Agent
把 Harness 自己变成 Agent 可CRUD的对象——持久化 IPython 当内存、Continual Harness 当操作系统,让 Agent 在跑任务时同时反向修改自己的脚手架。
📜 MIT🔥 GitHub Trending🧬 Self-Improving⌨️ TypeScript + Python🤖 A2A 互联
6.3k+
GitHub Stars
持续 Trending
95.5%
ARC-AGI-3 跑分
Opus 5 RHAE Best@1
v0.8.0
2026-08-21 发布
4,558 commits
4,558
Commits
活跃迭代
1,260
支持模型
4 大 Provider
95.4%
人类专家参考
可对比基线
📛项目名Prime Agent(自改进 RLM 编码与研究 Agent)
👥作者Prime Intellect(Alex L. Zhang / Kevin Thomas / Sebastian Müller 团队)
📜许可证MIT(完全开源)
⌨️技术栈TypeScript host + Python IPython 内核 + Node ≥ 22.8.0
🔗仓库github.com/PrimeIntellect-ai/prime-agent
📚文档7 篇:quickstart · usage · long-running-agents · rlm · skills · architecture · providers
🎯理论RLM 博客 + Continual Harness 论文(arxiv 2605.09998)
💡一句话把 Agent 当成可自我 CRUD 的程序,让 Harness 不再是写死的脚手架,而是 Agent 在跑任务时也能反向修改的活体。
🧨 它解决了什么问题?
传统编码 Agent 框架的"两条死结":
①上下文塞不下:固定 Token 窗口 + 静态上下文压缩,模型每轮都要把同一份内容"翻译"成自然语言反复塞进 prompt,越用越笨。
②Harness 写死:提示词、技能、记忆、子代理一旦设计好就再不动,Agent 在新项目里撞到的坑没法自动沉淀成新技能。
Prime Intellect 团队(前 Vectice / PyTorch Lightning 出身)8 月 5 日发布 Prime Agent 时直言:
“Modern harness designs were built around the capabilities of earlier generations of models. Static, hand-engineered sub-agents, prompts, skills, and memory are set once at design time and never adapt to what the agent learns while running.”
他们的解药是两条抽象:把上下文从"塞 prompt"换成"持久化 IPython 变量";把脚手架本身从"写死文件"换成"Agent 可 CRUD 的对象"。
🔬 七大核心亮点
① 递归语言模型(RLM):把上下文当代码变量
Prime Agent 只给模型暴露一个内置工具:持久化的 IPython 内核。文件读写、Shell、子代理调用、上下文管理,全部由模型在 Python 里写成代码调用,而不是传统 Harness 那种"工具菜单 + 参数 schema"。
解析过的文件、表格、任务句柄都以 Python变量长期存在,不挤对话窗口
Agent 能在代码里组合数据变换,而不是每次都通过自然语言来回序列化
任意长 session 都不会"丢历史",因为历史活在变量里而不是 prompt 里
这等于把 Agent 从"会写代码的聊天机器人"重塑为"在 REPL 里编排一切的程序"。
② Continual Harness:让 Harness 本身可 CRUD
这是 Prime Agent 最让人"细思极恐"的抽象——Agent 可以把"自己脚手架"当成对象来创建 / 读取 / 更新 / 删除:
提示词:补充提示(supplemental prompts)
技能:可复用的工作流说明
记忆:跨 session 沉淀的经验
子代理:spawned 子代理的规格
Agent 在跑任务的过程中可以反向修改这些组件;多个 session 之间能跨进程协调。这是真正意义上的"自我修改",不只是反思。
③**/refine**命令:有证据支撑的状态精炼
Agent 跑完一轮后可以主动跑/refine,审查整条轨迹,对 harness 状态应用"小的、有证据支撑的更新"。
关键安全设计:永不重写"不可变基系统提示"(immutable base system prompt)
每次精炼都会留下快照,方便回滚糟糕的修改
默认仅作用于当前 session(local to the session)
这等于给 Harness 配了一个内置的"git commit history + revert"——Agent 可以改自己,但改坏了能撤销。
④ 持久化目标 + 自动压缩:跨 session 不丢进度
/goal命令设定一个目标,Agent 会让目标在跨轮次、跨终端、跨 session 都保持活跃,直到完成、暂停或清除。配合自动压缩(context window overflow 时主动清理),长任务可以跑几天不掉链子。
⑤ 后台 Daemon:终端断开 Agent 继续跑
Prime Agent 在本地 socket 上跑一个后台守护进程,持有所有 live agent session。
用户
Ctrl+C/ 关掉终端 → 代理循环继续在后台下次用
prime-agent attach <agent>重新接上,看进度、做引导每个 root session 跑在 recoverable worker 进程里,崩溃后从 JSONL + kernel state snapshot 恢复
Idle 30 分钟的子代理自动卸载,需要时从磁盘 reload
这套机制让"Agent 在周末替你跑重构、星期一打开终端看结果"成为常态。
⑥ Agent2Agent 直接通信:去中心化协调
Prime Agent 不通过用户路由两个子代理之间的消息——它们直接互发消息。
一个子代理审计认证模块;另一个扫测试覆盖;它们之间能自动同步发现
可以 spawn 持久子代理之后,在主代理轨迹里再发消息过去
可以同时打开两个 Prime Agent session,让它们互相对话
这等于把多代理协调从"中央调度器"换成"对等网络"。
⑦ 技能可执行 + 自主模式:把重复工作流固化为 Python 包
技能不是 Markdown 文本,而是可导入的 Python 包。内置技能创建器会观察重复工作流,并主动提议转成项目级或个人级技能。下次再遇到同样任务,import进来即可。
/autonomous启动有界自主模式:按预算(轮次 / Token / 时间)运行/heartbeat周期 / 定时再进会话支持
quality gates门控,只有满足条件才 commit
🛠️ 实战场景
场景 1周末跨天长任务:周五下班,关掉终端,周一看结果
给 Prime Agent 一个跨天的目标:把项目里 200 个 TypeScript 文件的 any 类型全部替换为精确类型,跨周末两天完成。
周五下班时Ctrl+C;Prime Agent daemon 在后台继续持有 session、IPython kernel 和子代理;周日它用/goal持续追踪进度、自动压缩上下文、用子代理分批处理模块;周一早上prime-agent attach回来,看日志、看 diff、按需引导。
场景 2多 Agent 并行审计:让 3 个子代理同时扫 3 个模块
在主 Agent 的 REPL 里:
# 让 3 个子代理并行审计认证、订单、支付三个模块auth_review=await rlm("检查 auth/ 的 session fixation 和越权风险",name="auth-reviewer")order_review=await rlm("扫 order/ 的状态机原子性问题",name="order-reviewer")pay_review=await rlm("查 payment/ 的金额精度和对账完整性",name="pay-reviewer")# 主 Agent 不用等子代理同步完成——结果会通过 A2A 消息流回来continue# 主 Agent 继续推进其它工作三个子代理在后台跑,结果自动汇集到主 Agent 的 audit report。
场景 3自我进化:跑一周后自动生成新技能
连续一周每天用 Prime Agent 跑相同的 PR review 工作流后,/refine注意到 Agent 反复走同一段代码模式(先看 CI、看 reviewer 反馈、扫 changelog)。
它会主动提议:“是不是该把这套流程沉淀成skills/pr_review_pipeline/这个项目级技能?”,你确认后,下周其他项目import进来即可。这是"Agent 自己写自己的技能库"的日常。
场景 4ARC-AGI-3:95.5% 跑赢人类基线 95.4%
Prime Intellect 团队把 Prime Agent + Opus 5 丢到 ARC-AGI-3 公开榜,RHAE Best@1 跑出 95.5%,略高于发布博客中列出的人类专家参考线 95.4%(ARC 社区榜单同时列了 95.3% 的"Human Intelligence Harness",中位数为 95.24%,数字之间互不构成"普遍优越于人类"的结论)。
实测意义不在于"超过人类",而在于:Agent CRUD 自己的 harness这件事,对真实长链推理任务有可测的提升。
🚀 上手指南
系统要求:macOS / Linux、Node.js ≥ 22.8.0、Python ≥ 3.10(IPython 内核)、4GB+ 内存
License:MIT(完全免费商用,Skill 子目录如skills/coding-agent/也是 MIT)
# Step 1:一键安装(macOS / Linux,自动验证 SHA-256)curl-fsSLhttps: //app.primeintellect.ai/prime-agent/install.sh|sh# Step 2:进入项目目录,启动 Prime Agentcd/path/to/ your-project prime-agent# Step 3:首次登录选择订阅或 API-key(OpenRouter / Prime Inference / Vercel AI Gateway / OpenCode Go)/login# Step 4:浏览所有运行 / 空闲 / 已保存的 sessionprime-agent agents# Step 5:detach + reattach——终端关了,代理继续prime-agent attach<agent-name># Step 6:后台服务状态 / 自检 / 关闭prime-agent status prime-agent doctor[--fix]prime-agentshutdown[--force]💡 三种持久化目标使用方式:
•/goal <text>— 设定目标,跨轮次活跃直到完成
•/heartbeat <interval>— 周期性重新进入会话
•/autonomous— 在预算内自主运行,可配质量门控
💡 /refine 最小循环:跑完一长串任务后,输入/refine→ 它读你的整条轨迹 → 提议"小而可证据化"的 harness 更新(技能 / 补充提示 / 记忆 / 子代理)→ 你 approve 后才生效,基系统提示永远不动。
⚠️ 安全边界(务必读 SECURITY.md):Prime Agent 不是沙箱。模型生成的 Python 和项目命令会以你操作系统用户身份执行。测试陌生仓库、Skill、扩展前请用一次性 clone 或受限环境隔离,它保护不了你的 SSH key 或浏览器 cookie。
🆚 同类对比
Prime Agent vs 主流 Agent Harness
vs OpenHands:OpenHands 有子代理和工具,但 Harness 是静态设计;Prime Agent 用/refine反向修改 harness。
vs AutoGPT:AutoGPT 是经典自主循环,但 prompt + memory 写死;Prime Agent 把 prompt/skill/memory/subagent 全部做成对象。
vs Claude Code:Claude Code TUI 体验成熟,但 prompt 是 Anthropic 私有;Prime Agent MIT 完全开源 + 1260 模型可选。
vs Codex CLI:Codex 依赖 OpenAI API,无 daemon 无 RLM;Prime Agent 把 IPython 当唯一内置工具,跨进程保活。
vs Cursor:Cursor IDE 体验完善,但 Editor 形式;Prime Agent 是 CLI + daemon 形态,专攻长时自主任务。
vs Claude Code Skills(122 期对照):Skills 是 Markdown + 静态调用;Prime Agent 的技能是可导入的 Python 包 + 自动生成。
📊 数据卡片
95.5%ARC-AGI-3
Opus 5 跑分30 minIdle 子代理
自动卸载6 大Skill 命令
/goal/refine 等
🧠 今日总结
Prime Agent 不是又一个"AI 编码助手"——它把Harness本身当成可 CRUD 的对象,让 Agent 在跑任务时反向修改自己的脚手架、用/refine有证据地精炼、用 daemon 在跨天 session 里持续推进、用 A2A 消息直接协调子代理。对长时自主任务、自进化研究、和"Agent 自己写自己的 Skill 库"这件事,它给出了目前最完整的一套开源答案。
配合前几期的 Cordis(插件底座)、Headroom(上下文压缩)、OpenViking(上下文数据库)、skills(Skill 化),本期把"AI Agent 基础设施"叙事线的最后一公里补齐——从被动 Harness 到自进化 Harness。
💬 互动话题
你愿意让你的 AI 编码助手反向修改自己的提示词吗?
觉得/refine是革命还是风险?有没有想过用它做"周末托管"?
评论区聊聊,下期挑一位读者的真实场景,做一篇对照实测。
每日开源 · 早间篇 · 第 123 期 · 完