news 2026/7/30 1:41:06

Karpathy重磅论文拆解:从上下文工程到 AI Agent DAG

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Karpathy重磅论文拆解:从上下文工程到 AI Agent DAG

Karpathy最近丢出了一份 9 页的 PDF 文档,详细阐述了从Context Engineering(上下文工程) 到 Agent DAG(智能体有向无环图) 的演进路径。

核心观点极其犀利:“别再只盯着模型本身了,真正的胜负手在于架构。”

他做了一个疯狂的实验:把自己的一个已经手搓优化过的代码库(nanochat)丢给 AI Agent,让它自己跑。结果如何?

  • 2天时间,跑了 700次 实验;
  • 发现了4个连 Karpathy 本人都没注意到的代码 Bug;
  • 将模型训练速度从 2.02 小时压缩到了1.80 小时(提升 11%)。
  • 这个仓库发布仅 4 个月,狂揽 90,900 颗 Star。

Karpathy 认为,Prompt Engineering 已经过时了,现在的核心是Context Engineering(上下文工程)

如果把 LLM 比作 CPU,上下文窗口就是内存(RAM)。以前的做法是每次对话都重新加载信息,而现在的做法是建立一个死循环:

  1. Agent 修改代码;
  2. 运行测试(固定预算,比如 5 分钟);
  3. 如果分数变高,Git 提交;如果分数变低,Git 回滚。

这就是著名的Ratchet(棘轮)机制——只进不退。

Karpathy 在文档中给出了非常具体的工程化路径。如果你想让你的 Agent 从聊天机器人进化为autonomous researcher(自主研究员),请严格按以下步骤执行:

第一步:寻找单一评分指标

没有评分器,就没有循环。你需要找一个能用一个数字自动衡量的任务。

  • 错误示范:“帮我优化这段代码,让它更好。”(太主观)
  • 正确示范:“运行测试套件,目标是让执行时间低于 100ms。”(单一数字,自动判定)
第二步:物理隔离“评分文件”

这是最关键的一步,防止 Agent “作弊”。

  • 不可变文件:存放数据准备和评分逻辑。Agent 绝对不能触碰这个文件,否则它会为了高分而修改评分标准。
  • 可编辑文件:这是 Agent 的“游乐场”,它只能修改这里的代码。
第三步:锁定“时间预算”

给每次尝试设定固定的时间(比如 5 分钟)。为什么?只有时间固定,不同尝试之间的分数才具有可比性。如果一次跑 1 分钟,一次跑 1 小时,分数就没有意义了。

第四步:注入“永不暂停”指令

program.md(给 Agent 的指令文件)中,必须写入这句咒语:

"NEVER STOP: 不要问人类是否继续,不要问是不是好的停止点。除非被手动中断,否则一直工作。如果没有思路了,就去读论文、读代码,尝试更激进的架构修改。"

大多数 Agent 失败的原因就是太“礼貌”了,总是停下来问“还要继续吗?”。你要的是机器,不是客服。

第五步:睡眠时运行,醒来读 Diff

让它在晚上跑。第二天早上,不要看 Agent 生成的“总结小作文”(那是生成的文本,可能撒谎),直接看 Git Diff。 代码改了什么,就是什么。

第六步:从“单循环”到“DAG”

当一个 Agent 跑通后,再引入第二个 Agent。注意:必须给每个 Agent 分配独立的 Git Worktree(工作树)。如果它们共用一个文件夹,会互相覆盖代码,导致灾难。 最终,你会形成一个Agent DAG(有向无环图)——就像一个没有分支、没有 PR、没有合并冲突的 GitHub,只有不断生长的代码 lineage(血统)。

Karpathy 的这份文档传达了一个明确的信号:AI 的竞争焦点已经从模型大小转移到了系统架构。

不要试图去训练一个更聪明的模型,而是去构建一个更聪明的循环

学习资源推荐

如果你想更深入地学习大模型,以下是一些非常有价值的学习资源,这些资源将帮助你从不同角度学习大模型,提升你的实践能力。

一、全套AGI大模型学习路线

AI大模型时代的学习之旅:从基础到前沿,掌握人工智能的核心技能!​

因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

二、640套AI大模型报告合集

这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示

​因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。

因篇幅有限,仅展示部分资料,需要点击文章最下方名片即可前往获取

四、AI大模型商业化落地方案

作为普通人,入局大模型时代需要持续学习和实践,不断提高自己的技能和认知水平,同时也需要有责任感和伦理意识,为人工智能的健康发展贡献力量。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/30 1:39:58

Python循环与异常处理的最佳实践与性能优化

1. 循环结构与异常处理的核心逻辑在编程实践中,for循环和异常捕获是两个看似独立却经常需要配合使用的关键机制。for循环作为最基础的流程控制结构,负责对可迭代对象进行遍历操作;而异常捕获则是保证程序健壮性的安全网,两者结合使…

作者头像 李华
网站建设 2026/7/30 1:39:15

空调PTC电辅热原理与使用指南:制热效果与耗电实测

1. 先搞清楚 PTC 电辅热到底解决空调制热的什么问题空调制热时,室外温度越低,传统热泵从室外吸热就越困难。很多人在冬天开空调会发现制热效果差、升温慢,甚至室外机结霜导致频繁停机除霜。PTC 电辅热就是在这种场景下介入的辅助加热方案。它…

作者头像 李华
网站建设 2026/7/30 1:36:21

构建AI就绪的数据策略:企业在规模化人工智能前必须把握的关键要素

在企业规模化部署人工智能的进程中,数据策略的“就绪度”已成为决定成败的关键分水岭。尽管97%的企业已启动AI项目,但一项调查显示,仅有5%的企业认为其数据已为规模化AI做好准备。构建一个AI就绪的数据策略,核心在于完成从“有数据…

作者头像 李华
网站建设 2026/7/30 1:35:54

基于ESP32与OLED的自制蓝牙HUD:从硬件选型到软件实现的完整指南

1. 项目缘起:从“鸡肋”到“真香”的HUD自制之路 几年前,我开车时总忍不住低头瞥一眼手机导航,这个动作有多危险,每个司机都懂。后来市面上出现了所谓的“HUD抬头显示器”,买回来一个,发现要么是简单的OBD…

作者头像 李华
网站建设 2026/7/30 1:33:53

STM32 CAN回环测试实战:CubeMX配置与HAL库驱动详解

1. 从零开始:为什么CAN回环测试是嵌入式开发的“第一课”如果你刚开始接触STM32的CAN总线,或者用CubeMX和HAL库做项目时,面对CAN通信心里没底,那这篇文章就是为你准备的。我见过不少新手,包括当年的我自己,…

作者头像 李华