
⚡ Agent Lightning:微软开源"Agent训练Agent"框架,6000条样本涨14.6个百分点
微软开源了一个项目。2026年8月25日
叫 Agent Lightning。
GitHub 上线即 1.76 万 Star,v1.0 正式版代码精简到约 3500 行。
它做了一件前所未有的事:用部署时的真实 Agent Harness 做强化学习训练。
不需要改代码,Agent 在真实工作流里直接被训练。不需要模拟环境
结果有多炸裂?
仅用 6000 条训练样本,把 Qwen3.5-9B 的 SWE-bench Verified 成绩从 41.8% 拉到 56.4%。
涨了 14.6 个百分点。
🤔 一、先说痛点:Agent训练的"双重鸿沟"
最大的麻烦是什么?训练一个AI Agent
训练环境和上线环境不一致。
传统强化学习训练Agent时,通常应当搭建一个模拟环境。Agent在模拟环境里学习,学完后再部署到真实环境。
问题在于:模拟环境和真实环境的工具调用、上下文结构、控制流都不一样。
Agent在模拟器里考了90分,放到真实代码库里可能只有50分。
这就是所谓的 sim-to-real gap (模拟到现实的鸿沟)。
更麻烦的是,如果你想给Agent加一个新工具,训练环境的模拟器也要跟着改。维护成本极高。
Agent Lightning的解决方案极其直接:不要模拟器,直接用真实Harness训练。
🔧 二、Agent Lightning的核心机制
整个框架的核心理念用一句话概括:
Agent 通过框架代理与模型交互,工具、上下文、控制流和环境全部保持在环内,且无需修改任何代码。
它做了三件事:,具体来说
1. Harness代理层 :在Agent和模型之间插入一个代理层。Agent的每次工具调用、每次上下文交互,都经过这个代理层。训练时,代理层收集真实交互数据用于强化学习。
2. 无侵入设计 :开发者不需要修改任何业务代码。你的Agent该怎么跑还怎么跑,代理层在后台静默工作。
3. PPO训练管线 :使用近端策略改良(PPO)算法,在真实交互数据上训练模型。配套数据清洗、防reward hacking机制和完整训练脚本,全部开源。
| 对比项 | 传统RL训练 | Agent Lightning |
|---|---|---|
| 训练环境 | 模拟器 | 真实Harness |
| 代码改动 | 大量适配 | 零修改 |
| Sim-to-real Gap | 严重 | 不存在 |
| 数据效率 | 低(需大量模拟) | 高(6000条即可) |
📊 三、数据说话:6000条样本的魔法
最让人震惊的是资料效率。
传统大模型训练动辄百万、千万条数据。Agent Lightning只用了6000条训练样本,就实现了14.6个百分点的提升。

拆解一下这个数字:
- 基座模型 :Qwen3.5-9B(通义千问3.5,90亿参数)
- 训练前 :SWE-bench Verified 41.8%
- 训练后 :SWE-bench Verified 56.4%
- 提升幅度 :+14.6个百分点(相对提升35%)
- 训练数据 :仅6000条
作为对比,GitHub Copilot Pro用GPT-5.5模型在SWE-bench Verified上的成绩是56.0%。
也就是说,一个9B的开源模型,经过Agent Lightning训练后,在编程能力上追平了GPT-5.5级别的闭源模型。
这个数据效率的飞跃,说明真实环境交互数据的信噪比远高于模拟数据。
🎯 四、Agent Lightning Skill:让Agent优化Agent
v1.0.1版本还推出了一个更meta的功能:Agent Lightning Skill 。
它能干什么?
让Claude Code、Codex、GitHub Copilot这些编程智能体,系统性改良其他AI Agent的提示词、工具和工作流。
翻译成人话就是:AI Agent A 帮 AI Agent B 调参。
这是"Agent训练Agent"从论文走向工程化的标志性一步。
过去优化一个Agent的prompt需要人工反复试错。现在可以让另一个更强的Agent来做这件事——它分析B的执行日志,找出失败模式,自动调整prompt和工具配置。
一个Agent改良另一个Agent,这已经不是工具,是生态自演化 的雏形。
🌍 五、为什么这件事比你想的重要
很多人看到"又一个训练框架"就划走了。
但Agent Lightning解决的不是某个技术细节,而是一个根本性问题:AI Agent的训练办法要从"人工喂养"变成"实战学习"。
搬到真实环境就蔫了。过去训练Agent像养温室花朵——在模拟环境里精心培育
Agent Lightning让Agent径直在野外生长。真实工具、真实上下文、真实错误,在实战中变强。
意味着:,这个范式如果跑通
- 小模型有机会追上大模型 :9B经过训练追平GPT-5.5,成本差距是数量级的
- Agent定制门槛暴跌 :任何团队都能用自己的真实业务数据训练专属Agent
- "Agent训练Agent"成为可能 :Skill功能让AI互相优化,开启自演化路径
⚠️ 六、局限和风险
当然,不是没有问题:
Reward hacking风险 :Agent可能学会钻训练奖励函数的漏洞,而不是真正提升能力。微软配套了防reward hacking机制,但这是长期博弈。
真实环境训练成本 :虽然数据量少,但每条数据都要在真实环境里跑完整Agent循环,单条成本不低。
泛化性待验证 :目前只在编程任务上验证了效果。其他领域(客服、数据分析、运维)能否复现,还需要社区验证。
📌 本文要点
- Agent Lightning是"真实Harness在环"的强化学习框架 :不需要模拟器,Agent在真实工作流里直接被训练
- 数据效率极高 :6000条样本,9B模型SWE-bench从41.8%涨到56.4%,追平GPT-5.5
- 零代码修改 :代理层无侵入设计,开发者不用改业务代码
- Skill功能让AI优化AI :Claude Code等智能体可以系统性优化其他Agent的prompt和工具
- 开源完整 :3500行代码、训练脚本、数据集全部MIT开源
正式开始。Agent训练Agent的时代
3500行,你今晚就能跑。代码在GitHub上

评论0