Agent Lightning:微软开源Agent训练Agent框架,6000条样本涨14.6个百分点


Agent Lightning:微软开源”Agent训练Agent”框架,6000条样本涨14.6个百分点

2026年8月25日,微软开源了一个项目。

叫 Agent Lightning。

GitHub 上线即 1.76 万 Star,v1.0 正式版代码精简到约 3500 行。

它做了一件前所未有的事:用部署时的真实 Agent Harness 做强化学习训练。

不需要模拟环境,不需要改代码,Agent 在真实工作流里直接被训练。

结果有多炸裂?

仅用 6000 条训练样本,把 Qwen3.5-9B 的 SWE-bench Verified 成绩从 41.8% 拉到 56.4%。

涨了 14.6 个百分点。


🤔 一、先说痛点:Agent训练的”双重鸿沟”

训练一个AI Agent,最大的麻烦是什么?

训练环境和部署环境不一致。

传统强化学习训练Agent时,通常需要搭建一个模拟环境。Agent在模拟环境里学习,学完后再部署到真实环境。

问题在于:模拟环境和真实环境的工具调用、上下文结构、控制流都不一样。

Agent在模拟器里考了90分,放到真实代码库里可能只有50分。

这就是所谓的 sim-to-real gap(模拟到现实的鸿沟)。

更麻烦的是,如果你想给Agent加一个新工具,训练环境的模拟器也要跟着改。维护成本极高。

Agent Lightning的解决方案极其直接:不要模拟器,直接用真实Harness训练。


二、Agent Lightning的核心机制

整个框架的核心理念用一句话概括:

Agent 通过框架代理与模型交互,工具、上下文、控制流和环境全部保持在环内,且无需修改任何代码。

具体来说,它做了三件事:

1. Harness代理层:在Agent和模型之间插入一个代理层。Agent的每次工具调用、每次上下文交互,都经过这个代理层。训练时,代理层收集真实交互数据用于强化学习。

2. 无侵入设计:开发者不需要修改任何业务代码。你的Agent该怎么跑还怎么跑,代理层在后台静默工作。

3. PPO训练管线:使用近端策略优化(PPO)算法,在真实交互数据上训练模型。配套数据清洗、防reward hacking机制和完整训练脚本,全部开源。

对比项 传统RL训练 Agent Lightning
训练环境 模拟器 真实Harness
代码改动 大量适配 零修改
Sim-to-real Gap 严重 不存在
数据效率 低(需大量模拟) 高(6000条即可)

三、数据说话:6000条样本的魔法

最让人震惊的是数据效率。

传统大模型训练动辄百万、千万条数据。Agent Lightning只用了6000条训练样本,就实现了14.6个百分点的提升。

拆解一下这个数字:

  • 基座模型:Qwen3.5-9B(通义千问3.5,90亿参数)
  • 训练前:SWE-bench Verified 41.8%
  • 训练后:SWE-bench Verified 56.4%
  • 提升幅度:+14.6个百分点(相对提升35%)
  • 训练数据:仅6000条

作为对比,GitHub Copilot Pro用GPT-5.5模型在SWE-bench Verified上的成绩是56.0%。

也就是说,一个9B的开源模型,经过Agent Lightning训练后,在编程能力上追平了GPT-5.5级别的闭源模型。

这个数据效率的飞跃,说明真实环境交互数据的信噪比远高于模拟数据。


四、Agent Lightning Skill:让Agent优化Agent

v1.0.1版本还推出了一个更meta的功能:Agent Lightning Skill

它能干什么?

让Claude Code、Codex、GitHub Copilot这些编程智能体,系统性优化其他AI Agent的提示词、工具和工作流。

翻译成人话就是:AI Agent A 帮 AI Agent B 调参。

这是”Agent训练Agent”从论文走向工程化的标志性一步。

过去优化一个Agent的prompt需要人工反复试错。现在可以让另一个更强的Agent来做这件事——它分析B的执行日志,找出失败模式,自动调整prompt和工具配置。

一个Agent优化另一个Agent,这已经不是工具,是生态自演化的雏形。


五、为什么这件事比你想的重要

很多人看到”又一个训练框架”就划走了。

但Agent Lightning解决的不是某个技术细节,而是一个根本性问题:AI Agent的训练方式要从”人工喂养”变成”实战学习”。

过去训练Agent像养温室花朵——在模拟环境里精心培育,搬到真实环境就蔫了。

Agent Lightning让Agent直接在野外生长。真实工具、真实上下文、真实错误,在实战中变强。

这个范式如果跑通,意味着:

  1. 小模型有机会追上大模型:9B经过训练追平GPT-5.5,成本差距是数量级的
  2. Agent定制门槛暴跌:任何团队都能用自己的真实业务数据训练专属Agent
  3. “Agent训练Agent”成为可能:Skill功能让AI互相优化,开启自演化路径

️ 六、局限和风险

当然,不是没有问题:

Reward hacking风险:Agent可能学会钻训练奖励函数的漏洞,而不是真正提升能力。微软配套了防reward hacking机制,但这是长期博弈。

真实环境训练成本:虽然数据量少,但每条数据都要在真实环境里跑完整Agent循环,单条成本不低。

泛化性待验证:目前只在编程任务上验证了效果。其他领域(客服、数据分析、运维)能否复现,还需要社区验证。


本文要点

  1. Agent Lightning是”真实Harness在环”的强化学习框架:不需要模拟器,Agent在真实工作流里直接被训练
  2. 数据效率极高:6000条样本,9B模型SWE-bench从41.8%涨到56.4%,追平GPT-5.5
  3. 零代码修改:代理层无侵入设计,开发者不用改业务代码
  4. Skill功能让AI优化AI:Claude Code等智能体可以系统性优化其他Agent的prompt和工具
  5. 开源完整:3500行代码、训练脚本、数据集全部MIT开源

Agent训练Agent的时代,正式开始。

代码在GitHub上,3500行,你今晚就能跑。

文章摘自:https://www.cnblogs.com/badhope/p/22685292/agent-lightning-train-agent-with-agent