资讯›热点›正文

微软开源 Agent Lightning v1.0,约 3500 行代码实现智能体强化学习训练

夜航西飞 2026-10-9 19:45 阅读 3 热点
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,用约 3500 行代码即可对真实智能体框架做强化学习训练,并在 Kubernetes 上原生运行,将 Qwen3.5-9B 在 SWE-bench 上提升 14.6 个百分点。

微软亚洲研究院近日开源了全面重构的 Agent Lightning v1.0,提出“Harnessed Agentic RL”(带框架的智能体强化学习)训练范式,核心思路是:部署时用什么智能体框架(Agent Harness),训练时就让这个框架直接参与强化学习,无需把智能体重新实现进训练系统。

微软开源 Agent Lightning v1.0,约 3500 行代码实现智能体强化学习训练

传统智能体强化学习要求开发者在训练框架内部重建智能体的执行循环,成本高且训练对象与上线对象容易脱节。Agent Lightning 的做法是在智能体与模型之间放一个 LLM 代理,开发者只需把原本调用模型 API 的地址指向它,原有框架代码几乎零改动即可接入强化学习。整套控制面仅约 3500 行代码,以“简单”为第一原则。

工程上,Agent Lightning v1.0 原生支持 Kubernetes,智能体可直接以标准 Kubernetes 任务运行,复用自有集群或本地设施,不再依赖 Modal、E2B 等商业沙箱服务,大规模滚动成本更低且全程开源可复现。它还引入“协同异步强化学习”,在收集到足够滚动后暂停接单、完成更新再恢复,对外部框架透明,实测端到端速度较同步 RL 约快一倍且更省 GPU。

微软开源 Agent Lightning v1.0,约 3500 行代码实现智能体强化学习训练

在效果验证上,研究团队基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 搭建了完整流水线,仅用约 6000 条训练样本,就让该模型在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%,绝对值提高 14.6 个百分点。该版本还配套了数据清洗、防奖励作弊与训练脚本,便于复现。

随着 AI 智能体从单一模型演变为由模型、工具与执行环境组成的复杂系统,其能力越来越依赖外部框架的编排。Agent Lightning 把“训练—部署一致性”作为卖点,降低了中小团队用强化学习打磨自有智能体的门槛,也反映出智能体基础设施正快速走向标准化与开源化。

读者评论 (0)

想参与讨论?请 登录 后发表评论。

还没有评论,欢迎抢沙发!