Hugging Face 将编程助手变为强化学习训练场 全程开源
Hugging Face 与 Liquid AI 发布开源工具,可将 Claude Code、Codex、OpenCode 等编程助手直接用作强化学习训练环境,无需修改其源码,实验中模型成功率显著提升。
人工智能开源社区 Hugging Face 近日联合 Liquid AI 发布了一套开源工具,核心思路是把 Claude Code、Codex、OpenCode 等主流编程助手直接变成强化学习(RL)的训练环境。开发者无需改动这些助手的源码,即可让模型在真实编码场景中学习。

实现方式是部署一个位于智能体与推理服务之间的捕获代理(capture proxy)。它将编程助手的请求转发给 vLLM 推理服务器,同时完整记录模型生成的精确 token 编号与对数概率,再把可训练的序列交给 Hugging Face 的 TRL 框架用于策略梯度更新。该代理兼容 OpenAI、Anthropic、Gemini 等四种主流 API 格式。
在主要实验中,团队用 LFM2.5-2.6B 模型在四个智能体环境中训练,整体一次通过率(pass@1)从 42.2% 提升至 54.2%,并在所有环境取得改进,工具调用次数也有所下降。仅在 OpenCode 单一环境训练的变体,在该环境评测中成功率可达 58%。

这一做法的意义在于,它把模型在真实工具里试错变成了可规模化的训练信号。以往强化学习多在人工搭建的沙盒中进行,而真实编码助手自带丰富的任务分布与反馈,能让模型学到更贴近生产环境的策略。开源发布也降低了研究者复现的门槛。
背景上,自 2025 年以来,围绕智能体与编码自动化的竞争迅速升温,各大实验室都在探索如何把真实工作流转化为训练数据。Hugging Face 此次把训练能力反向嵌入编码助手,延续了其推动开放权重生态的一贯路线,也为端到端的自动化机器学习实验提供了新范式。
读者评论 (1)
想参与讨论?请 登录 后发表评论。
思路挺巧,不过54%一次通过率说实话还是偏低,真正生产环境里根本不敢用。