微软亚研院开源 Agent Lightning v1.0:让真实 harness 直接参与强化学习训练
摘要
Microsoft Research Asia 提出 Harnessed Agentic RL 训练范式,并开源 Agent Lightning v1.0。该框架以约 3,500 行代码实现,允许部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重写 agent,为智能体训练提供新路径。
Microsoft Research Asia 近日提出了一种名为 Harnessed Agentic RL 的训练范式,并基于该思路开源了重建后的 Agent Lightning v1.0。这一框架试图解决智能体强化学习流程中长期存在的一个工程痛点:训练环境与部署环境之间的割裂。
传统做法通常要求在训练框架内部重新实现 agent 逻辑,导致部署时使用的 harness 与训练时所用的代码不一致,增加维护成本并可能引入行为偏差。Agent Lightning v1.0 的核心设计是让部署阶段实际运行的同一 agent harness 直接参与强化学习过程,从而省去在训练框架内重写 agent 的步骤。
据公开信息,该框架以约 3,500 行代码实现,属于轻量级方案。其目标并非构建一个庞大的训练平台,而是提供一条让现有 harness 与强化学习训练对接的路径,降低智能体训练链路的改造成本。
对于 AI 行业从业者而言,这一开源项目的意义在于将训练与部署的一致性提升为框架层面的设计约束。后续该范式能否在更多 agent 场景中验证其通用性,值得持续关注。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗