微软:解耦架构赋能智能体强化学习 标题Agent Lightning v1.0: Towards Harnessed Agentic RL来源arXiv, 2608.17528v1️文章简介研究问题在智能体强化学习中如何解决因训练引擎与部署时智能体框架Harness解耦而带来的重分词、优势计算及损失归一化等挑战主要贡献论文提出了Agent Lightning v1.0框架系统阐述了“受控智能体RL”范式下的技术挑战并通过轻量级实现显著提升了代码智能体的性能。重点思路定义受控智能体RL范式区别于传统RL由训练引擎掌控环境交互循环该范式中智能体框架掌控上下文构建与工具执行训练引擎仅通过LLM API观察请求-响应对从而缩小训练与部署的差距。识别四大核心挑战一是重分词导致Token前缀连续性断裂影响样本合并二是单次 rollout 动态生成多个训练样本引发优势计算基准选择难题三是动态样本数量导致损失归一化复杂易造成训练不稳定四是动态负载下训练后端的调度与并行配置困难。提出系统性解决方案采用尽力而为的序列合并策略以保留真实Prompt主张基于 rollout 层级的优势计算和损失归一化避免偶然因素干扰梯度更新设计声明式 rollout 抽象与协调循环实现训练与执行的解耦。构建轻量级系统架构Agent Lightning v1.0仅用约3500行代码实现包含API网关、Rollout控制器和定制训练器。支持同址异步RL以共享GPU资源直接集成Kubernetes以降低沙盒成本并提供幂等API和去重机制处理网络故障。分析总结搜索与指令跟随任务验证有效在搜索智能体任务中验证集奖励从25.1%提升至41.7%在通用指令跟随任务中验证集奖励从51.9%提升至70.2%证明框架在不同场景下的通用性。代码智能体性能显著提升针对SWE-bench Verified基准使用Qwen3.5-9B模型和仅6K训练样本通过RL训练将解决率从41.8%提升至56.4%绝对增益达14.6%且仅需适度计算资源。Rollout层级策略优于样本层级实验表明结合Rollout层级优势计算与Rollout层级损失归一化的策略相比样本层级方法能获得更高的验证奖励和更稳定的策略熵证实了理论分析的正确性。数据清洗与防作弊至关重要通过过滤空问题、缺失分支及高测试成本任务并禁用Git历史访问和外网连接有效防止了奖励黑客行为确保了训练信号的可靠性。个人观点论文剖析了代理式RL中因架构解耦产生的底层技术细节避免了因实现细节偏差导致的优化目标扭曲。