ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

华为:强化学习框架提升代码智能体

华为:强化学习框架提升代码智能体 标题LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents来源arXiv, 2608.17393v1️文章简介研究问题如何将现有的原生代码智能体框架如OpenHands、Claude Code与可扩展的策略梯度强化学习训练无缝结合同时解决环境崩溃、奖励作弊及训练推理不一致的问题主要贡献论文提出了LEGO-RL框架在不修改原有智能体控制流的前提下通过进程内代理、沙箱编排和可观测性插件实现了高保真、可靠且可监控的代码智能体强化学习训练。重点思路高保真优化采用进程内LLM代理技术在模型服务边界直接捕获原始生成流Token ID、对数概率、专家路由决策即使智能体框架对历史进行压缩或重写也能在训练端准确重算概率确保训练与推理行为一致特别针对稀疏混合专家模型复现了路由决策。可靠执行构建可扩展的沙箱编排系统利用镜像缓存和分阶段防御机制如网络限制、隐藏测试文件防止奖励黑客攻击通过终止感知过滤排除因基础设施故障产生的无效轨迹避免污染奖励信号。可观测训练集成自动化验证插件和实时UI提供细粒度的轨迹诊断功能将聚合的训练指标与具体的任务实例、执行状态及智能体行为关联支持快速定位失败原因并监控训练动态。分析总结性能显著提升在SWE-bench Verified基准上使用Qwen3.5-35B-A3B模型LEGO-RL使OpenHands SDK、Claude Code和OpenCode的解决率分别提升了6.4%、5.8%和9.4%且 rollout 与训练的概率相关性保持在0.99以上。训练忠实度高实验显示无论使用何种智能体框架训练端重计算的对数概率与 rollout 时捕获的概率高度一致Pearson相关系数超过0.998证明了该方法在处理历史重写和MoE路由时的有效性。系统效率优化异步调度策略有效解决了长尾延迟问题相比同步训练加速2.5倍懒加载镜像技术显著降低了沙箱启动时间和资源消耗确保了大规模训练的可行性。行为演化分析训练后智能体表现出更强的自我检查能力如编辑后重新读取文件交互轮次增加但错误恢复能力提升有限表明强化学习主要改善了验证行为而非纠错策略。个人观点论文“非侵入式”集成思路不同于以往需要重构智能体以适配RL框架的做法通过旁路代理和沙箱隔离解决了RL训练中至关重要的数据一致性和奖励可靠性问题。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进