小白程序员必看!Agent强化学习技能进化新思路:收藏这技能,一起变强! 文章介绍了AWS AI Labs提出的RESKILL技术该技术通过将技能生成融入GRPO训练循环使Agent在训练中自我学习和进化技能解决了传统离线生成技能与Agent训练脱节导致的偏差问题。RESKILL通过让Agent在训练中自我诊断、评测和决定技能使用实现了技能与策略的协同进化显著提升了Agent在未见任务上的表现。文章还探讨了实验结果、消融实验以及RESKILL的局限性和未来展望。Agent强化学习有一个挺尴尬的矛盾。RL训练让Agent越跑越强。技能系统给Agent装使用说明书让它少走弯路。这两件事本来应该一起做一边训练一边把学到的好策略沉淀成可复用的技能。但现实中它们是分开的。 技能离线生成好塞进训练。Agent边训边用一套固定的技能训完了技能还是那套从来没跟着一起进化过。分开做的后果很直接Agent变了技能没变。偏差越来越大。 一份三个月前总结的最佳实践在新训出来的Agent眼里可能已经是多余的约束。更糟的是离线生成的技能可能从一开始就跟Agent的理解方式不兼容它根本看不懂这份技能在说什么。AWS AI Labs发了一篇论文叫RESKILL把这两件事塞进了同一个GRPO训练循环。不额外花一条rollout的预算。核心设计一句话让Agent在训练中自己写技能、自己测技能、自己决定留不留。一、为什么不能离线生成技能然后扔进训练先理解这个矛盾为什么存在。Anthropic的Skill Creator是当前技能生成的标杆人给例子LLM诊断失败提出候选技能盲测验证效果。一个完整的人机协同闭环。但这个流程跑在推理时依赖人类反馈假设Agent的策略是静态的。RL训练里完全没有这些条件。策略每一步都在变。上一轮总结的失败模式下一轮可能已经被Agent自己克服了。离线生成的技能不知道Agent当前什么样也不知道它接下来会变成什么样。 强行塞进去就像给一个正在长身体的小孩穿三个月前量的衣服穿不上或者穿上了反而碍事。已经有人尝试在RL训练里加技能了SKILLRL用teacher model蒸馏技能MEMRL演化情节记忆INSPO维护指令候选池。但它们都走同一个模式技能在外面生成好单方面扔进训练。 Agent只能被动接受没有反馈回路。图1 Anthropic Skill Creator、RESKILL、SkillRL对比图二、RESKILL怎么把技能生成塞进RL训练GRPO天生有一个特性每个训练步同一批任务、同一个策略参数采样 G 条rollout。 这 G 条rollout唯一的不同是采样噪声。这个特性恰好可以用来做受控实验给同一个小组里的不同rollout分配不同的技能版本谁好谁坏一比就知道。RESKILL的核心设计就是利用这个性质让每一条rollout同时干三件事零额外开销。图2 RESKILL概览1 三重身份一条rollout同时优化策略、诊断失败、评测技能第一重策略优化。rollout的奖励信号按标准GRPO流程更新策略参数。第二重失败诊断。 每条rollout的完整轨迹成功还是失败、用了新版还是旧版技能被存进一个经验水库。水库保持LIFO更新确保里面始终反映的是Agent最近的行为分布不是训练早期的过时数据。水库是技能生成的原料后面会讲。第三重技能评测。 rollout所属的版本收到的奖励被用来更新Thompson Sampling的后验。一次rollout既是训练数据也是技能评分的投票。三样事情一条rollout就搞定了。总rollout数跟标准GRPO一模一样。2 经验水库驱动的技能生成管道水库不是存着好看的。它驱动了一套完整的技能创建管道灵感来自Anthropic的Skill Creator但把人类反馈换成了训练数据。断言评分。 每个训练周期结束时一组规则化的断言扫过水库里的所有轨迹生成每个断言的通过率。低通过率直接标注出Agent当前的高发失败模式。断言的妙处在于它们会被LLM诊断器动态更新删掉已经不再触发的旧断言添加针对新失败模式的新断言。对比分析Contrastive Analysis。 水库按任务分组。每组内同时有成功案例和失败案例有新技能和旧技能下的轨迹。LLM逐组对比成功的时候做了什么失败的时候缺了什么技能的指导是被正确遵循了还是被无视了推荐 → 撰写 → 验证。 基于诊断结果一个技能推荐器提出 1-3 个操作ADD新建、MODIFY修改、DELETE删除。一个技能撰写器把推荐变成结构化的技能内容when什么情况下用、action具体怎么做、examplesDO/DON’T 示例以及触发条件general每步触发beginning仅在任务开始时触发action_pattern上一动作匹配特定模式时触发。触发条件最后要过一道验证门新技能的触发率必须在水库上超过50%。 触发频率太低说明激活条件写得太窄整个版本打回重写。最多 3 次。3 Thompson Sampling让技能版本在训练中公平竞争新版本的技能生成了。要不要替换旧的不能拍脑袋决定。策略正在训练Agent的行为每天都在变。早期的比较结果和晚期的权重不一样策略进化导致证据会变质。RESKILL把新旧版本当成一个两臂Bandit问题。每个训练步Thompson Sampling从Beta后验中采样决定给分组里的每条rollout分配新版本还是旧版本。分配概率随证据累积动态偏移好的版本自然拿到更多rollout差的被边缘化。但Agent在进化。上周的rollout数据是旧政策下的表现不应该跟今天的同等权重。RESKILL引入了一个自适应折扣伪计数在合并新观察前先收缩一个因子wt1/(1nt/M)w_t 1/(1 n_t/M)wt​1/(1nt​/M)。ntn_tnt​是这一步新拿到多少条rolloutM是记忆参数。关键细节M不需要手动调。 系统从已完成的A/B测试数据里用预测似然准则自动估计最优M。一组测试跑完M的估计就够准了没有完成的测试时默认不加折扣。每个周期结束时新版本后验均值超过旧版本就接受新版本成为基线。否则回滚下一个周期立即开始。三、实验里发生了什么五个领域ALFWorld具身推理、Agentic Search搜索推理、ScienceWorld科学实验、InterCode-SQL交互式编程、WANDS网络购物两个模型规模Qwen3-4B和8B。3.1 主要结果两模型规模、两套基准上RESKILL全部超过所有基线。ALFWorld 4B89.8%超出最强基线 SKILLRL83.9%5.9 个点。Search 4B47.6%超出 SKILLRL45.1%2.5 个点。更关键的是未见任务。ALFWorld 8B 未见任务RESKILL 95.3%SKILLRL 82.6%差距 12.7 个点远大于已见任务上的 1.2 个点差距。Search 上 RESKILL 对 SKILLRL 的未见任务提升是已见任务的 2.1 倍。 和解的训练保留了更泛化的技能版本。ScienceWorld OOD最极端RESKILL 48.8%SKILLRL 26.9%差了近一倍。静态技能库在未见任务上直接崩盘。3.2 消融实验不测试就接受技能 训练崩盘。 关掉技能版本测试auto-accept每个候选技能直接接受不评测ALFWorld 从 89.8 掉到 62.7比裸 GRPO 的 75.3 还差 12.6 个点。没有经过评测的技能注入RL训练不是没有帮助是主动有害。换成均匀分配新老各一半rolloutSearch 从 47.6 掉到 46.0。比 auto-accept 强但不如Thompson Sampling差的版本浪费了一半的rollout预算。和解的顺序很重要。 “先离线生成技能再训练策略和先训完策略再加技能”都没有同时一起进化好。 ALFWorld 上差 10 到 18 个点。技能和策略之间的偏差在分离训练的间隙里就已经埋下了。创始人能力不重要和解机制更重要。 把技能创建器从Claude Sonnet 4.5换成基础模型自己Qwen3-4B-InstructALFWorld只掉了 4.8 个百分点Search 只掉了 0.5。依然超过所有现有RL基线。 增益的大头在和解机制本身不在技能生成器有多强。技能生命周期加、改、删都是自动的。 论文可视化了一条完整的技能进化线。训练早期Agent还在探索技能创建集中在ADD补基础能力。训练中期策略能力上来后转向MODIFY和DELETE删掉已经被Agent内化的技能把剩余技能做精做细。整个过程没有人干预。跨域迁移换一个领域还能自己进化。 冻结ALFWorld训出来的策略把整个RESKILL管线除了策略更新搬到ScienceWorld上跑只让技能库进化。RESKILL迅速在新领域建立起有效的技能库而所有基线都趴在零附近。和解训练不只是让Agent更强它教会了Agent怎么从技能中受益。四、局限与总结RESKILL还有几个硬问题没解决。进化频率目前是固定的超参数每 5 步一次不同领域需要不同的频率。太密了Agent还没适应上一版技能又来新版。太稀了策略已经把技能内化了技能还没更新。小模型存在技能理解天花板。 4B模型偶尔把技能名字当成环境动作去执行或者在不该用的时候强行套用。把技能当指令读还是当推理指引来用这道认知鸿沟小模型还跨不过去。但RESKILL最让我触动的不是具体技术。是它对技能这件事的认知跳出了一切已有的框架。不是先写技能再训练。不是训完再反思成技能。不是人在外面看着写一份技能扔进去。 是在Agent自己变强的过程中让它自己发现哪些策略值得沉淀下来、哪些技能已经过时了该淘汰、哪条新经验应该被提炼成下一版的技能内容。技能库不是一本写完就定稿的教科书。它是一个跟着Agent一起进化的器官。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取