ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

从 Qwen3-4B 到 Polaris-4B-Preview:强化学习提升推理能力的实验全记录

从 Qwen3-4B 到 Polaris-4B-Preview:强化学习提升推理能力的实验全记录 从 Qwen3-4B 到 Polaris-4B-Preview强化学习提升推理能力的实验全记录【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARISPOLARIS 是一个专注于强化学习RL提升推理能力的开源后训练配方项目。它用公开数据和学术级算力把 Qwen3-4B 训练成 Polaris-4B-Preview在 AIME25 上从 65.6 分飙升到 79.4 分甚至超过了 Claude-4-Opus、Grok-3-Beta 等商业闭源模型。这篇文章完整记录了这个实验的每一处关键细节数据、奖励、三阶段训练、温度搜索与评估结果帮你一次性看懂 RL 如何逼出小模型的推理上限。Polaris-4B-Preview 凭什么超越大模型很多人以为推理能力只能靠堆参数但 POLARIS 用结果证明强化学习RL可以让 4B 小模型在数学推理上反超 671B 级模型。在 AIME25 基准上Polaris-4B-Preview79.4 分不仅远超基座 Qwen3-4B65.6 分还压过了 Deepseek-R1-671B70.0、QwQ-32B69.5甚至 Grok-3-Beta77.3与 Claude-4-Opus75.5这些商业巨头。仅凭一个 4B 模型就能进入顶级推理阵营这正是强化学习训练策略的核心魅力。训练数据从哪里来53K 精选数学难题集训练的核心数据是parquet/stage1/polaris-data-53K.parquet包含约 5.3 万道竞赛级数学题。这份数据并非凭空生成而是从两个公开数据集过滤而来DeepScaleR 数据集约 40K 样本AReaL 数据集约 106K 样本过滤的目的是保留中等偏难、分布均衡的题目太简单的题 RL 学不到东西太难的题模型永远解不出、拿不到正向奖励。你可以在仓库中直接用scripts/data/jsonl2parquet.py把自己的 jsonl 数据转成训练用的 parquet 格式实现数据 DIY。奖励函数设计规则打分 LLM 兜底RL 训练的关键在于奖励信号。项目中的奖励实现参考了deepscaler/rewards/math_reward.py核心思路分为两层规则化判分用extract_answer抽取模型输出的 \boxed{} 答案再用 sympy 与 mathd 两套数学规范化工具与标准答案比对LLM 兜底判分当 LaTeX 启发式判分失败时调用 Gemini 等大模型作为 ORM结果奖励模型二次判断输出[[YES]]才给分。这种规则为主、LLM 为辅的奖励函数设计大幅降低了格式错误和表述差异带来的误判是训练稳定收敛的幕后功臣。三阶段训练流水线从 1.4 到 1.5 的温度爬坡Polaris-4B-Preview 的完整训练分为三阶段每个阶段的训练脚本都开放源码阶段脚本路径采样温度最大响应长度Stage 1scripts/train/qwen3-4b/stage1.sh1.439936Stage 2scripts/train/qwen3-4b/stage2.sh1.4548128Stage 3scripts/train/qwen3-4b/stage3.sh1.552224第一阶段让模型学会想得更久第一阶段用 GRPO 算法 vLLM 采样rollout n8、batch 128在parquet/stage1/qwen3-4b-s1.parquet上训练。此时基座模型刚接触超长思维链采样温度设为 1.4鼓励模型探索多样的解题路径最大响应长度逐步拉到 4 万 token 级别。第二阶段过滤简单题集中火力攻坚做完阶段一后先用verl/scripts/model_merger.py把 FSDP checkpoint 合并回 HuggingFace 格式然后做两件关键的事用search_optimal_temperature.py在 1.4~1.6 区间搜索最优采样温度用drop_easy_data.py统计每道题的平均得分把平均分超过 0.9 的已攻克题目从数据集中剔除逼模型去啃硬骨头。第三阶段终极冲刺与多样性控制阶段三继续提升采样温度到 1.5、响应长度放宽到 52224同时配合 Ulysses 序列并行actor_rollout_ref.actor.ulysses_sequence_parallel_size2与动态 batch 策略在有限显存内跑完最长链。整个过程还引入了trainer.dyn_sampling_polarisTrue的动态采样机制根据训练进度实时调整样本难度分布。训练成本到底有多高POLARIS 在 README 中明确公开了算力账本硬件32 张 H800 GPU约 4 节点时长约 10 天速度每步约 0.33 小时配置batch size 128、rollout n8、学习率 1e-6也就是说用学术界可及的算力而非数据中心级资源就能复现出超越商业闭源模型的推理能力这也是 POLARIS 被称为开源 RL 后训练配方的原因。如何复现与评估动手跑一遍复现流程在 README 的 Training 小节有完整说明核心步骤为安装依赖pip install -e ./verl、pip install -e ./并固定transformers4.51.0、vllm0.8.4训练前把 Qwen3-4B 的config.json中max_position_embeddings改为 131072以支持超长输出依次运行三阶段脚本并在阶段间合并 checkpoint、搜索温度、剔除易题评估时用scripts/eval/eval_vllm_aime24.py等脚本推荐解码温度 1.4、最大长度 90000最后用evaluation/grade.py自动判分。一个容易踩的坑解码温度与长度POLARIS 官方特别提醒解码温度不要用 Qwen3 默认的 0.6建议提到 1.4与训练温度对齐且响应长度要大于 64K。如果输出被截断性能可能反而低于基座 Qwen3。温度是强化学习推理模型部署中最容易忽略、却影响最大的超参数。最终成绩单五大基准全面领先基准Qwen3-4B基线Polaris-4B-Preview提升幅度AIME24 avg3273.881.27.4AIME25 avg3265.679.413.8Minerva Math avg443.644.00.4Olympiad Bench avg462.269.16.9AMC23 avg887.294.87.6值得一提的是7B 版本的 Polaris-7B-Preview 同样表现抢眼AIME24 达 72.6而 1.7B 版本也在 AIME24 上拿下 66.9 分——说明这套三阶段 RL 数据过滤 温度搜索的配方具有很强的跨模型规模迁移能力。总结小模型 RL 训练的三个核心启示回顾整个实验POLARIS 留给我们三条可复用的经验数据比算力更值得花心思从 146K 原始数据过滤出 53K 高难度题并持续剔除已被攻克的简单样本是保持训练动力的关键温度是 RL 模型的隐藏开关训练阶段温度逐级爬升1.4→1.45→1.5推理阶段也要对齐到 1.4 左右才能发挥完整实力超长响应是推理质量的硬约束没有 4 万到 5 万 token 的思考空间再好的训练配方也会被截断浪费。如果你也想复现这份强化学习提升推理能力的完整实验可以直接 clone 仓库并按照三阶段脚本逐步执行。这套从数据、奖励到训练、评估全链路开源的配方正是当前开源推理模型研究中难得的实验全记录。【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进