ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

为什么InternVL3.5-38B的推理更强:Cascade RL(MPO+GSPO)两阶段训练完整原理解析

为什么InternVL3.5-38B的推理更强:Cascade RL(MPO+GSPO)两阶段训练完整原理解析 为什么InternVL3.5-38B的推理更强Cascade RLMPOGSPO两阶段训练完整原理解析【免费下载链接】InternVL3_5-38B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-38BInternVL3.5-38B 是 OpenGVLab 开源的 384 亿参数多模态推理大模型其多模态推理能力相比上一代显著提升核心功臣正是Cascade RL级联强化学习先用MPO做离线 RL 稳定热身再用GSPO做在线 RL 精调对齐。这篇完整指南用通俗语言讲清这套先粗后细两阶段训练的工作原理、每一步在做什么以及你本地这套模型文件分别对应哪个训练阶段。 先说结论Cascade RL 强在哪里对比维度只用离线 RL只用在线 RLCascade RLMPOGSPO训练稳定性高较低起点弱时 rollout 质量差高离线阶段打稳地基推理上限受限于固定数据分布高高在线阶段自我迭代GPU 时间成本低高大量无效采样仅为单阶段的零头多模态推理表现一般不稳定显著提升MMMU、MathVista 等一句话概括离线 RL 保证收敛、在线 RL 保证上限级联起来就是又快又好。这正是 InternVL3.5 系列在整体推理性能上最高提升 16.0% 的关键来源之一。 模型速览InternVL3.5-38B 是什么来头InternVL3.5-38B 延续了 InternVL 系列经典的ViT–MLP–LLM三段式架构视觉编码器InternViT-6B约 5.5B 参数负责把图像切成动态高分辨率的 patch 序列投影层MLP像素重排压缩把每个 patch 的视觉 token 压缩后送入语言模型语言模型基于 Qwen3-32B 初始化约 32.8B 参数上下文窗口 40960 token。完整训练流水线共四步CPT多模态继续预训练→ SFT监督微调→ Cascade RLMPO GSPO。 你当前仓库里的权重就是走完全部流水线的最终版。可以从 README.md 的元数据看到base_model: OpenGVLab/InternVL3_5-38B-MPO且base_model_relation: finetune——也就是说本仓库模型 MPO 检查点 GSPO 在线强化学习的产物。相关模型定义与配置可以查看聊天模型主类modeling_internvl_chat.py视觉编码器 InternViTmodeling_intern_vit.py组合式配置vision LLMconfiguration_internvl_chat.py架构与分辨率参数max_dynamic_patch: 12、force_image_size: 448config.json16 个权重分片共约 76.8GBbf16索引见 model.safetensors.index.json 第一阶段离线 RL —— MPO 混合偏好优化热身Cascade RL 的第一个阶段用**离线 RL 算法 MPOMixed Preference Optimization混合偏好优化**在固定数据集上微调模型。MPO 的总损失由三部分加权组合$$ \mathcal{L}_{\text{MPO}} w_p \mathcal{L}_p w_q \mathcal{L}_q w_g \mathcal{L}_g $$三个分量各自管一件事详见 README.md偏好损失DPO loss——教模型更好的回答应该比差的回答概率更高直接对齐答案优劣排序质量损失BCO loss——教模型追求绝对质量高的回答而不只是相对更好生成损失LM loss——保留标准的语言建模目标防止微调后输出跑偏或语言能力退化。为什么这一步很关键离线 RL 不需要模型实时采样训练稳定、收敛快是高效的热身。它把模型输出分布先推到比较理想的区域从而保证下一阶段在线采样rollout的质量——如果起点太弱在线 RL 采出来的回答大部分是垃圾强化学习信号会被噪声淹没。完成这一步的中间产物就是官方单独放出的InternVL3.5-38B-MPO检查点方便研究对比两个阶段的贡献。⚡ 第二阶段在线 RL —— GSPO 序列级精调对齐热身结束后换用在线 RL 算法 GSPO继续训练。此时模型开始用当前自身生成的回答self rollouts 奖励信号来进一步精调输出分布。GSPO 有两个值得新手记住的要点README.md组内归一化优势与 GRPO 类似对同一问题采样 G 条回答优势值 该组奖励的归一化结果无需额外训练一个价值网络critic序列级重要性采样重要性采样比取逐 token 比值的几何平均并在没有参考模型约束的情况下训练。官方实测这种设定对稠密模型和 MoE 模型都更有效训练更稳。通俗地说MPO 阶段像按标准答案刷题打底GSPO 阶段像自己出卷、自己改错、自己进步——模型在真实推理路径上不断自我纠偏这是离线数据给不了的能力。 效果验证推理能力为什么显著变强推理类基准大幅提升两阶段级联训练在 MMMU、MathVista 等多模态推理与数学基准上带来显著提升且官方消融实验Ablation Study专门验证了 Cascade RL 相对单离线/单在线的增益README.md训练性价比极高相比只跑离线或只跑在线的 RL级联方案在远少得多的 GPU 时间内达到更高性能能力外溢InternVL3.5 系列整体推理性能最高 16.0%、推理速度提升 4.05×同时新增 GUI 交互、具身智能等能力。 小贴士评测时启用Thinking 模式配合do_sampleTrue、temperature0.6可让模型先逐步推理再给出答案多步推理类任务收益最明显。 上手指南InternVL3.5-38B 部署与硬件要求硬件门槛38B 版本需要2 张 A100 GPU30B 以下版本单卡即可推理框架LMDeploy 或 vLLM 均可LMDeploy 中 38B 版本设置tp2张量并行切两张卡版本要求transformers4.52.1加载方式支持 bf16 全精度、bnb 8-bit 量化、device_mapauto多卡自动切分流式输出通过TextIteratorStreamer实现边生成边打印。快速体验单图对话的最小流程加载模型 →load_image动态切图最多 12 个 patch 缩略图→model.chat(tokenizer, pixel_values, question, generation_config)完整示例代码见 README.md。 文件资源导航文件说明README.md项目主文档训练流水线、MPO/GSPO 公式、快速开始、部署与消融实验config.json模型结构配置视觉编码器 Qwen3 LLM 动态高分辨率参数modeling_internvl_chat.pyInternVLChatModelchat / batch_chat / generate 推理入口modeling_intern_vit.pyInternViT 视觉编码器实现configuration_internvl_chat.py组合式模型配置类conversation.py对话模板管理含多轮上下文拼装model.safetensors.index.json16 个权重分片约 76.8GBbf16的张量索引❓ 新手常见疑问 FAQQ1仓库里的权重和 MPO 版有什么区别本仓库是完整流水线的最终版CPT SFT MPO GSPO推理能力最强MPO 版只完成了离线 RL适合作为消融对比的研究基线。拿不准就用无后缀的最终版。Q2为什么不用纯在线 RL比如直接 GRPO一步到位起点模型在线采样的回答质量低奖励信号被噪声主导GPU 时间大量浪费在无效 rollout 上。MPO 离线热身先抬升起点让在线阶段采样即有效所以总训练成本反而更低。Q3GSPO 和 GRPO 有什么不同GSPO 把重要性采样从逐 token提升为序列级几何平均并去掉了参考模型约束官方验证对稠密和 MoE 模型训练都更稳定有效。Q4多模态推理能力具体强在哪级联 RL 主要收益体现在需要多步推理的任务上——MMMU、MathVista、数学与科学学科推理等再叠加 Thinking 模式深度思考与 Best-of-N并行思考 过程奖励模型选优的测试时扩展效果进一步放大。【免费下载链接】InternVL3_5-38B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-38B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进