
Kimi-VL 技术报告全解析MoonViT 视觉编码与 Moonlight MoE 架构下的高效多模态推理模型【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llmKimi-VL 是月之暗面Moonshot AI开源的多模态大语言模型VLLM本文基于仓库内 Kimi-VL 技术报告解读 展开系统拆解其混合专家MoE架构、两阶段训练管线与多类训练数据配比并结合仓库中的对话助手部署工程与后端源码印证其低激活参数、强多模态推理、可落地的智能体能力等技术结论。读完本文你将完整掌握 Kimi-VL 的模型结构、预训练与后训练全流程、数据配方以及它在仓库配套项目中的真实运行方式。模型概览16B 总参数、2.8B 激活参数的 MoE 多模态架构Kimi-VL 是由月之暗面开发的开源多模态大模型采用混合专家Mixture-of-ExpertsMoE架构具备视觉感知、长上下文理解和强大的智能体Agent能力。其总参数量为16B而每次推理实际激活的参数仅为2.8B。较低的推理成本使其能够在参数高性能的基础上实现强大的多模态交互与推理能力。从仓库的模型支持列表可以看到Kimi-VL 系列在本项目中以两个核心条目呈现Kimi-VL-A3B 技术报告解读即本文所基于的文档与Kimi-VL-A3B-Thinking WebDemo 部署网页对话助手。前者解读技术报告后者提供可直接运行的多模态推理对话助手两者共同构成读论文 动手跑的完整学习路径。效果评估在权威多模态基准上的表现Kimi-VL 在 InfoVQA、MathVista、LongVideoBench、OSWord、ScreenSpot、WindowsAgentArena、MMLongBench、Video-MME、EgoSchema、VSI-Bench 等权威基准测试中表现出色在多项任务上超越了 GPT-4o、Qwen2.5-VL、DeepSeek-VL2 等模型。技术报告中的评估结果对应仓库models/Kimi-VL/images/02-1.png、02-2.png、02-3.png三张图表覆盖以下能力维度通用理解MMMU、MMBench-EN-v1.1、MMStar 等数学推理MathVista、MathVisionOCR 与文档理解InfoVQA、OCRBench、MMLongBench-Doc多图与长视频BLINK、Video-MME、LongVideoBench、MLVU、EgoSchema、VSI-Bench智能体Agent能力ScreenSpot、ScreenSpot-Pro、OSWorld 等 GUI 操作类基准。其中特别值得注意的是Kimi-VL 的 Thinking 变体Kimi-VL-Thinking-A3B在数学与通用推理任务上的对比中表现突出——这正是后文将要详细拆解的长思维链 SFT 强化学习训练管线带来的结果。仓库配套的对话助手工程正是基于Kimi-VL-A3B-Thinking构建可以直观体验其可视化思考过程◁think▷ 标签的推理特性。模型架构解读MoonViT MLP Projector Moonlight MoE 解码器Kimi-VL 的结构主要包含三个部分视觉编码器MoonViT、MLP 投影层Projector与 MoE 语言解码器Moonlight。视觉编码器MoonViT原生分辨率处理MoonViT 允许原生分辨率处理无需复杂的切割拼接操作即可直接处理不同分辨率的视觉输入。它采用插值绝对位置嵌入和二维旋转位置嵌入RoPE增强了对高分辨率图像的细节感知能力。这意味着无论输入是小尺寸图像、长视频帧序列还是高分辨率 UI 截图架构图中分别展示了 50px 小图、270px 视频帧、6172px 高分辨率图与 800px UI 截图等输入形态MoonViT 都能以接近原生的方式编码视觉信息。MLP 投影层ProjectorPixel Shuffle 降采样实现模态融合投影层采用双层 MLP 结构将视觉编码器的连续输出特征通过pixel shuffle操作以空间维度 2×2 降采样同时通道维度相应扩展再经过 MLP 投影到语言模型空间。投影后用于表达视觉特征的 token 长度不固定而是随输入图像的尺寸和处理方式而变化实现了视觉与语言模态间灵活、高效的融合——这也是原生分辨率处理能够高效落地的关键设计。MoE 语言解码器Moonlight2.8B 激活参数的高效底座语言解码器基于月之暗面自主研发的Moonlight模型使用 Mixture-of-Experts 架构通过非共享专家Non-shared Experts与共享专家Shared Experts配合 Router 路由实现仅2.8B 激活参数即可达到较大模型的性能水平。从架构图可以看到解码器内部包含 Attention Layer、FFN 与专家选择 Router输入端的视觉特征与文本 token 共同进入 MoE 解码器完成统一推理。模型训练解读四阶段预训练 三阶段后训练Kimi-VL 的训练采用先对齐视觉、再联合优化、最后激活长上下文的渐进式策略。整体训练流程如下预训练阶段1. 视觉预训练ViT Training该阶段独立训练 MoonViT 视觉编码器使用大规模图文对数据包括图片 alt 文本、OCR 文字、生成的描述、边界框标注等数据通过SigLIP 风格的对比损失SigLIP loss和图像引导下的文本生成caption loss两个 loss 联合训练提升视觉表征能力。训练数据规模为 2T 0.1T tokens配合微型语言解码器以 CoCa-loss 对齐到后续的 LLM。在此过程中MoonViT 的输出被训练成能生成连续、高质量的图像语义特征为后续与语言模型的融合做准备。该阶段序列长度为 8192仅训练 ViT 部分。2. 联合预训练阶段Joint Pre-training在此阶段加载已完成纯文本预训练的 MoE 语言模型Moonlight并与视觉编码器 MoonViT 进行联合训练使用1.4T tokens的混合数据文本 图文采用逐步增加图文比例的方式图文占比最高可达 40%确保语言能力不被弱化。该阶段 ViT 与 LLM 联合训练序列长度仍为 8192。3. 联合冷却阶段Joint Cooldown为进一步提升模型在高难度任务中的综合能力Kimi-VL 在预训练完成后进入联合冷却阶段。该阶段的核心目标是利用更高质量的语言与多模态数据0.6T tokens以更高的学习率重新预热在不干扰模型已有能力的前提下有针对性地强化其在数学推理、代码生成、知识问答等领域的表现。无论是纯文本数据还是多模态数据都使用了多重方案对数据进行了清洗和增强不仅提升了模型的图文对齐能力也强化了其对复杂视觉语境的理解与处理能力。这种精细化的数据调度策略保证了模型在保持泛化能力的同时能够精准提升目标任务上的表现。4. 多模态联合长上下文激活阶段Joint Long-context该阶段通过两轮训练将上下文长度由 8K 扩展至128K tokens每个子阶段都将上下文长度扩大四倍序列长度由 32768 逐步扩展至 131072并将RoPE 旋转位置编码的频率下限从 50,000 提升至 800,000。每个子阶段中长文本数据占比为 25%其余 75% 的 token 重放前一阶段的短文本数据。为使模型在纯文本和多模态输入场景中均能激活长上下文能力该阶段所使用的长数据不仅包括长文本还涵盖了长视频、长文档等多种类型的长多模态数据共 0.3T tokens。经过长上下文激活训练后模型能够在Needle-in-a-HaystackNIAH任务中成功定位关键信息——无论是在长文本还是长视频场景下均展现出卓越的检索与理解能力。技术报告中的 NIAH 测试数据显示文本 haystack 在 (0,2048] 至 (65536,131072] 各区间召回率均为 100.0仅最长区间降至 87.0视频 haystack 各区间同样均为 100.0最长区间为 91.7充分验证了 128K 长上下文能力的有效激活。后训练阶段1. 多模态联合 SFT该阶段通过指令微调对 Kimi-VL 的基座模型进行训练增强其指令跟随能力与对话互动能力最终形成可交互的 VLLM 模型。在微调过程中对MoonViT、MLP 投影层、MoE LLM 进行联合优化训练数据包含纯文本与图文混合形式的监督微调数据。训练数据使用了精心构建的多模态 QA 数据首先在32K token的序列长度下进行 1 个 epoch 的训练再在128K token的序列长度下再进行 1 个 epoch 的训练训练采用学习率衰减策略第一阶段32K中学习率从 2 × 10⁻⁵ 衰减至 2 × 10⁻⁶第二阶段128K中先将学习率重新升温warmup至 1 × 10⁻⁵最终再衰减至 1 × 10⁻⁶。2. 长思维链 SFTLong-CoT SFT在强化学习前使用经过筛选的 RL prompt 数据和 prompt 工程构建了一个规模小但质量极高的长链式思维Long-CoT数据集。该数据集包括针对文本和图像输入生成的、经过严格验证的推理路径。与传统拒绝采样Rejection Sampling方法类似通过精心设计的提示引导模型生成具备人类类推理过程的推理链条规划Plan→ 评估Assess→ 反思Reflect→ 探索Explore。通过使用该数据集的轻量级 SFT模型可以内化这些多模态推理策略从而提升其在复杂任务中的思考深度与逻辑连贯性。微调后的 Kimi-VL 在生成多模态回答时表现出更为细致、条理清晰的推理能力——这一特性在仓库对话助手的后端代码中得到了直接印证clean_response函数会识别并保留模型输出的◁think▷...◁/think▷思考标签在前端以查看思考过程的形式向用户可视化展示模型的推理链条。3. 强化学习RL为了进一步提升模型的推理能力Kimi-VL 进行了大规模的强化学习训练使其能自主构建结构化的链式思维CoT推理过程。与 Kimi K1.5 相似采用一种变体的在线 Policy Mirror Descent 算法旨在迭代优化策略模型 π以提升其问题求解的准确率优化以下目标函数$$\max_{\theta} \mathbb{E}{(x, y^*) \sim \mathcal{D}} \left[ \mathbb{E}{(y, z) \sim \pi_{\theta}} \left[ r(x, y, y^*) \right] - \tau , \mathrm{KL} \left( \pi_{\theta}(x) , | , \pi_{\theta_i}(x) \right) \right]$$其中$r(x, y, y^*) \in {0,1}$ 是用于评估模型输出答案是否正确的奖励模型τ 是正则化参数用于控制策略更新的幅度。此外还引入了长度惩罚机制用于避免模型在推理中过度思考而生成冗余的推理步骤。训练中采用了两种智能采样策略以优化训练路径课程学习采样Curriculum Sampling基于问题难度标签引导模型由浅入深地学习优先级采样Prioritized Sampling根据每个样本的成功率对其训练价值进行动态排序。通过这些策略模型能够更加集中精力学习具有教学意义的样本从而加快能力提升的速度。最终模型逐步发展出关键的元推理能力Metareasoning包括错误检测、路径回溯、解法重构等通过完整历史推理轨迹的上下文利用实现了有意识地搜索与修正的能力并将这一策略内化至模型中。训练数据解读多类型数据配比与处理方式每个训练阶段所使用的数据规模与序列长度可汇总如下对应技术报告 Overview of training stages 表格仓库图片见 02-7.png阶段数据组成Tokens序列长度可训练组件ViT TrainingAlt text、合成 Caption、Grounding、OCR2T 0.1T8192仅 ViTJoint Pre-trainingText、Knowledge、Interleaving、Video、Agent1.4T8192ViT LLMJoint Cooldown高质量文本、高质量多模态、学术来源0.6T8192ViT LLMJoint Long-context长文本、长视频、长文档0.3T32768 → 131072ViT LLM各类数据的处理方式与详细说明如下表数据类型数据来源与处理方式大小作用与用途文本数据来源于 Moonlight 语言模型的预训练语料涵盖中英文本、代码、数学、推理、百科等领域。数据经过清洗、质量筛选与分布调控以提升语言建模质量5.2T tokens提供语言建模基础强化语言理解与生成能力图文配对数据Caption包含 LAION、CC 等开源中英文图文对结合月之暗面自建的图文描述数据。合成数据比例受到严格控制以避免幻觉处理过程包含去重、相关性校验与图像分辨率多样化约 2T tokens建立图文对齐能力学习通用视觉表示与基础图像理解图文交织数据Interleaved来自教材、网页、教程等多来源图文内容采用结构化提取与重排序策略保证图文顺序一致性部分内容为合成部分来源于开源语料结构化转换-支持长图文内容的理解与跨模态上下文建模特别有助于多图文档类任务OCR 数据包含公开 OCR 数据集与大规模内部采集数据涵盖手写、自然图景、扫描文档等应用图像增强技术旋转、加噪、变形以增强鲁棒性并通过 OCR 2.0 策略扩展图表、表格识别能力数百万样本提升模型识别多样化视觉文本文字、排版、结构等的能力知识类视觉数据从课本、百科、论文等知识性资料中提取图示与图文段落配合 OCR 与版面解析组件生成结构化知识输入。强调图解知识的推理性与专业性-加强模型对图解知识、图形推理、空间结构等知识的理解能力智能体数据Agent利用自动化脚本与人类标注器在虚拟桌面/网页中生成截图、动作记录与任务轨迹并对图标语义与交互行为进行标注。任务轨迹经过整理为结构化多步交互路径数十万条交互支持模型完成多步操作任务具备软件 GUI 理解与智能体执行能力视频数据采集自开源视频数据集与网络长短视频统一为视频帧描述对格式。长视频采用滑窗方式生成稠密描述部分为人工标注部分为合成数百万帧构建模型时序理解、视频问答、多模态联动的能力从整体数据配方可以看出文本数据5.2T为语言能力筑基图文配对数据建立跨模态对齐OCR 与知识类数据强化专业视觉理解Agent 与视频数据则分别支撑 GUI 智能体操作与长视频时序推理——各类数据在训练管线中被精确调度到对应阶段共同塑造了 Kimi-VL 均衡的多模态能力。从技术报告到实战仓库配套的 Kimi-VL-A3B-Thinking 对话助手技术报告中的各项设计——MoE 低激活推理、长思维链 SFT、128K 长上下文——最终都体现在仓库可运行的工程中。仓库提供了基于Kimi-VL-A3B-Thinking的前后端分离多模态对话助手部署教程见 01-Kimi-VL-对话助手.md应用说明见 app/README.md其技术要点与报告结论一一对应运行环境与资源Ubuntu 22.04、Python 3.12、CUDA 12.4、PyTorch 2.6.0bfloat16 精度下加载参考显存约 40GB最低双卡 4090 或单卡 A6000依赖清单见 app/requirements.txt模型下载使用 modelscope 的snapshot_download(moonshotai/Kimi-VL-A3B-Thinking, ...)下载对国内用户友好推理链路后端通过AutoProcessor统一处理图像与文本processor.apply_chat_templateprocessor(images..., text...)构造多模态输入以model.generate(max_new_tokens...)生成代码见 app.py长思维链的可视化模型输出中的◁think▷...◁/think▷思考标签会被后端保留、前端展示让用户直观看到报告所述的规划-评估-反思-探索推理过程多轮对话与长上下文管理应用按会话UUID保存历史通过max_history_length滑动条2-20 轮控制保留的上下文长度与模型 128K 长上下文能力配合使用。将技术报告解读本仓库 02-Kimi-VL-技术报告解读.md与对话助手工程对照阅读即可完成从看懂架构与训练方法到本地跑通多模态推理对话的完整闭环。总结Kimi-VL 的技术亮点可以归纳为三点架构上MoonViT 原生分辨率视觉编码 pixel shuffle 投影 Moonlight MoE 解码器以 16B 总参数、2.8B 激活参数实现高效率多模态推理训练上四阶段预训练视觉预训练 → 联合预训练 → 联合冷却 → 长上下文激活与三阶段后训练多模态 SFT → 长思维链 SFT → 强化学习层层递进最终获得 128K 长上下文与元推理能力数据上文本、图文、OCR、知识、Agent、视频等多类型数据被精确调度至各训练阶段支撑了模型在通用理解、数学推理、GUI 智能体与长视频理解等场景下的均衡表现。配合仓库中的对话助手工程读者可以亲手验证这份技术报告所描述的每一项能力。【免费下载链接】self-llm《开源大模型食用指南》针对中国宝宝量身打造的基于Linux环境快速微调全参数/Lora、部署国内外开源大模型LLM/多模态大模型MLLM教程项目地址: https://gitcode.com/datawhalechina/self-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考