ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

【清华代码熊】DeepSeek V4.1 Flash 后训练详解

【清华代码熊】DeepSeek V4.1 Flash 后训练详解 上期解析了 DeepSeek V4.1 Flash 模型架构改进本期解析 DeepSeek V4.1 Flash 预训练/后训练技术 预训练45T 文本 多模态混合语料、直接训练 sparse attention取消 DeepSeek V4 的 dense 冷启动、DeepSeek-ViT 通过 contrastive pre-training autoregressive fine-tuning 两阶段预训练。 后训练复用 V4 后训练 Pipeline不引入新的后训练算法投入在数据和环境 Scaling。包括大规模 Agent 任务-环境合成、Scaffold Compute 的异步 RL Scaling、40 Teacher full-vocabulary OPD。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进