ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

053、VLA模型的训练数据与配比:互联网数据与机器人数据的融合

053、VLA模型的训练数据与配比:互联网数据与机器人数据的融合 053、VLA模型的训练数据与配比:互联网数据与机器人数据的融合昨晚调一个RT-2风格的VLA小模型,loss死活降不下去,曲线像心电图一样在0.8附近抽搐。我盯着tensorboard看了半小时,最后发现是数据配比里互联网图文数据和机器人操作数据的比例设成了9:1——模型直接变成了一个“看图说话”的专家,动作预测分支基本在瞎猜。这个坑我踩过不止一次,今天干脆把VLA训练数据这块的底裤扒干净。先说结论:VLA模型不是“用机器人数据训练一个多模态大模型”,而是“用互联网数据教模型理解世界,用机器人数据教模型操作世界”。这两类数据的本质区别在于——互联网数据提供的是语义先验和视觉表征,机器人数据提供的是动作分布和物理约束。缺了前者,模型泛化能力差到令人发指;缺了后者,模型就是个会说话的哑巴。数据配比不是拍脑袋定出来的我见过太多人直接照搬论文里的配比,比如RT-2用的是9:1(互联网:机器人),PaLM-E用的是5:1,OpenVLA用的是2:1。但人家那个配比是建立在特定模型规模、特定任务集合、特定机器人平台上的。你换个场景,配比就得重新调。我自己常用的一个经验法则:先固定机器人数据量,再反向调节互联网数据量。比如你手里有10万条机器人操作轨迹(每条包含多帧观测和动作序列),先全部用上,然后从互联网数据里随机采样,分别试1倍、2倍、5倍、10倍,画一条“互联网数据量 vs 动作预测准确率”的曲线。你会发现曲线先升后平再降——升是因为语义先验在帮忙,平是因为模型容量饱和了,降是因为互联网数据开始淹没机器人信号。这个“降”的阶段特别隐蔽。loss曲线看着还在
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进