ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Astra: General Interactive World Model with Autoregressive Denoising

Astra: General Interactive World Model with Autoregressive Denoising 它的核心不是提出一个全新的 diffusion而是把一个已经很强的视频生成模型 Wan-2.1 改造成一个能够接收动作、持续预测未来、并适配多种任务的交互式世界模型。先给你一句话总结Astra 预训练视频生成模型 自回归分块生成 动作注入 历史记忆抑制 多动作专家。输入当前画面和动作模型不是单纯“生成好看的视频”而是不断预测“执行这个动作之后世界接下来会变成什么样子”论文展示的应用包括第一人称探索、机器人操作、自动驾驶和相机控制。 Astra General Interactive World…一、这篇论文究竟想解决什么问题作者认为现在很多所谓“world model”实际上更像是视频生成器。例如普通的 Image-to-Video给它一张图它就生成后续视频。问题是生成完之后你没法在中间告诉它往左走。然后世界立即左转也不能下一秒又告诉它往右走。然后右转传统 T2V/I2V 模型通常只生成有限长度的视频也缺少根据 agent action 实时改变未来轨迹的能力。作者因此认为真正的 world model 最关键的一个特征应该是Interactivity交互性也就是其中\(o_t\)当前 observation\(a_t\)agent action\(o_{t1}\)未来 observation作者指出普通视频生成模型通常缺乏长时间 rollout、动作响应和持续交互能力而自回归生成又容易产生误差积累和 temporal drift。 Astra General Interactive World…所以 Astra 想解决三个核心问题① 怎样生成很长的视频② 怎样让视频真正响应 action③ 怎样同时支持相机、键盘、机械臂等不同类型的 action整篇论文基本就是围绕这三个问题设计的。二、Astra 的整体框架论文 Figure 2 的思想其实非常简单初始图像 ↓ 历史 observation action ↓ Astra ↓ 预测下一段视频 chunk ↓ 把这个 chunk 加进历史 ↓ 新的 action ↓ 预测下一个 chunk ↓ ……所以它不是一次生成整条视频而是数学上其中 \(z_i\) 不是一帧而是一个video chunk。每一个 chunk 内部又通过 diffusion / flow matching 进行 denoising。也就是说 Astra 把Autoregressive负责长期时间推进和Denoising / Diffusion负责高质量视频生成结合起来。论文把这个叫Autoregressive Denoising World Model其基本流程和训练目标在论文第 4 页给出每次从噪声 denoise 出下一个 chunk再将生成结果追加进 history继续预测。 Astra General Interactive World…三、它最大的几个创新是什么我认为可以把论文贡献浓缩成4 个关键模块。1. Autoregressive Denoising长时间世界预测普通 diffusion videoimage ↓ diffusion ↓ videoAstraHistory ↓ Denoise ↓ Chunk 1 History Chunk 1 ↓ Denoise ↓ Chunk 2 History Chunk 1 Chunk 2 ↓ Denoise ↓ Chunk 3于是\[ z_{i}f(z_{1:i-1},a_{1:i}) \]因此理论上可以不断 rollout。这个设计让它同时具有diffusion 的画面质量autoregressive 的长期预测action-conditioned 的实时控制。论文强调世界模型的重要区别不是单纯生成未来而是能根据任意时刻加入的动作动态改变未来。 Astra General Interactive World…四、创新 2ACT-Adapter —— 让 action 真正影响视频这是 Astra 很重要的一点。假设机器人收到动作\[ a_t\text{move-right} \]问题来了怎么把这个 action 输进 diffusion model最简单的方法通常是Action embedding ↓ Cross Attention ↓ Video Transformer但作者认为这种方式对于细粒度运动控制不够直接。所以他们设计了Action-Aware Flow Transformer Adapter简称ACT-Adapter它怎么做先\[ a_t \rightarrow ActionEncoder(a_t) \]得到\[ e_a \]然后把 action embedding 直接注入每一个 Transformer block 的 latent feature。大致可以理解成Video latent ↓ Self Attention ↓ ACT Adapter ← Action feature ↓ FFN ↓ Next block而不是只在最前面告诉模型“我要往左。”而是让 action 在网络内部持续影响视频 latent。作者具体采用action encoderelement-wise addition 注入每层self-attention 参数可训练其余大部分 Wan-2.1 参数冻结每个 self-attention 后加入一个 linear adapterlinear layer 初始化为 identity。这样可以最大程度保留 Wan-2.1 已经学到的视频生成能力。 Astra General Interactive World…论文 Figure 3 就是在画这一过程动作经过 encoder 后进入 ACT-Adapter并注入 Flow Transformer。 Astra General Interactive World…五、创新 3Action-Free Guidance这里的设计其实非常像 diffusion 里的 CFGClassifier-Free Guidance。作者改成Action-Free GuidanceAFG训练时随机把 action 去掉有时候 History Action → Future 有时候 History ∅ → Future于是模型学会两种预测\[ v_\theta(z_t,t,a) \]和\[ v_\theta(z_t,t,\varnothing) \]推理时\[ v_{\text{guided}} v_{\theta}(z_t,t,\varnothing) s[ v_{\theta}(z_t,t,a) - v_{\theta}(z_t,t,\varnothing) ] \]直觉上\[ \text{有Action预测} - \text{无Action预测} \]就是action 本身造成的变化。再把这个变化放大。因此如果输入←模型会更加明确地往左转。而不是继续按照原来的运动趋势向前走。论文把这个机制用于增强 action responsiveness。 Astra General Interactive World…这个思路其实非常漂亮。六、创新 4Noisy Memory —— 解决“视觉惯性”我觉得这是整篇论文里一个特别值得注意的点。世界模型通常会输入很多历史帧Frame1 Frame2 Frame3 ... Frame100历史越长世界越稳定。但作者发现了一个问题历史越多模型越不听 action。为什么因为现实视频大多数运动是连续的。比如前 100 帧一直↑ ↑ ↑ ↑ ↑ ↑ ↑ ↑现在突然给←模型可能认为根据历史我应该继续往前。于是 action 被历史视觉信息淹没了。作者把这个现象叫Visual Inertia视觉惯性即\[ History \gg Action \]模型过度依赖过去画面。 Astra General Interactive World…Astra 的解决方法非常简单训练时给历史帧加噪声。也就是干净历史 Frame1 Frame2 Frame3 ↓ 加一点 noise ↓ 模糊历史作者称为Noise-as-Mask它不是把历史删除而是降低历史视觉信息的可靠程度。于是模型不能单纯copy history而必须去看Action因此\[ History\ influence \downarrow \]\[ Action\ influence \uparrow \]有意思的是这个噪声只在训练使用。推理的时候历史还是干净的。论文还使用 history compression保留第一帧把中间历史压缩成 compact visual tokens从而延长有效记忆范围。 Astra General Interactive World…所以这一块可以概括为通过主动破坏历史视觉信息逼迫模型学习 action-conditioned dynamics。七、创新 5Mixture of Action ExpertsMoAE世界模型还有一个问题不同任务的 action 完全不一样。比如自动驾驶\[ a[x,y,z,q_x,q_y,q_z,q_w] \]camera pose。机器人\[ a[x,y,z,r_x,r_y,r_z,\text{gripper}] \]机械臂末端动作。游戏/探索W A S D Mouse离散动作。这三类 action 的结构完全不一样。所以作者提出Mixture of Action Experts也就是“动作专家混合模型”。它的结构首先Camera action ─→ Projector Robot action ─→ Projector Keyboard ─→ Projector映射到统一 action space\[ a_m \rightarrow R_m(a_m) \]然后有一个\[ Router \]决定用哪些 expert┌ Expert 1 Action → Router → Expert 2 └ Expert 3Router 做 Top-K\[ g_iRouter(a_i) \]最后\[ e_i \sum_{k1}^{K} g_i^kE_k(a_i) \]得到统一 action embedding。所以同一个 Astra 可以处理camera motionrobot posekeyboard/mouse command。这也是作者所谓General Interactive World Model的重要来源。 Astra General Interactive World…八、整个 Astra 用一句流程图表示实际上整篇论文可以压缩成Action ↓ Action Encoder ↓ MoAE ↓ Action embedding ↓ ACT-Adapter ↓ Initial image → Wan-2.1 / Flow Transformer ↓ Video Chunk 1 ↓ Noise-augmented history ↓ Action 2 → ACT-Adapter ↓ Video Chunk 2 ↓ ...训练History Action ↓ Flow Matching ↓ Next Chunk推理Generated Chunk ↓ 加入 History ↓ 输入新的 Action ↓ Generate Next Chunk所以它的世界模型本质上可以写成\[ \boxed{ p(o_{t1:tk}\mid o_{1:t},a_{1:tk}) } \]九、它用了什么数据作者不是只用一个数据集而是把很多场景混起来训练。数据集Action场景nuScenesCamera / vehicle pose自动驾驶SekaiCamera pose第一人称探索SpatialVIDCamera keyboard/mouse开放场景RT-1Robot pose机械臂操作Multi-Cam VideoCamera pose人体/多视角总训练规模约\[ 397K\ videos \]约\[ 360\ hours \]其中包含 camera、robot pose、keyboard/mouse 等异构动作。 Astra General Interactive World…这也是为什么他们需要 MoAE。十、训练成本基础模型Wan-2.1它是一个大型 video diffusion / flow model。训练配置8 × 80GB GPUbatch size 1 / GPUAdamWlr \(10^{-5}\)30 epochs大约 24 小时分辨率480 × 832latent3D VAEcondition frames随机 1128target frames33Astra General Interactive World…而且并不是整个 Wan-2.1 全量训练。主要训练AttentionACT AdapterAction EncoderMoAE。这种做法对复现来说非常重要。十一、结果怎么样他们自己建立了Astra-Bench每个数据集取 20 个 held-out sample。测试480×83220 FPS96 frames50 inference steps评价两个方面视频质量包括Subject ConsistencyBackground ConsistencyMotion SmoothnessAesthetic QualityImaging QualityAction following看模型到底有没有按照用户动作运动。其中 action following 使用人工评价其他指标主要来自 VBench。 Astra General Interactive World…主要结果中 Astra 的\[ Instruction\ Following0.669 \]相比Wan-2.10.061MatrixGame0.268Yume0.652同时其 Subject Consistency、Background Consistency、Motion Smoothness 和 Aesthetic Quality 也取得表中最高值Imaging Quality 为 0.747与表中最高的 MatrixGame 0.748 基本接近。 Astra General Interactive World…这里可以看出来Astra 最大的提升并不只是“视频更漂亮”而是Action Following 明显增强。这才是这篇工作的核心。十二、消融实验其实很说明问题论文 Table 3模型Instruction Followingw/o AFG0.545w/o Noise0.359Cross-Attention Adapter0.642w/o MoAE0.651Astra0.669Astra General Interactive World…这里有一个特别重要的信息。去掉 Noisy Memory\[ 0.669\rightarrow0.359 \]掉得非常厉害。也就是说历史视觉惯性可能确实是 action-conditioned world model 的一个核心问题。相比之下去掉 MoAE\[ 0.669\rightarrow0.651 \]单纯从这个指标看影响并没有那么大。但 MoAE 的意义主要是把不同 action modality 放进一个模型。因此 MoAE 更多解决的是\[ Generalization / Generality \]而 Noisy Memory 更多解决\[ Action Responsiveness \]这是读这篇论文时很值得区分的一点。十三、它最后能做什么论文 Figure 7 展示四类典型能力。① World Exploration输入W A S D ↑ ↓ ← →然后\[ 当前画面动作 \rightarrow 未来第一人称视频 \]② Robot Manipulation例如Observation Robot action ↓ Future manipulation video可以预测抓取移动物体工具操作。作者认为这种 rollout 可用于planningpolicy learningsafe exploration。Astra General Interactive World…③ Autonomous Driving输入当前道路 车辆动作预测未来交通场景包括道路变化ego motionsurrounding agents。Astra General Interactive World…④ Camera Control例如pan left rotate move forward世界随 camera pose 改变。Astra General Interactive World…十四、这篇论文真正的核心贡献怎么概括如果你以后做论文汇报我建议不要列成五六条而是总结成这三个核心贡献① Autoregressive Denoising World Model把\[ Autoregressive Video Diffusion / Flow Matching \]结合起来实现长时间、chunk-wise、interactive video rollout。② 强 Action Conditioning通过\[ ACT\text{-}Adapter AFG Noisy\ Memory \]解决历史视觉信息太强、动作信号太弱。特别是提出Visual Inertia这个问题非常有意思。③ Unified Heterogeneous Action Modeling通过\[ MoAE \]统一camerarobotkeyboard/mousenavigation使一个模型可以跨任务训练。最终作者把 Astra 定位为一个兼顾 interactivity、consistency 和 versatility 的通用交互式 world model。 Astra General Interactive World…十五、它和普通 Video Generation 最大的区别这个你一定要理解因为它也是你现在学习 world model 最重要的一条线。普通视频生成\[ \boxed{ P(Video|Image,Text) } \]Astra\[ \boxed{ P(Future\ Observation| History,Action) } \]差别就在\[ \color{blue}{Action} \]和\[ \color{blue}{Autoregressive\ Interaction} \]比如普通 I2V一张街道图 → 生成一个人在街上向前走。Astra当前世界 ↓ W ↓ 向前走 ↓ A ↓ 向左走 ↓ D ↓ 向右走每一个 action 都会改变之后的 world state。这才更接近\[ World\ Dynamics \]十六、对你做“红外 世界模型”特别有启发的地方这篇其实和你的方向很匹配因为 Astra 给了一个非常清楚的骨架\[ Observation Action \rightarrow Future\ Observation \]你以后完全可以考虑把\[ ObservationRGB \]扩展成\[ Observation \{RGB,\ IR/Thermal\} \]于是RGB history ────────┐ │ IR/Thermal history ─┼→ World Model → Future RGB │ Future IR Robot action ───────┘ Future thermal state而且 Astra 的Visual Inertia / Noise-as-Mask思想对红外尤其值得研究。比如机械臂接近一个热源t0 冷 t1 冷 t2 冷 t3 action抓住热物体 t4 ? t5 ?RGB 世界可能变化很小但\[ Thermal\ state \]应该逐渐改变。这时如果模型过度依赖历史IR_t ≈ IR_{t-1}就可能产生一种你可以类比称为Thermal Inertia / Thermal Visual Inertia也就是模型因为历史红外帧长期稳定而忽略 action 引起的未来热状态变化。这个问题跟 Astra 提出的 visual inertia 在逻辑上非常接近但放到红外世界模型中会自然产生新的研究问题。十七、最后给你一个非常简单的理解版本如果完全不管论文里的复杂公式你只需要记住这句话Astra 把 Wan-2.1 从“视频生成器”改造成了“能根据动作不断预测未来的视频世界模型”。怎么改Astra │ ┌─────────────┼─────────────┐ ↓ ↓ ↓ Autoregressive ACT-Adapter Noisy Memory 长期预测 动作控制 防止历史压制动作 │ ↓ MoAE │ camera / robot / WASD所以它真正解决的核心矛盾是\[ \boxed{ Long\text{-}term\ Consistency \quad VS \quad Action\ Responsiveness } \]历史越强 → 世界越稳定但越不听 actionaction 越强 → 越听指令但容易破坏时间连续性。Astra 的整个设计本质上就是在解决这个 trade-off。Astra 是一个“根据你做的动作预测接下来画面会变成什么样”的视频世界模型。比如现在给它一张街道图然后你按W它就生成“往前走之后看到的画面”接着你按A它再生成“向左转之后的画面”。所以它不是普通的“看图生成视频”而是当前画面 你的动作 → 接下来会看到什么论文主要做了三件事第一让它能一段一段地持续生成未来所以可以预测比较长的视频第二让动作真的能控制结果不至于模型只顾着延续之前的视频第三让它既能接受 WASD、相机移动也能接受机械臂动作所以可以用在场景探索、机器人操作、自动驾驶这些不同任务里。 Astra General Interactive World…你可以把整篇论文直接理解成这个框图看到当前世界 → 输入动作 → Astra 预测下一段世界 → 再输入新动作 → 再预测下一段最核心的问题就是“如果我现在做这个动作世界接下来会发生什么”
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进