
4万被试预训练fMRI基础模型能跨人解码吗——fMRI-PTE精读论文fMRI-PTE: A Large-scale fMRI Pretrained Transformer Encoder for Multi-Subject Brain Activity Decoding作者Xuelin Qian, Yun Wang, Jingyang Huo, Jianfeng Feng, Yanwei Fu版本arXiv:2311.00342 v12023DOI10.48550/arXiv.2311.00342原文https://arxiv.org/abs/2311.00342先用30秒说清楚这篇论文想解决一个长期限制脑解码走向大模型的问题不同人的脑结构和fMRI响应差异很大模型通常只能在单个被试上训练、再服务于同一个人。fMRI-PTE的做法是先把近4万名UK Biobank被试的静息态fMRI投影到统一皮层表面训练一个两阶段的压缩模型之后只用较轻的对齐模块把共享表示迁移到NSD自然图像解码。结果可以概括为三句话。第一预训练编码器几乎达到论文所设“Upper Bound”的fMRI表面重建精度。第二在四名NSD被试的跨被试图像重建中fMRI-PTE总体优于论文重训的MAE、MBM和LEA基线。第三它还不能证明已经得到适用于任意脑任务、任意人群的通用基础模型跨被试测试只覆盖4名NSD被试、一个视觉数据集和视觉皮层ROI而且论文目前是2023年的arXiv v1预印本。图1原论文Figure 1第2页被试内与跨被试视觉解码概览。图片为论文原图裁剪未重绘或添加标注。一、问题不只是“把脑信号变成图片”自然图像重建常被描述成“从fMRI还原被试看到的图片”但真正困难的不只是生成器够不够强。一个典型流程要先收集某名被试大量“图像—fMRI”配对再训练该被试专属映射。换一个人体素位置、皮层几何、信噪比和功能组织都变了模型往往要重来。这造成两个瓶颈一是单个被试的数据昂贵且规模小二是大量无标签fMRI不能被有效复用。作者因此提出一个更接近“预训练—微调”的问题能否先从大规模、多被试、无任务标签的fMRI中学习共享表示再把它迁移到视觉解码这也是fMRI-PTE被称为大型预训练Transformer编码器的原因。这里要注意“跨被试解码”有两种设置。one-to-one是在一个被试上建立下游映射直接测试另一个被试many-to-one则用若干已知被试的fMRI—图像配对做特征对齐再测试一个未参与对齐的被试。后者利用了更多下游被试的数据但目标被试仍然是未知的。两种设置都比单纯的被试内训练更接近共享模型却不是“零样本解码任意人”。二、第一道关把不同人的fMRI变成同一种表示作者没有直接拼接各数据集的原始体素。UK Biobank静息态fMRI先从MNI体积空间映射到32k_fs_LR皮层表面NSD的GLM beta原本位于fsaverage表面也被转换到同一模板。随后对每个session的顶点响应做z-score并用pycortex把表面展开成一张1023×2514的二维图像。下游只保留HCP-MMP图谱中的视觉ROI共8405个顶点覆盖V1–V4、LO、MT、VVC、FFA相关区域等。统一表面坐标的价值很直接同一像素位置尽量对应不同被试的相似皮层位置卷积和Transformer才有机会学习跨人的统计规律。图2原论文Figure 3第5页统一表面图像中的视觉ROI。图片为论文原图裁剪。但空间配准并不等于功能完全对齐。相同解剖位置在不同人身上仍可能有不同的感受野、响应幅度和功能边界。fMRI-PTE真正需要学习的是在这种残余差异之上仍可复用的表示。因此表面投影是必要的输入规范化而不是跨被试问题已经被解决。三、模型为什么分成两个预训练阶段整体流程由“离散重建”和“Transformer压缩”组成最后才连接视觉生成器。图3原论文Figure 2第4页fMRI-PTE完整训练管线。图片为论文原图裁剪。1. 先学会忠实重建局部纹理第一阶段类似VQGAN。卷积编码器把二维fMRI表面图压成连续特征再通过向量量化映射到离散码本对称解码器重建原始表面图。训练同时使用重建损失、感知损失、对抗损失和码本承诺损失。作者的考虑是普通像素回归容易把高频结构平均掉而fMRI表面图中细小的局部变化可能携带重要信号。离散码本迫使模型先建立一套可以复用的“脑活动局部词汇”。这一阶段的卷积网络包含5个block残差深度为[1,1,2,2,4]论文报告约训练60万次迭代。2. 再用Transformer压缩全局关系第二阶段以第一阶段的离散索引为目标。ViT编码器接收量化后的表面表示经过映射层压缩为77×768的潜在表示MAE风格的Transformer解码器则在100% mask token条件下仅依赖这个潜变量预测全部离散索引。编码器深度24、隐藏维度2048、16个注意力头。这与经典MAE随机遮住部分patch不同解码端看不到任何原始token信息必须全部通过压缩瓶颈。作者希望编码器丢掉个体噪声而保存可泛化的脑活动结构。论文称实现了“78%压缩”但文中给出的不同张量尺寸并不能直接、唯一地推出这个百分比它可能采用了未充分说明的计算口径。这个数字适合作为作者报告而不宜当作可复核的精确结论。预训练先在1万名UK Biobank被试上从头训练20万次迭代再扩展到全部训练被试继续60万次迭代。数据划分约为39630名训练被试和1000名验证被试每人一个静息态session、490个时间点论文报告在8张NVIDIA A100上耗时约6天。第二阶段优化器一处把β1写了两次β10.9, β10.95大概率是排版错误但仅凭正文不能替作者确定第二项一定是β2。四、预训练之后怎样接到图像生成器下游数据来自Natural Scenes DatasetNSD。8名被试观看COCO自然图像作者主要在被试1、2、5、7上评估重复呈现的fMRI响应被平均。测试集包含所有被试共享的982张图像。fMRI-PTE编码器输出的脑表示先与图像特征对齐再交给Stable Diffusion或MaskGIT生成图像。两类生成器展示了不同偏好MaskGIT往往在AlexNet等偏低层的识别指标上更好Stable Diffusion则在不少CLIP语义指标上更强。因此“同一个脑表示是否有效”与“最后选哪种生成器”是两个问题不能只看最漂亮的示例图。读论文表2至表4时还要先分清指标。PixCorr和SSIM偏向像素或局部结构AlexNet第2层更接近低层外观第5层、Inception与CLIP更偏向类别和语义EfficientNet-B、SwAV采用距离数值越低越好。二选一识别通常把生成图的特征分别与目标图和一个干扰图比较选择更相似者因此50%附近才是随机水平。70%并不表示“还原了原图70%的像素”也不能直接和PixCorr的0.13比较。一个模型可能画错颜色与位置却因物体类别相同而获得较高CLIP或分类分数反过来结构相似的模糊图也可能在语义特征上吃亏。五、实验结果论文真正证明了什么1. fMRI表面重建几乎达到设定的上界论文表1比较了MAE、MBM、LEA和fMRI-PTE。fMRI-PTE的Pearson相关为0.8546±0.004MSE为0.0263±0.001几乎等于Upper Bound的0.8547和0.0262也优于其他预训练基线。不过SSIM为0.7937±0.006低于LEA的0.8098±0.009。换句话说“整体数值相关和误差最好”成立“所有结构指标都最好”不成立。图4原论文Figure 8第16页GT、fMRI-PTE、MAE和LEA在四名NSD被试上的表面重建。图片仅做忠实裁剪和无损旋转。2. one-to-one跨被试共享表示能迁移但生成图像并非逐像素复原在7→1、5→2、1→5、2→7四个迁移方向中fMRI-PTEMaskGIT的AlexNet识别准确率分别为72.82%、73.08%、70.05%和70.36%高于论文重训的LEA对应结果。Stable Diffusion版本的CLIP分数则在多个迁移方向更高例如7→1为63.68、1→5为65.71。图5原论文Figure 7第15页one-to-one跨被试视觉重建。图片为论文原图裁剪。从原图看方法经常能保住“飞机、房间、公交车”等粗粒度语义也会改变物体数量、姿态、背景甚至具体类别。它更像“由脑信号约束的语义生成”不是从fMRI读取出唯一且像素准确的原图。论文的二选一识别指标衡量生成图与目标图在特征空间是否更接近并不等价于日常理解中的高清复原。3. many-to-one利用多人对齐后未知被试仍可解码many-to-one设置用三名已知被试建立fMRI与图像特征的对齐再把映射用于第四名未知被试。fMRI-PTEMaskGIT在四个目标被试上的AlexNet指标为76.66%、76.45%、72.88%和72.63%Stable Diffusion版的CLIP指标为68.96、69.08、67.77和65.93。它比one-to-one更强并不意外因为对齐阶段见过更多人的配对数据。图6原论文Figure 6第14页many-to-one跨被试视觉重建。图片为论文原图裁剪。这项结果的重要性在于预训练表示似乎提供了跨人的共同坐标使新的目标被试不必重新训练整套大模型。但它仍不是严格的“完全无监督新人解码”因为流程借助其他NSD被试的任务态配对数据、统一预处理和线性/特征对齐。4. 被试内结果指标各有胜负被试内实验中fMRI-PTEMaskGIT取得PixCorr 0.131、AlexNet第2层78.13%、第5层88.59%、Inception 84.09%和CLIP 82.26%。它在多项视觉指标上领先论文列出的纯视觉方法但并非全面第一SSIM只有0.112低于若干方法BrainCLIP在使用视觉文本条件时的CLIP指标达到89.40%也高于fMRI-PTE。图7原论文Figure 5第13页被试内解码示例。每行包含真值、fMRI-PTE两种生成器和基线结果。图片为论文原图裁剪。因此最稳妥的表述是fMRI-PTE证明了大规模无标签预训练对多被试视觉解码有明显价值不同生成后端分别偏向低层外观或高层语义没有一个版本在所有指标上统治。六、这篇工作的贡献在哪里第一它把fMRI领域长期零散的“每人一模型”路线推向了共享预训练。近4万名被试的规模远大于常见视觉解码数据集说明静息态数据也能为任务态解码提供先验。第二它把解剖对齐、局部离散表示和全局Transformer压缩串成了一条完整管线。贡献不只是换一个更大的ViT而是为异构fMRI建立统一输入和受约束的信息瓶颈。第三它同时报告被试内、one-to-one和many-to-one结果使“跨被试泛化”不再只靠一组平均分。尤其是未知目标被试仍能生成有语义关联的图像为低校准成本脑机接口提供了方向。七、必须保留的局限与复现风险“基础模型”的范围还窄。预训练规模很大但下游只验证NSD自然图像解码和视觉皮层ROI没有展示语言、运动、临床或全脑任务迁移。它更准确地说是“面向视觉脑解码的fMRI预训练编码器”。跨被试证据仍来自4名NSD被试。one-to-one只报告四个定向配对不是所有被试两两组合样本的人口学多样性和跨扫描仪泛化也没有系统展开。静息态到任务态的域迁移缺少消融。UK Biobank预训练用静息态时间序列NSD使用图像诱发GLM beta。结果表明迁移可行却没有充分解释究竟是大样本、表面配准、离散码本还是Transformer容量贡献最大。生成指标容易被误读。二选一分类、CLIP相似度与“读取真实视觉体验”不是同一件事。定性图也显示语义接近时具体内容仍可被生成器改写。复现信息不够整洁。截至本文整理时arXiv条目未给出官方代码链接正文只表示未来将公开处理代码和数据。论文还出现fMEI-PTE、占位文字、优化器参数重复等编辑瑕疵。表2至表4没有报告跨随机种子的误差条部分基线虽然由作者重训但生成后端与输入模态并非完全等价。伦理边界不能被生成效果掩盖。论文使用UK Biobank和NSD已有数据但正文未单列新的伦理与知情同意讨论。当前结果不能支持读心、身份识别或临床诊断更不能推导出真实世界的无配合解码能力。如果要复现或继续研究我会优先核对四项细节。其一严格保存MNI、fsaverage和32k_fs_LR之间的映射版本否则统一二维图上的同一坐标可能已经失配。其二训练、验证和跨被试测试必须按“人”划分而不能让同一人的不同时间点跨集合。其三NSD重复试次平均会显著提高信噪比部署到单次试验前应单独报告性能下降。其四需要把编码器、对齐器与生成器分别消融并用相同生成后端比较不同脑编码器否则很难判断一张更好看的图来自脑表示还是来自生成模型更强的先验。八、我的判断它为什么仍值得读fMRI-PTE最有价值的地方不是又生成了几张“像原图”的图片而是把脑解码的训练单位从“一个被试”提升到“一个大规模人群数据分布”。这是fMRI基础模型路线较清楚的一次工程化表达先用无标签数据学习共享脑表示再让轻量下游模块承担任务和生成器适配。它也提示后续研究应该把注意力从单篇论文的最好图像转向四个更硬的问题表示能否跨数据集和扫描仪新人需要多少校准数据预训练能否迁移到视觉之外提升究竟来自数据规模还是模型结构。只有这些问题得到更广泛验证“大规模预训练编码器”才会真正成长为fMRI基础模型。如果把结论压缩成一句话fMRI-PTE有力证明了大规模多被试预训练可以改善跨人视觉解码但“通用脑基础模型”仍是它指向的目标而不是已经完成的事实。对读者来说最值得带走的不是某一张生成图而是一套判断框架先问预训练数据是否真正跨人再看下游是否隔离目标被试最后拆开脑编码器、对齐器与图像生成器各自的贡献。按这三步读才能判断“跨被试”到底来自共享脑表示还是来自更强的生成先验。参考信息与图片声明Qian X, Wang Y, Huo J, Feng J, Fu Y.fMRI-PTE: A Large-scale fMRI Pretrained Transformer Encoder for Multi-Subject Brain Activity Decoding. arXiv:2311.00342, 2023. DOI: 10.48550/arXiv.2311.00342.本文所有图片均来自论文正文保留原Figure编号与页码仅进行忠实页面裁剪。Figure 8另做无损90度旋转以便阅读没有生成、重绘、AI修复、添加箭头或语义性修改。数值均按论文正文和表格整理“作者认为”与本文的独立评价已尽量分开表述。