ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

多模态大模型能直接读眼科影像吗?AgentEYE 用专科VLM工具+循证检索解耦架构,302例诊断正确性从36.5分提到71.9分,有害输出率29%→3.5%

多模态大模型能直接读眼科影像吗?AgentEYE 用专科VLM工具+循证检索解耦架构,302例诊断正确性从36.5分提到71.9分,有害输出率29%→3.5% 一、研究背景做医疗影像智能体的团队几乎都会在某个节点面对同一个诱惑既然多模态大模型已经能看图说话那把片子直接喂给它、让它输出诊断报告是不是最省事的架构一到眼科这个诱惑就撞上了现实的墙。眼科的临床诊断从来不是一张图的分类题。医生要同时看眼底照相和眼部 B 超B 超看到玻璃体腔内一团中高回声眼底照相却因为屈光间质混浊几乎拍不清——这时候要判断是玻璃体积血、视网膜脱离还是更凶险的脉络膜黑色素瘤靠的是把两种模态的信息交叉验证再结合病史、指南和鉴别诊断逻辑收敛出一个判断。更麻烦的是医生做完判断还要能说清楚我为什么这么想因为下一步可能就是手术决策。而现有的眼科 AI大部分停在三种形态单任务分类模型。一个模型判断糖网分级另一个模型筛青光眼第三个做视网膜分层。性能可能很好但每个都只回答一个封闭问题凑不成一份能给临床看的报告。通用大模型直接看图。GPT-4o 这类多模态模型确实能对眼底照片说出一段话但在专科影像上的识别错误率相当高而且推理依据不透明——它说符合视网膜脱离表现你无从知道它究竟看到了什么。弱循证的报告生成。有些系统会在报告里附上参考文献但引用是模型自己想出来的。医生一查链接打不开、文献不存在或者内容和结论根本对不上。这三种形态共同缺失的东西是可审计性。真实临床里一份不能被追查依据的诊断报告是没法进入决策链条的。2026 年 8 月 5 日浙江大学医学院附属第二医院眼科中心金凯团队联合浙江大学生物医学工程学系、浙大医学院附属儿童医院、皖南医学院第一附属医院、中国矿业大学以及新加坡国立健康集团眼科研究所、宾夕法尼亚大学佩雷尔曼医学院、波兰眼科研究基金会等国内外机构在 Cell Press 旗下Cell Reports Medicine发表研究给出了他们的答案AgentEYE——一个自主的多模态眼科智能体。二、研究创新点AgentEYE 的设计取向可以概括成一句话不让大模型去做它不擅长的事而让它去做只有它能做的事。具体拆成三个创新点。第一把看图和推理彻底解耦。大模型不负责判读影像它负责规划识别这是眼底照片还是 B 超、该调哪个专科工具、工具结果之间有没有冲突、要不要去查指南、证据够不够、最后怎么把这些拼成一份报告。真正的影像判读交给专门训练过的本地视觉语言模型。这是典型的编排层而非替代层思路但在眼科多模态场景下是第一次被系统验证。第二让证据检索的目标从提分改成可查。这是本研究最反直觉、也最有价值的发现。团队做了消融实验把检索模块整个拿掉——诊断正确性和完整性评分几乎没变。按常规逻辑这会被解读为检索没用。但作者的结论正相反检索的价值本来就不在提高诊断准确率而在于让报告里的每一条结论都能挂上一条可核查的证据链。评价一个医疗智能体不能只看准确率这一个数。第三主动报告能力边界而不是只报喜。论文同时给出了三类不好看的结果波兰外部队列上 AgentEYE 相对基线没有优势对超出专科工具标签范围的未见疾病只改善了报告完整性、没提高诊断正确性检索虽然大幅减少了虚构文献但没有消灭不相关和弱支持的引用。作者在讨论部分明确写道AgentEYE 现阶段是需要前瞻性多中心验证的可追溯决策支持原型不是自主诊断系统。三、技术原理AgentEYE 把一次诊断拆成四个相互衔接的环节每个环节都留下可检查的中间状态。环节一多模态识别与路由。系统接收同一患者同日采集的一组眼科影像自动区分眼底照相与眼部 B 超分发到对应的专科分析通道。这一步看似简单但在真实数据里图像命名混乱、模态标注缺失是常态自动路由省掉了大量人工预处理。环节二专科影像工具调用。眼底和 B 超各有一个本地视觉语言模型工具基于开源基座做 LoRA 参数高效微调训练而成代码库中的vlm_training模块依赖 PyTorch 2.8 与 Hugging Face PEFT 0.17。训练数据来自浙大二院真实临床队列9,049 名患者、31,393 张眼底图像、43,266 张眼部 B 超图像、15,244 份参考报告与 PDF 记录。这是整个系统里唯一真正看图的部件也是后面消融实验证明的性能主来源。环节三循证检索与充分性判断。当影像工具输出存在不确定性或两个模态的结论互相矛盾时智能体触发检索。检索有两路一路查本地构建的临床指南语料索引代码库diagnosis_guidelines模块从清洗后的指南 Markdown 语料建立一路查权威网络医学证据。检索回来之后不是直接塞进上下文而是先做一次充分性判断——现有证据够不够支撑结论不够就重写检索问题再查一轮。这个自我评估—重新检索的闭环是它区别于普通 RAG 的地方。环节四诊断整合与报告生成。大模型推理核心把三样东西合到一起专科工具的影像判读、检索到的指南与文献证据、临床鉴别诊断逻辑。输出的报告包含诊断结论、诊断解释、鉴别诊断、处理建议和带来源的参考文献。评估方法本身也值得一提。团队在 302 例基准上跑了五种方法对比完整 AgentEYE、去掉专科工具的消融、去掉检索的消融、通用大模型直接看图、能自行生成引用的大模型基线并采用三个不同大模型作为评委独立打分避免单一评委的偏好污染结论。四、实验结果内部基准302 例同日双模态病例。自动评分结果对比鲜明方法诊断正确性诊断完整性完整 AgentEYE71.9375.59去掉专科影像工具39.40—通用大模型直接看图36.5248.57完整系统的诊断正确性71.93 分、完整性75.59 分而通用大模型直接分析图像只有36.52 分和48.57 分——差距接近一倍。消融实验给出了归因移除专科影像工具后诊断正确性从 71.93 骤降至 39.40 分几乎回落到通用大模型基线水平。而移除检索模块正确性和完整性评分变化都很小。结论非常清楚在这套智能体里专科影像工具贡献了绝大部分诊断能力检索模块的贡献在别处。眼科医生盲法评价200 例、3 名医生、1,200 次独立评分。团队从 302 例中抽取 200 例让 3 名眼科医生在不知道报告来源的情况下对 AgentEYE 与能自行生成引用的大模型基线两组共 400 份报告打分。按多数投票汇总评价维度AgentEYE大模型基线诊断正确率83.0%42.0%报告完整率82.5%41.5%潜在有害输出率3.5%29.0%引用被判为正确86.5%46.5%其中两个数字最值得注意。一是潜在有害输出率 3.5% vs 29.0%。基线组接近三成的报告被医生判定为可能造成临床伤害这个比例足以否决任何落地方案AgentEYE 降到 3.5%虽然仍不为零但已经进入人工复核可控的范围。二是无法核实或疑似虚构的文献只出现在基线组AgentEYE 的报告中一例未见。这正好印证了前面那个反直觉的消融结果——检索模块不提高诊断分数但它把幻觉引用这个类别整个消灭了。对需要过合规审查的医疗产品来说这比多几分准确率更要紧。外部验证优势存在但边界也清晰。在皖南医学院第一附属医院的外部队列上对既定疾病类别AgentEYE 相对通用大模型基线把诊断正确性提高18.53 分、完整性提高11.17 分跨中心优势成立。但在规模较小的波兰队列上两种方法总体表现接近。对于超出专科工具标签范围的未见疾病AgentEYE 主要改善了报告完整性并未显著提高诊断正确性。作者对局限的交代相当坦诚主要基准只覆盖七个诊断类别其中脉络膜黑色素瘤和视网膜母细胞瘤各只有1 例未见疾病分析应被理解为边界条件测试而非开放世界诊断能力的证据症状、视力、眼压、既往眼病史、结构化电子病历变量以及 OCT 等模态均未纳入本次运行时评估形式化生成与大模型评委打分都是单次运行运行间波动性尚未解决。五、应用前景对做医疗智能体定制的团队来说AgentEYE 提供了三条可以直接迁移的工程经验。其一别让通用大模型碰专科影像的判读环节。36.52 → 71.93 这个数字差本质上是在告诉你多模态大模型的图像理解能力距离专科影像判读的要求还有一个数量级的差距。正确的做法是把它放在编排位置——识别模态、调度工具、检查冲突、整合结论这些是它真正擅长的。任何把片子直接喂给大模型的方案在专科场景下大概率是不合格的。其二检索模块的 KPI 应该单独设不要和准确率绑在一起。这是本研究最容易被忽略的启示。很多团队评估 RAG 时只看加了检索准确率涨了几个点涨得少就砍掉。AgentEYE 的消融告诉你检索的产出是可审计性不是准确率。在医疗场景一份带真实可查引用的报告和一份带虚构引用的报告即使诊断结论完全一样也是两种性质完全不同的产品——后者过不了任何一道合规审查。评估指标应该包含引用正确率“不可核实文献占比这类维度。其三“证据充分性判断 重写检索值得抄。普通 RAG 是检索一次、拼进上下文、生成”AgentEYE 多了一步自我评估证据够不够不够就换个问法再查。这一步在工程上不复杂但对减少证据和结论对不上的情况效果明显。同时也要看清它还不能做什么。论文本身把话说得很明白这是一个需要前瞻性多中心验证的原型。当前版本没有接入 OCT、视力、眼压、病史和结构化电子病历也就是说它并不构成完整的临床决策跨中心性能受疾病谱、图像采集规范、报告习惯和专科工具覆盖范围的共同影响在波兰队列上就没有复现出优势后验的敏感度、特异度估计依赖从自由文本报告中抽取诊断只能作为辅助指标。团队给出的下一步计划也很务实开展前瞻性多中心临床验证比较眼科医生用与不用AgentEYE 时的诊断准确性、决策时间、转诊合理性、治疗方案变化和安全性系统层面则要整合 OCT、视力、眼压、病史与电子病历扩大专科工具的疾病覆盖并重点完善逐条结论与证据之间的核验机制。代码已按 MIT 协议开源在 GitHub含基准运行、评委打分、消融分析脚本与指南语料索引构建工具但不含模型权重与原始影像数据。研究由国家自然科学基金82201195资助。六、结论AgentEYE 回答了本文开头那个问题医疗影像智能体不该让大模型直接看图。把影像判读交给专科工具、把流程规划交给大模型、把证据链交给检索三者各归其位——在 302 例内部基准上把诊断正确性从 36.52 分推到 71.93 分在 200 例医生盲评中把潜在有害输出率从 29.0% 压到 3.5%把引用正确率从 46.5% 提到 86.5%并且彻底消除了虚构文献。但更值得记住的是那个没提分的消融结果。当团队发现去掉检索模块后诊断分数几乎不变时他们没有把检索砍掉而是重新定义了它的价值检索不是用来提分的是用来让报告可以被查的。在医疗这个行业“能被查本身就是一项刚性功能它决定了一个系统能不能从演示走进诊室。对正在做医疗智能体的团队这项研究留下的最实用的一句话可能是先想清楚每个模块的 KPI 是什么再决定它该不该留在架构里。论文原文信息链接医疗影像智能体该让大模型直接看图吗AgentEYE 用专科工具加循证检索把眼科诊断正确性从 36.5 分提到 71.9 分本文基于 2026 年最新论文/开源项目的独立解读立场与原作者无关仅作技术交流。参考文献Zhao K, Sun Q, Kang D, Yu T, Han W, Yao R, Agrawal R, Ying GS, Grzybowski A, Jin K. An autonomous multimodal AI agent for evidence-grounded ophthalmic diagnosis.Cell Reports Medicine, 2026. DOI: 10.1016/j.xcrm.2026.102969 | PMID: 42556343Chen W, Dong Y, Ding Z, et al. Interpretable agentic AI system with localized reasoning for radiology.npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02994-8 | PMID: 42457975Everett SS, Bunning BJ, Jain P, et al. From tool to teammate in a randomized controlled trial of clinician-AI collaborative workflows for diagnosis.npj Digital Medicine, 2026. DOI: 10.1038/s41746-026-02545-1 | PMID: 41851268Chen M, Wu Y, Ma J, Jia X, Gao C, Zhao F, Qiao Y. Independent and collaborative performance of large language models and healthcare professionals in diagnosis and triage.npj Digital Medicine, 2026;9(1):222. DOI: 10.1038/s41746-026-02409-8Abukhiran I, Mansour A, Caicedo ML, Minkowitz JM, Pantanowitz L. End-to-end clinical validation of a human-supervised large language model agent for enterprise surgical pathology reporting.Modern Pathology, 2026. DOI: 10.1016/j.modpat.2026.101049 | PMID: 42526601
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进