ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

被误判的大模型:物理学专家复审揭示基准测试危机与AI能力的“近饱和”真相

被误判的大模型:物理学专家复审揭示基准测试危机与AI能力的“近饱和”真相 被误判的大模型物理学专家复审揭示基准测试危机与AI能力的“近饱和”真相耶鲁大学、剑桥大学和南加州大学联合发表名为How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks论文其研究探讨了前沿LLM在解决高级物理问题时的真实水平指出目前的评估标准严重低估了它们的实际能力。研究团队通过对六个主要物理基准进行专家级审计发现大量所谓的模型错误实际上源于题目定义模糊、参考答案错误或评分程序僵化。在修正了这些基准缺陷并排除问题题目后诸如GPT-5.6-Sol等模型的得分出现了大幅跃升在多个测试中接近满分。结果表明当前的闭口物理题目已趋于性能饱和难以有效区分顶尖 AI 的推理差异。作者因此呼吁开发更具挑战性且经过专家验证的新一代评估工具以准确衡量人工智能在科学探索领域的进步。另外前沿LLM在面对理论物理中的开放性未解难题Open Research Problems时明显遇到瓶颈需要新的方法和工具解决该问题。核心结论1. 现有物理基准测试严重低估了前沿大模型的真实水平论文指出此前行业报告中记录的大模型在物理测试中的“低分”主要源于评估流程破损Broken Evaluation Pipelines而非大模型物理推理能力的真实缺陷。2. 模型表现“不佳”主要是因为基准测试本身的缺陷与打分失误耶鲁大学等机构的物理专家对 250 个被传统评估系统判定为错误的回答进行了审查发现95.2% 的“失败案例”归咎于测试材料或打分机制题目/参考答案缺陷Benchmark Errors, 占 57.2%包括参考答案计算错误、题目未给出必要的物理假设如坐标/符号约定、边界条件或归一化常数、以及条件不自洽。评分器失误Grader Errors, 占 38.0%基于规则的传统评分器如 SymPy 或 EED过于机械拒绝了模型给出的数学等价表达、不同正负号约定或因子顺序变动。真实模型错误Model Errors, 仅占 4.8%在所有被拒回答中仅有 12 个是模型自身真正的物理逻辑或推导错误。3. 专家更正后大模型在主流物理基准上趋于“近饱和”状态当专家修复了有缺陷的题目和参考答案并允许数学上等价的表达后前沿模型如 GPT-5.6-Sol、Claude Fable 5、Gemini 3.1 Pro的得分出现了爆发式增长HLE-Physics人类最后考试-物理部分GPT-5.6-Sol 的平均准确率从 47.3% 暴涨至78.7%pass4 达到91.4%。CMT-Benchmark凝聚态理论测试得分从 61.0% 提升至87.2%pass4 达到98.0%。CritPt前沿物理关键点测试得分从 32.3% 跃升至87.5%pass4 达到94.4%。PRISM-Physics与PHYBench修正后得分分别高达94.6%和90.2%。4. 出现了“测试缺陷天花板”效应当模型的实际物理能力大幅提升、真实错误率降至极低水平时测试得分不再由模型能力决定而是受限于基准测试自身的缺陷率20%~50%。这意味着对于所有表述清晰、有标准答案的闭卷物理题closed-ended physics problems前沿大模型的能力已经达到或接近饱和天花板。5. 闭卷题饱和 vs 开放性科研难题的瓶颈论文同时强调闭卷测试的饱和并不意味着大模型已经具备独立开展前沿物理研究的能力。当研究人员使用智能体框架Agentic Harnesses让大模型尝试攻克理论物理中的开放性未解难题Open Research Problems时模型尚未能完整解决任何一个未解难题。因此作者呼吁学术界建立经专家严格验证、难度更高的新一代物理基准测试。https://arxiv.org/html/2609.13009v1
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进