ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

大模型评测榜单的水分在哪里?开发者如何辨别可信度

大模型评测榜单的水分在哪里?开发者如何辨别可信度 现在一提大模型评测榜单舆论场就会同时出现三种新闻某个模型在多个榜单完成“屠榜”某个版本的 OpenAI 模型刷掉前面的成绩某个国产模型一夜之间登顶前列。如果只是吃瓜看看没问题但如果你真的要拿这些榜单做模型选型、买 API、部署本地模型就必须先搞清楚一件事榜单里的水分到底藏在哪个环节。这里不打算替任何一家模型站台也不准备给某个排行榜颁奖。我更想聊一个更实际的问题大模型评测榜单的公平性为什么一直有争议普通开发者在对比模型时应该怎么判断一份评测值不值得信如果要自己拉一组测试怎样做才不容易被自己的流程带偏。适合读这篇文章的人有三类正在对比大模型 API 的应用开发者打算在本地部署开源模型、又被各种榜单弄糊涂的工程师以及需要给团队做技术选型判断的技术决策者。看完整篇你会发现真正重要的可能不是“谁是第一”而是“这份榜单在什么条件下成立以及我自己的场景里到底能不能复现”。1. 榜单本质不是考试成绩而是一套受限快照1.1 不同榜单测的根本不是同一种能力大模型评测榜单并不是一场统一考试。不同榜单的数据集、任务类型和评分方式差别非常大直接拿两个榜单的分数比较本质上并不成立。MMLU、C-Eval 这类知识问答基准测的是模型在选择题上的知识记忆和推理能力。GSM8K、MATH 这类数学基准测的是数学解题和逐步推理。HumanEval、MBPP、SWE-bench 这类代码基准测的是代码生成、函数补全和真实代码仓任务。LMSYS Chatbot Arena 这类竞技场更像“用户盲选”谁的回答更好由真实用户投票决定。AgentBench、GAIA 这类智能体任务测的是模型在工具调用、多步推理和真实交互中的表现。如果模型 A 在 MMLU 上比模型 B 高 2 分你只能说“在这套选择题协议下A 的知识覆盖更强一点”不能说“A 比 B 好用”。同样某个模型在 Chatbot Arena 上赢了也未必代表它在结构化输出、长文本处理或严格 JSON 格式上更稳定。所以第一个建议是拿到榜单之后先不要盯着总排名和第一名先去看这个榜单有多少个科目、每个科目怎么测、样本量是多少。总分只是把多个维度压缩成一条线真正能用于选型的一定是分维度信息。1.2 “屠榜、刷榜、一夜登顶”对应的三种真实情况标题里“屠榜”“刷榜”“一夜登顶”这几个词并不是简单的网络段子它们分别对应不同的评测现象。“屠榜”通常指某个模型在一个发布周期里同时登顶多个主流榜单。这往往说明模型的基础能力确实有提升也可能只是因为它发布时榜单里的对比模型还没有更新到最新版本。看到“屠榜”时最该确认的是榜单里有没有加入同期发布的同级别模型而不是只看冠军是谁。“刷榜”这个词在社区里含义很模糊。我更愿意把它理解为“针对评测协议做优化”。公开评测已经存在很多年训练数据里完全可以出现原题厂商也有能力把评测集的分布训练进模型。这是一件现实存在的事情并不违法但它会削弱榜单的泛化能力。如果一个模型在某个长期不变的选择基准上突然暴涨而它在其他没有重叠风险的评测中提升不大就要多留一个心眼。这里不是说某一家公司在作弊而是说“刷榜”现象本身值得警惕。“一夜登顶”更接近发布策略。一个没有开放 API、没有公开权重、没有提供复现脚本的新模型突然出现在某些榜单顶部这确实容易引发争议。它不一定是假可能是榜单只选择了它擅长的子集也可能模型只在特定 Prompt 模板下表现很好。核心验证方式只有一个能不能复现。要判断一个模型是否“真的强”关键不是看宣传稿而是看它是否允许别人用公开评测脚本、固定参数、固定样本去复现分数。能复现说明评测至少在控制变量的前提下成立不能复现那它更适合被当成“发布事件”来看待而不是技术事实。2. 榜单里的水分主要藏在五个环节2.1 数据层测试集与训练集重叠是最难查的一环评测公平性第一个关键点是数据。过去几年很多公开基准已经被无差别抓进训练语料。模型在训练阶段“见过”的题目到评测阶段再拿出来看分数当然会高。这不一定是厂商故意作弊。很多情况下研发团队没有精力把所有评测题目从海量训练语料中精确剔除。但如果一个模型卡里没有写“已对评测集进行污染检查和数据去重”那它的分数就不能完全说明真实能力。判断数据污染有几个可操作的信号看模型卡里是否披露污染检查方法比如 n-gram overlap 过滤、困惑度异常检测、样本级别去重。看榜单是否有独立的评测集更新机制。评测集长期不变被污染的风险就会持续累积。看模型分数分布是否异常。比如常识类科目接近满分而长文本、多轮对话等扩展科目表现一般这个组合本身需要解释。看第三方复现成绩。如果第三方拿同一套数据重新跑分数和榜单相差很多数据层的问题就值得怀疑。对普通开发者来说不需要真的去算 n-gram 重叠。只要记住一个长期固定、又不披露过滤方法的榜单说服力会随时间的推移不断下降。2.2 协议层换一个 Prompt排名可能就变评测协议是大模型评测里最容易被忽略、又最容易制造“水分”的地方。同一批测试题用不同的 system prompt、few-shot 示例、答题格式要求模型输出会变化评分也会跟着变。最常见的协议问题有四个few-shot 示例的数量和选取。示例是随机抽出的还是精心挑选的“最有利于模型理解题意”的几条如果是后者相当于给模型开了小灶。答案格式要求。有的榜单要求模型输出“A/B/C/D”选项字母有的要求先输出解释再给答案有的让模型自由输出后由规则提取。输出格式不同解析失败率差别很大。system prompt 的倾向性。比如“请一步步思考”这句话对某些模型的推理能力提升非常明显但不是所有真实场景都会默认带上。解码参数。temperature、top_p、max_tokens、frequency penalty 设置不同结果可能差好几个百分点。很多模型在 temperature0 时更稳定但如果评测里用了较高温度分数波动就会明显增加。判断一份榜单是否规范最简单的办法是看它有没有公开完整评测脚本和 Prompt 模板。如果只有“我们测了结果如下”而没有脚本那这份榜单很难称得上可复现。基于开源评测框架跑出来的榜单比如用 lm-evaluation-harness 或 OpenCompass 这类工具至少给其他人提供了复核入口。2.3 统计层测试集太小第一名和第二名可能没有区别这是一个经常被忽视的“水分”。不少榜单的总分来自几百道题的评测集而每个子科目可能只有几十道题。几十道题意味着什么每多对一道题准确率可能上升 1 到 3 个百分点。也就是说第一名和第二名之间的差距可能只来自 2 道题。这种情况下单纯看分数排序没有统计意义。更严谨的做法是看置信区间看每个模型运行了多少次、标准差是多少。如果两个模型的分数差值小于置信区间的宽度那它们的排名就处于“统计上无法区分”的状态。个人经验是同样的评测任务至少跑两到三遍再下结论。因为即使固定了 temperature0不同的批次、不同的并发、不同的服务端版本也可能带来波动。如果你看到一个榜单没有说明运行次数、没有给方差那它更适合当成快照参考而不是选型依据。2.4 版本层base、instruct、API 模型根本不是一个物种另一个容易踩的坑是模型版本。很多开源模型同时有 base 版本、instruct 版本、chat 版本能力面向完全不同。如果榜单没有写明跑的是哪个版本你就无法判断分数到底代表什么。API 模型的情况更复杂。模型供应商在后端更新版本时用户感知不到评测者也不一定打得准。一个模型在榜单上的成绩可能是旧版本等你真正接入时API 已经换了一套行为。所以一份评测规范必须要记录模型具体版本号、API 名称或权重文件哈希、部署框架、量化方式、采样参数。如果一份榜单没有这些信息它就只能作为粗略参考不能作为最终结论。2.5 评比机制层机器打分、LLM 打分和真人打分各有偏废最后是打分机制的问题。机器自动打分适合有确定答案的选择题、数学题和代码测试用例但对开放式回答、多轮对话质量、逻辑连贯性机器打分往往很弱。于是很多榜单引入 LLM-as-judge让一个裁判模型给另一个模型的回答打分速度快、成本低。但裁判模型也有自己的偏好可能对长文本、某种写作风格、“看起来更完整”的回答有偏好这些偏好会让分数失真。相对可信的是真人盲评。LMSYS Chatbot Arena 走的就是这条路由用户对未知身份的模型进行投票通过 Elo 体系排位。这样不容易让某个模型通过刷固定题库拿分但缺点也很明显用户偏好并不等于生产环境能力。某个模型在对话聊天上很讨喜但在严格 JSON 输出、长文档摘要、Agent 工具调用上可能并不稳定。3. 拿到一份榜单五分钟判断它值不值得信3.1 优先读方法说明不要只盯排名现在很多排行榜页面做得越来越美观有总分、有柱状图、有雷达图但方法说明被藏在一大段英文里。我的建议是先跳过那些图直接找“评测配置”。你需要确认的信息很具体这份榜单用什么评测框架跑出来的有没有公开仓库地址测试集是什么样本量是多少是否包含训练集污染检查每个模型用的是什么版本是 base model、instruct model还是 API 模型解码参数是否固定有没有说明温度、top_p、max_tokens、随机种子跑了多少次是否给了置信区间是否有第三方或者独立研究者复现过同样结果如果以上信息大部分缺失那就把这份榜单当“产品宣传材料”看而不是“独立评测报告”。3.2 可信度核查清单下面这个清单不一定保证绝对权威但能帮你快速过滤掉水分较大的榜单。核查项可信度较高的情况可信度较低的情况评测代码公开在开源仓库社区可复现只在内部文档或宣传页展示模型版本写明版本号、API 名或权重哈希只写“某模型”或“某 API”
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进