ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

MEX 检索基准评测方法论:盲评对比 Grep,token 消耗直降 54% 的背后

MEX 检索基准评测方法论:盲评对比 Grep,token 消耗直降 54% 的背后 【免费下载链接】mexTeam memory for engineers and their AI agents. Lives in your repo. Shared through Git.项目地址https://gitcode.com/gh_mirrors/mex2/mex点击查看免费下载MEX 是一款把团队记忆放进代码仓库的开源工具核心能力之一是用代码图Code Graph做自然语言检索。这篇文章拆解 MEX 的检索基准评测方法论它如何用盲评、配对 Token 核算和确定性回退证明图检索对比传统 Grep 文件搜索能让 AI Agent 的 token 消耗直降 54%且答案正确率不降反升。为什么检索效果不能只看测试全绿在做代码图检索mex graph scope 自然语言问题的评测时MEX 团队先直面了一个尴尬的现实旧的评测全绿不代表检索真的好用。问题出在考的和用的不一致 旧门禁任务大多用精确标识符如runGraphScope这类查询当然能命中但真实使用中Agent 问的是什么东西防止检索结果超过 token 预算这类自然语言问题往往查不到目标声明查不到就会反复换说法重试token 和延迟直线上升最后 Agent 退回 Read/Grep 逐文件翻代码图检索的存在意义被完全抵消。这套评测原则完整记录在 EVAL_SYSTEM_PLAN.md其中几条对任何想评测检索系统的团队都有参考价值缺失的结果就是失败不能从平均分里剔除、比较相同工作量要统计重试和回退的总消耗而不只是第一次响应、确定性检查守 CI随机 Agent 实验支撑发布决策。两层评测架构确定性套件 无头盲评MEX 把评测拆成两层各管一件事见 evaluate/README.md层级位置特点用途确定性套件evaluate/graph/不经过模型、便宜、可复现开发与 CI 主循环无头 Agent 对比evaluate/compare/真实 Agent 会话、可重复发布决策支撑确定性套件的每个任务都带精确的源码级标准答案符号名、声明类型、仓库相对路径甚至起止行号。准备阶段会主动拒绝过期行号、重复任务 ID、歧义声明。任务覆盖自然语言符号查询、改写paraphrase家族、多符号流程、负向查询定义在 evaluate/compare/suites/mex-graph.json 这类套件文件中。设计 Grep 基线给对照组一个公平的起点盲评对比的核心设计是设三个配对臂armsFiles 臂对照Agent 只能用普通的 Read / Grep / Glob 翻仓库——这就是一个会用文件搜索的 Agent 该达到的水平main 臂使用已发布main分支构建的图Candidate 臂当前待验证版本强制先执行一次mex graph scope之后才允许读文件。两个关键公平性细节⚖️臂顺序做平衡排列。24 个会话按任务与轮次打乱执行顺序避免某个臂总在后跑、白吃前一个臂预热的提示词缓存会话完全隔离。每个会话从全新中立临时目录开始不继承任何对话状态Bash 命令经白名单守卫Agent 无法跨臂作弊。值得一提的是MEX 还保留了一条确定性的 Grep Top-3 基线evaluate/lib/grep-baseline.mjs按关键词子串命中数给文件打分取前 3 个文件的全文作为 token 分母——这是早期紧凑度基准的诚实分母用于说明图检索返回的上下文远比读 3 个最像的文件精瘦。盲评打分先判答案再揭身份这是整套方法论里最有盲测精神的一环 所有会话的答案先被匿名化打上A001、A002… 这样的盲评编号打乱顺序后对照源码判分判分依据是结构化的标准答案Agent 必须给出实质性的答案文本≥40 字符、精确的源声明符号名、以及路径行号的证据引用规则定义在 evaluate/compare/lib/answer.mjs身份映射单独存放在blind-reveal.json揭盲之前不允许任何人包括判分流程知道哪个答案来自哪个臂盲评文件带与运行绑定的一致性校验过期的评审结果无法挂到新结果上——防止旧判分、新数据的张冠李戴。盲评的实现细节在 evaluate/compare/lib/report.mjs 中判分与揭盲是两个显式步骤。Token 核算只比较同题配对的消耗两个 CLIClaude / Codex暴露的用量字段各不相同MEX 的做法是原始用量对象原样落盘只把确定语义的字段映射成统一结构未缓存输入、缓存写入、缓存读取、输出等字段缺失就保留null绝不把缺失当 0 来制造省钱假象。对比信号采用同任务、同轮次的配对差值deltaNewTokens newTokens(候选臂) - newTokens(Files 臂)其中 New tokens 未缓存输入 缓存写入 输出。报告同时给出分布、配对均值和确定性 bootstrap 95% 区间——这是评测文档里反复强调的比较配对差值而不是绝对会话总量原则的直接落地。结果token 直降 54%正确率不降反升试点规模12 个自然语言任务6 个 Hono 6 个 MEX 仓库问题每臂各跑一遍共 24 个 Claude Sonnet 会话全部通过执行、权限、主体一致性与 token 核算检查。实测结果完整数据见 evaluate/RESULTS.md指标Files 基线GrepMEX 图检索变化盲评正确答案6/1250.0%7/1258.3%1 题New tokens393,637179,179-54.5%Processed tokens3,348,865920,544-72.5%估算成本$3.6973$1.6061-56.6%单题平均延迟45.62 s35.17 s-22.9%检索质量侧12 个任务中 11 个在首次响应就命中了必需文件必需源码区间返回 22/23图证据覆盖率 12/12而候选臂平均每个会话只用了1.0 次去重后的 scope 查询——没有反复重试的行为。12 个任务的配对中位数 new-token 降幅为 -47.0%。确定性回退不经过模型的硬指标随机 Agent 实验只支撑发布决策真正的 CI 门禁由确定性套件把守。两个独立回退套件的硬指标套件通过File5源码区间召回其他指标TypeScriptsrc/compiler6/61.01.0源码优先套件TS/Python/Rust 混合合成仓库9/91.01.0R5 0.9167MRR 0.875nDCG10 0.9095完整性门禁同样全部通过两次重建产生相同的归一化图哈希无抽取/存储丢失、重复身份、悬挂边或 FTS 漂移。效率门禁evaluate/thresholds.json则要求图检索返回量 ≤ Grep Top-3 全文且期望召回 ≥ 0.85——质量门禁永远先于效率门禁执行防止输出变短但没答对被误读为胜利。解读边界与复现方式MEX 团队对 54% 这个数字的表述相当克制见 RESULTS.md 的Limits on interpretation每任务仅 1 轮重复、单一模型单题效率仍有噪声试点未包含已发布main图实现这一臂发布决策需三臂齐全TypeScript 用的是真实仓库src/compiler子树的稀疏检出而非完整 monorepo结论是该试点下 token 下降且正确率不降反升不是通用的省钱百分比。复现确定性部分很简单npm ci npm run build npm run eval:test无头对比则需本地已认证的模型 CLI并消耗模型配额命令与套件说明都在 evaluate/README.md 中。小结MEX 的检索基准评测方法论可以浓缩为四句话用盲评消除判分偏见用配对差值消除缓存偏差用精确源码级标准答案消除模糊判分用确定性门禁兜住 CI。54% 的 token 降幅只是这套方法论跑出来的一个试点结果——真正可复用的是先让评测可信再谈指标提升这个顺序。赞分享【免费下载链接】mexTeam memory for engineers and their AI agents. Lives in your repo. Shared through Git.项目地址https://gitcode.com/gh_mirrors/mex2/mex点击查看免费下载相关推荐OpenUI Lang 基准测试全解四格式 Token 效率对比、评测方法论与源码复现指南OpenUI Lang 基准测试全解四格式 Token 效率对比、评测方法论与源码复现指南 OpenUI Lang 是 OpenUI 项目中由大模型直接生成的T3MP3ST 黑盒Black-BoxXBEN 校准基准16/16 全类别盲打的评测方法论与实测结果T3MP3ST 黑盒Black BoxXBEN 校准基准16/16 全类别盲打的评测方法论与实测结果 本篇基于仓库中的 bench/xbow/result网络安全渗透测试AI Agent多智能体人工智能应用安全代码智能体红蓝对抗AI 评测本地部署4.35 perplexity背后的真相StarChat-β模型全维度测评方法论4.35 perplexity背后的真相StarChat β模型全维度测评方法论 引言代码生成模型的评估困境 你是否还在为选择合适的代码生成模型而困惑当面创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进