ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

扩散语言模型Mercury 2.5跑出每秒1107个token:速度这条路线值得关注

扩散语言模型Mercury 2.5跑出每秒1107个token:速度这条路线值得关注 据报道Inception Labs 在 9 月 8 日发布了 Mercury 2.5官方给出的吞吐是每秒 1107 个 token跑在市面上常见的 NVIDIA GPU 上上下文长度 260KAPI 报价约每百万输入 token 0.20 美元、每百万输出 token 0.75 美元。它走的不是主流那条路——不是自回归Autoregressive而是扩散语言模型dLLMdiffusion LLM。简单说就是大模型生成文本这件事多了一个不那么逐字念的方案。一、技术上到底变在哪先把两条路线讲清楚自回归路线从左到右一个 token 一个 token 往后生成每一步都依赖前一步的结果本质是串行。速度受限于解码步数、显存带宽优化到极致的一批模型大概也就每秒 200 token 上下。扩散语言模型dLLM从一整段带噪声 / 被掩码的序列出发通过迭代去噪把整句话逐步细化出来。它一次可以细化多个位置天然可以并行所以吞吐能拉得很高。公开资料里Inception 上一代 Mercury 2 已经做到约每秒 1009 token。据 Inception 官方博客Mercury 2.5 相比 Mercury 2 在智能程度上有约 40% 的提升对标的是成本优化型的前沿模型这一类官方点名的参照包括 GPT-5.6 Luna 低配档、Gemini 3.5 Flash-Lite、Claude Haiku 4.5。同时发布的还有 Mercury Voice官方称首 token 延迟低于 170 毫秒面向语音 Agent和 Mercury Router用一个 dLLM 来理解请求、再路由到最合适的模型。这里有个容易被标题盖过的点速度不等于质量。据钛媒体等报道有第三方评测显示 Mercury 2.5 在知识类基准上的准确率偏低、排名靠后。这其实符合扩散路线当前的特征——它的强项在延迟和吞吐弱项在需要精确事实、需要复杂多步推理的场景。首发选每秒多少个 token这个数字而不是某个榜单多少分本身就说明厂商很清楚自己的差异化在哪。二、什么变了什么没变变了的是延迟和吞吐这条线第一次有了独立的架构路线。过去想快基本只能靠堆算力、堆优化现在多了一种换生成方式的选择语音 Agent、实时补全、请求路由这类对首 token 延迟极敏感的场景多了一个可选项。没变的是评测体系仍然以准确率、推理能力为主价格仍然是竞争的主战场企业选型最终看的是单位任务成本而不是 token 单价。扩散模型不会因为快就把自回归模型替掉——至少在知识准确率的问题解决之前不会。三、对普通开发者的实际影响值得关注但没必要立刻搬家。可以先按场景对号入座适合它的场景代码填充 / 补全官方最初就是拿 Mercury Coder 切入编码场景的高并发、低延迟的后台批处理比如分类、抽取、打标作为路由层判断请求该走哪个模型语音类 Agent对首 token 延迟有硬要求不适合它的场景需要高事实准确率的知识问答、数字计算、严谨摘要复杂多步推理、需要长链条思考的任务对输出稳定性要求极高的对外业务成本账要这么算单价低 ≠ 总成本低。真实成本是总成本 ≈ token 用量 × 单价 纠错/重试成本 接入与维护成本如果一个模型答案不够准你需要加一层校验、加一次重试、加一个人工兜底那便宜一半很容易被吃掉。这一点在选型时经常被忽略。四、想试的话怎么上手据官方说明Mercury 模型可以通过 Inception API、Baseten、OpenRouter 三个渠道调用并提供了 1 亿免费 token 用来试。OpenRouter 走的是 OpenAI 兼容接口接入成本很低fromopenaiimportOpenAI clientOpenAI(base_urlhttps://openrouter.ai/api/v1,api_keyYOUR_KEY,)respclient.chat.completions.create(# 具体型号以 OpenRouter 模型页为准Mercury 2.5 上线后替换对应 idmodelinception/mercury-2,messages[{role:user,content:用一个例子解释扩散语言模型和自回归的区别}],)print(resp.choices[0].message.content) 几个坑提醒一下1.**先确认型号和版本号**。新模型上线节奏很快id和价格都以平台模型页为准别照着博客里的旧id直接上生产。2.2.**把它放在延迟敏感的位置别拿它替换主推理模型**。让快的干快的让准的干准的。3.3.**一定要做输出校验**尤其是数字、事实、法律条款这类错一个字就出事的内容。4.4.**先小流量灰度**用自己业务的真实请求跑一批对照别只看官方 demo。 速度这条线确实值得盯但 token/s 从来不是唯一指标。你的业务更怕等得久还是更怕答得错——想清楚这个选型答案基本就出来了。你怎么看评论区聊聊。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进