ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

两天五款模型、API 降价 50%:大模型价格战打到“每任务成本“时代,企业怎么重新算账?

两天五款模型、API 降价 50%:大模型价格战打到“每任务成本“时代,企业怎么重新算账? 两天五款模型、API 降价 50%大模型价格战打到每任务成本时代企业怎么重新算账核心结论9 月 22-23 日两天OpenAI 发 GPT-6 Sol 和 Luna、Anthropic 发 Claude Opus 5.5、xAI 发 Grok 4.7、小米开源 MiMo-V2.6——五款模型四家公司。OpenAI 直接宣布 API 价格永久降 50%Sol 输入 $2/百万 token、Luna 输入 $0.10Anthropic Opus 5.5 典型工作负载成本降 40%。这不是又一次促销是大模型竞争范式的转移从谁跑分高到谁完成一个任务更便宜。对企业架构师的直接含义是你 9 月份做的 Token 成本预算到 10 月份就该重算了。这篇文章从工程视角拆解新价格梯度、单位任务成本怎么算以及为什么模型路由比选一个旗舰重要得多。一、9/22-23 两天发生了什么先把时间线捋清楚9/22OpenAI 发布 GPT-6 Sol 和 GPT-6 LunaAPI 价格较 GPT-5.6 促销价永久下降 50%。同一天xAI 发布 Grok 4.7小米开源 MiMo-V2.6 系列。9/23Anthropic 发布 Claude Opus 5.5性能追平 Fable 5.1成本只有上代 Opus 5 的六成。9/24谷歌、OpenAI、Anthropic 被曝正在组建前沿 AI 标准局SAFA年底或 2027 年初落地。9/25 今早OpenAI 被曝将在数日内预览网络安全专用模型 GPT-6 Cyber。把这四件事放在一起看头部厂商一边发新模型一边降价同时开始谈行业自律标准。这说明两件事——能力红利期见顶价格战开始安全治理从口头呼吁变成机构化。二、价格梯度一张表看清新一代模型定价这是目前公开 API 的价格梯度输入/输出美元/百万 token2026-09-23 官方定价模型输入价格输出价格上下文窗口定位GPT-6 Luna$0.10$0.50105 万轻量高频摘要、提取、简单问答MiMo-V2.6-Flash$0.14$0.28—开源可自部署输出更便宜GPT-6 Sol$2.00$10.00105 万中阶编程、代码审查、数据分析Grok 4.7200K$2.00$6.0020 万标准对话输出比 Sol 便宜 40%Claude Opus 5.5$4.00$20.00100 万高价值长周期编码、知识工作GPT-6 Astra旗舰级未在本次降价范围—105 万最复杂多步骤、多模态、科学数学数据来源OpenAI 官方博客9/22、Anthropic 官方公告9/23、36氪/腾讯科技整理9/23。几个值得注意的点GPT-6 Sol 的 $2/$10 已经直接打到 Claude Sonnet 5 的价位——OpenAI 在用中阶模型的价格抢 Anthropic 的腰部客户GPT-6 Luna 的 $0.10 输入甚至低于小米 MiMo-V2.6-Flash 的 $0.14但输出 $0.50 比 MiMo 的 $0.28 贵——输入便宜、输出贵适合长 prompt 短回答的场景Grok 4.7 在 prompt 超过 20 万 token 后价格翻倍到 $4/$12——长上下文场景要小心这个隐藏触发点。三、范式转移从token 单价到单位任务成本这次发布最值得架构师关注的不是单价降了多少而是 OpenAI 开始用每任务成本cost per task作为宣传单位。AutomationBench 是一个覆盖 47 种工具、销售/营销/运营/客服/财务/HR 场景的智能体工作流测试。OpenAI 公布的数据模型/模式任务完成率单任务成本相对 Sol 的倍数GPT-6 Sol xhigh33.2%$0.271xGPT-6 Astra low30.3%约 $1.053.9xClaude Fable 5.131.4%约 $2.408.9xClaude Opus 5 max26.9%约 $3.0011.1x数据来源OpenAI 官方 AutomationBench 数据9/2236氪整理。注意这是 OpenAI 自己公布的数据不是第三方独立测试Fable 5.1 的成本未计入约 40% 任务的 fallback 成本。看懂这张表的关键跑分只差 2-3 个百分点成本差 4-11 倍。过去企业选型看 benchmark——谁分高用谁。现在要看的是完成你业务里一个真实任务到底花多少钱。这意味着你的成本模型必须从输入 token 数 × 单价升级成单位任务成本 输入 token × 输入价 输出 token × 输出价 缓存命中 token × 缓存价× 工具调用次数 × 推理轮数 ×1 重试率这和我 9/16 写《Agent 账单刺客》时算的那笔账是同一套逻辑只不过当时算的是 Token 暴涨 30 倍的恐慌现在厂商主动把单价打下来了——但单位任务成本这个计算框架没变甚至更重要了。四、缓存折扣是隐藏的成本杠杆这次降价里最容易被忽略的是提示词缓存prompt caching的折扣力度。OpenAI GPT-6同步改进提示词缓存开发者可以通过仪表盘看缓存命中率调整推理强度和工具可用性时不破坏已有缓存还能用显式 breakpoint 控制哪些前缀进缓存。GitHub Copilot 数十亿次请求中需要重新处理的 prompt token 比例下降超过 50%。Anthropic Sonnet 5提供最高 90% 的 prompt caching 成本节省。小米 MiMo-V2.6-Flash缓存命中输入价格低至 $0.0028/百万 token——是正常输入价的 2%。这意味着什么如果你的 Agent 每次对话都带一段相同的系统提示、相同的工具描述、相同的知识库片段动辄几千 token缓存命中率从 0 提到 80%实际成本可能再降一个数量级。但缓存不是自动的。工程上要做三件事把稳定不变的前缀系统提示、工具 schema、知识库片段放在 prompt 最前面把每次变化的用户输入放在最后面用官方提供的诊断工具监控缓存命中率低于 50% 就要排查 prompt 结构。五、模型路由不是所有任务都要旗舰GPT-6 家族三档定位已经非常清晰Astra最复杂的多步骤、多模态、科学数学任务Sol高频复杂工作——构建功能、代码审查、调试、数据分析Luna大规模轻量任务——摘要、提取、简单问答。这对企业架构的直接启示是不要再让所有任务都过同一个旗舰模型。一个真实场景你的客服 Agent 每天处理 1 万次请求。其中 80% 是查订单状态“退款政策是什么这种简单问答用 Luna 就够了15% 是帮我改个 SQL”“分析一下这个报表”用 Sol只有 5% 是这个客户流失原因是什么帮我出个挽回方案需要 Astra。按这个路由模型算一笔账80% 走 Luna$0.10/$0.50、15% 走 Sol$2/$10、5% 走 Astra。和全部走 Astra相比月度成本可能差一个数量级。OpenAI 自己也在推这个方向——Sol 和 Luna 的价格是长期价格不是短期促销就是为了让企业把路由策略写进生产系统。六、QAQ1OpenAI 这次降价是真永久还是先降后涨OpenAI 官方口径是长期价格不是短期促销。但参考 7 月 GPT-5.6 Luna 降 80%、8 月 Sol 促销再降 20% 的节奏OpenAI 在用降价抢调用规模。OpenRouter 数据Luna 日均 token 调用量涨到降价前 13.8 倍Terra 5.6 倍促销期用户 32% 在促销结束后留存。企业可以把路由策略写进生产系统但要留好切换到备选模型的抽象层。Q2我们现在要不要从 GPT-5.6 迁到 GPT-6 Sol/Luna分情况。如果你的业务是高频中低复杂度任务摘要、提取、客服Luna 的 $0.10/$0.50 价格值得迁移如果是复杂编程和 Agent 工作流Sol 比 GPT-5.6 Sol 便宜一半且能力接近 Astra值得 A/B 测试。但不要盲目迁移——Luna 被用户质疑开倒车部分场景不如上一代 GPT-5.6 Luna。先拿你的真实业务数据跑 benchmark再决定。Q3DeepSeek 还有价格优势吗36氪的对比GPT-6 Luna 折算人民币约等于 DeepSeek V4.1 Flash 的闲时价格输入 1 元/百万、输出 4 元/百万。但 DeepSeek 早就在缓存命中价格上做了很大折扣用户自发对比后发现还是 DeepSeek 划算。国产模型在缓存定价上仍然有优势企业做路由时不要只看标价要看缓存命中率下的实际成本。Q4价格战对模型质量有影响吗这次发布有一个被价格新闻盖住的积极信号对齐表现。OpenAI 内部测试显示Sol 在 coding deception 测试中的欺骗率从 GPT-5.6 Sol 的 10.4% 降到 1.3%Luna 从 9.5% 降到 2.8%工具失效主动告知率Sol 从 22.2% 升到 94.6%。但模型在访问被拒绝警告下仍有 64.4% 的尝试绕过——边界问题没有完全解决。价格降了安全指标反而在改善这对企业是好消息。七、给技术决策者的 3 条判断立刻重算你的 Token 成本模型。9 月份做的预算到 10 月份就过时了。把新价格梯度、缓存折扣、模型路由都算进去你会发现月度账单可能比预期低 30-50%——但前提是你做了路由分层而不是全部走旗舰。把每任务成本写进选型规范。以后选模型不要只看 benchmark 分数要看你的真实业务场景下完成一个典型任务花多少钱。AutomationBench 那套完成率 × 单任务成本的二维评估值得在企业内部复刻一遍。留好模型抽象层。价格战没有终点——OpenAI 7 月降 80%、8 月降 20%、9 月永久降 50%Anthropic 跟降小米开源。你的系统不要硬编码任何一家模型的 API要能在一周内把流量从 OpenAI 切到 Anthropic 或国产模型。这种可切换性本身就是价格战给企业的最大红利。关于作者AI 架构的深耕者智能价值的转化者。11 年全栈 AI 架构与技术掌舵经验立足架构设计与战略决策双视角精通大模型全链路工程化部署独握端侧 AI 软硬一体化核心技术。主导 15 企业级 AI 项目从蓝图到落地累计创造超 2000 万合同价值服务千万级用户与 500 企业。关注我一起把前沿 AI 变成可落地的商业价值。数据来源OpenAI 官方博客Introducing GPT-6 Sol and Luna2026-09-22Anthropic 官方 Claude Opus 5.5 公告2026-09-2336氪《OpenAI、Anthropic 同日模型大战“是兄弟就砍一刀”》2026-09-23光锥智能36氪/腾讯科技《GPT-6 家族上新OpenAI 打价格战但又不全靠价格战》2026-09-23OpenRouter 7-8 月流量数据财联社关于 GPT-6 Cyber 与 SAFA 的报道2026-09-25。价格数据以各厂商官方定价页为准本文工程解读为作者个人判断。本文基于 2026-09-25 可查证的公开信息撰写不构成投资建议。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进