
微软把本地编码模型的内存门槛定在 120GB官方说「四分之一成本」媒体读成了「零推理费」2026 年 10 月 7 日微软发布MAI-Code-1.1-Flash—— 一个「为本地执行而设计」的编码模型同时提出「混合智能」Hybrid Intelligence把 PC 上跑的 AI 和云上跑的 AI 组合起来。但这一轮传播里出现了一个值得拆开的口径差微软官方博客的标题是“Better, faster, at a quarter of the cost”四分之一成本而不少报道把它写成了 “zero inference fees”零推理费。「零成本」和「四分之一成本」是两件事。这篇文章把发布里的四件事分开讲模型本身改了什么、120GB 这个门槛怎么来的、「成本」到底指什么、以及同日发布的硬件说明了什么。一、这次发布的到底是什么先把这个模型的定位说清楚因为它不是一个聊天模型。MAI-Code-1.1-Flash是微软 MAI 系列的编码模型前代是2026 年 6 月发布的 MAI-Code-1-Flash。1.1 这一版官方给出的三个改进方向代码生成质量高于前代token 效率提升 25%通过3-bit 量化降低内存占用从而支持本地执行最后一条是这一版的题眼它不是「也能本地跑」而是「以本地跑为前提设计的」。二、120GB 这个数字是怎么来的官方给的说法是要在本地运行 MAI-Code-1.1-Flash建议使用内存 120GB 以上的 PC。这里有两个需要分清的词表述含义建议recommended官方原话是「it is recommended to use」——这是推荐配置不是硬性下限120GB一个目前消费级笔记本刚刚够到的量级为什么这很重要如果它是「最低要求」那这个模型基本把绝大多数现有设备排除在外如果是「建议配置」那它是一句体验导向的话 —— 低于这个数能跑但体验会打折。这两种读法对读者的决策影响完全不同。而官方用的是前者。三、「零推理费」和「四分之一成本」差在哪这是这一轮传播里最值得单独说的一处。微软 AI 官方博客的标题“MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost”部分报道的标题“Zero Inference Fees”「零」和「四分之一」不是同一个数量级也不是同一件事。更关键的是**「成本」指的是什么成本**。对一个本地模型来说成本项由谁承担每次调用的 API 账单消失模型在你自己的机器上硬件购置转移到你要跑得动得有对应的机器电费转移到你运维、驱动、量化的兼容性排查转移到你所以准确的表述不是「零成本」而是「成本从一个科目挪到了另一个科目」。这也是为什么第二节的 120GB 和这一节是同一件事「省下的推理费」和「买得起 120GB 机器的钱」是同一笔账的两端。四、真技术的那部分值得单独讲把商业话术剥掉之后这一版有两个可以独立成立的工程改进① 3-bit 量化量化是把模型权重从高精度压到低精度用精度换内存和带宽。3-bit 是一个相当激进的位宽—— 常见的是 4-bit比如各种 Q4 量化。位宽越低同样的内存能装下的参数越多但精度损失的风险也越大。微软这一版敢把它作为「支持本地执行」的手段说明他们认为在编码这个任务上3-bit 的精度损失是可接受的。② token 效率提升 25%这个数字的读法要小心。「token 效率」通常指完成同一个任务所需的 token 数而不是吞吐。如果是这个口径那它意味着同样的任务输出更短—— 对按 token 计费的云 API 是直接省钱对本地推理是直接省时间生成更少的 token 就更快结束。这两个改进和「成本」是两回事前者是内存后者是速度/长度。它们合起来才让「本地跑得动、跑得不难受」成立。五、同日发布的硬件128GB 刚好越线这一条我认为是整轮发布里信息量最大、但最少被提的。与 MAI-Code-1.1-Flash 同一天微软还发布了Surface Laptop Ultra—— 笔记本最大内存 128GBSurface RTX Spark Dev Box—— 迷你 PC同样最大 128GB把这三个数字并排放模型建议内存 120GB 笔记本最大内存 128GB ↑ 刚好多出 8GB这不是巧合。一款「建议 120GB 内存」的模型配上一条「最大 128GB」的产品线意思是这个模型的推荐配置正好是这一代 Surface 的顶配。换句话说这次发布的不是「一个模型」是「一个模型 一条刚好装得下它的产品线」。六、「混合智能」的三件套和它的边界微软对 hybrid intelligence 的官方描述是三个部件强大的本地 AI高性能运行时runtime路由功能—— 在本地 AI 和云 AI 之间选最优的那个本地 AI 的官方理由是它不如云上的强但有一个显著优势 ——能在设备上完成处理不必把机密信息发出去。这是隐私不是性能。边界在哪儿Copilot 可以访问 PC 上的数据来替用户做事但只在用户授权之后。Nadella 的原话是“We’re supercharging Copilot on Windows with Hybrid Intelligence. With your permission,Copilot can tap into the context on your PC, take action for you, and use local models whenit makes sense, giving you more capability while helping your tokens go further.”注意最后半句“helping your tokens go further” ——让 token 走得更远。这句话把路由功能的商业逻辑说得很直白本地模型是用来省 token 的也就是降低云侧消耗。这和第三节的成本账是同一件事的另一种说法。七、什么时候该本地跑什么时候不该基于以上可以给一个不依赖厂商口径的判断框架适合本地跑代码里有不能外发的内容私有算法、客户数据、未公开的密钥结构调用量足够大大到能把硬件钱摊回来你已经有一台 120GB 级别的机器边际成本为零不适合本地跑调用量小 ——硬件钱永远摊不回来任务需要最强的模型—— 本地模型官方自己说了不如云你的机器远低于 120GB—— 跑得动和跑得好是两件事先看清官方用的是「建议」一句话本地推理不是「免费」是预付。它把按次的账单换成了一次性的硬件投入只有当你确定用量足够大、或者隐私确实是硬约束时这笔预付才划算。小结微软发布MAI-Code-1.1-Flash前代是 2026 年 6 月的 1-Flash改进是代码质量、token 效率 25%、3-bit 量化本地运行的官方表述是**「建议 120GB 以上内存」** —— 是建议不是最低要求官方标题说「四分之一成本」不是「零推理费」—— 这两个说法不能互换同日发布的Surface Laptop Ultra / RTX Spark Dev Box 最大内存 128GB刚好越过 120GB 这条线「混合智能」 本地 AI 运行时 路由官方给本地 AI 的理由是隐私而 Nadella 那句 “helping your tokens go further” 点明了省 token 的商业动机本地推理 预付制把按次的 API 账单换成一次性硬件投入用量不够大就不划算参考资料内容来源页面日期核验时间模型名称、前代、token 效率 25%、3-bit 量化、建议 120GB、同日 Surface 发布、混合智能三件套、Nadella 原话Microsoft has released its local AI ‘MAI-Code-1.1-Flash’ and is also proposing ‘hybrid intelligence’2026-10-082026-10-09官方博客标题「at a quarter of the cost」口径核验的关键一条MAI-Code-1.1-Flash: Better, faster, at a quarter of the cost — Microsoft AI2026-10-07标题经 Gigazine 转引核验正文未直连见下混合智能的官方说明Building Windows for hybrid intelligence — Windows Experience Blog2026-10-07同上「Zero Inference Fees」这个说法Microsoft’s Local Coding AI Has Zero Inference Fees but Recommends 120GB-Plus RAM — eWeek2026-10-082026-10-09⚠️ 核验边界必须写明本次核验时microsoft.ai与blogs.windows.com两个官方页面无法直连DNS 解析失败官方标题与引语均经 Gigazine 转引。因此「四分之一成本」这个标题、以及 Nadella 的引语属于转引不是直引文中没有使用任何需要打开官方博客才能确认的数字「Zero Inference Fees」这个提法只出现在 eWeek 的标题里正文未能读取建议读者在引用前自行打开上面两条官方链接确认。