ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

ollama v0.40.0发布:Apple Silicon 默认启用 MLX,决策模型、嵌入能力与 OpenAI 工具消息全面演进

ollama v0.40.0发布:Apple Silicon 默认启用 MLX,决策模型、嵌入能力与 OpenAI 工具消息全面演进 2026 年 10 月 7 日Ollama 发布 v0.40.0 版本。本次更新的核心方向非常明确进一步强化 Apple Silicon 设备上的 MLX 运行时体验同时完善决策模型支持、嵌入能力、多模态嵌入、OpenAI 兼容接口中的工具消息处理以及模型拉取、路由和底层运行时兼容性等多个方面。从更新内容来看v0.40.0 不只是一次常规模型列表扩展而是围绕本地模型运行效率、Apple Silicon 适配、复杂工具调用消息处理、图像结果保留以及嵌入接口能力进行的一次集中升级。一、Apple Silicon 默认使用 MLX本次版本最核心的变化v0.40.0 最重要的更新是在 Apple Silicon 设备上支持 MLX 运行时的模型架构将自动通过 MLX 运行。也就是说在 Apple Silicon 设备环境中只要某个模型架构已经得到 MLX 运行时支持Ollama 会默认选择 MLX 来运行该模型。这一变化直接体现在版本说明中的核心描述在 Apple Silicon 设备上受到 MLX 运行时支持的模型架构将自动在 MLX 上运行。对于 Apple Silicon 用户而言这意味着模型运行时的选择不再只是用户需要额外关注的配置问题。Ollama 在模型架构和运行时能力支持的基础上自动将符合条件的模型交给 MLX 执行。此次更新围绕 MLX 进行了多项相关工作包括MLX 的 System one 支持MLX 决策模型改进对发布方分词器语义进行匹配缓解 GPU 空闲后出现的高延迟问题降低模型查找和 MLX 决策请求的开销MLX 版本升级修复与近期 MLX 更新相关的补丁问题MLX 对嵌入能力的支持从这些内容可以看出MLX 在 v0.40.0 中并非只获得默认启用这一项变化而是涉及系统支持、决策模型、分词器语义、请求性能、GPU 空闲后的延迟表现、版本兼容性和嵌入能力等多个层面。其中“缓解 GPU 空闲后高延迟”尤其值得注意。模型在 GPU 一段时间未工作后再次被请求时延迟表现会直接影响交互体验。该项提交明确针对这一情况进行了缓解。与此同时“降低模型查找和 MLX 决策请求开销”则指向了请求处理流程中的效率优化。除了模型本身的执行速度外模型定位、运行时选择和决策请求的处理成本同样会影响整体响应体验。二、模型运行命令qwen3.8 的拉取与运行方式v0.40.0 的版本说明中给出了 qwen3.8 的使用示例。拉取模型ollama pull qwen3.8运行模型ollama run qwen3.8这两条命令分别对应模型的下载与启动运行流程。首先通过ollama pull qwen3.8获取模型随后使用ollama run qwen3.8启动模型并进入交互运行。在本次 Apple Silicon 默认 MLX 的更新背景下如果 qwen3.8 的模型架构受到 MLX 运行时支持那么在 Apple Silicon 设备上它将自动通过 MLX 运行。版本说明没有要求用户增加额外的 MLX 启动参数也没有展示手动切换运行时的命令而是强调符合条件的模型架构会自动在 MLX 上执行。三、模型范围扩展新增多个可用模型除 qwen3.8 外本次版本说明还列出了更多模型gemma4qwen3.6qwen3.5这意味着 v0.40.0 的模型可用范围中除了 qwen3.8 之外还包括 gemma4、qwen3.6 和 qwen3.5。版本说明使用的是“Additional models include”的表达即额外可用模型包括以上内容。因此qwen3.8 与这些新增模型共同构成了本次说明中被明确提及的模型范围。从版本内容来看模型支持与 MLX 默认运行并不是彼此独立的两部分。Apple Silicon 上的 MLX 自动运行机制为受支持模型架构提供了新的默认执行路径而模型列表扩展则为用户带来更多可拉取、可运行的模型选择。四、决策模型正式进入 MLX 支持范围v0.40.0 进一步明确决策模型现在也已可在 MLX 上使用。版本说明中列出的决策模型包括Nimbletev1clefclef-flash这项更新的重要之处在于MLX 的能力范围不再仅限于普通模型架构支持也覆盖到了决策模型。同时提交记录中还出现了以下与此相关的内容文档链接到可用的决策模型文档记录决策模型的图像输入能力MLX 决策模型改进降低 MLX 决策请求开销这些变化共同构成了决策模型在 v0.40.0 中的完整更新脉络。一方面决策模型被明确纳入 MLX 支持范围另一方面文档开始指向可用的决策模型并记录决策模型支持图像输入这一能力。同时底层还对 MLX 决策模型进行改进并减少相关请求的处理开销。因此本次决策模型更新不仅仅是“可以在 MLX 上运行”还包括可用模型文档入口、图像输入文档说明、运行改进和请求开销优化等多个组成部分。五、MLX 支持嵌入能力v0.40.0 的另一个重要变化是MLX 现在支持嵌入。版本说明中明确写到MLX 已经具备嵌入支持。此外提交记录中还包括“模型添加多模态嵌入”的内容。这意味着本次嵌入相关更新包含两个层面MLX 支持嵌入模型支持多模态嵌入前者是 MLX 运行时层面的能力扩展后者则是模型能力层面的更新。嵌入能力是本次版本更新中单独被强调的内容。随着 MLX 支持嵌入Apple Silicon 设备上的模型运行时能力覆盖范围进一步扩大而多模态嵌入的加入则表明嵌入相关能力不局限于单一输入类型。在接口路由层面本次还修复了 embed 接口中 413 与 400 的路由问题。这一修复直接关联嵌入请求处理说明 v0.40.0 不仅增加了 MLX 嵌入和多模态嵌入能力也同步处理了 embed 路由中的状态码问题。六、OpenAI 兼容接口工具消息内容处理全面调整v0.40.0 中OpenAI 相关的改动数量较多重点集中在工具消息、工具结果、空结果和图像结果的内容组织方式上。本次涉及的 OpenAI 相关提交包括保持工具消息内容部分位于同一条消息中将空工具结果保留为一个空内容数组合并工具结果部分时保留图像位置对包含图像的工具结果进行拆分而不是加入图像标记合并包含图像的工具结果处理这些更新共同反映出v0.40.0 对工具调用结果的结构化内容处理进行了细化。首先“保持工具消息内容部分位于同一条消息中”说明工具消息中的内容部分不再被拆散到不同消息中而是维持在单条消息结构内。其次对于空的工具结果更新要求以空内容数组的形式保留。这意味着即使工具执行结果为空也不再以其他形式替代而是明确保留为空数组结构。再次工具结果中涉及图像时图像位置需要在合并内容部分时得到保留。图像不仅是附加信息也具有在消息内容中的相对位置。此次改动明确处理了图像位置在合并过程中的保留问题。此外当工具结果中包含图像时系统不再通过添加图像标记来处理而是对这些结果进行拆分。版本说明中的描述是拆分带有图像的工具结果而不是增加图像标记。这些变化可以归纳为一个清晰方向工具消息与工具结果的内容结构更加严格空结果、图像结果、图像位置以及内容部分的归属关系都得到更精细的处理。对于使用 OpenAI 兼容接口、工具调用以及带图像工具结果的场景而言这些改动是 v0.40.0 中不可忽略的一部分。七、分词器语义匹配MLX 进一步贴近发布方行为本次提交记录中还包括“MLX匹配发布方分词器语义”。这一项更新的重点在于分词器语义匹配。模型在运行过程中分词器负责将输入内容转化为模型可处理的形式。v0.40.0 对 MLX 进行了分词器语义层面的匹配工作使其行为与发布方分词器语义保持一致。该更新与 Apple Silicon 默认使用 MLX 的整体方向相互关联。随着更多模型架构在 Apple Silicon 上自动选择 MLX 运行分词器语义的一致性也成为运行时适配工作中的重要环节。八、模型拉取规则更新允许候选版本匹配最低版本要求在模型拉取相关部分v0.40.0 包含一项更新允许候选版本拉取匹配最低版本要求提交说明中使用的是 RCs即候选版本。该项变化针对的是模型拉取时的最低版本匹配规则。也就是说在拉取流程中候选版本可以匹配相应的最低版本要求。这一改动属于 pull 流程的规则调整与模型下载行为直接相关。九、底层兼容与版本更新llama-server、llama.cpp、MLX除了用户可直接感知到的 MLX 默认运行、模型支持和工具消息处理外v0.40.0 还包含多项底层维护和兼容性工作。相关提交包括llama-server准备移除兼容性补丁llama.cpp版本更新MLX版本升级MLX修复与近期 MLX 更新相关的补丁问题多次合并上游主分支到发布分支合并 OpenAI 工具数组内容相关变更测试拆分 create 集成测试其中llama-server 的变化是为移除兼容性补丁做准备。该内容显示兼容性补丁相关工作仍在持续调整。llama.cpp 则进行了版本更新MLX 也进行了版本升级。与此同时针对近期 MLX 更新带来的变化v0.40.0 修复了相关补丁问题。测试方面本次将 create 集成测试进行了拆分。这属于测试组织结构上的调整。此外发布分支在多个日期进行了与上游主分支的合并说明本次发布过程中持续同步了主线更新内容。十、完整提交时间线梳理为了完整还原 v0.40.0 的更新构成以下按照时间顺序整理本次版本中列出的提交内容。2026 年 9 月 25 日llama-server准备移除兼容性补丁2026 年 9 月 29 日将上游主分支合并到发布分支再次将上游主分支合并到发布分支2026 年 9 月 30 日将上游主分支合并到发布分支2026 年 10 月 1 日OpenAI保持工具消息内容部分位于同一条消息中2026 年 10 月 2 日OpenAI将空工具结果保留为一个空内容数组将上游主分支合并到发布分支OpenAI合并工具结果部分时保留图像位置2026 年 10 月 3 日文档链接到可用的决策模型文档记录决策模型的图像输入OpenAI拆分带图像的工具结果不再增加图像标记2026 年 10 月 4 日MLXSystem one 支持MLX决策模型改进MLX匹配发布方分词器语义将上游主分支合并到发布分支2026 年 10 月 5 日pull允许候选版本拉取匹配最低版本要求2026 年 10 月 6 日合并 OpenAI 工具数组内容相关变更测试拆分 create 集成测试MLX缓解 GPU 空闲后的高延迟降低模型查找与 MLX 决策请求开销将上游主分支合并到发布分支llama.cpp版本更新MLX版本升级MLX修复近期 MLX 更新相关的补丁问题模型添加多模态嵌入2026 年 10 月 7 日routes修复 embed 接口中 413 与 400 的路由问题十一、v0.40.0 更新重点总结Ollama v0.40.0 的更新重点可以从以下几个方向进行归纳。第一Apple Silicon 上的 MLX 成为默认执行路径。在 Apple Silicon 设备上受到 MLX 运行时支持的模型架构会自动通过 MLX 运行。这是本版本最核心的变化。第二模型与决策模型范围进一步扩展。本次明确提到 qwen3.8并列出 gemma4、qwen3.6、qwen3.5 等额外模型。与此同时Nimble、tev1、clef、clef-flash 等决策模型现在也可在 MLX 上使用。第三MLX 能力覆盖面扩大。MLX 获得嵌入支持并完成 System one 支持、决策模型改进、分词器语义匹配、GPU 空闲后延迟缓解、请求开销降低、版本升级和补丁修复等更新。第四嵌入能力得到同步增强。除了 MLX 支持嵌入外模型侧还加入多模态嵌入并修复 embed 接口中 413 与 400 的路由问题。第五OpenAI 工具消息与图像结果处理更加精细。工具消息内容保持在同一条消息中空工具结果使用空内容数组保留图像位置在内容合并时得到保留带图像的工具结果采用拆分方式处理而不是插入图像标记。第六模型拉取、测试、底层组件持续维护。候选版本可以匹配最低版本要求create 集成测试被拆分llama-server 兼容性补丁进入准备移除阶段llama.cpp 与 MLX 均完成版本更新。结语代码地址github.com/ollama/ollamaOllama v0.40.0 是一次以 MLX 为中心的版本更新。在 Apple Silicon 上支持 MLX 的模型架构将自动运行在 MLX 之上决策模型正式进入 MLX 支持范围MLX 新增嵌入支持模型侧加入多模态嵌入OpenAI 工具消息、空工具结果和图像结果处理得到进一步完善同时GPU 空闲后的延迟、模型查找开销、决策请求开销、embed 路由状态码、分词器语义和底层版本兼容问题也都得到处理。对于使用 Apple Silicon 设备运行 Ollama 的用户而言v0.40.0 的重点在于 MLX 自动运行机制及其配套优化。对于使用决策模型、嵌入能力、图像工具结果和 OpenAI 兼容接口的用户而言本次版本同样带来了覆盖模型、接口、路由和消息内容结构的多项变化。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进