ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

NeoHorse-1适合你吗?从个人助理到工具调用的智能体模型场景选型指南

NeoHorse-1适合你吗?从个人助理到工具调用的智能体模型场景选型指南 【免费下载链接】NeoHorseNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.项目地址https://gitcode.com/gh_mirrors/ne/NeoHorse点击查看免费下载NeoHorse-1是由 TokenRhythm 开源的智能体原生Agent-Native因果语言模型家族提供 4B 和 9B 两种规格专为个人助理、工具调用Tool Calling、编码与指令遵循场景设计。本文用 5 分钟帮你搞清楚NeoHorse-1 适合谁、4B 和 9B 怎么选、以及如何在本地跑起来。一、NeoHorse-1 是什么为什么值得关注NeoHorse-1 不是一般的聊天模型它是一系列在智能体后训练Agentic Post-Training路径上打磨出来的智能体模型出身基于 Qwen3.5-4B 和 Qwen3.5-9B 做后训练原生支持 262,144 token 上下文定位文本输入 / 文本输出面向本地自部署self-hosted协议Apache 2.0 开源许可商用友好见 LICENSE它最特别的地方在于背后的Routing Harness路由框架框架把任务分派给不同模型池记录工具调用轨迹和结果再把能力反馈喂回下一轮训练数据形成一个评估 → 选择 → 更新的原型闭环是通往递归自我改进RSI的初始原型。 完整方法论可查阅仓库中的技术报告TechnicalReport_NeoHorse_v1.pdf二、两大核心卖点智能体能力与指令遵循2.1 智能体Agentic任务表现NeoHorse-1 在个人助理类基准PinchBench、VitaBench、WorkBuddy Bench、tau2-Bench 等上表现突出。以 4B 为例它在 PinchBench 上拿到77.3分、tau2-Bench 上拿到88.5分均超过同规格基线 Qwen3.5-4B。2.2 9B 版的更高天花板9B 版本在同样基准上进一步提升例如 PinchBench 达到82.3、tau2-Bench 达到90.8、BFCL v4工具调用基准达到67.4十项基准平均分 69.04是 9B 档位开源模型中的第一梯队。三、场景选型指南4B 还是 9B这是本文的重点。不同场景下的推荐如下你的场景推荐规格理由️ 消费级 GPU / 边缘设备本地部署4B部署足迹轻8-bit 量化后单机即可流畅运行 个人助理 / 日常问答 Agent4B十项基准均分 64.87指令遵循已很能打️ 复杂工具调用 / 多步骤任务编排9BBFCL v4、tau2-Bench 等工具调用基准显著领先 代码补全与编码 Agent9BHumanEval 98.17编码能力上限更高 企业级私有化部署数据不出域9B容量更高同等文本接口下综合表现更强3.1 硬件不够选量化版本4B 和 9B 均提供16-bitBF16及 8-bit / 5-bit / 4-bit 量化版本GGUF 格式量化版占用更少的磁盘和显存让普通玩家更容易在自有硬件上运行 NeoHorse 智能体模型Apple 芯片用户还可选择 MLX 版本。3.2 快速决策口诀显存紧张、追求轻快→ NeoHorse-1-4B能力优先、显存充足→ NeoHorse-1-9B两个都想试→ 先 4B 验证流程再上 9B 提能力四、工具调用实战让模型自己动手NeoHorse-1 原生支持 OpenAI 兼容的工具调用协议。仓库提供了开箱即用的示例脚本几乎零代码即可体验对话示例examples/chat.py —— 向部署好的模型发送你是谁开启思考模式返回完整回复工具调用示例examples/tool_call.py —— 询问北京现在天气怎么样模型自动调用get_current_weather工具函数返回结构化的 tool_call运行方式非常简单以对话示例为例python examples/chat.py \ --url http://127.0.0.1:8000 \ --model neohorse-1-4B 也就是说把它接入自己的 Agent 应用只需要一个标准 API 端点无需额外改造。五、一键部署最快上手步骤下载权重从 Hugging Face 或 ModelScope 拉取 NeoHorse-1-4B / 9B 权重含 GGUF 量化版选择推理框架SGLang 或 vLLM 均可关键参数见 README.md 的 Deployment 章节SGLang--reasoning-parser qwen3--tool-call-parser qwen3_codervLLM--enable-auto-tool-choice--tool-call-parser qwen3_coder验证服务跑一遍examples/chat.py和examples/tool_call.py确认对话与工具调用都正常接入你的应用任何 OpenAI 兼容客户端/v1/chat/completions都能直接使用⚠️ 262,144 token 是配置上限实际可用长度取决于 GPU 显存显存不足时请调小--context-length/--max-model-len。六、常见问题FAQQ1NeoHorse-1 和普通聊天模型的最大区别是什么A它经过路由引导的智能体后训练routing-guided agentic post-training训练信号直接来自真实执行轨迹和工具调用结果因此在个人助理、工具调用这类多步骤任务上更强。Q24B 和 9B 接口一致吗A完全一致都是文本输入 / 文本输出的标准服务接口切换规格只需换权重和服务别名neohorse-1-4B/neohorse-1-9B。Q3可以商用吗A可以NeoHorse-1 以 Apache 2.0 协议发布。七、总结NeoHorse-1 到底适合你吗✅ 适合你如果你想用本地部署构建智能体应用、重视工具调用可靠性、需要 Apache 2.0 许可的开源智能体模型 ❌ 不适合你如果你需要多模态图像输入输出能力或期望零配置的云端 API。一句话选型轻部署选 4B强能力选 9B两者共享同一套智能体后训练血统是目前开源小参数智能体模型中非常值得试水的一组选择。更多评测细节可查阅 README.md 中的完整基准表格与技术报告 TechnicalReport_NeoHorse_v1.pdf。赞分享【免费下载链接】NeoHorseNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.项目地址https://gitcode.com/gh_mirrors/ne/NeoHorse点击查看免费下载相关推荐终极指南7个最佳Core ML模型性能对比帮你选择最适合的应用场景终极指南7个最佳Core ML模型性能对比帮你选择最适合的应用场景 想要在iOS应用中集成机器学习功能却不知道选择哪个模型Awesome CoreML M文档教程SeedVR2-7B模型选型终极指南找到最适合你的AI助手SeedVR2 7B模型选型终极指南找到最适合你的AI助手 还在为选择AI模型而头疼吗 面对SeedVR2 7B模型家族的多个版本不知道哪个才是你的人工智能计算机视觉模型推理服务如何在10分钟内用CUBER部署应用到Kubernetes新手友好指南如何在10分钟内用CUBER部署应用到Kubernetes新手友好指南 CUBER是一款简化Kubernetes应用部署的自动化工具只需创建约10行代码的创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进