ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

上线即获2368个Like:NeoHorse-1-4B的开源热度能撑多久

上线即获2368个Like:NeoHorse-1-4B的开源热度能撑多久 上线即获2368个LikeNeoHorse-1-4B的开源热度能撑多久【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B一个4B参数的小模型发布首日就拿下2368个Like训练数据不是海量公开语料而是自家Routing Harness里跑出来的Agent执行轨迹宣传口径里最显眼的不是某项刷榜分数而是递归自我提升RSI这个在学术讨论中存在争议、在商业模型上几乎无人敢碰的词。这就是NeoHorse-1-4B——基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴等机构于9月发布的开源模型由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办的公司出品。本文不打算复述发布通稿而是把三件事放在一起看这个2368 Like的初始热度由什么构成、它的真实技术底座到底长什么样、以及这些热度与底座能不能撑起一周甚至更久的社区生命力。数据复盘2368个Like背后是一套选代而非训练的叙事在Hugging Face的公开页面上NeoHorse-1-4B以hours_seen2的极短时间窗口斩获2368个Like。这个数字要拆成两层看。第一层是Like的基数是否扎实。2368在HF小模型赛道属于中等偏上的首发量级——它明显高于绝大多数4B微调模型的常态热度但也不构成刷爆全站级别的现象。真正值得注意的不是绝对值而是涨速两个小时内逼近2400意味着发布窗口内存在强力的集中导流而不是自然传播的缓慢爬坡。第二层是Like的构成是否健康。回顾发布前后的公开传播链澎湃新闻、搜狐、智东西、上观新闻等多家媒体同步报道标题统一锚定Agent-Native模型首个RSI等关键词同一窗口期CSDN上出现了十余篇关于NeoHorse-Jev-4B同系列决策模型的部署与微调实战文章时间集中在9月30日至10月6日之间。这说明热度并非单一事件驱动而是媒体通稿、技术博客、社区教程三路并行的结果——这也为能不能撑下去提供了第一个判断维度热度来源是否单一。热度来源拆解三个同时成立的第一次2368个Like之所以能在两小时内形成本质上是三个稀缺性标签同时命中标签一创业明星的第一款模型。王云鹤的履历华为诺亚方舟实验室主任、盘古大模型负责人自带行业注意力NeoHorse是其创业后的首个模型交付。媒体稿中AI基建牵手Agent新锐要让Agent走进核心业务的叙事把一次模型发布包装成了上海AI产业链联动的样本。标签二首个Agent-Native模型的稀缺定位。从澎湃新闻的报道原文看核心卖点是探索将Agent使用工具、接收反馈和修正错误的经验转化为模型能力——不是又一个通用底座而是把执行轨迹当作训练数据的新范式。这恰好命中了2026年Agent赛道最大的痛点Agent框架层出不穷但基座模型普遍缺乏真实工具交互经验。标签三RSI递归自我提升的激进叙事。这是双刃剑。RSI在学术上长期存在自我指涉式改进是否可收敛的争论模型公开宣称Towards Recursive Self-Improvement在商业开源模型中极为罕见。它给了社区一个极强的讨论钩子但也把兑现标准抬到了最高——一旦后续迭代不能证明模型变强→参与训练→更强的闭环叙事就会反噬。这三个标签的共同点是它们都指向路线而非榜单。热度不是来自某个benchmark的一骑绝尘而是来自我们走了一条别人没走的路。热度之外从仓库源码看NeoHorse-1-4B的真实底座热度叙事需要过技术关。逐项核对仓库内容后可以得出一个清晰的判断这个模型的技术底座是扎实的但它的强项与宣传口径并不完全重合。先看仓库的模型卡README.md。模型由Qwen3.5-4B后训练而来属于语言模型权重的纯文本推理重打包版本Vision权重不包含在内重打包只改配置与张量键名不改微调后的数值。宣传中4B干翻9B的说法需要克制理解官方给出的核心数字是十项基准宏平均64.87 vs 基座58.945.93的提升且主要增量集中在Agentic能力组——QwenClawBench 44.686.21、WorkBuddy Bench 34.419.79、PinchBench 77.336.14、tau2-Bench 88.464.17。换句话说提升是定向的后训练把能力集中砸向了工具使用与指令遵循而非通用知识。config.json给出了架构层面的关键证据模型为32层采用**线性注意力与全注意力交错的混合架构**layer_types中每4层出现一个full_attention其余为linear_attention原生上下文长度262,144可扩展至1,010,000 tokenattn_output_gate: true、linear_conv_kernel_dim: 4等参数指向带门控与卷积核的线性注意力实现。这意味着4B参数的上下文承载能力远超同尺寸全注意力模型——对Agent场景动辄几十万token的轨迹上下文而言这是实打实的工程优势。训练数据的身世在README.md的Highlights中写得直白Routing Harness将任务分发给异构模型池记录工具交互与结果估计能力需求用能力级反馈塑造下一轮训练混合之后引入routing-guided curriculum SFT与routing-guided on-policy distillation把执行轨迹转化为训练信号同时保留每条响应周围的执行与harness上下文。数据侧则有精确/近似重复剔除、评测去污、结构校验、六维语义评估、Scene/Goal/Outcome子场景标注。这条数据来自自家执行系统的路线与澎湃报道中训练语料以OpenSquilla产生的执行轨迹为核心完全对得上——RSI叙事的起点是OpenSquilla这个开源Routing Harness的真实运行日志这比空谈概念扎实得多。评测协议README中Reported protocol也值得较真SGLang v0.5.17temperature1.0top_p0.95启用thinking模式多个基准跑三遍取均值。协议透明、可复现这在4B赛道是加分项但也要指出VitaBench32.00与BFCL v461.79并未拿到组内第一说明提升并不均衡——Agentic组全面领先工具调用与指令遵循各有短板。热度叙事里全面碾压的说法在数据面前站不住。部署侧的工程诚意同样可以从仓库验证README给出SGLang与vLLM两条OpenAI兼容启动路径并明确要求--reasoning-parser qwen3与--tool-call-parser qwen3_coder——这正是chat_template.jinja里那套tool_callfunction...parameter...结构化调用格式的推理侧对应物。tokenizer_config.json中完整保留了|im_start|、think、tool_response、|fim_prefix|等全套Agent/RAG/补全控制符264K上下文加上BF16双分片权重见model.safetensors.index.json总大小约8.4GB配一张24GB卡即可流畅跑起完整Agent链路。Apache-2.0许可LICENSE则把商用门槛直接清零——这是社区教程能在两周内密集产出的制度性前提。对比同类模型的上榜曲线热度持续性取决于第二落点4B级开源模型的Like曲线业界规律大致有三种形态一次性脉冲型发布当日靠媒体大V转发冲高随后迅速回落——常见于故事性强但技术增量有限的模型教程接力型首日中等热度但随后因部署简单、文档完善、许可宽松被大量教程与二次开发持续反哺曲线呈现长尾——NeoHorse-Jev-4B在CSDN的表现接近此形态两周内十余篇实战文单篇浏览量200-330区间覆盖Ollama/llama.cpp/vLLM/Codex集成全链路榜单驱动型分数足够碾压引发benchmark复现潮热度随第三方评测的发布周期性抬升。对照仓库证据NeoHorse-1-4B目前处于脉冲型向教程接力型过渡的窗口。它具备接力的硬件条件Apache-2.0、双框架部署文档、264K上下文、混合注意力架构但缺一个关键第二落点目前公开的复现材料高度集中在同系列的Jev-4B决策模型上而非NeoHorse-1-4B本体。社区用脚投票的方向正在从看新闻转向能不能拿来干活——而干活评测目前多数发生在决策模型的细分场景里。未来一周的观察指标热度能否续命看这四件事把上面的证据收敛成可操作的观察清单未来一周发布后第2-8天应盯住四个指标第三方评测的独立复现是否有非官方账号公布tau2-Bench/QwenClawBench的复跑结果。Agentic分数88.46/44.68是模型最硬的卖点一旦有独立复现出现分歧叙事强度会立刻分化反之若多份复现趋同热度将从新闻热度转为基准热度。教程的主体迁移CSDN/掘金等平台的实战文章标题主体是否从Jev-4B决策模型迁移到NeoHorse-1-4B本体的Agent部署。这个迁移发生的速度和密度直接决定长尾能否成形。RSI叙事的第二次证据团队是否在一周内放出新版模型重新进入Harness并带来可量化增益的中间结果。这是2368个Like里最脆弱的部分——RSI承诺的是闭环闭环的第一次公开证据才真正决定这条技术路线的可信度。生态侧翼动作OpenSquilla与NeoHorse-1-4B的绑定是否加深如官方教程、预置路由配置以及是否出现基于该模型的LoRA/量化/Agent框架适配仓库。Apache-2.0许可意味着任何第三方都有权做这件事做的人越多热度越不依赖团队自身投放。2368个Like回答的是多少人愿意点赞而上述四个指标回答的是多少人愿意持续投入。前者是营销与媒体共振的结果后者才是开源模型生命力的真正计量单位。对NeoHorse-1-4B而言首日热度的含金量取决于一个尚未兑现的承诺能否在接下来一周内开始兑现——在那之前它仍然是一个方向正确、证据部分到账的开源样本值得观察但还不值得被断言为又一个现象级模型。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进