ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

企业级 AI 大脑:Hermes Agent 与 GBrain 及 Brain Computing

企业级 AI 大脑:Hermes Agent 与 GBrain 及 Brain Computing 这一篇我想把企业级 AI 大脑这个被讲得很玄的词,拆到底层机制上。前面几篇我们聊了 Agent 的运行时、最后一公里、评估和多智能体协作,那些讲的都是单个 Agent 或者一群 Agent 怎么把一件事做成。今天换个尺度看问题,当一个企业里有几十上百个 Agent 同时干活,它们彼此之间靠什么连成一个系统,而不是一堆互相不认识的临时工。我的核心观点先放这里:企业级 AI 真正的分水岭,不是某个 Agent 有多聪明,而是有没有一个集中式的脑去统一持有记忆、知识和推理,让所有 Agent 共享同一份认知底座。Hermes 负责动手和编排,GBrain 负责记和想,Brain Computing 负责让记和想在算力与存储层面可弹性供给。这三层拆开了,企业 AI 才从一群能干的个体变成一个有记忆、能协同的组织。为什么一定要有一个集中式的脑先说清楚痛点。很多企业刚开始上 Agent,做法是给每个场景塞一个独立的 Agent,客服一个、报表一个、运维一个,各自跑得挺欢。问题出在规模上来之后:每个 Agent 自己维护自己的上下文、自己的知识库、自己的经验,彼此之间完全不互通。这会带来三个绕不开的坑。第一是记忆割裂。客服 Agent 今天从用户那学到一条重要的业务规则,报表 Agent 明天根本不知道,同样的知识要在十几个地方各存一遍,还经常对不上。第二是知识漂移。同一个概念在不同 Agent 里被解释成不同意思,时间一长口径就分歧了,你没法保证全公司 AI 说的是同一套话。第三是协同缺失。一个跨部门的复杂任务需要多个 Agent 接力,但没有一个中枢做全局规划,它们只能各自为政,谁也不知道别人干到哪了,依赖关系全靠人工在中间传话。集中式脑要解决的,正是这三件事。它把记忆、知识、推理从每个 Agent 的肚子里抽出来,放到一个大家都能访问的地方。一个 Agent 学到的经验,其他 Agent 立刻能用;全公司的知识只有一份权威版本;跨 Agent 的任务由中枢统一排优先级和依赖,而不是各干各的。更深一层看,这其实是一次架构范式的转变。单 Agent 像面向对象里每个对象自带状态,状态跟着实例走,实例死了状态就没了。企业 AI 大脑更像共享内存的多进程模型,执行单元(Agent)是无状态或可短暂有状态的 worker,真正的认知状态集中在共享中枢里。这样做的好处是执行单元可以被替换、扩缩、重试而不丢记忆,认知底座可以单独升级而不影响上层编排。举个具体的例子。一家制造企业想用 Agent 做供应链风险预警,采购 Agent 发现了某供应商的交期异常,物流 Agent 同时在跟踪在途库存,财务 Agent 在算现金流。如果没有中枢,三个 Agent 各知道一块,谁也拼不出下周三产线要停这个全局结论。有了 GBrain,采购发现的异常写进共享情境记忆,物流和财务的 Agent 在规划时就能读到它,中枢据此把三路信息合成一条预警推给相关负责人。这种跨 Agent 的合成能力,是单 Agent 架构天然做不到的。而且监督这件事的,不再是某个人在中间当传话筒,而是中枢里一套稳定的编排规则,它能 7×24 小时不疲倦地盯着所有 Agent 的进展。需要强调一句,这类系统通常并不存在一个无所不知的超级模型在云端统一思考。更常见的实现是:GBrain 作为一个有明确定义接口的服务,负责记忆读写、知识检索、一致性校验和跨 Agent 的调度决策,Hermes 作为无状态或有短记忆的执行体去调它。下面一层层拆。记忆不是一块硬盘,是分层的很多团队一上来就说给 Agent 接个向量库当记忆,这想法太糙了。人的记忆是分层的,机器的也该分层。GBrain 里的记忆一般至少拆成三层,每层解决的问题和存的东西都不一样。短期记忆管的是现在正在想什么。它是当前任务的工作上下文,包括对话缓冲、推理草稿、这一步用到的工具返回。这层很像 CPU 的寄存器和缓存,速度快、容量小、任务结束或者超时就被清掉。如果什么都往短期记忆里塞,上下文窗口会爆,推理质量会掉,成本会飞天。所以短期记忆的关键是裁剪和摘要,不是无脑堆积。长期记忆管的是一直记住的东西。它是向量化的语义沉淀,已经学过的知识、历史经验和经过提炼的结论都存在这。这层对应传统意义上的知识库和档案,跨任务持久。写入长期记忆不是把原始上下文直接 dump 进去,而是要做摘要和蒸馏,把一整段对话提炼成几条可检索的知识点。否则长期记忆会无限膨胀,检索信噪比越来越差。长期记忆还需要遗忘机制,过时的、低可信度的、重复的知识要能被淘汰,这一点后面会展开。情境记忆管的是当时发生了什么。它记录特定会话或事件的轨迹:谁、在什么时候、做了什么、结果如何。这层对复盘、审计、个性化至关重要。比如一个金融场景的 Agent,事后要能回答那天那笔异常交易为什么被放行,靠的就是情境记忆里的完整轨迹,而不是重新猜。这里还有一个关键的工程细节:长期记忆不是直接写入的,情境记忆要经一道提炼才能沉淀成长期记忆。一次具体的会话是情境,系统会定期或按需把里面可复用的规律抽出来,浓缩成去标识化的语义知识点写进长期记忆。这步蒸馏很重要,否则长期记忆就是情境记忆的冗余拷贝,既占空间又拉低检索信噪比。反过来,长期记忆里的知识在推理时也会被注入短期记忆作为上下文,三层之间是一个不断流动的循环,而不是三个互不相干的抽屉。很多团队误以为接个向量库就等于有了记忆,缺的正是这条从情境到语义的提炼链路,结果向量库里堆满未经消化的原始对话,检索出来全是噪音。除了记忆三层,GBrain 还要接知识双通道。一条是知识图谱,存实体、关系、规则,擅长结构化的因果推理和约束检查,比如张三的权限不包含审批李四的报销;另一条是向量检索,做语义相似度召回,擅长从海量文档和片段里找相关经验。两者不是二选一,而是融合重排:图谱给出硬约束和关系路径,向量给出软相关,再按相关性、时效性和可信度统一排序后喂给推理。最后所有这些,都通过一个统一记忆接口对外暴露:读、写、检索、遗忘,并且处理版本、权限和一致性。这个接口是 Hermes 和 GBrain 之间最关键的契约。Hermes 与 GBrain:动手的归动手,想事的归想事职责切分是这套架构能不能成立的核心。切得不清,就会变成两头都管、两头都漏。我用一张对照来说。Hermes 这一侧是执行与编排。它接收任务意图,理解用户或系统的请求;把目标拆解成可执行的步骤序列;编排并协调多个专职 Agent 协同;调用工具、执行动作、产出结果;维护本次任务的本地工作上下文。注意,它管的是怎么把一件具体的事做成。它的边界也很明确:不持有跨任务的长期记忆,不维护全局知识图谱,不做全局部署级的统一规划,不跨 Agent 共享状态。一个 Hermes 实例挂了,它的本地上下文可以丢,因为记忆都在 GBrain 里。GBrain 这一侧是集中式中枢。它统一读写记忆(短期、长期、情境);维护全局的知识图谱和向量索引;做跨 Agent 的统一规划与调度决策;集中进行推理、反思和一致性校验;负责权限、版本、审计和遗忘策略。它管的是所有事共享什么、全局该怎么排。它的边界同样清晰:不亲自执行业务动作,不直接调用外部业务工具,不绑定单一任务的生命周期,不替某个 Agent 做局部步骤决策。这套切分最实在的好处是解耦。Hermes 可以随便换模型、换工具、换编排策略,只要还遵守和 GBrain 的接口契约,记忆和知识都不受影响。GBrain 里的记忆模型、检索算法、知识图谱 schema 也可以单独升级,上层的执行 Agent 无感知。两边各自独立演进,不会一改就全瘫。实际工程里还有几个容易忽略的点。一是并发写的一致性问题,多个 Hermes 可能同时往 GBrain 写记忆,得有版本号、乐观锁或者事件溯源之类的机制保证不互相覆盖。二是权限与租户隔离,不同 Agent、不同业务部门能看到的记忆范围必须不一样,不能让 A 部门的 Agent 读到 B 部门的敏感情境。三是遗忘不是删除这么简单,长期记忆的淘汰要结合可信度打分和访问频率,避免把关键但冷门的知识误删。把这三件事展开说,每一件都不简单。并发写如果用全局锁,中枢立刻成为吞吐瓶颈,所以成熟的实现多用乐观并发加冲突合并,让写冲突的少数请求重试而不是阻塞全部。租户隔离如果靠应用层自觉,迟早有人写错一处就泄露,更稳妥的是在统一记忆接口里强制带租户上下文,接口层做行级或向量级的过滤,调用方根本拿不到越界数据。遗忘策略则最好做成可观测的流水线:每次淘汰都有日志,关键的低频次知识先降级到冷存储而不是直接抹掉,真出错了还能回捞。这些机制单看都不起眼,但缺一个,企业就不敢把核心业务记忆托付给这个中枢。Brain Computing:把记和想变成基础设施如果 GBrain 是认知中枢,那它底下必须有一层东西,让记和想在工程和成本上真的跑得起来。这就是 Brain Computing,把它理解为推理与记忆的计算底座。这层至少有四块能力。推理引擎负责把模型跑起来:模型服务化、请求批处理、KV 缓存复用、投机解码、量化蒸馏加速。它的目标是把调用模型从一次昂贵的一次性动作,变成可按需供给、可复用的服务。向量数据库负责 embedding 索引和近似最近邻检索,支撑语义记忆和知识召回,现在的系统往往还要支持多模态表征,图文音都能进同一个向量空间。记忆存储是分布式 KV 加对象存储加时序存储的组合,负责把短期、长期、情境三类记忆落到不同特性的介质上,还要做版本和快照,方便回放和审计。调度编排负责算力调度、弹性扩缩容、隔离和配额,保证一个任务把资源吃满时不影响别的任务。推理引擎内部还有不少门道。大模型推理最贵的不是算力本身,而是显存里的 KV 缓存和反复 prefill 的开销。成熟的 Brain Computing 会把 KV 缓存做跨请求复用,把多路小请求合并成批处理,用投机解码和量化把单 token 成本压下来。这些优化对上层 Agent 完全透明,但它们决定了这套大脑在经济上跑不跑得通。很多团队的 Agent 单跑一次两块钱觉得不贵,乘以日活百万就是一天两百万,底座不做推理加速,模型再聪明也用不起。所以你看,Brain Computing 表面上在讲算力,实质是在讲让认知服务变成一种可计量、可治理、可摊薄成本的公用设施。再往下是物理基础设施:异构算力把 GPU、NPU、CPU 混在一个池子里按需分配;分布式存储提供高吞吐低延迟和副本容灾;高速互联用 RDMA 和池化网络把显存和存储直通,减少数据搬运的瓶颈。这里要划一条清清楚楚的线。Brain Computing 跟给 Agent 调一个大模型 API不是一回事。调 API 是单次、无状态、无治理的;Brain Computing 是把推理、检索、记忆、调度全部当成可复用的基础设施统一供给,它有弹性、有隔离、有成本治理、有故障域划分。后者才是企业愿意长期依赖的东西。一个部门级的 demo 用 API 就够了,一个全公司的 AI 大脑没有底座必塌。与单 Agent 的本质区别:状态在哪里把前面的东西串起来,就能看清企业 AI 大脑和单 Agent 在本质上差在哪。我画一张对照。单 Agent 模式里,每个 Agent 的记忆和知识都锁在自己肚子里,和其他 Agent 不互通。结果就是重复建设(同一份知识存十遍)、口径分歧(同一个概念各说各话)、无法统一规划(跨 Agent 任务靠人传话)。这在 Agent 数量少、彼此不搭界的时候问题不大,一旦规模上来,摩擦成本指数级上升。企业 AI 大脑模式反过来,把记忆与知识从 Agent 内部抽成共享中枢,所有 Hermes 都连到同一个 GBrain 上。于是记忆共享、知识一致、全局协同成为默认能力,而不是每个场景重新攒一遍。Agent 退化成纯粹的执行与编排单元,它的价值在于会干活,而不在于记得多。这个区别的根本,是认知状态的归属。单 Agent 把状态跟着执行单元走,执行单元是 First-Class 的,记忆是它的附属品。企业大脑把状态变成 First-Class 的共享资产,执行单元反而是可替换的、临时的。前者像一群各自带笔记本的临时工,后者像一个组织共用一套档案和规章。规模越小,前者越便宜;规模越大,后者越不可或缺。再补一个容易被忽视的视角。单 Agent 架构在 Agent 数量少时是低谷,因为每个实例自己管状态,没有协调开销。但一旦 Agent 超过某个临界点,状态的不一致会自我放大:一个 Agent 改了知识另一个不知道,下游基于旧知识做了决策,错误沿着调用链扩散。这种系统性漂移在单 Agent 视角里根本看不出来,因为每个 Agent 看自己都是对的。集中式大脑用一份权威状态消除了这个放大环路,代价是引入中枢的可用性和一致性挑战,但这个代价是确定的、可治理的。换句话说,单 Agent 把复杂度藏在了系统边界之外,企业大脑是把复杂度收拢到中枢统一面对,这是工程上更诚实、也更易追责的选择。我的看法写到这里,我想把话说透。现在行业内卷模型、卷参数、卷 benchmark,但企业真要用 AI 扛业务,瓶颈从来不在模型够不够聪明。瓶颈在:几十个 Agent 一起干活的时候,它们记的东西能不能共享,知道的知识是不是同一份,面对一个跨部门的活能不能被统一排程。我越来越确信,企业级 AI 真正的护城河,是这套脑——集中式的记忆、知识、推理中枢,加上底下可弹性供给的算力与存储底座。单 Agent 在 demo 阶段确实快,拖一个框架半天就能跑,但那是因为它不用和任何东西协作、不用记住任何跨时间的东西。一旦你要的是跨部门、跨系统、跨周期地持续运作,没有脑的 Agent 只是一群健忘且各自为政的临时工,规模越大越乱。所以如果你在规划企业的 AI 体系,我的建议是先想清楚脑长什么样,再决定手怎么长。记忆怎么分层、知识怎么融合、哪些状态必须共享、底座怎么供给算力,这些才是值得花大功夫的地方。模型可以换,工具可以接,但认知底座一旦定错,上面所有的 Agent 都要跟着返工。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进