ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

企业的知识库建得起来,为什么就是用不起来?

企业的知识库建得起来,为什么就是用不起来? 企业知识库用不起来部分项目可能在内容维护、关系治理和业务衔接等环节遇到困难。知识库的账要按调用次数算按容量算会失真。它得可辅助内容处理、关系抽取和流程触发关键内容与动作应由规则或人员审核。知识库最初是为检索造出来的最早的库是图书馆的卡片目录一册书对应一张卡片按分类号排进抽屉。计算机进来后卡片变成数据库里的一行记录分类号变成字段查找靠布尔表达式用 AND、OR、NOT 把命中的集合做交并补。布尔检索的毛病是没有排序命中三千条和命中三条一样难用。于是有了排序。情报检索领域提出的向量空间模型把文档和提问都转成词频向量用夹角余弦算相关度后来演化出 BM25 这类概率模型加入词频饱和与文档长度归一至今仍是全文检索的默认打分方式。到这一步库的重心从怎么存移到了怎么找。企业知识库接过了这一棒。Wiki 把页面之间的链接交给写作者Confluence 一类工具补上权限、版本与评论检索框后面接的是倒排索引。倒排索引按词建表记录每个词出现在哪些文档的第几个位置查询时做集合运算速度极快。它认字形不认意思。传统关键词检索对词汇差异较大的查询可能召回不足。工程上称这类情况为词汇不匹配也是关键词检索绕不过去的那堵墙。词向量的思路是把词投进高维空间让含义相近的词落在相邻位置句子和段落沿用同一套办法得到整段的向量检索时算向量距离不再依赖字面重合。这里有一笔很容易被忽略的账。1024 维 float32 的向量单条占用 4KB一百万个文本片段约 4GB 常驻内存。近似近邻索引的选择也直接连着成本具体取决于数据规模、参数、硬件和召回目标图结构常驻内存吃内存IVF_FLAT 先聚类再在小范围内精算内存省召回靠调 nprobe 换。容量规划要先算这笔再谈算法调优。录入靠人力建库即终点多数知识库的上线路径是发通知、定目录、要求各部门上传。部分项目在初期集中上传后可能出现后续更新不足。原因在成本结构整理文档的时间由员工个人承担收益归团队没有谁有动力持续维护。可自动化的那一段其实很长。文档格式分两类PDF 记录的是绘图指令流段落与表格要重新识别双栏排版和跨页表格是出错高发区Word、HTML、Markdown 带着结构标记解析相对直接。扫描件和图片要先过 OCR把像素还原成文字。拿到纯文本之后是切分。切得太碎一段话被拦腰截断向量里的语义不完整切得太长一段里塞进好几个主题检索时被平均掉。工程上常取几百个字作为一个片段在标题层级处断开相邻片段之间留一部分重叠。切完过 embedding 模型转向量写进向量库同时在全文检索引擎里留一份关键词索引。embedding 模型一旦更换全量向量必须重算重灌上线前的模型选型比事后反复调参更省钱。经验带不走知识管理领域很早就区分过两类知识。一类能写成文档、公式、流程图另一类只存在于做过这件事的人身上比如某条产线的参数为什么这么调某个客户为什么对交付周期格外敏感。要让后一部分留下来存档不够得把关系写出来。关系型数据用表表与表之间靠外键关联知识图谱用的是图基本单元是三元组形如实体—关系—实体例如A 部件—包含—B 芯片。三元组的写法来自语义网那套标准主谓宾结构让机器可以直接做推理。图数据库在存储层做了取舍用邻接表把关系固化在磁盘上遍历一跳邻居不受全表规模影响代价是写入比关系库重schema 改动也更麻烦。查询语言 Cypher 的位置相当于 SQL写法是描述一个图形状让引擎去找匹配的子图。落到企业里从文档中抽出人名、机构、产品型号这些实体再抽出任职于“供应商是”总部位于这类关系堆起来就是一张网。骨干离职后交付的文件能转化成可查询的关系某个客户的历次交付异常指向同一家供应商的同一批料。图上还能做路径推理两个没有直接关系的实体通过中间节点连出一条链。检索给出答案动作还得人去做大模型的知识压在参数里训练结束就固定补知识要重新训练或微调。检索增强生成RAG可为回答提供资料片段与引用线索但不能保证答案完全准确。把检索结果变成动作靠的是编排。编排的前身是工作流引擎BPEL、BPMN 那套规范用 XML 描述流程跑的是预先画好的有向无环图数据平台后来用 DAG 调度器管理任务依赖同样不允许循环。大模型 Agent 的需求不一样模型可能判断材料不够再搜一次需要回到上一个节点重来图里必须有环。LangGraph 一类引擎把节点写成有状态的函数边可以带条件每走一步把状态写进检查点在启用检查点、持久化和恢复策略时部分任务可从保存状态恢复。工程上最容易翻车的地方是条件分支写得过松流程在两个节点之间反复横跳跑满迭代上限才停。生产环境里节点级超时、最大迭代次数、失败重试策略要在配置阶段定死。把三段接成闭环小艾智能体的做法是把这三段做成一条贯通的流程配置用 JSON 或 YAML 完成。文档处理引擎负责入口这一段自动识别格式后解析、语义切分、转向量Milvus 存向量、Elasticsearch 管关键词、Neo4j 存三元组关系。检索侧做混合召回余弦相似度落在 [-1,1] 区间BM25 是无界分数两者量纲不可比直接加权相加会被量级大的一路主导这里用 reciprocal rank fusion 按排名融合必要时再加一层 cross-encoder 重排。编排层内置二十余类节点覆盖 LLM 推理、条件分支、REST 调用、数据提取、文本摘要、代码审查、会议纪要等条件路由与并行执行都在配置里声明状态由检查点持久化。Skills 用 Markdown 声明能力描述、输入参数与输出结构新增技能启动即注册Agent 通过 Skill 节点在运行时调用。反馈侧会可形成待审核知识候选条目并经规则或人工审核后入库。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进