ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

AI Agent 相关知识扫盲:16 个概念+11张图+38个开源项目推荐

AI Agent 相关知识扫盲:16 个概念+11张图+38个开源项目推荐 最近半年 AI Agent 这词到处都是GitHub 上相关项目动不动就几十万 Star朋友圈天天这个炸了 那个爆火。但真要问一句「Agent 到底是什么」很多人答不上来今天我就来扫个盲。我这一年主要拿 Claude Code 改代码Agent 用得多。这篇把这些概念理一理从最基础的 Token到多 Agent 协作一共 16 个概念自底向上分成 5 层。每个概念配一张图再配几个按 GitHub Star / Fork 热度筛过的代表项目看完能对 Agent 有个完整的认识。先放一张全景图为什么要分层因为 Agent 这些概念是一层一层垒起来的下面的不懂上面的就悬空。比如不懂 Token就理解不了为什么会有上下文窗口这个限制。从底往上看一遍整个脉络就清楚了。第一层基础底座这一层是地基看着不起眼但后面会反复用到。三个概念。TokenAI 只认数字模型不认汉字也不认英文它只认数字。你输入的一段话会被分词器切成一个个小单元叫 Token每个对应一个数字模型干的活就是对这些数字做运算。Token 直接影响三件事上下文能塞多少、API 怎么计费、回复有多快。这也是为什么 Claude Code 要弄个CLAUDE.md文件——把项目架构浓缩成几百行而不是把整个代码库都塞进去怕的就是上下文被无关内容占满。要数 Token 的话tiktokenOpenAI 出的最方便。想看更通用的分词器实现也可以顺手看看 Hugging Face Tokenizers 和 SentencePiece。训练从通才到专家你可能会好奇为什么同一个模型写代码的时候很聪明问它冷门问题就开始瞎编这跟训练有关。训练分两步。第一步叫预训练拿海量的通用数据网页、书、代码喂给它让它学会语言和常识。这一步最烧钱几万张显卡跑上几个月。第二步叫微调用规模小但更专业的数据接着练比如想让模型擅长写代码就拿大量优质代码来微调。打个比方预训练像读本科知识面广但都浅微调像读研究生在一个方向上钻深。微调框架里 LLaMA-Factory约 72K Star最火支持 LLaMA、Qwen 这些主流模型。偏训练加速可以看 Unsloth偏 RLHF / SFT 流程可以看 TRL。幻觉它不是故意骗你你大概也被 AI 一本正经地忽悠过。我问过一个模型Spring 里有没有处理消息重试的注解它信誓旦旦给了我一个AsyncRetryable参数、用法讲得头头是道——结果加进代码编译就报错这注解压根不存在。这就是幻觉。原因在于大模型本质上是个概率预测器它算的是「下一个词最可能是什么」而不是「正确答案是什么」。所以它有时候会编出看起来挺合理、其实是错的内容。它不是坏了是天生就这么运作。用的时候自己验证一下别全信。第二层能力扩展底座有了模型已经是个合格的聊天机器人。但要变成能干活的 Agent它得有记忆、会用工具、能查资料。这些能力基本都在这一层。Context Engineering2025 -26年比较火的概念最近一年有个变化大家不太提 Prompt Engineering提示词工程了开始说 Context Engineering上下文工程。以前的提示词工程关心的是「这句话怎么写」。但 Agent 面对的是复杂任务它需要的不只是一句提示词而是整个信息环境项目背景、之前做过什么决定、有哪些工具能用、输出要什么格式、有什么安全约束。把这些都系统地准备好就是上下文工程。Maven 有份报告说得挺到位大部分 Agent 失败不是因为模型不行是上下文没喂对。RAG让 AI 开卷考试问大模型一个公司内部的问题它经常瞎编因为训练数据里没有你们公司的资料。RAG检索增强生成的思路很简单让它回答之前先查资料相当于开卷考试。流程是——提问 → 把文本转成向量 → 在向量库里找最相关的内容 → 把找到的拼进提示词 → 交给模型生成回答。RAG 也分代最新的叫 Agentic RAG不再傻乎乎检索一次就回答而是让一个 Agent 来决定要不要查、查什么、要不要多查几轮。框架标杆是 LlamaIndex约 50K Star主打深度文档理解的有 RAGFlow约 83K Star传统检索问答工程里 Haystack 也值得看。记忆你发现没每开一个新的对话AI 都不记得你是谁上次聊的全忘。Agent 要干活就得有记忆短期记忆管当前这摊事太长会自动摘要长期记忆把你的偏好存下来下次直接用。相当于给它配了个笔记本省得每次重新自我介绍。Mem0约 59K Star专门做这个。如果想看更完整的长期记忆 / Agent 状态管理可以看 Letta偏记忆服务化可以看 Zep。Tool UseAgent 的手Claude 是怎么「看到」你代码文件的它不是自己打开文件看而是调了一个叫Read的工具。这就是 Tool Use也叫 Function Calling。这里有个关键点模型自己不执行函数它只是决定「该调哪个函数」真正执行的是外面的程序。理解了这个下面 MCP 才好懂。Computer Use / Browser UseAgent 的眼睛有些事没有 API 可以调得像人一样去看屏幕、点按钮、填表单。Computer Use 让 Agent 能看屏幕截图、模拟鼠标键盘Browser Use 更专注专门操作浏览器。browser-use约 99K Star这个项目Star 数比很多 Agent 框架都高因为只要人能在浏览器里干的事它都能干。工程里还经常搭配 Playwright 做浏览器自动化和回归验证。MCP统一接口接一个新工具就得写一套代码今天接数据库写一套明天接文件系统又写一套挺烦的。MCPModel Context Protocol就是来解决这个的相当于 Function Calling 的标准化版本。它的架构分三层Host 是 AI 应用比如 Claude CodeClient 负责在 Host 内部和外部通信Server 是提供具体能力的工具服务。配的时候就是声明每个 Server 能干啥。MCP 管的是 Agent 怎么连工具服务器合集可以看 awesome-mcp-servers约 89K Star官方服务器合集是 modelcontextprotocol/servers约 87K Star。至于 Agent 之间怎么通信那是第四层 A2A 的事。第三层智能核心能力和工具都有了这层看 Agent 怎么把它们串起来完成任务。Agent从对话到执行普通聊天是你问一句、它答一句。Agent 是你给个任务它自己拆解、自己执行、自己检查搞完给你结果。一句话Agent 模型 规划 记忆 工具调用。它不是聊天框是个能自己干活的角色。跟普通对话对比一下普通对话Agent交互一问一答给任务自己搞定工具没有能调外部工具拆解不拆直接答自己拆成多步反馈没有做完看结果不行重来OpenClaw约 379K Star就是典型的 Agent。写代码这块Claude Code 和 Cursor 是主流如果想看 SDK 层怎么封装 Agent可以看 OpenAI Agents SDK、Pydantic AI。CoT 和推理模型先想再答CoT思维链就是让模型在给答案之前先把推理过程写出来逼它一步步想别直接跳到结论。对数学、写代码这种需要多步推理的事效果明显。2024 年 OpenAI 的 o1 把这事推进了一步出现了推理模型o1、DeepSeek R1、Claude 的 extended thinking——把长链推理直接练进模型里不用你再写「一步一步想」它自己就会。DeepSeek-R1 是开源推理模型的代表。ReAct想一步做一步Agent 怎么完成一个复杂任务不是一口气干完而是「想一想、做一步、看看结果、再想下一步」循环往复。你可能会说这不就是平时调试代码的流程吗差不多区别在于这个循环是 Agent 自己跑的不用你在旁边一步步指挥。编排框架里 LangGraph约 35K Star比较成熟。它背后的 LangChain 生态更大但 LangGraph 更贴近 Agent 的状态机和循环编排。反思人做完题会检查一遍Agent 也该会。反思就是生成之后再评估根据反馈修正。分两种一种是自己审自己适合检查格式、有没有改错地方另一种是丢进真实工具里验证比如跑测试、编译看有没有报错。Skill岗位手册Skill 是结构化的知识包给 Agent 补充某个领域的流程和工具。模型本身像个聪明但不懂具体流程的新人Skill 就像是给它的岗位手册看完就知道这事该怎么干。第四层协作一个人能力再强也有上限2026 年比较热的方向是让多个 Agent 一起干活。Multi-Agent组队干活产品拆需求、前后端并行、测试验收一个人理论上全能干实际干不过来Agent 也一样。常见的编排有三种顺序的一个接一个像流水线、并行的同时干最后汇总、层级的一个主管拆活、底下的人各干各的。框架里 CrewAI约 54K Star比较简单AutoGen微软的约 59K Star更灵活MetaGPT约 69K Star专门做多 Agent 软件开发。还有个热度很高的新项目 Paperclip约 71K Star主打零人公司——把 Agent 组织成一家公司连 CEO、预算、组织架构都有。它本质还是多 Agent 编排框架而且这项目 3 个月涨到 7 万 Star。足以看出热度火爆。A2AAgent 之间的通信协议MCP 解决了 Agent 怎么调工具但没解决 Agent 怎么跟另一个 Agent 说话。Google 2025 年推出了 A2A 协议来补这块——让不同框架、不同公司做的 Agent 能互相发现、通信、协作。一句话区分MCP 是 Agent 连工具的接口像 USB-CA2A 是 Agent 连 Agent 的协议像蓝牙。A2A 仓库在 A2A Protocol24K Stars。第五层工程实践光有概念Agent 在生产环境里跑不稳还得靠工程手段兜底。开发方式这几年也在变大概三个阶段Vibe Coding氛围编程Karpathy 2025 年提的用大白话描述要啥让 AI 写适合做 demo。Context Engineering上下文工程系统地管上下文写 CLAUDE.md、配记忆、接 MCP。Agentic EngineeringAgent 工程化搭一套让 Agent 能稳定运行的工程底座权限、沙箱、日志、测试都配上。不想写代码也能搭 Agent 的话Langflow约 150K Star、Dify约 145K Star和 Flowise约 54K Star可以可视化拖拽。最后还有个概念叫 Loop Engineering循环工程。Claude Code 的负责人 Boris Cherny 说过一句话「我现在不写提示词了我的工作是写循环。」意思是把 Agent 干活看作一个循环——发现任务、分派、执行、验证、记录——工程师要设计的是这个循环本身。这套东西里干货和营销掺半但「循环」这个视角确实给了个能落地的调试切入点。概念和项目对照表我按两个维度筛了一遍先看项目和概念是否强相关再看 GitHub Star / Fork 热度。Star 代表关注度Fork 代表二次使用和改造的人多不多。数字是我写稿时从 GitHub API 查的后面肯定会变所以这里只保留到约数。概念推荐项目按热度优先适合看什么Star / ForkToken / 分词tiktokenOpenAI 模型 Token 计算约 18.5K / 1.5KToken / 分词SentencePiece经典子词分词算法约 11.9K / 1.4KToken / 分词Tokenizers高性能通用 tokenizer约 10.8K / 1.1K训练 / 微调LLaMA-Factory一站式微调主流开源模型约 72.2K / 8.8K训练 / 微调Unsloth低成本、高速微调约 66.6K / 6.0K训练 / 微调TRLSFT、RLHF、偏好优化约 18.7K / 2.8K推理模型DeepSeek-R1开源推理模型代表约 92.0K / 11.7KRAGRAGFlow文档解析 RAG 工作流约 82.9K / 9.6KRAGLlamaIndex数据连接、索引、检索编排约 50.2K / 7.6KRAGHaystack传统检索问答工程框架约 25.6K / 2.9K向量库 / 检索底座Chroma本地向量库和检索实验约 28.4K / 2.3K记忆Mem0Agent 长短期记忆约 58.7K / 6.7K记忆Letta长期记忆和有状态 Agent约 23.4K / 2.5K记忆Zep记忆服务化约 4.7K / 0.6KTool Use / Agent SDKOpenAI Agents SDKAgent、工具调用、handoff 封装约 27.2K / 4.2KTool Use / Agent SDKPydantic AI类型安全的 Agent 开发约 17.8K / 2.2KMCPawesome-mcp-serversMCP Server 生态目录约 89.3K / 11.7KMCPmodelcontextprotocol/servers官方 MCP Server 示例约 87.3K / 11.0KBrowser Usebrowser-useAgent 操作浏览器约 99.1K / 11.1KBrowser UsePlaywright浏览器自动化和回归验证约 91.1K / 5.9KBrowser UseSelenium经典浏览器自动化约 34.2K / 8.7KAgentOpenClaw端到端 Agent 产品形态约 379.0K / 79.3KAgent 框架LangChainLLM 应用生态入口约 139.4K / 23.1KAgent 框架LangGraph状态图、循环、可控 Agent约 34.9K / 5.8KMulti-AgentPaperclip零人公司、Agent 公司化编排约 70.8K / 13.2KMulti-AgentMetaGPT多 Agent 软件开发流程约 68.8K / 8.8KMulti-AgentAutoGen多 Agent 对话与协作约 59.0K / 8.9KMulti-AgentCrewAI角色分工式多 Agent约 53.7K / 7.5KA2AA2A ProtocolAgent 之间通信协议约 24.3K / 2.5K评测 / 反思promptfooPrompt 和 Agent 输出评测约 22.3K / 2.0K评测 / 反思DeepEvalLLM / RAG / Agent 测试约 16.2K / 1.5K评测 / 反思RagasRAG 质量评估约 14.4K / 1.5K可观测 / 反馈闭环LangfuseLLM 调用链路、反馈、评估约 29.2K / 3.0K可观测 / 反馈闭环PhoenixLLM 可观测和实验分析约 10.2K / 0.9K幻觉 / 护栏Guardrails AI输出校验、约束和护栏约 7.0K / 0.6K低代码 AgentLangflow可视化搭建 Agent / RAG约 149.7K / 9.3K低代码 AgentDify企业级 LLM 应用平台约 145.4K / 22.9K低代码 AgentFlowise拖拽式 LLM 工作流约 53.6K / 24.5K最后16 个概念过完了。如果只记一句话就是上面那个Agent 模型 规划 记忆 工具调用剩下那些概念都是在给这个公式添砖加瓦。光看不动手没用挑一个顺眼的项目装上跑跑比看十篇文章都管用.资料展示下面是我整理的AI大模型 学习资料和工具包 预览适合收藏后按主题逐步学习
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进