
本文收录于专栏agent智能体系列—— 专栏系统覆盖 AI Agent 的记忆、工具、插件与实战点击订阅可跟踪后续更新。本课定位Agent和MLL的运行机制懂了思想从哪来本课把镜头拉远介绍从符号主义 Agent、强化学习 Agent 到 LLM Agent 的三条谱系再到 ReAct、Plan-and-Execute、Reflexion、ToT 四个经典范式。范式不是历史文物——第 6 课的循环里跑的就是 ReAct第 22 课的编排是 Plan-and-Execute 的产品化。阶段 1概念与基础 来源吸收微软课程微·03 Agentic Design Principles 与微·01 Agentic Patterns 的思想 知识更新至 2026-10关键字Agent发展史、ReAct范式、强化学习Agent、符号主义Agent、Plan-and-Execute、Reflexion、思维树ToT、LLM Agent起源本节目录3.1 三条谱系Agent 不是 2023 年才有的3.2 ReActThought → Action → Observation3.3 Plan-and-Execute / Reflexion / Tree of Thoughts三条改进路线3.4 从范式到产品2023-2026 的时间线概念讲解3.1 三条谱系Agent 不是 2023 年才有的Agent智能体是 AI 的原生概念比 LLM 老得多。理解谱系能帮你看清今天的 LLM Agent 复兴本质是旧的 Agent 框架换上了新的决策核心。经典教科书定义Russell NorvigAgent 感知环境、做出决策、采取行动以达成目标的实体。这个定义贯穿三代——变的是决策怎么实现符号推理 → 学习到的策略网络 → 大模型。三代各自的遗产直接活在今天的 LLM Agent 里遗产来自在 LLM Agent 中的化身任务分解与搜索符号主义GPS 的手段-目的分析Planner / Tree of Thoughts感知-行动循环、奖励信号强化学习MDP 框架Agent loop、环境反馈、RL 微调第 31 课记忆与反思认知架构SOAR/ACT-R短期/长期记忆、ReflexionLLM Agent 的起飞点是 2022 年 10 月的 ReAct 论文arXiv:2210.03629Yao et al.——它第一次把推理与行动交织成统一循环其后几乎所有 Agent 系统都是它的变体或组合。3.2 ReActThought → Action → ObservationReActReason Act的循环结构Question: 哪个国家的人口是日本的 1.5 倍以上且国土相邻 Thought 1: 我需要先查日本人口。 Action 1: search[日本 人口] Observation 1: 日本人口约 1.24 亿2023 年。 Thought 2: 1.5 倍约 1.86 亿。候选邻国里俄罗斯远超…… Action 2: search[俄罗斯 人口] Observation 2: 俄罗斯人口约 1.44 亿…… Thought 3: 不够 1.86 亿。中国人口约 14 亿满足。 Action 3: finish[中国]三个成分的分工Thought思考模型显式写出推理——决定下一步查什么、评估已有信息。这是 chain-of-thought 的行动版。Action行动调用外部环境论文里是 Wikipedia API。Observation观察环境返回结果进入下一轮 Thought。ReAct 论文的核心贡献是证明双向增强推理引导行动reason to act——知道该查什么行动反哺推理act to reason——查回来的事实修正推理。在 HotpotQA/Fever 上ReAct 通过与 Wikipedia API 交互缓解了纯 chain-of-thought 的幻觉与错误传播在 ALFWorld/WebShop 两个交互环境上ReAct 分别比模仿学习和强化学习基线高出 34% / 10% 的绝对成功率仅用 1-2 个示例做 few-shot。今天你去用任何主流 AgentClaude Code、OpenAI 深度研究、各家编码 Agent其骨架仍是 ReAct——只是 Thought 藏进了模型的 reasoning 部分Action 变成了标准 tool_calls 协议第 2 课。3.3 Plan-and-Execute / Reflexion / Tree of Thoughts三条改进路线ReAct 是逐步反应式的每一步只看局部。它的三个已知弱点及对应改进范式弱点 1长任务漂移——走一步看一步目标容易丢。→Plan-and-Execute先规划后执行Plan: ① 查 X ② 查 Y ③ 对比 ④ 写结论 Execute: 逐步执行计划必要时 Replan规划与执行分离的思想来自 Plan-and-Solve promptingWang et al., ACL 2023, arXiv:2305.04091LangChain 将其工程化为 Plan-and-Execute agentPlanner大模型一次性出完整计划 Executor小模型逐步执行 Replanner失败时重规划。优点大模型调用次数少、长任务不漂移、大小模型分工省钱代价计划可能过时需要 replan 机制兜底。弱点 2失败不复盘——错了就错了下次还错。→Reflexion语言化反思Trial 1: 尝试 → 失败测试不过 Reflect : 失败因为没处理空输入下次要先做边界检查 Trial 2: 带着反思文本重试 → 通过ReflexionShinn et al., NeurIPS 2023, arXiv:2303.11366提出verbal reinforcement learning不更新权重把失败教训写成文字存入 episodic memory作为下一轮的上下文。名场面HumanEval 编程基准上 Reflexion 达到 91% pass1超过当时 GPT-4 直接生成的 80%。这是Agent 自我改进最简单可行的形态第 12 课深入其局限。弱点 3单链探索——一条路走到黑不能回头。→Tree of Thoughts思维树ToTYao et al., NeurIPS 2023, arXiv:2305.10601把推理组织成树每步生成多个候选thought用模型自评做启发式剪枝配 BFS/DFS 搜索支持回溯。Game of 24 任务上 GPT-4 CoT 成功率 4%ToT 达 74%。代价是调用次数暴涨每个节点都是一次推理生产 Agent 中多用于离线难题求解而非在线循环。一图总览四范式范式决策时机核心机制强项弱项ReAct每步Thought-Action-Observation 交替通用、实时纠偏长任务漂移、贵Plan-and-Execute开局先出全计划再执行省大模型、目标稳计划过时需 replanReflexion失败后文字反思入记忆重试自我改进需要明确失败信号ToT每步多分支生成-评估-搜索-回溯难题探索调用量爆炸3.4 从范式到产品2023-2026 的时间线2023 上半年AutoGPT/BabyAGI 引爆自主 Agent想象——但完成率惨淡暴露了规划与记忆的短板。2023-2024范式沉淀期。LangChain/LlamaIndex 把 ReAct/Plan-Execute 工具化OpenAI function calling 让 Action 标准化。2024-2025Anthropic《Building Effective Agents》2024-12-19给行业泼冷水又指路多数场景 workflow 足够Agent 用在刀刃上MCP 协议Anthropic 2024-11-25 开源发布统一工具接入。2025-2026编码 AgentClaude Code、Devin 类与深度研究 Agent 成为两类最先规模落地的形态多 Agent 编排、Agentic RL 成为前沿第 31 课。案例实战同一任务ReAct 与 Plan-and-Execute 的行为对比目标用一个真实信息检索任务观察两种范式的行为差异理解各自适用面。任务“查证珠穆朗玛峰的高度乘以 3.28084 后是否大于 25000 英尺”步骤一ReAct 风格轨迹基于第 6 课将实现的 mini agent工具search calculator此处展示轨迹形态Thought 1: 需要先获取珠峰准确高度。 Action 1: search(query珠穆朗玛峰 高度) Observation 1: 珠穆朗玛峰海拔约 8848.86 米2020 年测定。 Thought 2: 现在计算 8848.86 × 3.28084。 Action 2: calculator(expr8848.86*3.28084) Observation 2: 29031.6938424 Thought 3: 29031.69 25000结论成立。信息充分可以回答。 Action 3: finish(是约 29032 英尺 25000 英尺)步骤二Plan-and-Execute 风格轨迹Plan: 1. 检索珠峰高度米 2. 计算高度 × 3.28084英尺 3. 与 25000 比较并给结论 Execute step 1: search → 8848.86 米 Execute step 2: calculator → 29031.69 Execute step 3: 29031.69 25000 → 是 (全程无 Replan)步骤三对比分析——两种范式在本任务上结果一致差异在过程属性观察ReActPlan-and-Execute大模型调用3 次决策每次都带完整思考1 次规划 3 次轻执行中途改向能力强Thought 2 可临时换查法弱除非触发 replan可审计性轨迹即推理过程计划先行合规友好若 step 2 工具报错下一轮 Thought 立即处理需要显式 replan 分支结论两步就能完成的任务两者无差别任务一长10 步、或需要并行执行子任务Plan-and-Execute 的成本与稳定性优势才显现环境高度不确定、每步都可能改变策略的场景ReAct 的反应性更值钱。这也是第 22 课 orchestrator-workers先拆分再并行的选型逻辑。完整代码本课轨迹为示意基于第 6 课已实测的 mini_agent.py 运行形态整理2026-10-01 实测输出节选调用 search({query: 珠穆朗玛峰高度})→调用 calculator({expr: 8848.86*3.28084})→ 最终回答 29031.69 英尺。第 6 课提供可运行完整实现Plan-and-Execute 的编排思想在第 9 课的 orchestrator-workers 模式中展开。小结Agent 概念三代同堂符号主义给了分解与搜索强化学习给了循环与奖励LLM 给了通用语言决策核心。ReAct2022-10是 LLM Agent 的起点范式Thought-Action-Observation 交织推理与行动互哺。三大改进路线对症 ReAct 三弱点Plan-and-Execute 治漂移、Reflexion 治不复盘、ToT 治单链不回头。范式选择是成本/稳定性/反应性的三角权衡没有万能解产品化主线是workflow 优先Agent 点睛。本课的四范式将在第 5 课被装进四大件组件框架重新标注在第 9 课扩展为完整模式体系。扩展阅读 网络提示学术站 arxiv.org 境内多可直连慢其余评测/规范站需代理。详见总纲附录《国内网络访问与国产适配指南》。ReAct 原论文Yao et al., arXiv:2210.03629ICLR 2023https://arxiv.org/abs/2210.03629ReflexionShinn et al., arXiv:2303.11366NeurIPS 2023https://arxiv.org/abs/2303.11366Tree of ThoughtsYao et al., arXiv:2305.10601NeurIPS 2023https://arxiv.org/abs/2305.10601Plan-and-SolveWang et al., arXiv:2305.04091ACL 2023https://arxiv.org/abs/2305.04091LLM Agent 综述329 篇文献arXiv:2503.21460 https://arxiv.org/abs/2503.21460我的专栏蛋白 / 抗体 / 多肽 / 核酸分子模拟 / 动力学 / 对接药物 / 设计 / 案例AI / Agent / 大模型开源蛋白结构预测分子模拟基础小分子药物设计案例AI Agent系列开源蛋白生成方法实践分子动力学模拟-Amber蛋白药物设计案例化学大模型开源多肽设计模型分子动力学模拟-Gromacs多肽药物设计案例《AI Agent原理与实战》开源多肽性质预测分子动力学模拟-OpenMM开源小分子生成设计CADD中的机器学习模型DNA/RNA药物设计結合自由能高效计算配置《MCP 入门实战》siRNA药物设计模型UCSF DOCK系列我胡师兄说药《AI入门实战2026》ASO药物设计模型rDock系列 LeDock系列 gnina系列《经典机器学习实战》