【AI】智能体经典范式 一个现代的智能体其核心能力在于能将大语言模型的推理能力与外部世界联通。它能够自主地理解用户意图、拆解复杂任务并通过调用代码解释器、搜索引擎、API等一系列“工具”来获取信息、执行操作最终达成目标。 然而智能体并非万能它同样面临着来自大模型本身的“幻觉”问题、在复杂任务中可能陷入推理循环、以及对工具的错误使用等挑战这些也构成了智能体的能力边界业界涌现出了多种经典的架构范式。ReAct (Reasoning and Acting) 一种将“思考”和“行动”紧密结合的范式让智能体边想边做动态调整。Plan-and-Solve 一种“三思而后行”的范式智能体首先生成一个完整的行动计划然后严格执行。Reflection 一种赋予智能体“反思”能力的范式通过自我批判和修正来优化结果。ReActReAct诞生之前主流的方法可以分为两类一类是“纯思考”型如思维链 (Chain-of-Thought)它能引导模型进行复杂的逻辑推理但无法与外部世界交互容易产生事实幻觉另一类是“纯行动”型模型直接输出要执行的动作但缺乏规划和纠错能力。ReAct的巧妙之处在于它认识到思考与行动是相辅相成的。思考指导行动而行动的结果又反过来修正思考。为此ReAct范式通过一种特殊的提示工程来引导模型使其每一步的输出都遵循一个固定的轨迹Thought (思考) 这是智能体的“内心独白”。它会分析当前情况、分解任务、制定下一步计划或者反思上一步的结果。Action (行动) 这是智能体决定采取的具体动作通常是调用一个外部工具。Observation (观察) 这是执行Action后从外部工具返回的结果例如搜索结果的摘要或API的返回值。智能体将不断重复这个 Thought - Action - Observation 的循环将新的观察结果追加到历史记录中形成一个不断增长的上下文直到它在Thought中认为已经找到了最终答案然后输出结果。那怎么判断循环是否结束呢在实际部署中系统不依赖模型的“主观感觉”来判断结束而是采用工程化硬截断策略显式终结动作预设 Finish 作为特殊行动模型输出该指令时即视为任务完成。最大迭代上限设置硬性轮次阈值通常为5-15轮作为安全兜底防止陷入死循环或消耗过量Token。结果同质化检测当连续两轮的观察结果高度相似语义相似度超过阈值时判定信息已穷尽强制终止。资源耗尽强制返回达到上限时将当前最完整的观察结果拼接后返回。Plan-and-SolvePlan-and-Solve Prompting 核心动机是为了解决思维链在处理多步骤、复杂问题时容易“偏离轨道”的问题。与 ReAct 将思考和行动融合在每一步不同Plan-and-Solve 将整个流程解耦为两个核心阶段规划阶段 (Planning Phase) 智能体接收用户的完整问题它的第一个任务不是直接去解决问题或调用工具而是将问题分解并制定出一个清晰、分步骤的行动计划。这个计划本身就是一次大语言模型的调用产物。执行阶段 (Solving Phase) 获得完整的计划后智能体进入执行阶段。它会严格按照计划中的步骤逐一执行。每一步的执行都可能是一次独立的 LLM 调用或者是对上一步结果的加工处理直到计划中的所有步骤都完成最终得出答案。ReflectionReflection 机制的灵感来源于人类的学习过程其核心工作流程可以概括为一个简洁的三步循环执行 - 反思 - 优化。执行 (Execution)首先智能体使用我们熟悉的方法如 ReAct 或 Plan-and-Solve尝试完成任务生成一个初步的解决方案或行动轨迹。反思 (Reflection)接着智能体进入反思阶段。它会调用一个独立的、或者带有特殊提示词的大语言模型实例来扮演一个“评审员”的角色。这个“评审员”会审视第一步生成的结果并从多个维度进行评估例如事实性错误是否存在与常识或已知事实相悖的内容逻辑漏洞推理过程是否存在不连贯或矛盾之处效率问题是否有更直接、更简洁的路径来完成任务遗漏信息是否忽略了问题的某些关键约束或方面 根据评估它会生成一段结构化的反馈 (Feedback)指出具体的问题所在和改进建议。优化 (Refinement)最后智能体将再次调用大语言模型要求它根据反馈内容对最初的结果进行修正生成一个更完善的结果。