
作者:IPLEX知识产权法律事务所 金容德专利代理师
AI智能体是当前人工智能领域的热门概念,但定义范围很广:有人用它指具有搜索功能的聊天机器人,也有人将其限定为能够规划任务并调用多种工具的系统。近期研究还涉及记忆更新、经验学习以及多智能体之间的角色分工。
这篇综述以智能体推理为统一视角,梳理上述概念。它将模型与环境持续交互时的规划、行动与学习共同纳入推理过程,而不止于一次文本生成。论文并未提出单一新模型,而是对截至2025年的相关研究进行系统整理。
三个核心要点:第一,智能体推理将思考与行动连接起来;第二,论文将其分为基础推理、自演进推理和多智能体协同推理;第三,同一能力既可在推理时通过提示词与工作流实现,也可通过强化学习或微调学习到模型中。
论文基本信息
论文“Agentic Reasoning for Large Language Models”是一篇智能体推理领域的综述,作者包括Tianxin Wei、Ting-Wei Li、Zhining Liu等,涉及伊利诺伊大学厄巴纳-香槟分校、Meta、Amazon、Google DeepMind、加州大学圣迭戈分校和耶鲁大学等机构。论文于2026年1月18日以arXiv v1发布,梳理规划、工具、搜索、反馈、记忆、自演进、多智能体、应用、评测基准及未来挑战。其价值在于整合研究脉络与设计选择,而非通过实验验证某个新算法。
1. 论文的整体框架
论文图1概括了整篇综述:上方展示用户提出任务、智能体解决问题并将经验迁移至其他任务的流程;中间说明从传统大语言模型推理到智能体推理的变化,包括静态输入转向动态上下文、被动生成转向交互,以及固定预训练状态转向持续演进。

图1:智能体推理的整体框架
来源:Tianxin Wei等,Agentic Reasoning for Large Language Models,图1,第2页。
图中下方分为四部分:基础智能体推理涵盖规划、工具使用与网络搜索;自演进智能体推理涵盖反馈、记忆与自演进;多智能体协同推理涵盖角色分配、协作与共同演进;应用与评测则涉及医疗、金融、法律、教育、机器人、科学、软件、游戏及网络等领域。
可以这样理解:普通聊天机器人侧重回答当前问题;智能体系统更像项目管理者,需要确认目标、拆解任务、查找资料、执行工具,并在结果不符合要求时重新规划。
智能体不宜仅理解为“能够调用工具的聊天机器人”。论文讨论的推理还包括观察什么、下一步如何行动、如何解释失败、应保留哪些经验,以及向其他智能体传递哪些信息。
2. 普通大语言模型推理与智能体推理的区别
普通大语言模型通常接收一组提示词,通过一次或数次生成给出回答。即使采用思维链或比较多个候选答案,若模型不实际影响外部环境,其计算过程仍相对封闭。
在智能体推理中,输出会成为改变下一次输入的行动:搜索返回新资料,代码执行产生结果或错误,网页操作改变界面状态。智能体据此修订计划并继续行动。因此,跨步骤的状态管理与错误恢复,与单次回答质量同样重要。
两者在输入、计算方式、外部连接、状态管理、错误处理和目标上有所不同。普通大语言模型通常依赖固定提示词,执行一次生成或有限的内部搜索,不直接操作外部环境,并围绕当前对话管理状态。发生错误时,主要通过重新生成回答处理,目标通常是给出可信的答复。
智能体推理则以随行动结果变化的动态上下文为输入,反复进行思考、行动、观察与修订。它可连接搜索、API、代码、浏览器或机器人,同时管理外部记忆、任务及环境状态;遇到错误时,通过验证、回滚、重新规划或更换工具恢复,最终在环境中实现目标状态。
因此,智能体推理不等同于思维链。思维链可延长内部计算,而智能体推理将内部判断与外部行动连接成反馈闭环。计划写得长并不意味着能力更强;及时发现错误并恢复至正确状态,可能更为关键。
3. 基础智能体推理:规划、工具使用与搜索
基础智能体推理关注单个智能体在复杂但相对稳定的环境中完成目标所需的能力。规划确定缺失的信息,搜索补充信息,工具执行实际行动,三者在系统中紧密衔接。
3.1 规划:将目标转化为可执行步骤
规划不只是列出待办事项,还包括判断当前状态、选择下一步、评价中间结果,并在必要时调整计划。论文将相关方法分为工作流设计、树搜索、形式化、任务分解、外部工具利用及奖励设计。

图2:大语言模型智能体规划方法的分类
来源:同文,图2,第11页。
- 工作流设计:划分感知、推理、执行与验证等步骤,明确各阶段的任务。
- 树搜索:将不同选择展开为分支,结合路径评价进行深度优先或广度优先搜索。
- 形式化:以代码、状态机、图结构或逻辑表达式表示计划,而非仅使用自然语言。
- 任务分解:将复杂目标拆分为子目标,明确相互依赖关系及执行顺序。
- 外部工具利用:在规划中结合知识图谱、搜索、世界模型、计算器及代码执行器等工具。
- 后训练:通过奖励期望行为,使规划能力逐渐内化至模型中。
产品实现中,失败处理规则往往比宏大的计划更重要。例如,付款前出现错误后,是重试、回到最近成功状态、请求用户确认,还是更换付款方式,都应有明确规则。状态转换与恢复流程直接影响智能体的实际质量。
3.2 工具使用:通过外部能力弥补模型局限
语言模型在实时信息、精确计算、内部数据和现实网络操作方面存在局限,搜索API、数据库、计算器、代码执行器及业务系统可提供补充。但工具越多,越需要判断何时选用哪种工具、如何构造正确参数,以及如何处理失败结果。

图3:传统大语言模型与智能体工具调用系统的区别
来源:同文,图3,第15页。
图左侧的传统大语言模型无法直接调用外部工具,可能受知识过时或计算误差影响。右侧的智能体系统根据问题选择工具、检查调用结果,并在信息不足时再次选择。关键在于选择、调用、观察与重新选择的循环。
常见失败包括调用不存在的工具、参数错误、将错误消息误判为成功,以及重复无效调用。因此,应同时设计工具接口模式校验、调用前检查、超时与重试限制、权限控制及结果来源说明。
3.3 搜索:主动获取所需信息
传统RAG通常按预设方式检索一次,再根据文档生成回答。智能体搜索则在各步骤判断是否需要搜索、搜索什么、结果是否充分,以及是否继续检索,使搜索成为推理过程的一部分。

图4:静态RAG与智能体搜索系统的比较
来源:同文,图4,第18页。图中节选了与本文说明相关的部分。
以专利现有技术检索为例,结果过多时,智能体可增加分类号或申请人条件;结果过少时,则扩展同义词或上位概念。它还应核查文献是否披露全部关键技术特征,而不只是汇总若干搜索结果。
论文区分了三类方法:在推理时通过提示词组织搜索、通过微调或强化学习学习搜索行为,以及结合知识图谱等结构化信息源。三者可根据系统需求组合使用。
4. 自演进智能体推理:反馈、记忆与能力扩展
基础智能体侧重完成当前任务,自演进智能体则利用已有经验改善下一次行动或任务。反馈帮助识别问题,记忆则使经验能够用于后续判断,两者构成自演进的重要基础。
4.1 反馈:识别并纠正错误路径

图5:智能体反馈的三种形式
来源:同文,图5,第21页。
论文将反馈分为三类:推理时反思,在不改变模型参数的情况下检查并修订回答或计划;参数适应,利用已验证轨迹或偏好数据,将改善后的行为学习到模型权重中;基于验证器的反馈,通过单元测试、约束检查器或模拟器判断成败,并在失败时重试。
三者的区别在于反馈如何保留并发挥作用。反思通常影响当前对话,参数适应可带来更长期的行为变化;验证器即使不能详细解释失败原因,也能筛选可验证的结果,尤其适用于代码生成等验证成本较低、判断标准明确的任务。
4.2 记忆:关键在于选择与组织
智能体记忆并不只是长期保存完整对话。系统需要决定记录哪些信息、如何概括与组织、何时检索,以及何时删除过时信息。

图6:智能体记忆设计的三个维度
来源:同文,图6,第24页。图中节选了与本文说明相关的部分。
第一个维度是如何在当前提示中利用对话、摘要、工作流与历史执行轨迹;第二个维度是结构化记忆,例如用图结构保存实体关系或联合处理图像、音频与文档;第三个维度是将记忆的写入、更新、删除及检索本身作为学习对象。
记忆的主要风险在于错误累积:错误事实进入长期记忆后,可能反复影响后续任务;不同用户的信息混入同一记忆,还可能引发隐私或越权问题。因此,应记录来源、创建时间、可信度、访问权限、失效条件及修改历史。
4.3 自演进:调整规划、工具与搜索方式

图7:规划、工具与搜索的自演进方式
来源:同文,图7,第28页。图中节选了与本文说明相关的部分。
自演进不止于修改一次回答。智能体可比较成功与失败,生成练习任务、调整规划策略,或在现有工具不足时编写新的代码工具;也可记住常用信息源,改进检索路径。
不过,不应将自演进理解为系统像人一样自主设定目标与价值观。现有研究多在有限环境中,利用既定反馈更新记忆或策略。系统仍需明确哪些部分可以修改、修改是否获得授权,以及如何撤销不当变更。
5. 多智能体推理:角色、协作与集体记忆
复杂任务可由多个智能体分工完成,例如分别负责规划、搜索与结果验证。论文将这种协作结构归纳为多智能体协同推理。
5.1 角色设计:协作不等于重复相同提示词

图8:多智能体的一般角色与特定领域应用
来源:同文,图8,第30页。
典型角色包括协调者、执行者、评审者、记忆管理者及通信协调者。它们分别负责目标分解与进度管理、搜索与代码执行及文档生成、错误与风险检查、长期知识整理,以及信息格式与共享范围的控制。
以法律工作为例,接收任务的智能体整理事实,专业分析智能体检索法律与判例,验证智能体检查引文及逻辑一致性。但角色命名本身不会提高准确性,还需明确输入输出格式、责任范围、停止条件与交叉验证方式。
5.2 协作结构:顺序、层级、角色分工与动态生成

图9:推理时协作与基于后训练的协作
来源:同文,图9,第34页。
推理时协作通过提示词或工作流安排智能体的顺序与角色。顺序结构由后一步承接前一步结果;层级结构由中央协调者管理子智能体;角色结构预先划分专业职责;动态生成结构则由大语言模型按任务组织工作流。
基于后训练的协作,利用数据或奖励优化各角色提示词、智能体连接关系及下一调用对象的选择策略。其中的难点是贡献归因:即使最终答案正确,也不容易判断此前搜索或反证分别贡献了多少。
5.3 共享记忆:多个智能体共享什么?

图10:多智能体记忆设计的四个维度
来源:同文,图10,第40页。图中节选了与本文说明相关的部分。
多智能体协作使记忆设计更复杂。论文从结构、拓扑、内容与管理四个维度分析:结构可为层级式或扁平式;拓扑涉及集中式或分布式存储;内容可侧重事实或程序;管理则涉及摘要、遗忘、过滤与验证。
共享越多,信息越充分,但通信成本和错误传播风险也越高;隔离过度又可能缺少必要上下文。企业场景应结合个人信息、商业秘密与部门权限,区分共享和私有记忆,并记录信息来源及访问历史。
6. 推理时设计与后训练的区别
论文也按能力实现的阶段,区分推理时方法与后训练方法。二者可根据成本、灵活性和稳定性组合使用,并非只能二选一。
推理时方法保持模型权重不变,通过提示词、检索、工作流和外部记忆调整行为,便于快速修改并接入现有模型,但可能增加提示长度、调用成本及执行波动。它适合规则频繁变化或仍在试验阶段的产品,典型实现包括规划提示词、检索循环、记忆检索、验证与重试。
后训练方法通过强化学习、监督微调和偏好学习,将行为模式内化至模型权重。它有助于重复任务中的一致性与效率,但需要训练数据和奖励设计,更新成本也更高,适用于大规模重复任务或特定环境优化,例如工具调用微调、搜索策略强化学习及记忆控制学习。
实务中,可先以推理时方法验证工作流,再将反复出现的成功模式整理成训练数据,逐步转入后训练。全部依靠训练会增加修改成本,全部依靠提示词则可能提高词元开销与延迟。
一种混合设计是:通过训练稳定工具选择与调用格式,通过外部记忆和规则管理最新业务要求及用户条件,并由验证器或人工审批控制高风险操作。
7. 应用场景与评测基准
7.1 主要应用领域

图11:智能体推理的代表性应用
来源:同文,图11,第43页。图中节选了与本文说明相关的部分。
论文涉及数学推理与编程、科学发现、机器人与具身智能体、医疗、网页导航及自主研究。不同领域的约束不同:代码智能体重视执行与测试,医疗智能体重视证据与责任审查,机器人智能体重视物理动作安全及实时响应。
- 数学与编程:重点包括问题分解、代码执行、测试、错误修复及代码仓库层面的长期任务。
- 科学发现:提出假设、规划实验、调用工具、评价结果,再据此迭代实验设计。
- 机器人与具身智能体:将语言目标与空间感知、实际动作连接起来,持续应对环境变化。
- 医疗:关注专业角色协作、证据检索、患者状态记忆及安全决策支持。
- 网页探索与自主研究:在多个网站和工具之间核实信息,并形成较长篇幅的综合成果。
7.2 应当评价哪些能力?

图12:智能体推理评测基准的范围
来源:同文,图12,第65页。
只看最终正确率,可能遗漏重要失败。即使答案相同,不必要的重复调用、错误记忆或危险操作也会影响产品价值。论文整理了工具使用、记忆、规划、多智能体等能力基准,以及机器人、科学、医疗和网页等应用基准。
实际评测除任务成功率外,还可关注步骤准确率、工具调用成功率、重试次数、平均耗时、词元与API成本、错误恢复率、记忆污染率、引文准确率、人工干预次数及危险操作阻断率。智能体由多个组件组成,仅看总分难以定位问题。
8. AI专利实务视角
专利分析首先应区分智能体推理这一宽泛概念与具体实现。规划、工具、检索、记忆和协作已有大量研究及开源框架,仅列出这些要素,并不足以说明技术上的独特性。
值得关注的是解决实际产品瓶颈的具体结构,例如工具反复出错、长期记忆累积错误、协作通信成本过高、用户信息泄露给其他智能体,或长期任务丢失中间状态。技术问题越明确,越有助于确定保护重点。
8.1 值得关注的技术领域
可从六个领域展开分析。规划与状态控制关注长期任务中的错误积累和恢复成本,应说明状态表示、步骤转换条件、检查点、回滚范围及重新规划规则。工具编排关注工具选择错误、无效参数、重复调用及权限滥用,对应实现包括接口模式规范化、调用前校验、动态路由、按错误码恢复、权限控制与沙箱。
智能体搜索需处理无效检索、证据不足及文献矛盾,重点包括检索触发条件、查询改写、来源可信度、信息充分性与停止条件。记忆控制则关注记忆污染、重复存储、用户信息混杂与检索延迟,涉及记录准入、摘要与结构化、可信度与失效管理、删除与修正、访问权限及来源追踪。
多智能体协作需通过角色分配、通信拓扑、信息压缩、共同奖励、分歧协调及贡献评价,降低通信成本、职责重叠和集体错误。治理与审计则关注长期操作的责任追踪及风险控制,包括操作记录、规则检查、审批步骤、按风险分配权限、中断恢复与可复现审计。
8.2 技术差异在于运行条件,而非组件名称
仅列出智能体、规划器、记忆与验证器,容易停留于功能描述。需要进一步说明:在何时、根据哪些输入与状态作出判断,更新何种数据结构,以及失败后如何恢复。
明确状态表示:说明当前目标、已完成步骤、未验证条件、工具结果、可信度与权限状态如何管理。
明确触发条件:用数值或规则说明何时进一步检索、重新规划、请求人工批准或更新记忆。
明确数据流:说明各模块接收哪些信息,并以何种格式传递给下一模块。
衡量技术效果:采用可复现指标,例如调用次数、延迟、内存占用、错误恢复率及危险操作阻断率。
保留替代实现:结合集中式与分布式、规则驱动与学习驱动、单智能体与多智能体等实现方式,应对技术与市场变化。
结语:从语言模型到行动系统
大语言模型的发展并不只是生成更长的回答,而是逐步形成能够理解目标、制定计划、选择工具与信息、记住行动结果、从失败中恢复,并在必要时与其他智能体协作的系统。
能力增强也带来更高的系统设计要求。连续错误操作可能比一句错误回答造成更大影响,因此状态管理、验证、授权、审计、记忆质量控制及中断恢复,与性能同样重要。
专利分析也应从具体问题出发:识别实际产品中反复出现的技术瓶颈,说明解决问题的数据流与控制规则。智能体系统的竞争力不仅取决于模型名称,也取决于支持其安全、高效行动的系统架构。
本文基于发表时的情况撰写。如需就具体事项咨询,请联系IPLEX。
