
作者:IPLEX知识产权法律事务所 金容德专利代理师
让AI智能体浏览网站、查找信息、点击按钮并在失败后调整路径,需要连续的行动、观察与判断,不同于一次性回答问题。过程中可能出现误点击、重复操作或过早放弃。
.
Agent Gym-RL的论文正是针对这个多回合决定问题. 研究者提出了将环境,代理人,和学习算法分开的综合强化学习框架,并将其与"放大Inter-RL"结合,在学习之初短暂地限制互动的次数,然后逐渐增加. 论文的核心信息很简单。 与其从一开始就给予代理人长的行动自由,不如让代理人通过短的任务学习基本知识,然后扩大行动范围,这样可能比较稳定.
一句总结. AgentGym-RL是一个综合框架,通过在各种现实世界环境中的在线强化学习来训练LLM代理,而放大Inter-RL是通过逐步增加互动的最大数量来提高长期探索能力,同时减少初始学习衰减的一种方法.
1. 三分钟后看报纸
第一,问题的出发点是,现有的LLM强化学习集中在一个单一的响应任务上,在需要多种行动和观测的代理任务中,它缺乏环境多样性,学习稳定性,以及长期的互动支持.
为了解决这个问题,AgentGym-RL将Environment,Agent,和训练分开,通过一个标准化的服务器客户端结构和平行的推出,将网络,搜索,游戏,内涵和科学环境连接为一个学习管道.
在学习方面,缩放Inter-RL设定了初始小互动的最大数量,并随着学习阶段的进展而增加允许的数量. 一个可靠地学习熟悉行为,然后允许更长时间探索的课程.
研究实验结果,论文的7B型机车记录了BabyAI 96.67,TextCraft 91.00,SciWorld 57.00,WebArena 26.00,以及Deep Search 38.25. 然而,它并没有在所有任务中击败商业模式,而且每项任务的优劣是不同的.
然而,通论主要在同一系列环境中被验证,物理现实环境和多代理学习仍然是未来的任务. 在一些科学任务和网络导航中,始终观察到程序错误和过度互动。
2. 关键词要先知道
LLM代理是一个系统,语言模型不仅生成句子,而且还调用工具,观察环境,选择多步动作.
多回合强化学习是学习,根据由多种行动和观察构成的整个轨迹更新政策,而不是一个单一的答案.
互动视野是一集中一个代理能够与环境互动的最大次数. 为了便于理解,本条也称其为动作或交互长度的最大数量.
探索和开发涉及尝试新的行为路径,而开发则涉及重复已经学会的行之有效的行为。两者的平衡直接影响到强化学习的稳定。
" 推出 " 是指将代理人置于一个真实环境中的过程,其现行政策是收集包括行动、观察和奖励在内的轨迹。
POMDP是一种决策模式,代理商不能直接看到整个环境状态,必须仅根据一些观察来决定其下一步的行动. 它对于你一步一步地查看网页或游戏屏幕的情况很有效.
GRPO是一种强化学习方法,它在同一任务中生成多个轨迹,然后利用组内的相对性能来更新策略.
重要表述摘要. 论文中的“无SFT从零开始学习”并不意味着对语言模型本身进行随机初始化的预训。 将这一点解读为将Qwen2.5系列的预学或定向学习模型作为起点,但使用环境奖励来学习代理的行为,而不事先使用代理任务的专家轨迹对地图进行微调,则更为准确.
3. 为什么对现有的人工智能人员来说 强化学习很困难?
3.1 单一反应强化学习和多回合代理学习之间的差异
在提交一次答案的任务中,如数学问题或代码问题,只能因最终正确答案的准确性而得到奖励. 另一方面,在网页浏览或科学实验中,中间动作会改变链条中的下一个状态. 一个错误的点击可以改变您随后的整个观察,您初始动作的效果可以在以后出现几个转折. 这增加了发放信贷以确定哪些行动有助于长期轨迹的成功的问题。
随着相互作用数量的增加,可能的行动路径会爆炸. 如果你不够探索,你只会重复简单的捷径,反之,如果你从一开始就允许过多的探索,学习可能会因为毫无意义的行动和高度差异而崩溃. 论文将这两个极端分别作为短固定地平线的性能上限和长固定地平线的学习衰减.
3.2 没有综合框架,试验本身就困难重重
每个环境都有不同的行为指令,观测格式,重置方法,以及奖励计算. 网页浏览器处理标签和按钮,TextCraft使用编译命令,BabyAI进行空间移动和门操纵. SciWorld需要测量温度,连接电路和混合化学品等程序动作. 要将它们连接到一个单一的强化学习代码中,环境接口,平行执行,错误恢复,和资源组织必须标准化.
AgentGym-RL不仅涉及研究思想,还涉及长期推出过程中出现的工程瓶颈. 论文解释,它解决了WebArena的多浏览器执行,SciWorld的平行初始化,TextCraft和SciWorld的内存泄露,以及一集结束后的完整初始化等问题. 在长期的代理学习中,这种系统稳定性与算法本身一样重要.

图1 图1:按模型大小对五个代理任务的业绩和总体准确性进行比较. 资料来源:习近平等人,p. 2. 国家
图1的左侧显示五个环境的每个环境的性能,右侧显示模型参数尺度与整体精度之间的关系. 论文强调,7B规模的强化学习模式与更大的开源模式竞争,在一些环境中,得分高于商业模式. 然而,不可能从右侧的图上一个点概括出所有实际能力,必须看到每个基准的评价方法和任务组成是不同的.
4. AgentGym-RL框架的结构如何?

图2 图2:AgentGym-RL整体结构,分为Environment,Agent,和训练模块. 资料来源:习近平等人,p. 3 (简体中文).
4.1 环境单元
环境被包装为一个独立的服务器,代理请求观察,检查可用的动作,执行动作,并通过基于HTTP的客户端重置. 这种结构的优点是,即使网络环境,搜索环境和游戏环境有不同的内部执行,代理和学习模块也可以通过共同的界面访问.
论文中包含的五种情景是:WebArena用于现实的网络导航,Deep Search用于利用搜索引擎进行多层次信息探索,TextCraft用于基于文本的制作游戏,BabyAI用于一个网格世界中包含的任务,SciWorld用于进行科学实验和程序.
4.2 代理模块
Agent模块封装接收观察、进行推理并生成下一步动作的循环。其提示词策略、采样设置、奖励函数,以及长期规划和自我反思机制均可扩展。核心是将智能体的推理逻辑与具体环境的实现细节分离。
4.3 培训单元
培训模块分批收集平行环境中的轨迹,计算日志概率和参考模型概率,并进行惠益估计和政策更新。 论文解释,PPO,GRPO,RLOO,和REINFORCE++作为在线强化学习算法支持,SFT,DPO和拒绝采样也作为辅助学习方法支持.
1. 同步初始化多个任务和环境客户端.
2. 每个代理根据当前观测结果生成一个动作.
3. 环境触发了行动,并回报了新的观察和奖励.
4. 将您的动作和观察作为轨迹保存到剧集结束.
5. 根据收集到的轨迹计算优势估计,并更新策略参数。
6. 将环境重新设置为初始状态,并重复下一次推出.
简单类比:驾驶学校. 环境与道路和信号系统类似,Agent与驾驶学员类似,Training更接近于查看驾驶记录并更改下课计划的教练. 通过将道路与学生和教练分开,如果增加一条新的道路,一个不同的学生模式,或者改变分级,你不必重建整个系统.
5. 核心主张:ScalingInter-RL逐步增加动作数量

图3 纸图5:放大Inter-RL,在短视中学习基础,然后扩展至长视. 资料来源:习近平等人,p. 8. 与《公约》第8条有关的事项
5.1 为什么不从一开始就允许长期互动
如果在尚未了解环境基本规则的早期阶段给代理人大量动作,那么这些额外的计算无法保证会导致有益的探索. 您可能反复按同一按钮, 在您已经浏览过的页面之间前后移动, 或者调用与任务无关的工具 。 这种轨迹增加了奖励分散和信贷分配困难,使政策更新变得不稳定。
相反,如果行动的数量持续固定,解决稳定但复杂的任务的机会就不足。 代理人可能只能适应简单的成功道路,可能无法学习规划,反射,反向跟踪等长期行为模式.
5.2 逐步扩展地平线
缩放Inter-RL使用单调增加最大交互次数作为h1,h2,h3的课程. 在早期阶段,一个小的交互预算允许高效地使用基本动作,经过一定的学习期后,最大转弯次数会增加,以允许更长的导航路径.
1. 初始阶段:可靠地学习简单的任务和短期的基本工具使用.
2. 中间阶段:增加互动次数,以便在失败后恢复、改变路线和进一步检索。
3. 后期:增强规划,反射等复杂行为,以及远期的战略回溯.
4. 每个阶段的推出都是由当前政策产生的,因此随着代理商能力的增强,任务难度和搜索空间尺度会一起增长.
从专利的角度来说,只有一行。 广义的课程学习可能是一个已知的概念。 在权利要求中,与其简单地表达困难,不如专注于一个特定的控制结构,通过将政策更新与奖励相结合,限制政策多回合推出中的最大互动次数,并抑制学习崩溃。
6. 关键学习曲线显示: 长转速但可以分解

图4 论文图7:固定10个转弯,固定5个转弯的奖励和实际互动次数比较,以及深度搜索中的缩放Inter-RL. 资料来源:习近平等人,p. 12个。
在左侧的图中,一个允许从一开始最多10个转弯的设置会给予最初的奖励,这些奖励会迅速上升,但随后在大约150个学习步骤后迅速崩溃. 最大5个回合的设置相对稳定,但后来的性能停滞. 缩放Inter-RL起初保持短互动,并逐渐增加转弯次数,最终达到最高的奖励.
右侧的图显示了实际使用的互动次数. 扩大的RL在培训开始时大约开始4个转弯,在培训的后期增加到6个以上。 换句话说,它是一种不仅拥有大片最终视野的结构,而且依次根据代理人的学习状态给予探索自由.
论文声称的技术效果。 它可以减少高度差异,积累不正确的行动,虚假的工具呼叫,以及早期探索长视野导致的重复行动,同时提供足够的互动预算以解决后期的复杂任务. 论文将这一点解释为勘探与开发,学习稳定性,以及提高计算效率之间的平衡.
7. 实验是在什么环境下进行的?
实验环境由五种不同的类型组成,从网页浏览到科学程序不等. 每种环境都有共同之处,即代理人必须多次行动,并收到反馈来选择下一步行动,但他们评价它们的能力不同.
WebArena是一种网络导航方案,它通过点击按钮,搜索,以及网页导航来评价你实现目标的能力,跨越购物,论坛,GitLab,地图,和CMS.
深度搜索(Deep Search)是一种深度搜索的情景,它反复调用搜索引擎,评价其结合来自多个来源的信息回答一个问题的能力.
TextCraft是一个数字游戏情景,它评估了您在类似Minecraft的文本环境中收集材料和进行多步工艺的能力.
BabyAI是一个包含的挑战情景,它评估了您在网格世界中打开大门、移动和到达目标物体的能力。
SciWorld是一种科学挑战方案,它评估你进行诸如温度测量,检测导电性,寻找生物体,以及操纵材料等程序实验的能力.
主要骨干为Quen2.5-3B和Quen2.5-7B. 比较目标包括GPT-4o,OpenAI o3,双子座2.5 Pro等商业模型,以及Quen,Llama,DeepSeek等开源模型. 评价数字是论文选择的任务集,最大互动次数,以及采样设置的结果,不应直接转换为一般产品性能排名.

图5 图6:WebArena、Deep Search、TextCraft、BabyAI和SciWorld的学习奖励趋势。 资料来源:习近平等人,p. 10个
学习奖励曲线在所有五个环境都显示出上升趋势,但形状不同. TextCraft和BabyAI的回报率相对较快,而WebArena和SciWorld则高度波动. 这符合论文的解释,即在一个有明确规则和反馈的封闭环境中,强化学习更容易找到一条成功的路径,在现实的网络或复杂的科学程序中,噪音和行动空间会变得更大.
8. 在不夸张的情况下读取关键实验结果
在WebArena中,Quen2.5-7B录制了9.76,AgentGym-RL-7B录制了22.00,放大Inter-7B录制了26.00. 缩放Inter-7B在绝对分数上超过了基准模型+16.24.
在"深度搜索"中,Quen2.5-7B录制了18.75,AgentGym-RL-7B录制了34.00,"放大Inter-7B"录制了38.25. 缩放Inter-7B在绝对分数上超过了基准模型+19.50.
在TextCraft中,Quen2.5-7B记录了42.00,AgentGym-RL-7B记录了89.00,AssemblyInter-7B记录了91.00. 缩放Inter-7B在绝对分数上超过了基准模型+49.00.
在BabyAI中,Quen2.5-7B记录66.67,AgentGym-RL-7B记录92.22,AssemblyInter-7B记录96.67. 缩放Inter-7B在绝对分数上超过了基准模型+30.
在SciWorld中,Quen2.5-7B录得1.50分,AgentGym-RL-7B录得50.50分,AssemblyInter-7B录得57.00分. 缩放Inter-7B在绝对分数上超过了基准模型+55.50.
以上总结的标准模型为文中描述的Quen2.5-7B-Instruct. 每种环境的改进是“缩放Inter-7B”和基准模型之间的绝对分数差。 最大的改进见于SciWorld和TextCraft,两者都有相对明确的规则和成功条件,都有通过试训和错误学习的强烈信号.
8.1 WebArena:与商业模式竞争,但不是最好的
缩放Inter-7B在WebArena记录了26.00的整体,超过了GPT-4o的16.00,接近双子座2.5 Pro的28.00. 然而,它没有达到OpenAI o3的34.00和o4-mini的36.00. 差距依然存在,特别是在GitLab和Reddit子任务方面。 因此,“7B型战胜了WebArena的所有商业型号”的说法是不准确的。
8.2 深度搜索:强,但不如o3
缩放Inter-7B为38.25,超过GPT-4o 26.75和双子座2.5 Pro 36.50,但低于OpenAI o3 49.50和o4-mini 42.50. 它以52.00的成绩在NQ中录得最高分,并以70.00的成绩在TriviaQA中获得最佳分数,但总体平均值与顶级推理模型留有差距.
8.3 TextCraft和BabyAI:长期行为学习的力量
在TextCraft中,AdvancedInter-7B以91.00超过了GPT-4o的83.00,并且是记录到33.33的少数模型之一,即使在最困难的深度4中也是如此. BabyAI在论文中所有模型中的总得分最高,为96.67分. 这表明,互动的升级可以在有明确的行为规则和成功回报的环境中有效发挥作用.
8.4 SciWorld:最大的改进和最明显的限制同时出现
在SciWorld,缩放Inter-7B为57.00,大大超过了OpenAI o3的41.50. 这是由于根据Quen2.5-7B计算,比1.50增加了55.50分. 然而,所有模型在化学混合任务中都得分为0. 准确进行科学程序和实验性诊断失败原因的能力仍未解决。
阅读数字时要记住的事. 这些结果是论文具体评价样本的性能,工具界面,最大转弯次数,以及采样次数. 并不是数字直接证明模型的一般知识,安全性,实际的网络服务兼容性,或向新环境的可转移性.
9. 哪个强化学习算法效果更好?
在3B模型中,TextCraft录制了GRPO 75.00和REINFORCE+ 28.00,BabyAI录制了GRPO 93.33和REINFORCE+ 70.00,深搜索录制了GRPO 25.75和REINFORCE+ 13.25.
在7B模型中,TextCraft录制了GRPO83.00和REINFORCE+73.00,BabyAI录制了GRPO92.22和REINFORCE+84.44,Deep Search录制了GRPO34.00和REINFORCe+24.00.
在论文中,GRPO在所有三项任务和两个模型天平上的得分都高于REINFORCE++. 研究者解释道,在长期轨迹中只使用全集的回报和很少的奖励,可以产生巨大的差异,而使用组内相对表现的GRPO则提供了更稳定的学习信号.
然而,这种比较仅限于论文选择的超参数和环境. 将算法优越或自卑普遍化需要进一步核实相同的计算量,相同的样本数量,以及不同的奖励密度和模式家族.
10个 测试时的计算量是否提高了性能?

图6 纸图8:在深度搜索和SciWorld中增加最大交互次数时,精度的变化. 资料来源:习近平等人,p. 17号.
准确性一般随着深度搜索中互动次数从2转增至10转,而SciWorld中互动次数则从10转增至30转而增加. 学习的代理人甚至以更少的转弯来超过基准模型,并随着转弯次数的增加而保持其优越性. 这表明代理人的测试时间计算不仅可以用内部推理符表示规模,还可以与现实世界环境进行额外的互动.

图7 纸图9:Pass@K性能在增加平行标本K时会发生变化. 资料来源:习近平等人,p. 17号.
Pass@K,它并行生成多个轨迹,并检查是否有人成功,也随着样本数量的增加而增加. 论文报告说,在64个样本中,强化学习模型在深度搜索和SciWorld7.05分的成绩都比基线模型高出5.5分. 然而,这种方法可以大大增加实际服务的成本和延误,因此产品设计需要在成功率和计算预算之间保持平衡.
11个 案例分析:强化学习有什么变化?

图8 图10:WebArena基本模型和RL模型动作轨迹比较. 资料来源:习近平等人,p. 19. 第19条:
基本模式未能利用这样一个事实,即在匹兹堡论坛订阅受欢迎文章的任务中,尽管多次点击同一文本元素,屏幕并没有改变. 另一方面,强化学习模式通过浏览错误的页面成功,然后按以下顺序采取行动:返回,搜索论坛,选择搜索结果,确认订阅按钮.
本案中的重要变化不仅仅是增加知识。 完善行动政策,利用环境反馈识别故障,切换到不同路径,检查终止条件. 从专利说明书的角度来看,有余地将这种错误恢复、重复行为抑制和目标实现状态确定作为单独的附属条件或补偿工业设计。
12. 报纸到底证明什么 和它没有证明什么
范围由论文直接证明. 多回合在线强化学习管道可在五种数字环境下运行. 从短视向长视向扩展的方法显示学习曲线比固定转弯设置更稳定. 3B和7B模型比基准模型大大改进,跨越了多种剂基准。 测试性能可以随着相互作用的增多和平行样本的增多而增加.
范围尚未得到充分证明。 全面化和向全新的环境,工具和奖励结构转移,真实世界的物理机器人或具有较长工作时间和安全限制的实际服务,多代理协作/竞争,以及与人们的联合决策,都需要额外的核查. 此外,本文件不只支持这一结论,即在所有商业模式中,在所有评价条件下,这种模式始终是优越的。
这一点必须加以批判解读。 虽然论文中的性能比较非常令人印象深刻,但每种环境的评价样本和界面数量不同,一些网络任务排除了状态变化操作. 此外,在某些环境中,例如BabyAI和SciWorld,“不良商业模式”的结论十分有力,但未能达到WebArena和Deep Search中的最佳商业模式。
13. 从专门研究人工智能专利的专利代理师的角度看发明点
以下是从论文公布内容中得出的专利实践角度的解释. 必须通过针对具体国家的法律原则和对专利和非专利文献的单独搜索来确定实际的新颖性、创新步骤、权利范围和侵犯的可能性。
13.1 将发明概念分为五层
发明概念可分为五层. 核心算法是一种多回合强化的学习方法,随着学习的进展,它逐渐增加代理与环境相互作用的最大数量. 系统结构以模块框架为前提,将环境,代理,和培训分开,并通过标准化的服务器-客户界面将其连接起来,数据流可以描述为在平行环境中收集轨迹并通过计算奖励和日志概率来更新政策的政策学习管道.
稳定技术的核心是控制通过限制初始偏差和短视野的非生产性探索来减少学习崩溃,然后扩展至长视野,操作技术可以被概括为通过调整测试时的相互作用数量和平行样本数量来管理成功率和计算预算的一种方法.
13.2 最强的维权候选人是 " 扩大国际权利联盟 "
虽然AgentGym-RL的模块化结构是实用的,但分离环境,代理,和学习者并在HTTP上连接的概念本身很可能被广泛应用于软件框架. 另一方面,结合强化学习阶段增加最大互动次数并抑制长固定视野初始学习崩溃的结构是论文最明显的实验点.
然而,如果你声称课程学习概念宽泛,即“从简单的任务发展到困难的任务”,就很有可能与现有技术相冲突。 权利要求必须披露一个特定的控制变量的组合,称为互动视野、政策轨迹生成、终端奖励或轨迹奖励、政策更新、步骤过渡条件和最大转弯增加。
14. B. 从企业和产品角度看的影响
AgentGym-RL的直接应用是需要多种动作和环境反馈的产品,例如网络任务自动化,搜索代理,游戏代理,虚拟机器人,以及科学实验助理. 特别是在服务方面,成功所需的行动数量因用户和任务而异,重要的是设计一种根据难度和可靠性调整互动预算的设计,而不是固定.
在生产阶段,你不仅需要优化最高成功率,还需要优化环境呼叫成本,浏览器会话次数,耐久性,重复动作率,错误回收率,以及安全关闭条件. 论文的测试时间缩放结果表明,更多的转弯和样本可以提高性能,但实际服务需要动态政策,以反映计算预算的限制.
实际影响。 AI智能体的竞争力并不仅仅取决于模型参数的数量. 它如何与环境互动,将失败转化为学习信号的奖励设计,以及决定何时增加行动预算的操作政策,可以和模型大小一样重要的知识产权点.
15. 文件的局限性和后续研究问题
1. 虽然印地语的性能很高,但其对完全新环境和新工具的概括化能力还没有得到充分的验证.
2. 多数挑战仍然在数字模拟方面,长期挑战依然存在,包括现实世界的物理限制和传感器噪音。
3. 目前的框架侧重于单一代理人,多智能体协作和竞争是未来的研究课题.
4. SciWorld的化学混合物失败了所有模型,一些科学任务导致程序错误,学生试图用记忆中的事实而不是实验来回答.
5. 在WebArena中,过度交互问题依然存在:即使已经到达目标页面,仍会进行不必要的点击和滚动。
6. 该文件提出了披露代码和数据的计划,但实际可复制性需要单独确认披露和执行环境的范围。
7. 互动视野过渡规则需要更加自动化和在理论上合理。
16岁。 结论
AgentGym-RL将LLM代理强化学习视为一个连接各种环境的综合系统问题,而不是单个基准的代码. 最引人注意的部分是 " 扩大内部RL " 。 一开始,当代理方尚未获得基本技能时,行动自由受到限制,随着政策更加稳定,互动时间会延长,以提高长期决策能力.
实验结果表明,即使是小的7B模型也能与更大得多的模型竞争,并有相应的后续强化学习和测试时间的相互作用. 同时,WebArena和Deep Search之间的空隙,科学程序错误,以及过度的相互作用,都清楚地揭示出代理智能还没有完成.
从专利的角度来看,关键不是“将强化学习应用到AI智能体中”这一广义概念,而是在长期推广过程中解决高度差异和学习衰减的技术问题,并逐步控制相互作用的视野的具体结合。 今后,根据奖励统计和政策稳定性自动调整地平线,在测试时优化成本,可能成为一种更强大的技术区分。
结论:强大的AI智能体可以先学习以较短步骤完成任务,再逐步接受更长路径的探索训练。
本文基于发表时的情况撰写。如需就具体事项咨询,请联系IPLEX。
