网易首页 > 网易号 > 正文 申请入驻

最强智能体Agent Q发布!Llama 3成功率飙升3倍,OpenAI神秘「草莓」遭截胡?

0
分享至

新智元报道

编辑:乔杨 好困

【新智元导读】初创公司MultiOn最近发布了号称「目前最强」的Agent Q,在真实的预订任务中可以达到95.4%的成功率。网友纷纷猜测其背后有OpenAI神秘的Q*项目加持。

没有等来OpenAI的Q*/草莓项目的发布,一家名为MultiOn初创公司却抢先发布了名为Q的智能体。

非常高兴地宣布我们过去6个月的工作——Agent Q现已上线!这是一个能够推理并搜索的自监督智能体框架,并可以通过互联网上的真实任务进行自我对弈和强化学习,实现自我纠正和自主改进!

更引起关注的是,MultiOn联创/CEO Div Garg在推特上提及Agent Q时,总不忘带上这个显眼的。

这引来了各路吃瓜群众的持续围观,有人猜测,Agent Q背后的大boss正是OpenAI的Q*项目。

不仅如此,MultiOn还给Agent Q开设了独立的推特账号,经常输出各种奇怪言论且「人机难辨」。

账号的背景图片以及基本信息更是处处碰瓷草莓,还直接粘贴了奥特曼之前发的自家花园草莓照片。

但神奇的是,这个神秘账号的关注者不乏各路大佬和KOL,包括Y-Combinator CEO Garry Tan、Quora CEO Adam D'Angelo、《纽约时报》专栏作家Kevin Roose、沃顿商学院AI教授Ethan Mollick,以及多名OpenAI职员。

甚至,奥特曼最近也主动开始和这个神秘账号互动,评论了它玩梗「AGI达到二级」的帖子。

MultiOn的这波操作究竟是纯粹炒作,还是配合OpenAI对Q*的宣传预热,就见仁见智了。

要么这将是迄今为止发布的最好的AI agent之一,要么Div Garg会因为牵扯上这次最糟糕的炒作而毁了公司的声誉。在人工智能社区中,这会适得其反。

撇开种种争议不谈,我们先来看看这个Agent Q究竟有多少技术含量。

根据CEO Div Garg的说法,Agent Q不仅有规划、推理能力,还有自我修复功能。他们仅用了一天的训练时间,就将Llama 3的零样本性能提升了340%,在真实世界的预订任务中由95.4%的成功率。

这是自主AI智能体在现实环境中做出复杂而可靠的决策的一大进步。

在官方发布的demo视频中,Agent Q可以执行的任务包括预订餐厅、会议、机票,其中都涉及多步的规划、推理、决策,以及与各种应用程序的交互。

虽然MultiOn的研究团队已经在官网上传了论文,但Agent Q还未开放试用,需要在等待名单中注册以申请内测机会。

论文地址:https://multion-research.s3.us-east-2.amazonaws.com/AgentQ.pdf

官网宣称,Agent Q今年晚些时候向MultiOn的开发者和用户开放。

技术解读

近年来,虽然LLM已经彻底颠覆了NLP领域并取得了显著成就,但在交互环境中仍面临重大挑战,尤其多步推理任务,比如网页导航。

当前依赖静态语言数据集的训练方法,不足以使这些模型适应动态的现实世界互动。

Agent Q的出现是AI智能体领域的一个重大里程碑,它结合了搜索、自我反思和强化学习,能够进行规划和自我修复。

通过引入一种新的学习和推理框架,Agent Q解决了之前LLM训练技术的局限性,使其能够实现自主网页导航。

Agent Q在执行预订任务时的步骤拆解

当前方法的问题

当前的方法,如在精心策划的专家演示上进行监督微调,通常在智能体多步任务上表现不佳,其原因在于累积错误和有限的探索数据,因此在动态环境中需要复杂决策和自适应学习时,就会产生次优策略。

Agent Q方法与构件

Agent Q结合了引导式蒙特卡洛树搜索(MCTS)和AI自我反思与迭代微调方法,同时利用直接偏好优化(DPO)等RLHF算法,使LLM智能体从成功和失败的轨迹中学习,提高多步推理任务中的泛化能力。

Agent Q的关键组件包括:

1. 基于MCTS的引导式搜索:通过探索不同的行为和网页自主生成数据,并在探索(exploration)和利用(exploitation)之间取得平衡。

MCTS使用较高的采样温度和多样化提示词来扩展行为空间,确保能收集到多样化且最优的轨迹。

2. AI自我批评:每个步骤中,基于AI的自我批评都能提供有价值的反馈,从而优化智能体的决策。这种步骤级反馈对于长周期任务至关重要,因为稀疏信号往往导致学习困难。

3. 直接偏好优化:DPO算法通过构建由MCTS生成数据的偏好对来微调模型。这种off-policy的训练方法允许模型从聚合数据集中有效学习,包括搜索过程中探索的次优分支,从而提高复杂环境中的成功率。

评估实验

基于xLAM-v0.1-r模型构建的用于模拟网上商店的任务中,agent需要进行搜索以找到特定商品。

虽然RFT、DPO和集束搜索等方法也能实现一定提升,但幅度不及AgentQ。

如果同时使用Agent Q和MCTS方法,任务成功率即可从28.6%提升至50.5%,相当于平均人类水平50%。

在Open Table的真实预订任务中,agent需要执行多个步骤,包括找到对应的餐厅页面、选择合适的日期时间、根据用户偏好选择合适的座位、提交用户的联络方式,最后完成任务。

这个复杂度比Webshop明显上了一个台阶。根据实验后的统计,完成Webshop任务的平均步骤为6.8,Open Table则翻了一倍,达到13.9。

由于Open Table并非模拟数据集,而是真实的在线环境,很难进行自动化评估,因此论文使用了GPT-4-V作为评估者,根据预先定义的指标对agent每个步骤的操作给予奖励值,并标记任务是否完成。

Agent Q将LLaMa-3的零样本成功率从18.6%提升至81.7%,分数提高比例达340%,而且仅经过了一天的自主数据收集。

加入在线的蒙特卡罗树搜索后,成功率还能进一步提高到95.4%。

虽然Agent Q在上述的评估实验中都表现出了强大的网页导航、搜索、推理和规划能力,但目前所用的方法仍存在许多讨论和改进的空间:

- 推理算法的设计:目前Agent Q的核心挑战在于较弱的推理能力,因此限制了探索和搜索的策略;此外,目前在训练agent策略时,批评模型(critic)处于冻结状态,对其引入额外的微调或许有性能增益。

- 由于MCTS之前在数学和编码任务上的成功经验,Agent Q首选MCTS用于搜索,但在真实环境中可能引起相当数量的有风险的交互行为。更改搜索策略可能是较为合适的选择。

- 在线安全与交互:目前Agent Q的实际允许很大程度上的自主探索、自我评估,人类干预的程度有限。但agent的操作仍可能出现不少错误,尤其是在电子邮件、支付、存档等关键任务中。

如果不解决安全问题,就会大大限制Agent Q实际可部署的任务场景,未来可能需要额外的安全性批评模型以及human-in-the-loop的训练设置。

参考资料:

https://x.com/rm_rafailov/status/1823462897751875701

https://x.com/ai_for_success/status/1823447309008490730

https://www.multion.ai/blog/introducing-agent-q-research-breakthrough-for-the-next-generation-of-ai-agents-with-planning-and-self-healing-capabilities

责任编辑:郜雪丹_NT5097

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
1948年大决战在即,毛主席突然下令枪毙手下大将:谁求情都不行

1948年大决战在即,毛主席突然下令枪毙手下大将:谁求情都不行

史之铭
2025-11-20 04:16:55
当死神望而却步!一种让女性活过90岁的药,你可能正在吃!

当死神望而却步!一种让女性活过90岁的药,你可能正在吃!

徐德文科学频道
2025-11-18 19:35:12
婚姻中窦骁更强势,打破何超莲对明星固有印象,因为几乎零绯闻

婚姻中窦骁更强势,打破何超莲对明星固有印象,因为几乎零绯闻

话娱论影
2025-10-21 10:01:44
罗志祥近况:已写好遗嘱,自认被黑惨了,向时间管理大师六字道歉

罗志祥近况:已写好遗嘱,自认被黑惨了,向时间管理大师六字道歉

叨唠
2025-11-19 03:22:18
我在泰国地下娱乐城,一晚花5万,多数是中国女孩,很难忘

我在泰国地下娱乐城,一晚花5万,多数是中国女孩,很难忘

程哥历史观
2024-01-02 13:38:18
没条件别硬演,45岁霍建华用不修边幅的演技告诉内娱,如何演中偶

没条件别硬演,45岁霍建华用不修边幅的演技告诉内娱,如何演中偶

娱乐故事
2025-11-19 23:23:41
演员张艺洋已执行死刑!中国娱乐圈首例,倪大红、李雪健被牵连

演员张艺洋已执行死刑!中国娱乐圈首例,倪大红、李雪健被牵连

阿纂看事
2025-07-25 17:12:19
台军老兵叮嘱儿子:如果两岸开战,一枪干掉让你冲锋的长官!

台军老兵叮嘱儿子:如果两岸开战,一枪干掉让你冲锋的长官!

浩渺青史
2025-11-17 16:56:51
网友曝光蔡徐坤上学时的照片!我的妈呀!他以前长这样?

网友曝光蔡徐坤上学时的照片!我的妈呀!他以前长这样?

动物奇奇怪怪
2025-11-20 00:54:43
全市预警再升级!天津检出流感新毒株H3N2!多所学校班级开启线上教学!

全市预警再升级!天津检出流感新毒株H3N2!多所学校班级开启线上教学!

天津族
2025-11-19 07:35:46
云南考编大军奔赴广西 车站熙熙攘攘场面壮观

云南考编大军奔赴广西 车站熙熙攘攘场面壮观

七彩云南简南俊
2025-11-18 21:49:46
贝森特突然通知中国,感恩节前不签稀土协议,美国将对华发起报复

贝森特突然通知中国,感恩节前不签稀土协议,美国将对华发起报复

通文知史
2025-11-18 20:00:03
日媒忧虑:高市政权无人当得起“中日桥梁”

日媒忧虑:高市政权无人当得起“中日桥梁”

参考消息
2025-11-19 14:42:06
岛内讨论“一国两制”台湾方案,国台办回应

岛内讨论“一国两制”台湾方案,国台办回应

参考消息
2025-11-19 12:56:05
前线报道:乌克兰精锐无人机部队在波克罗夫斯克(红军村)对俄军造成巨大伤亡

前线报道:乌克兰精锐无人机部队在波克罗夫斯克(红军村)对俄军造成巨大伤亡

柯义在乌克兰
2025-11-19 13:49:51
哈里首次公开场合怼梅根,是不是不想再忍了?

哈里首次公开场合怼梅根,是不是不想再忍了?

优趣纪史记
2025-11-19 15:26:59
蔡正元重磅批郑丽文,称中国国民党以后改名为“中国国民投降党”

蔡正元重磅批郑丽文,称中国国民党以后改名为“中国国民投降党”

文史旺旺旺
2025-11-18 20:19:06
长盈精密:公司在深圳松岗燕罗的机器人智能制造产业园预计于今年四季度投入使用

长盈精密:公司在深圳松岗燕罗的机器人智能制造产业园预计于今年四季度投入使用

每日经济新闻
2025-11-19 20:53:56
套现356亿全身而退,潘石屹夫妇狠狠给美国房地产上了一课

套现356亿全身而退,潘石屹夫妇狠狠给美国房地产上了一课

林子说事
2025-11-16 05:26:48
中国反制直击美国命门!日本挑衅反遭打脸,美国双航母被锁死

中国反制直击美国命门!日本挑衅反遭打脸,美国双航母被锁死

墨印斋
2025-11-20 04:32:53
2025-11-20 05:56:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
13908文章数 66278关注度
往期回顾 全部

科技要闻

一夜封神,Gemini 3让谷歌找回“碾压感”

头条要闻

日方要求解释为何未告知磋商后会有媒体拍摄 中方回应

头条要闻

日方要求解释为何未告知磋商后会有媒体拍摄 中方回应

体育要闻

世界杯最小参赛国诞生!15万人岛国的奇迹

娱乐要闻

史林子出轨对方前妻放锤!

财经要闻

重磅!中金公司拟收购东兴与信达证券

汽车要闻

此刻价格不重要 第5代帝豪本身就是价值

态度原创

数码
游戏
亲子
旅游
房产

数码要闻

猫头鹰黑化版散热器风扇来袭

我的小众XP,在“玩法正确”面前一无是处?

亲子要闻

爸爸就是最大的危险

旅游要闻

金槐染晋南!六百年移民史诗,洪洞大槐树藏着亿万人的根!

房产要闻

29.4亿!海南“地王”片区,要卖超级宅地!

无障碍浏览 进入关怀版