网易首页 > 网易号 > 正文 申请入驻

腾讯AI Lab开源可复现的深度研究智能体,最大限度降低外部依赖

0
分享至

腾讯AI Lab 投稿
量子位 | 公众号 QbitAI

深度研究智能体(Deep Research Agents)凭借大语言模型(LLM)和视觉-语言模型(VLM)的强大能力,正在重塑知识发现与问题解决的范式。

然而,现有开源智能体框架多依赖付费工具,限制了可复现性和普适性。

腾讯AI Lab全新推出的Cognitive Kernel-Pro,一款全开源、多模块、层次化的智能体框架,为深度研究智能体的开发与训练提供了突破性解决方案。

在GAIA基准全集上,Cognitive Kernel-Pro超越开源免费框架SmolAgents,性能逼近依赖付费工具的智能体,展现出卓越的综合能力。在GAIA-text上,训练的8B模型超越WebDancer和WebSailor-7B。

相关论文排上当日HuggingFace热榜第一。

此外,腾讯AI Lab公开了Agent Foundation Model的训练配方,为社区提供可复现的训练路径。

相关技术报告及代码已开源于GitHub,详细链接可见文末。

全开源智能体框架

Cognitive Kernel-Pro以Python代码为动作空间,充分发挥现代LLM的推理和代码生成能力。

其核心设计包括以下四点。

1、模块化架构:框架采用两层多模块设计,包含主智能体和多个子智能体(如网页导航智能体、文件处理智能体)。主智能体负责任务分解和信息整合,子智能体专注于特定任务(如网页浏览、文件操作),确保模块独立性和扩展性。

2、状态管理与规划:通过“进度状态”(Progress State)机制,智能体能够记录已完成步骤、待办任务、历史经验和关键信息。这种结构化状态管理显著提升了复杂任务的处理效率。

3、标准化任务接口:主智能体与子智能体通过简洁的文本接口通信,子智能体以Python函数形式定义,输入任务字符串,输出格式化结果和日志,便于协作与调试。

4、测试时优化:框架引入反思机制(Reflection)和投票机制(Voting),通过评估和优化动作轨迹,提升任务完成质量。反思机制允许智能体审查和修正先前动作,投票机制则通过多轮轨迹比较选择最优结果,显著增强了网页浏览等高随机性任务的稳定性。

上表显示了Agent框架工具的使用和能力情况。

比较专有工具时,Google Search API(可以轻松切换到 DuckDuckGo 等免费 API)被排除在外,它是搜索相关任务的必备功能。

注:WebDancer 和 WebSailor 主要关注Web Agent,支持 PDF 获取和简单处理,但缺乏通用文件Agent功能。

许多现有智能体框架依赖付费工具,增加了使用成本并限制了广泛应用。而Cognitive Kernel-Pro框架尽可能使用免费、开源工具,使用LLM的python代码生成能力和理解能力对智能体任务进行处理。

创新训练方法

Cognitive Kernel-Pro不仅提供了强大的框架,还设计了全面的训练流程,覆盖网页导航、文件处理、代码生成和推理等多个领域。

关键创新包括:

  • 高质量Web Agent数据构建
  • 通过构造可验证的查询-答案对,结合中间过程提示和基于提示的拒绝采样,显著提升训练数据的质量和相关性.
  • Persona Hub数据增强
  • 利用Persona Hub生成多样化的合成查询,结合跨系统验证,增强训练数据的多样性和鲁棒性。
  • 推理数据优化
  • 对现有数据集(如NumiaMath、LogicCot、TACO)进行精细化处理,适配智能体任务格式,确保训练数据与实际应用场景一致。
  • 轨迹采样
  • 以GPT-4.1为骨干模型生成智能体轨迹,并通过相似度匹配进行拒绝采样,最大化训练数据的有效性。

性能优势

Cognitive Kernel-Pro在网页信息检索、文件处理和复杂推理等任务中表现出色,尤其在GAIA基准上超越SmolAgents,接近依赖付费工具的智能体框架。

相较于依赖Jina Reader、FireCrawl等付费工具的现有开源框架,Cognitive Kernel-Pro强调LLM和VLM的内在能力,最大限度降低外部依赖,实现真正的全开源。

上图的技术报告中对比了多个AI智能体框架,显示Cognitive Kernel-Pro在功能全面性和开源程度上具有显著优势。框架支持灵活切换免费API(如DuckDuckGo),进一步提升了可访问性。

上表展示了Cognitive Kernel-Pro与其他开源 Agent基础模型的性能对比。

Cognitive Kernel-Pro 在 GAIA-text基准测试中取得了优异的成绩,超越了WebDancer和WebSailor类似大小模型,体现了框架、模型训练方法的优越性。

首先,Cognitive Kernel-Pro是一个通用Agent框架,有更好的文件Agent、Code Agent的处理能力,在框架上比整体上是Web Agent的WebThinker、WebDancer、WebSailor要能处理更复杂的情况。

其次,在训练对应的开源模型CK-Pro-8B时,更通用、丰富的Agent数据被包含进训练集,共同提升了Agent基座模型的能力。

上表展示了测试Cognitive Kernel-Pro反思功能的消融实验。

更强的模型,例如GPT-4.1,可以提供更好的反思信号,但开源模型例如Qwen-3-32B已经能提供相当GPT-4.1的反思效果。

Cognitive Kernel-Pro的研究团队表示,未来工作将关注在将反思能力蒸馏到同一个Agent基座模型中。

GitHub:https://github.com/Tencent/CognitiveKernel-Pro
Arxiv:https://arxiv.org/pdf/2508.00414

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
52岁苏有朋给所有男星提了个醒:脸僵馒化不可怕,一股姨味才尴尬

52岁苏有朋给所有男星提了个醒:脸僵馒化不可怕,一股姨味才尴尬

鹿楠
2026-07-05 09:10:33
中国真实税率的另一种视角:增值税

中国真实税率的另一种视角:增值税

生命可以承受之轻
2026-07-03 16:18:06
我刚调任县长,中午在食堂吃饭,一个老同志拍桌子怒吼:瞎了眼吗

我刚调任县长,中午在食堂吃饭,一个老同志拍桌子怒吼:瞎了眼吗

千秋文化
2026-07-01 20:34:45
凌晨3点!世界杯重头戏,9.4万球迷见证 C罗大战亚马尔 CCTV5直播

凌晨3点!世界杯重头戏,9.4万球迷见证 C罗大战亚马尔 CCTV5直播

麦子的篮球故事
2026-07-04 13:36:23
媒体人:我们的国际影响力不再需要体育成绩来证明,所以归化没有那么迫切

媒体人:我们的国际影响力不再需要体育成绩来证明,所以归化没有那么迫切

懂球帝
2026-07-05 00:06:23
关店800家,连亏9个亿,“中国鞋王”日薄西山,创始人已倾家荡产

关店800家,连亏9个亿,“中国鞋王”日薄西山,创始人已倾家荡产

壹只灰鸽子
2026-07-03 13:35:04
驾校彻底凉凉!高考后为啥无人学车,不是孩子懒,是00后太清醒

驾校彻底凉凉!高考后为啥无人学车,不是孩子懒,是00后太清醒

生活魔术专家
2026-07-02 19:40:55
北大哲学系主任的毕业致辞火了:请原谅我不敢用堆砌起来的一组形容词来祝福你们

北大哲学系主任的毕业致辞火了:请原谅我不敢用堆砌起来的一组形容词来祝福你们

超级数学建模
2026-07-04 02:03:11
创非洲历史 摩洛哥连续2届进世界杯8强 造6大纪录 下轮欲复仇法国

创非洲历史 摩洛哥连续2届进世界杯8强 造6大纪录 下轮欲复仇法国

我爱英超
2026-07-05 03:54:40
世界杯一战封神!马雷斯卡钦点曼城新援,2000万白菜价捡顶级妖星

世界杯一战封神!马雷斯卡钦点曼城新援,2000万白菜价捡顶级妖星

澜归序
2026-07-05 06:27:45
头条世界杯|犯规绞杀阻挡不住法国,摩洛哥等来最好的试金石

头条世界杯|犯规绞杀阻挡不住法国,摩洛哥等来最好的试金石

澎湃新闻
2026-07-05 08:10:27
黄有龙澳洲赌债案落槌:2.8亿输光、2.7亿本金偿还、亿元利息主张

黄有龙澳洲赌债案落槌:2.8亿输光、2.7亿本金偿还、亿元利息主张

阿讯说天下
2026-07-02 09:56:50
“高考估分715查分299 女孩称试卷不是自己的”?四川绵阳市教体局核查:纯属谣言 查无此人

“高考估分715查分299 女孩称试卷不是自己的”?四川绵阳市教体局核查:纯属谣言 查无此人

闪电新闻
2026-07-02 12:26:25
里子面子都丢了!管不住下半身的任素汐,一场演唱会撕下她的体面

里子面子都丢了!管不住下半身的任素汐,一场演唱会撕下她的体面

日不西沉
2026-07-04 11:08:54
97%白人占比的阿根廷,为什么永远挤不进欧美“白人圈子”?

97%白人占比的阿根廷,为什么永远挤不进欧美“白人圈子”?

健身狂人
2026-07-05 06:06:40
联盟也有剧本?詹姆斯下家基本确定,后者已准备交易得到布朗尼!

联盟也有剧本?詹姆斯下家基本确定,后者已准备交易得到布朗尼!

你的篮球频道
2026-07-05 06:56:09
江苏一鸭血粉丝店被LV起诉,老板称实际侵权系隔壁餐吧;餐吧老板:修改多次仍被起诉,被索120万元判赔6万元,目前店铺已倒闭,无能力赔付

江苏一鸭血粉丝店被LV起诉,老板称实际侵权系隔壁餐吧;餐吧老板:修改多次仍被起诉,被索120万元判赔6万元,目前店铺已倒闭,无能力赔付

上观新闻
2026-07-05 08:04:37
名古屋亚运会还没开,日本主办方已经先急眼了

名古屋亚运会还没开,日本主办方已经先急眼了

阿振观点
2026-07-04 19:16:05
下个云南锗业?10元低价磷化铟+800G光芯片龙头 主力爆抢3亿筹码

下个云南锗业?10元低价磷化铟+800G光芯片龙头 主力爆抢3亿筹码

元芳说投资
2026-07-05 06:25:14
娃哈哈冰红茶测出甜蜜素遭美国扣押,该添加剂被当地禁用

娃哈哈冰红茶测出甜蜜素遭美国扣押,该添加剂被当地禁用

映射生活的身影
2026-07-03 19:55:02
2026-07-05 10:04:49
量子位 incentive-icons
量子位
追踪人工智能动态
12893文章数 176510关注度
往期回顾 全部

科技要闻

年费7.5万美元,美国富裕家庭把孩子送进AI学校

头条要闻

姆巴佩被巴拉圭队球员出拳击倒 进球后用不屑表情回应

头条要闻

姆巴佩被巴拉圭队球员出拳击倒 进球后用不屑表情回应

体育要闻

揭法国锋线最大优势 有人比姆巴佩还快?

娱乐要闻

王力宏成都舞台受伤 仍然坚持三小时

财经要闻

揭秘跨境“对敲”换汇黑产

汽车要闻

方程豹钛9内饰曝光 用上了长联屏设计/下半年上市

态度原创

手机
家居
旅游
游戏
房产

手机要闻

vivo X300系列还有新成员,什么时候发布是个问题

家居要闻

传奇筑 日常诗

旅游要闻

第二十一届广昌莲花旅游文化节开幕

玩家"反了"!大批退款GTA6/ps会员:别再装睡

房产要闻

总裁空缺17个月、现金缺口超1000亿:金融局“局外人”入局万科

无障碍浏览 进入关怀版