模型定位为可“端到端完成复杂工作”的智能体,核心能力分为四大类
一、基础基座能力
- 超长上下文:上下文窗口达105万词元,最大输出长度12.8万词元,可一次性处理整本书、大型代码库、全量项目文档
- 多模态输入:支持文本+图像输入、文本输出;知识截止时间为2026年4月30日
- 可调推理强度:支持low/medium/high/xhigh/max五档推理深度,可按需平衡效果与算力消耗
![]()
二、专业领域核心能力
1. 软件工程:全链路代码编写、调试、重构、项目搭建能力,可直接执行代码并返回结果,独立处理复杂多文件工程项目
2. 科研与数学:FrontierMath Tier 4 v2得分97.6%,可解决前沿开放数学问题,自主完成包含代码、终端工具的完整科研工作流
3. 办公生产:可按照用户提供的模板和格式要求,自动生成规范的文档、电子表格、演示文稿,完成多步骤串联的办公流程
4. 网络安全:OpenAI首个达到“关键”级网络安全能力的模型,在获得授权的前提下,可在防护严密的系统中发现未知安全漏洞,并开发对应利用方案
![]()
三、Agent 智能体能力(核心突破)
这是本次最大升级,模型从“回答问题”进化为“操作电脑完成工作”:
- 可自主操作浏览器、系统终端、本地软件,执行网页搜索、文件检索、数据整理等跨软件多步骤任务
- 支持复杂任务自动规划与执行,无需人工分步指令,端到端直接交付可用成果
- 在完全陌生的环境中具备极强的自主探索与规则学习能力,ARC-AGI-3测试得分99.9%,远超上一代模型
![]()
四、基准测试表现(能力佐证)
- ARC-AGI-3(陌生环境推理):99.9%
- ExploitBench(漏洞利用):100%
- FrontierMath Tier 4 v2(前沿数学):97.6%
- Terminal-Bench 4.0(终端操作):57.9%
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.