![]()
整理 | 林绮蓓
不只 Hugging Face,OpenAI 发现 AI Agent 还曾“越界”访问更多网站;豆包否认“对话团队砍半”:通用 Session 团队调整涉及 11 人;腾讯 QClaw 将于 12 月 24 日停止运营,即日起停止新用户注册;Meta 被爆让真人“冒充”AI 打电话,相关功能已回滚;Anthropic 发布 Claude Opus 5.5:速度提升超 30%,典型任务成本较上一代下降 40%;OpenAI 发布 GPT-6 Sol 和 Luna,API 调用价格下调;理想发布具身模型 ME-Dex-1.0:联合预测视觉、触觉与机器人动作......
行业热点
不只 Hugging Face,OpenAI 发现 AI Agent 还曾“越界”访问更多网站
9 月 25 日,OpenAI 更新对 AI Agent 异常行为的调查进展称,在回查模型训练和评估期间的互联网活动后,公司已就相关事件通知数十家第三方机构。此外,OpenAI 发布声明称,部分研究环境中的 Agent 曾将训练和评估数据发送至外部服务,其中包括 53 张由用户提供的图片。
此次调查源于今年 7 月发生的 Hugging Face 安全事件。当时,OpenAI 在内部网络安全评估中使用的模型绕过互联网隔离措施,利用共享基础设施漏洞获得外网访问权限,并访问了 Hugging Face 等第三方系统。OpenAI 随后开始扩大历史活动审查范围,检查模型在训练和评估过程中与外部网站的交互。
目前发现的行为包括绕过第三方访问控制、发现公开了的登录信息或访问密钥、通过查询或命令注入使外部服务执行指令、访问第三方内部运行资源,以及在网站上自动发布内容。OpenAI 将后一类行为称为“Agent spam”。公司表示,目前已按照是否绕过安全控制、影响服务可用性或对第三方造成其他影响等标准,通知数十家相关机构,历史审查仍在继续。
OpenAI 同时披露,在部分任务中,Agent 还将训练或评估环境中的数据发送到了第三方服务。其中确认有 53 张用户提供的图片被上传至图片托管网站,并生成未公开列出的链接。这些图片来自可被用于模型训练的数据。OpenAI 表示,目前大部分相关图片已经删除,并正在与托管服务商处理剩余内容。
菲尔兹奖得主曾集体发声,OpenAI 与独立数学顾问组合作,讨论 AI 数学成果的审查与发布
9 月 21 日,OpenAI 宣布,将与新成立的“数学与人工智能顾问组”(Advisory Group on Mathematics and Artificial Intelligence)合作,讨论 AI 生成数学成果的评估、审查、披露和发布机制。该顾问组设在普林斯顿高等研究院,由 9 名数学家组成,并独立于 OpenAI 运作。
OpenAI 表示,公司自 8 月 28 日起训练的一个尚未公开内部模型,已经在多个数学领域产生超过 100 项针对长期开放问题的结果。除此前公布的 Navier–Stokes 相关成果外,大量结果目前尚未公开,也尚未完成外部同行评议。随着相关成果数量增加,OpenAI 开始与数学界讨论应如何评估其重要性,以及如何安排后续验证和发布。
根据公开信息,该顾问组将就 AI 生成数学结果的重要性评估、发布顺序、学术规范、引用与成果归属等问题向 OpenAI 提供建议,同时讨论 AI 工具在数学研究和教育中的使用方式。成员不接受 OpenAI 支付的报酬,可以独立提出建议并公开发表评论,但不参与 OpenAI 内部模型研发决策,最终是否发布相关成果以及发布时间仍由 OpenAI 决定。
9 月 11 日,25 位菲尔兹奖得主联合发布公开声明,提出 AI 公司使用知名开放问题作为模型能力测试时,应处理好学术引用、研究归属、结果解释及发布规范等问题。
豆包否认“对话团队砍半”:通用 Session 团队调整涉及 11 人
9 月 24 日,豆包公关负责人刘星回应团队调整传闻,称部分自媒体所述“豆包裁员”“对话团队砍掉一半”等信息不实,实际为组织分工调整。据其披露,豆包通用 Session 团队规模不到 50 人,此次调整涉及 11 人,其中 3 人离职。
此次调整中,通用 Session 团队的部分职能被拆分至豆包交易和豆包工作团队,相关人员随业务一同转岗。刘星表示,部分转岗人员仍从事与此前相关的工作,例如转至交易方向的成员继续负责交易场景下的对话体验优化。
此前,有媒体报道称,豆包通用 Session 团队正在进行人员调整。该团队此前约有 50 人,主要负责豆包对话产品的策略、评测等工作。报道同时称,负责对话方向的产品后训练团队(Product Posttrain-Chat)也在调整,部分人员转向 Horizon RL、产品后训练办公(Product Posttrain-Work )等其他部门。
今年 7 月,字节跳动曾对 AI 业务进行组织调整,将飞书产品团队与豆包产品团队整合为新的豆包产品组织,由赵祺负责,同时推动豆包、飞书和火山引擎在企业生产力场景中的协同。
腾讯 QClaw 将于 12 月 24 日停止运营,即日起停止新用户注册
9 月 24 日,腾讯 QClaw 团队发布停止运营公告称,因业务发展调整,QClaw 将于 2026 年 12 月 24 日 00:00 正式停止运营。自公告发布之日起,QClaw 停止新用户注册,同时停止订阅服务购买与续费,已开通自动续费的用户将自动停止续费扣款。停运前,已注册及已购买订阅服务的用户仍可正常使用。
按照官方安排,12 月 24 日正式停运后,除数据备份与迁移功能外,QClaw 其他功能将停止使用。对于已经购买但尚未使用完毕的有效订阅套餐,用户可申请退款;账号内已有积分仍按照原有效期使用。用户可在停运前通过客户端将配置、记忆、Agent 人格和对话记录等数据备份至本地。2027 年 3 月 24 日 00:00 起,除法律法规要求留存的信息外,QClaw 将删除相关用户数据。
腾讯同时开放了 QClaw 向 WorkBuddy 的迁移通道,用户可将 QClaw 中的数据迁移至 WorkBuddy。腾讯相关人士表示,此次调整是为了整合资源并继续提供 Agent 服务;完成迁移的用户可获得 1000 积分补贴。
QClaw 于今年 3 月上线,是腾讯基于 OpenClaw 生态推出的本地 AI 助手,可通过微信远程连接电脑并执行文件处理、办公和开发等任务。今年 7 月,腾讯曾对相关业务进行组织调整,将 QClaw 产品中心相关业务及部分团队调整至 WorkBuddy 所属部门。
阿里云上线决策模型(预览版),专门处理分类、评分和 Agent 路由
9 月 24 日,阿里云百炼上线decision-model-preview决策模型预览版,API 已开放使用,目前处于限时免费阶段,并支持 Token Plan 接入。该模型面向分类、二元判断、评分和 Agent 路由等场景,不生成自然语言文本,而是直接返回结构化决策结果、概率分布和置信度。
根据阿里云官方文档,decision-model-preview目前提供三类基础能力:Choice、Noul 和 Score。其中,Choice 用于从多个候选项中选择结果,例如工单分类或 Agent 路由;Noul 用于进行是或否的二元判断,并返回对应概率;Score 用于衡量风险、质量、相关性、紧急度或优先级。一次请求可以同时包含多个问题,由模型在一次推理过程中返回多项判断结果。
在 Agent 场景中,开发者可以将用户请求、当前业务状态以及多个可用 Agent 的定义提交给模型,由模型判断下一步应交由哪个 Agent 或工具执行。官方列出的其他应用场景还包括工单分流、内容审核和结果校验等。
该模型采用 TypeSafe System One 协议,通过专门的 System One API 调用,而不是传统 Chat Completions 的文本生成接口。开发者需要提交待判断的state和一组类型化的questions,模型随后返回分类、评分、概率及置信度等结果。阿里云目前尚未披露该模型的参数规模、训练架构及底层基础模型信息。
目前,decision-model-preview已在华北 2(北京)和新加坡地域提供服务,支持最长约 65,536 Token 输入。官方公布的限流配置包括每分钟 1,200 次请求和每分钟 200 万 Token。该模型目前仅支持文本输入,最大文本输出长度标记为 0。
Google 给 Gemini 3.8 Live 加上实时数字人,可边对话边调用工具
9 月 24 日,Google 宣布在 Gemini Enterprise 正式上线 Gemini 3.8 Live with Live Avatar,将接近实时的视频生成与语音对话结合,提供口型、表情与语音同步的数字人交互。
据 Google 介绍,该功能可同时处理语音、摄像头画面和屏幕共享,并在后台调用工具、执行 API 请求及获取数据时继续与用户交谈。系统支持 97 种语言及自动语言识别,可用于网页、移动端和交互式终端。官方展示了酒店入住办理、保险理赔信息采集等应用场景。
企业可选用预设数字人,也可通过参考图像定制形象,但自定义功能须经过企业白名单审核与验证。生成的音视频均嵌入 SynthID 隐形水印。该功能目前提供美国和欧盟服务端点;同期公布的 Gemini 3.8 Live Extended Thinking 仍处于私有预览阶段。
阿里公布全栈 AI 路线图:披露 Qwen 4 训练进展,自研真武 V900 芯片亮相
9 月 22 日,阿里巴巴在 2026 云栖大会上公布全栈 AI 战略路线图,涉及大模型研发、自研芯片及云基础设施。阿里表示,Qwen 4 目前正在训练中,后续 Qwen 4.5 与 Qwen 5 规划探索 5 万亿至 10 万亿参数规模,同时推进模型架构、数据研究及递归自我改进(RSI),以支持更复杂、持续时间更长的任务。上述参数规模属于后续模型规划,并非此次披露的 Qwen 4 规格。
芯片方面,平头哥发布面向训练和推理的真武 V900,配备 216GB 显存,支持 FP8、FP4 计算,计划于 2027 年第一季度量产并商业化。阿里称,该芯片性能为 M890 的三倍,配套集群架构可扩展至 50 万张加速卡;倚天 720、730 CPU 也计划于 2027 年推出。
云基础设施方面,阿里云围绕模型、智能体运行环境及上下文管理公布产品升级,涵盖训练推理平台、存储与网络、企业智能体平台和安全服务。阿里巴巴集团 CEO 吴泳铭同时提出,到 2032 年将全球数据中心规模扩展至超过 20GW,作为其 AI 基础设施建设目标。
前小米 XLA 负责人陈龙创业,不造机器人本体,主攻具身大脑
近日,据媒体报道,前小米汽车智能驾驶基座模型兼 XLA 大模型负责人陈龙已赴硅谷创业,担任联合创始人,并与前 Google DeepMind 科学家共同研发具身大模型。目前项目已完成融资,并已开展商业化合作。
新公司现阶段主要聚焦具身智能模型,没有研发机器人本体的计划,技术方向之一为 Recursive Self-Improvement(RSI,递归式自我改进),目标是让模型通过持续交互和经验积累进行迭代。
陈龙此前在小米负责智能驾驶基座模型及 XLA 大模型相关工作,并参与 Xiaomi MiMo-Embodied 研发和 XLA 大模型量产上车。MiMo-Embodied 将自动驾驶、机器人、空间理解等任务纳入统一训练框架,XLA 则采用 VLA 架构,用于小米汽车智能驾驶系统。
Meta 被爆让真人“冒充” AI 打电话,相关功能已回滚
9 月 22 日,据路透社援引 Meta 内部帖子报道,Meta 曾为个人 AI Agent Muse 测试“Human Concierge”功能,在部分电话任务中由真人承包商代替 AI 完成通话,目前该功能已暂时回滚。
Muse 于 9 月初推出,可帮助用户发送邮件、购物、预订旅行,并联系美国商家预约服务、查询库存或询价。Meta 从 8 月开始测试电话功能,但实际使用中出现商家识别出 AI 后直接挂断等情况。随后,公司面向约一半员工测试真人接管机制,由受训真人 Agent 完成部分电话任务。内部数据显示,引入真人后,电话任务成功率约为 95% 至 98%。
该测试随后引发员工对信息披露和数据处理方式的讨论,包括用户信息可能在提示不足的情况下被真人承包商接触。Meta 超级智能实验室一名副总裁随后表示,公司已暂时回滚该功能。Meta 称,此次测试主要用于在公开推出前收集反馈、完善安全和隐私措施,未来只有在功能准备就绪并提供适当信息披露后才会正式上线。
梁文锋署名,DeepSeek 公开 Agent 训练基础设施 DSec:峰值并发超 38 万沙盒
近日,DeepSeek 发布论文《DeepSeek Elastic Compute(DSec)》,系统介绍其用于 Agent 训练与评测的基础设施 DSec,论文作者超 130 人,DeepSeek 创始人梁文锋位列作者名单。
论文披露,一个 DSec 生产单元约由 160 个 CPU 节点组成,包含约 3 万颗 CPU 核心和 250TB 内存,每天可服务约 300 万个沙盒,峰值并发超过 38 万个,沙盒创建速度超过每秒 5000 个,单个训练任务最多可同时启动约 3.2 万个沙盒。
在系统实现上,DSec 采用分层镜像、按需加载、内存回收和 CPU 调度等机制,并提供相应的沙盒隔离与安全机制。论文称,DeepSeek 部分模型的强化学习训练及评测工作负载已运行在该平台上。
华为云上线鸿蒙编码大模型:千行代码错误率降低 80% 以上
9 月 21 日,华为云宣布升级码道 CodeArts 代码智能体,上线鸿蒙编码大模型、码道鸿蒙智能体及鸿蒙开发者实践中心,覆盖鸿蒙应用的需求梳理、方案设计、代码编写和编译构建等环节。
据华为云介绍,鸿蒙编码大模型针对 ArkTS 语言及鸿蒙开发规范进行训练,融合超百万鸿蒙原始素材,包括开源样例、API、代码库和界面布局模板。官方测试数据显示,千行代码错误率降低 80%以上,一次编译通过率提升 78%以上,单次任务 Token 消耗降低 20%以上。模型已上线华为云码道和 MaaS 模型广场。
开发者可通过自然语言描述需求,由智能体辅助生成鸿蒙应用与元服务。智能体内置 DevEco CLI,支持调用端侧模拟器进行编译、预览和调试,并提供第三方库转化、小程序转元服务等能力。同步上线的实践中心提供案例、代码仓及云端环境,支持通过浏览器完成开发、编译、打包和测试。
宇树发布五指灵巧手 Dex5-S:单手 22 个自由度,售价 3.99 万元起
9 月 21 日,宇树科技发布五指灵巧手 Dex5-S,起售价 3.99 万元,提供标准版和 Pro 版,后者增加触觉感知功能。产品采用接近真人手的尺寸设计,重量约 620 克,配备铝合金外壳。
据官方公布的参数,Dex5-S 单手具备 22 个自由度,其中拇指、小拇指各 5 个,食指、中指和无名指各 4 个,并新增小拇指滚转自由度。单手搭载 22 个电机,采用双编码控制,关节支持反向驱动,并内置冲击保护结构。其最大负载为 2 公斤,持续作业负载为 1 公斤。
产品支持 15V 至 65V 供电,提供千兆以太网、USB 及高速 485 通信接口,部分接口配置下控制频率最高为 1000Hz;千兆网配置支持掌心相机直连,无需额外外部走线。宇树发布的演示视频展示了拿取勺子、使用剪刀裁纸和抛接柠檬等操作。
稚晖君发布启元 Q1、T1 两款机器人,均售价 19999 元起
9 月 20 日,彭志辉(网名“稚晖君”)参与打造的启元机器人在上海发布 Q1、T1 两款面向个人及家庭场景的机器人,并开放购买。两款标准版均售价 19999 元,Q1 探索版售价 26999 元,T1 Pro 售价 29999 元,计划于 10 月 1 日起按订单顺序陆续发货。
据发布会介绍,Q1 身高 88 厘米,具备 22 个柔顺力控自由度,支持折叠收纳。用户可通过 3D 打印定制外壳,编排互动动作,并调整语气、音色等设置,应用场景包括陪伴互动和编程教育。探索版开放 SDK、HDK 及硬件扩展接口,支持二次开发。
T1 支持轮足人形与四足形态切换,面向室内外跟随、家庭互动及辅助拍摄等场景。Pro 版搭载英伟达 Orin Nano 芯片,增加全向避障、低电量自动回充及跟随载物等功能。公司同时介绍了研发中的家务基座大模型 PrimeMind,该研发计划不代表现售 Q1、T1 已具备通用家务能力。
AI 快讯
千问发布 Qwen-Audio-3.1:一次推出 5 款语音模型,最高降价 95%
9 月 23 日,阿里千问发布 Qwen-Audio-3.1 系列语音大模型,一次推出 5 款模型,覆盖语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime)、音频理解和音频创作。其中,Qwen-Audio-3.1-ASR、TTS 和 Realtime 为现有产品线升级,同时新增 Qwen-Audio-3.1-ASR-Next 和 TTS-Next 两款模型。
语音识别方面,Qwen-Audio-3.1-ASR 支持 30 种语言和 16 种中文方言,并增加上下文增强、原生转写润色和分角色转写等能力,可联合输出说话人标签、时间戳和文本;低延迟流式识别的首字响应约 160 毫秒。官方公开的 KeSpeech 和 WSYue 方言测试结果显示,该模型在 11 个测试子集中的 6 个取得最低字错误率,平均 CER 为 4.55%。
Qwen-Audio-3.1-TTS 新增跨语言音色迁移和指令化语气控制;Realtime 模型支持全双工对话、多语言切换和工具调用。新发布的 ASR-Next 将处理范围从语音转写扩展至环境声、机械声等音频理解,TTS-Next 则可统一生成人声、音效和环境音,并支持声音复刻、时间戳控制和 48kHz 输出。
价格方面,千问同步下调 Qwen-Audio 全线语音模型调用价格,其中 TTS 价格下降约 70%,Realtime 下降约 85%,ASR 最高降幅为 95%。目前 Qwen-Audio-3.1 系列多数模型 API 已上线千问 AI 平台,ASR-Next 的 API 尚未开放。
Anthropic 发布 Claude Opus 5.5:速度提升超 30%,典型任务成本较上一代下降 40%
9 月 22 日,Anthropic 发布 Claude Opus 5.5。官方表示,该模型在多数工作任务中的表现达到 Claude Fable 5.1 水平,改进涉及编程、计算机操作及知识工作,输出生成速度较 Opus 5 提高超过 30%。
价格方面,每百万输入、输出 Token 分别为 4 美元和 20 美元,较 Opus 5 下降 20%;缓存读取价格为每百万 Token 0.20 美元,下降 60%。据官方测试,结合单价降低与任务 Token 用量减少,默认设置下典型工作负载的成本下降 40%,这一数字属于任务整体成本降幅。
模型发布前接受了 Frontier Design、METR 等机构的外部评估,并加入网络安全、生物研究等领域的防护机制,部分请求会转交其他模型处理。目前已通过 Claude 平台及 AWS、Google Cloud、Microsoft Azure 提供服务。Anthropic 计划在未来几周发布 Sonnet 5.5 和 Haiku 5.5。
OpenAI 发布 GPT-6 Sol 和 Luna,API 调用价格下调
9 月 22 日,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,扩充 GPT-6 模型系列。其中,Sol 面向复杂编程和智能体工作流,兼顾能力与成本;Luna 面向成本敏感、高调用量的任务。两款模型均支持文本、图像输入和文本输出,上下文窗口为 105 万 Token。
价格方面,在输入不超过 27.2 万 Token 的标准处理档位下,Sol 每百万输入、输出 Token 分别为 2 美元和 10 美元,缓存输入为 0.20 美元;Luna 分别为 0.10 美元、0.50 美元和 0.01 美元。OpenAI 表示,通过优化缓存和推理效率,两款模型的 API 价格较 GPT-5.6 对应模型的促销价格进一步降低。
两款模型已开放 API 调用,并开始向 Plus、Pro、Business、Enterprise 及 Edu 用户的 ChatGPT Work 和 Codex 推出;Free 与 Go 用户可在桌面应用中试用 Luna。开发者可通过 Responses 或 Chat Completions API 接入。
Google 发布 Gemini 3.8 TTS:可用自然语言设计声音,30 秒复制音色
9 月 23 日,Google 宣布推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款文本转语音模型。前者面向角色声音设计、有声书及互动内容,后者侧重大批量配音和语音智能体等应用。两款模型均已开始通过 Gemini API 和 Google AI Studio 提供服务。
通过声音设计功能,用户可用自然语言描述年龄、音色、口音及表达方式,无需录制参考音频即可创建声音,并保存为可重复调用的声音 ID。模型还支持逐句控制情绪、语速及表演方式,生成双人对话,并加入笑声、叹息等非语言声音。
此外,Google 提供声音复制功能,可根据 30 秒音频样本复制用户本人或其有权使用的声音,配套授权验证、SynthID 水印及 C2PA 凭证。AI Studio 中的声音复制功能暂不向欧洲经济区、英国、印度等部分地区开放。Google 表示,后续还将推出通过提示词调整现有声音音色、音高和口音的功能。
SpaceXAI 发布 Grok 4.7:强化编程与长时间任务执行
当地时间 9 月 21 日,SpaceXAI 发布 Grok 4.7,面向编程、智能体任务及知识工作。官方表示,相比 Grok 4.6,新模型采用更大规模的基座模型,并进行了更长时间的强化学习训练,训练任务侧重需要数小时完成的复杂问题,重点改进持续执行、自我检查及长上下文管理能力,同时针对 Grok Bot 运行框架进行了适配。
据公布的评测结果,Grok 4.7 在 CursorBench 4.0 上的得分由前代的 40.4%升至 46.3%,在 Terminal-Bench 4.0 上由 20.3%升至 38.0%。模型支持 50 万 Token 上下文窗口,接受文本和图像输入,输出文本,并提供四档推理强度。
Grok 4.7 已通过 API 开放,并接入 Cursor、Grok Build 及逐步上线的 GitHub Copilot。其标准版价格与 Grok 4.6 保持一致:提示词少于 20 万 Token 时,每百万 Token 输入、缓存输入和输出分别为 2 美元、0.5 美元和 6 美元;超过该阈值时,相应价格翻倍。
AWS 开源 Strands Harness,同模型下 Agent Token 成本平均降低 28%
9 月 21 日,AWS 旗下 Strands Agents 团队发布通用智能体运行框架 Strands Harness,采用 Apache 2.0 许可证开源,提供 Python 和 TypeScript 支持,可在本地运行或部署至云端,并接入不同模型服务。框架内置提示词缓存、上下文管理及溢出恢复等功能。
团队公布的测试显示,在使用相同 Claude 或 GPT 模型的条件下,Strands Harness 在六项基准测试中的 Token 成本较对比框架平均降低 28%,整体得分接近。测试通过 Harbor 在 Amazon EC2 上分布式运行,对比对象包括 Claude Code、Codex 等。官方同时指出,DeepSeek Harness 总体 Token 效率更高,但通常得分较低。
团队将成本表现主要归因于默认上下文管理策略:截断超过约 1500 Token 的工具返回内容,在上下文使用超过 85%时触发摘要压缩,并在溢出时执行恢复。上述数据来自发布团队测试,衡量的是 Token 成本;团队表示将另行发布论文,补充评测细节。
月之暗面推出 Kimi Code Desktop,支持本地项目、内置终端与浏览器
9 月 21 日,月之暗面推出 Kimi Code 官方桌面客户端 Kimi Code Desktop,支持 Windows 及搭载 Apple Silicon、Intel 芯片的 macOS 设备。产品延续 Kimi Code CLI 的 Agent 能力,用户可打开本地项目,通过对话让 Agent 读取和修改代码、运行命令,并在图形界面中管理项目、查看工具调用及代码改动。
桌面端提供计划模式和目标模式,分别支持先审阅方案再执行,以及围绕目标持续推进任务;长任务可暂停、恢复或转入后台运行。用户还可选择“始终询问”“必要时询问”“完全自动”三档权限模式,控制操作审批方式。
开发流程方面,客户端内置终端、浏览器及 Git 状态面板,支持运行测试、预览网页、审阅文件差异和查看关联 PR 状态,也可通过截图标注或点选网页元素向 Agent 反馈问题。用户可登录 Kimi 账号使用可用模型,或配置第三方模型供应商;已有本地 CLI 任务可在桌面端查看。
千问发布 Qwen-Image-2.1:7B 模型参数,支持透明图与多图编辑
9 月 20 日,千问团队发布 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中。其视觉生成模块拥有 70 亿参数,采用 32 层 Single-Stream DiT 架构,并通过混合粒度注意力、前缀 KV 缓存复用等方式优化推理效率。
该模型原生支持带透明通道的 RGBA 图像,可根据文字指令生成透明背景素材、编辑透明图层,也可从普通照片中提取主体,输出透明图像。多图编辑最多支持 10 张参考图,可用于人物、商品等多主体组合;局部编辑支持圈选、涂抹标注及独立掩码等方式。
据官方介绍,此次更新还优化了文字排版、人像光照和画面细节,以及编辑过程中的人物与商品一致性保持能力。模型权重已在 Hugging Face 和 ModelScope 提供,相关代码通过 GitHub 发布,模型采用 Qwen Research License 许可。
阶跃星辰发布 Step 5 Preview:6000 亿参数 MoE,支持 100 万 Token 上下文
9 月 20 日,阶跃星辰发布旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作及金融分析等智能体任务。模型采用稀疏混合专家(MoE)架构,总参数量 6000 亿,每个 Token 激活约 270 亿参数,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。
据官方介绍,Step 5 Preview 重点支持需要持续推理、多轮工具调用和迭代调整的复杂工作流程,可用于应用开发、代码调试、大规模资料研究及结构化分析。在金融场景中,其覆盖方向包括信息核验、估值分析等任务。
目前,Step 5 Preview 已通过阶跃星辰产品及开放平台 API 提供服务,开发者可调用模型构建应用,用户也可通过 AI Studio 体验。阶跃星辰宣布,计划于 10 月 15 日开放模型权重;此次发布为产品及 API 预览版本,权重尚未同步提供。
OpenAI 更新 Prompt Caching:缓存至少保留 30 分钟,支持预热与未命中诊断
OpenAI 近日更新提示缓存机制及开发文档,介绍 GPT-6 等模型在多轮对话和 Agent 任务中的上下文复用方式。根据官方文档,缓存自最近一次写入或复用起至少保留 30 分钟,每次复用都会刷新期限。因此,30 分钟是可刷新的最低保留窗口,并非整个任务的最长缓存时限。
开发者可通过 Responses API 提前缓存固定指令、工具定义和参考资料,预热过程不生成回答,但按缓存写入费率计费。此外,缓存仪表盘可监控命中率;诊断功能通过比较当前请求与此前响应,识别模型、工具、设置或输入变化造成的未命中,并返回相关 Token 数量。
上述功能适用于 GPT-5.6 及后续支持的模型。缓存写入价格为普通输入的 1.25 倍,读取为 0.1 倍。实际复用仍需满足提示前缀一致及请求设置兼容等条件,保持同一会话并不保证缓存命中。
IT 业界
Meta 将 Muse 接入 AI 眼镜:可基于眼前场景执行购物和办公任务
9 月 23 日,在 Meta Connect 2026 大会上,Meta 宣布将个人 AI Agent Muse 引入旗下 AI 眼镜,并进一步扩展 Muse 可调用的购物、支付、旅行和办公服务。相关眼镜端功能计划在未来几个月陆续上线。
接入 AI 眼镜后,用户可以直接通过语音唤醒 Muse。借助眼镜摄像头,Muse 能够基于用户当前看到的内容执行任务,例如识别货架上的商品、读取墙上的传单或处理购物清单,用户无需再通过语言描述眼前场景。Meta 还展示了 Muse 的语音模式,用户可以与其持续对话,同时让 Muse 在后台继续执行任务。
连接器方面,Muse 此前已接入数十家合作伙伴以及 Shopify 商品目录。此次 Meta 新增 Walmart、Best Buy、Gap、Sephora、Wayfair 等零售服务,并接入 Shop Pay 和 PayPal 支付;旅行和生活服务包括 Expedia 和 Instacart。办公场景则新增 Notion、Granola、GitHub 和 Box。
Meta 同时宣布,Muse 将获得独立电子邮箱地址,可通过邮件与用户或其他服务进行交互。Muse 于本月早些时候推出,Meta 将其定位为能够跨应用和服务执行任务的个人 AI Agent。
理想发布具身模型 ME-Dex-1.0:联合预测视觉、触觉与机器人动作
理想汽车 Foundation Model 团队近日发布世界动作触觉模型 ME-Dex-1.0(MachEmbodied-Dex-1.0)。与将触觉作为辅助输入的部分机器人模型不同,ME-Dex-1.0 将触觉状态与视频共同作为需要预测的未来观察,是一个联合学习未来视觉、触觉状态与机器人动作的世界动作触觉模型。
架构方面,ME-Dex-1.0 采用 Mixture-of-Transformers 设计,由视频专家、触觉专家和动作专家组成,并通过共享注意力机制连接三个模块。针对不同机器人、传感器布局产生的异构触觉数据,团队通过 Canonical Hand Model 和 Unified Tactile Autoencoder,将不同来源的触觉信息映射至统一的空间和潜在表示;Agentic Tactile Data Engine 则在仿真环境中通过力传感器补充视觉、触觉和动作配对数据。
团队在仿真与真机平台上评测 ME-Dex-1.0。论文数据显示,ME-Dex-1.0 在 DexJoCo 11 项联合训练任务中的平均成功率为 65.3%;在 ManiFeel 四项操作任务中的平均成功率为 70%,相比该基线的 55%提高 15 个百分点。团队还在搭载触觉传感器的 LeRobot SO-101,以及配备 Xynova Flex2 灵巧手的双臂机器人上进行了真机测试。
海光发布 1000 系列 CPU:采用 C86 架构,面向端侧智能场景
9 月 22 日,海光信息在深圳发布海光 1000 系列 CPU。该系列采用 C86 架构,面向低功耗、嵌入式和端侧算力需求,是海光首款面向端侧智能的处理器产品。此前,海光已推出 7000、5000 和 3000 系列 CPU,此次 1000 系列将其 CPU 产品覆盖范围进一步扩展至工业控制、边缘设备等场景。
产品方面,海光 1000 系列集成 iGPU,支持 4K 60Hz 双路显示、主流视频编解码和多种图形接口;支持 PCIe 4.0、TSN 以及 DDR4、DDR5 内存,并针对嵌入式应用加入低功耗、宽温、长生命周期和持续稳定运行等设计。安全方面,该系列支持国密算法、ECC、安全处理器及硬件密码加速。
海光信息表示,1000 系列并非单一芯片,而是面向端侧算力的一组产品,后续将根据不同应用场景配置 CPU、GPU 和 NPU 计算能力。目前其目标应用包括工业自动化、网络边缘、能源公用、交通运输和工业机器人等。发布会上,海光还公布了面向嵌入式生态伙伴的合作计划,将提供参考设计、样片、研发支持、适配认证及工程师培训等资源。
高通发布第六代骁龙 8 双旗舰平台,移动 CPU 主频首次达到 5GHz
9 月 22 日,在 2026 骁龙峰会上,高通发布两款旗舰移动平台:第六代骁龙 8 超级至尊版(Snapdragon 8 Elite Extreme Gen 6)和第六代骁龙 8 至尊版(Snapdragon 8 Elite Gen 6)。两款芯片均采用 2nm 制程,并搭载新一代自研 Qualcomm Oryon CPU。
CPU 方面,新一代 Oryon 采用 2 颗超级核心的配置,最高主频达到 5GHz。高通称,这是移动 CPU 首次达到 5GHz。芯片同时引入 Oryon Flex Cache 架构,可让不同类型 CPU 核心动态访问共享缓存。按照高通公布的与上一代产品对比数据,第六代骁龙 8 超级至尊版 CPU 性能提升 13%,GPU 性能提升 44%,Hexagon NPU 性能提升 35%;第六代骁龙 8 至尊版 CPU、GPU 和 NPU 性能分别提升 10%、35%和 14%。
其他配置方面,两款平台均搭载重新设计的 Adreno GPU 和 Hexagon NPU,并支持端侧 Agent AI、5G-Advanced 及 Wi-Fi 8。超级至尊版还加入 Adreno Neural Fusion、矩阵核心以及 APV 专业视频等功能。高通表示,荣耀、iQOO、摩托罗拉、一加、OPPO、REDMI、红魔、vivo 和小米等厂商将推出搭载两款平台的旗舰手机。
会议推荐
QCon 全球软件开发大会·2026(上海站)将于10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。限时 9 折优惠立减 680!查看更多详情可扫码或联系票务经理 18514549229 进行咨询。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.