新华社旧金山8月27日电 综述|中国开放权重模型加速融入全球AI产业链
新华社记者吴晓凌
随着Kimi、DeepSeek等中国开放权重模型能力持续提升,越来越多海外人工智能(AI)企业开始在中国开放权重模型基础上进行后训练,并据此开发自主模型和产品。中国开放权重模型参与海外AI研发的形式也日益多样,从直接作为基础模型接受进一步训练,延伸到生成合成数据、提供模型架构和训练方法参考。中国模型正加速融入全球AI产业链。
美国法律AI公司哈维日前发布其首个后训练开放权重模型Tenet。该模型以中国月之暗面最新开放权重模型Kimi K3为基础开发。哈维公司公布的技术细节显示,Tenet模型的训练体系高度贴合真实的法律工作场景,依托约1750个专业化法律工作智能体环境完成迭代优化,整套专项训练工作历时约2个月。该公司5月公布的早期测试显示,以“全部标准通过”的评判标准考虑,市场上多数通用模型完整完成法律实务任务的比例不足10%,在专业场景中实用性存在明显短板。而专项训练后的Tenet完整完成的综合法律实务任务数量接近原始Kimi K3模型的两倍;在合同起草、审查和谈判等专项任务中,完整完成的任务数量也增加约20%,同时基本保留原模型的通用法律知识能力。
这并非中国开放权重模型进入海外AI产品研发链条的孤例。美国AI编程平台——“光标”代码编辑器(Cursor)所属公司今年3月公布自主开发的编程模型Composer 2技术报告称,该模型以Kimi K2.5为基础,依托代码数据为主的持续预训练夯实专业底层能力,再通过大规模强化学习完成任务优化,实现向专项智能模型的进阶;5月推出的Composer 2.5仍以Kimi K2.5为基础,进一步扩大预训练规模和强化学习任务数量。美国AI初创企业“认知”公司、英国AI初创企业Cosine分别以Kimi模型为基础,通过进一步大规模强化学习提升软件工程能力,打造出各自的核心AI软件工程产品。
中国开放权重模型的影响还延伸到训练数据和模型架构。开放人工智能研究中心(OpenAI)前首席技术官米拉·穆拉蒂创办的思维机器实验室在研发其首款开放权重模型Inkling时,并未直接采用中国模型作为基础模型,但其官方技术说明称,Inkling的混合专家(MoE)架构主要沿用DeepSeek V3的技术路线。在后训练启动阶段,公司还使用包括Kimi K2.5在内的开放权重模型生成合成数据,用于首轮监督微调。
过去,AI企业在追求前沿模型能力时往往高度依赖闭源模型。随着Kimi、DeepSeek等中国开放权重模型能力持续提升,部分模型已进入前沿,为这些企业提供了闭源模型之外的技术选择。此外,随着人工智能由问答工具向智能体演进,衡量模型能力的标准也从知识回答延伸到完整执行复杂任务。而完成复杂任务所需的操作流程、判断标准和纠错机制,往往存在于真实业务场景、评测体系和工作流程里。在这一背景下,垂直AI的后训练更重视任务执行能力。Cursor、哈维和“认知”等AI公司就在接近真实业务的任务环境中开展大规模强化学习,让模型从中学习信息搜索、工具调用、上下文管理和错误修正等。
除了模型能力以外,开放权重模型还具有成本和控制优势。它们可由企业自主部署、持续优化和继续训练,在大规模调用场景下具有降低单位推理成本、提高部署灵活性和减少对外部应用程序编程接口(API)依赖的优势。
随着权重、数据、架构等技术成果更深融入全球AI研发和产业体系,中国开放权重模型在全球AI供应链中的作用不断增强,其国际影响正由产品出海进一步向技术输出延伸,呈现出成为海外AI企业开发新模型、新产品重要技术来源的趋势。(完)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.