文 | 伯虎财经(bohuFN),作者 | 楷楷 一向低调的字节跳动创始人张一鸣,却在近日高调发声。 他在7月底的Seed全员会上罕见现身,明确表示“字节跳动不会把蒸馏当作提升AI模型能力的捷径,即便Seed的模型能力暂时落后于国内主要的竞争对手。” 话音未落,字节又干了一件大事。据36氪报道,其成立了一个新的一级部门“AI数据与安全”,整合超千人的数据团队,与Seed、Flow、抖音等部门平行。 此外,据《晚点 LatePost》报道,字节正在讨论训练一个参数规模超5万亿的模型,如果落地,将会是目前国内已知参数规模最大的模型。 同一时间,豆包的商业化也开始全面加速:68、200、500元三档包月正式上线;豆包针对生活服务订单开始抽佣;飞书产品团队与豆包合并,猛攻桌面Agent。 更大的模型、更强的技术基础,以及从架构到业务都重新整合的商业闭环,当字节AI不再强调“追赶”之后,它开始尝试讲一个更慢、但更有想象力的故事。 字节AI,继续“大力出奇迹”,只是这一次,“出力”的方向变了。 01 张一鸣“拒绝蒸馏” 字节跳动创始人张一鸣,自从在2021年退居幕后,一直非常低调。但近日,他却罕见地在Seed全员会上露面,明确表态“拒绝蒸馏”。 随后在8月5日的字节全员会上,字节CEO梁汝波进一步定调:“字节大语言模型会坚定自研,做好基本功,接受短期落后,坚持优化长期,最重要的是动作不要变形。” 两位大佬同时发声,为何字节会如此态度鲜明地反对“蒸馏”? 先看看何谓“模型蒸馏”?就是用更强大的前沿模型生成的输出,来训练自己的模型。 就像在复习时坐在学霸(教师模型)旁边,向他反复提问,得到答案;再用这些“题目和答案”来训练自己(学生模型),以快速提高成绩。 但需要明确的是,蒸馏不是抄袭,它无法直接获得另一个模型的权重和完整训练数据,它只是一种相对“更快”的学习方式。 在国内AI圈,蒸馏几乎是一种心照不宣的“常规操作”。 比如在2025年初,DeepSeek发布推理大模型DeepSeek-R1,其还同时发布了六个小尺寸的蒸馏模型,它们的“教师模型”都是R1本身。 但在海外AI 圈,蒸馏却引发了舆论风暴。 今年初,美国AI公司Anthropic指控DeepSeek、Kimi和MiniMax三家大模型厂商,对其Claude模型发起工业级“蒸馏”攻击,但这三家企业均未作出正面回应。 蒸馏确实是提升大模型能力的一条“捷径”,但“更快”是不是等于“更好”,则一直留有争议。 主流的观点是,对于第一梯队的大模型企业而言,仅仅通过蒸馏,很难真正建立起技术壁垒。况且,大规模展开蒸馏也是一个比较复杂的系统工程,也需要计算投入回报比。 蒸馏技术本身并非原罪,但至少在字节这里,其对蒸馏的警惕,几乎贯穿了整个AI叙事。 早在2023年,模型团队内部就明确,不得将GPT生成的数据加入训练数据集。 2025年1月,DeepSeek R1横空出世,以有限的训练成本展现出强大的推理能力,给国内大模型企业带来很大的竞争压力,包括字节Seed团队。 对此,Seed内部曾有过讨论,是否要采用蒸馏方式,引入美国头部模型的生成结果,但最终这个提议被管理层否决了。 不过,面对国内外大模型不断跃升的智能水平,蒸馏一直是Seed内部无法回避的选项。 一直到Kimi K3出现,这个同样来自国内的大模型,能力已非常接近国外闭源旗舰模型,让Seed内部偏向蒸馏的声音更多了。 这一次,张一鸣终于站出来表态“不接受蒸馏”。据36氪报道,这次全体会之后,Seed内部出台了新的政策,明确要求禁止蒸馏K3等开放权重模型,并追溯排查疑似蒸馏的行为。 对字节来说,“拒绝蒸馏”不仅仅是口号,还是已经落到实处的动作。 02 打自己最擅长的牌 但问题是,一向信奉“大力出奇迹”的字节,这次为何一反常态,宁愿慢下来? 或许可以回到字节自身的基因里去找答案。 2012年,字节跳动推出第一款产品“今日头条”,从产品模式来看并不算非常创新。当时,搜狐、网易、腾讯等大厂均推出了类似的资讯APP。 但“今日头条”的特别之处在于,它尝试用技术手段来影响哪些内容能被用户看到,依靠算法推荐这一技术,字节走出了一条区别于门户的新闻资讯模式,并沿用至今。 如此,也就不难明白为何张一鸣选择对“蒸馏”说NO。蒸馏本质上是在复制别人已有的能力,沿着这条路走,最多只能不断逼近对方,很难真正实现超越。 只有颠覆行业已有的经验,才能走出属于自己的赛道,这是字节从打造第一款产品就学会的经验,在AI大模型领域更是如此。 2024年,牛津、剑桥等机构的联合研究登上《Nature》封面,指出如果模型反复用AI生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。 更重要的是,字节的核心战场从来不是纯文本大模型,而是原生多模态,它要求模型从一开始就具备处理文本、图像、音频、视频等多种信息的能力,而不是在文本模型上打补丁。蒸馏或许能帮字节在文本能力上快速追赶,却无法帮它构建起真正的多模态壁垒。 字节的选择是,打自己最擅长的牌:用数据和规模的确定性,去对抗技术路线的不确定性。这也是“大力出奇迹”在AI时代的延续——只不过,过去“大力”花在流量和产品上,现在“大力”花在底层能力和长期基础设施上。 拒绝蒸馏,短期看是慢,长期看是快。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.