![]()
8月6日,据字节跳动内部人士处消息,今年国内竞争对手开源模型的快速发展给字节跳动带来更大的压力。在近日的内部会议中,字节跳动创始人张一鸣表示,做模型要坚持长期主义、延迟满足感,而不是用别人的输出,换一时的榜单排名。
今年以来,国内AI大模型竞争已经极为激烈,几乎每隔几天就有新模型发布,每当有一个强大的开源新模型发布,字节跳动内部关于蒸馏的争论就会升温。据了解,张一鸣很少在Seed团队的会议上发言,但此次明确表态,字节跳动“应该愿意为长期目标牺牲一部分短期收益”。
据了解,字节跳动内部对开源模型严禁蒸馏,甚至通过API检测等方式在内部加强相关限制,张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。
国产大模型激战仍在延续,来自各家模型厂商新品“卷”上天际,就在当天早些时候,DeepSeek发布公告:计划近期整体上调DeepSeek API服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。
7月31日,DeepSeek宣布,DeepSeek-V4-Flash正式版API上线公测。这也是外界期待已久的DeepSeek正式版官宣上线,据了解,DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行后训练。
据业内人士分析称,此次官宣涨价也意味着DeepSeek即将上线V4-Pro正式版,将对整体算力调用产生影响。
何为“蒸馏”
“蒸馏”本是人工智能领域的一项基础技术。2015年,被誉为“深度学习之父”的杰弗里·辛顿等人明确提出这一技术命名,其核心逻辑是:让算力充沛的大模型做“师傅”,轻量级的小模型做“徒弟”,后者通过观察前者的输入输出,学习其解决问题的思路和方法,最终实现能力复刻。这种技术路径的价值在于,它能让一个体积更小、运行更高效的模型,在大幅降低算力需求的同时,获得接近尖端大模型的性能表现。
正因如此,“蒸馏”迅速成为全球人工智能界公认的常规操作。谷歌、开放人工智能公司(OpenAI)、亚马逊等美国科技巨头,不仅广泛使用这一技术,甚至将其作为标准化服务对外提供。换言之,“蒸馏”本质上是一种中性的技术方法,是人工智能技术迭代与创新演进的重要方式之一,是降低技术门槛、推动人工智能普惠发展的重要路径。
■综合自澎湃新闻、《求是》
■编辑:越玥、张阿嫱
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.