一家只拥有约24块GPU的初创公司,做出了韩国排名第一的大模型,并且在全球GPQA Diamond基准上位居第三。这个名为Darwin-398B-JGOS的模型来自VIDRAFT,它把DeepSeek-V4-Pro、Qwen3.5-397B以及英伟达550B参数的Nemotron-3-Ultra都甩在了身后。
排在它前面的,只有两个中国前沿模型。而韩国本土的其他选手差距明显:Solar-Open2-250B得分86.3,A.X-K2得分85.6,K-EXAONE-2.0-750B-A37B得分82.2。Darwin-398B-JGOS一举领先了约4.6分,这个优势放在强推理基准上相当可观。
![]()
GPQA Diamond之所以被看重,是因为它专门抵抗“谷歌搜索”式的回答——题目出自研究生水平的科学推理,网络检索几乎找不到现成答案,分数反映的是模型真正推理,而不是死记硬背的能力。这一次,只有二十几块GPU的团队就是靠着推理能力挤进了全球第一梯队。
模型是怎么炼成的?VIDRAFT用的是一种“进化合并”的方法:在小规模集群上,把多个开源模型像物种进化一样层层融合、筛选,最终合并出Darwin-398B-JGOS。核心思路不是堆硬件、堆参数,而是优化合并策略和训练流程。在动辄千卡万卡的大厂军备竞赛里,这种“方法重于规模”的路线显得格外异类——但排名证明了它的有效性。
当然,这次登顶也要看清楚前提。这是一个只测基础模型、单一基准的快照(2026年7月),GPQA分数会因评估设置而浮动,一个基准远远不能代表模型的全部能力。那两个中国前沿模型依然牢牢占住前两名,全球排名随时可能变化。
但VIDRAFT的出现至少传递了一个信号:在更聪明的合成方法面前,算力规模可能不再是唯一门票。当大厂们还在比拼万卡集群时,一支小团队用二十几块GPU就撕开了一道口子。后面能不能在更多基准上复现这种表现,会是比排名本身更值得跟踪的看点。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.