AI圈最近又出大新闻,美国迈阿密一家刚走出隐身状态的小初创,放了个核弹级消息,说自己搞定了困扰大模型快十年的数学瓶颈。这话一说整个圈都炸了,大部分人第一反应都是不信,毕竟这么多年多少大牛都栽在这个问题上,轮得到你一个新公司捡漏?不过人家转头甩出第三方独立测试结果,看着好像还真像那么回事,今天咱们就聊聊这事到底有多少分量。
![]()
这家叫Subquadratic的初创,掏出的新模型叫SubQ,他们说自家模型比现在市面上所有大模型都快,还更便宜更省电。最抢眼的是,它一次能处理的文本是普通大模型的12倍,几百份文档或者一整个代码库丢进去,它都能一口气搞定。更夸张的是,编程这类核心任务上,它的水平基本追上了OpenAI、Google DeepMind这些大厂的顶尖模型。
刚放消息那会儿,这家公司除了几个分数啥额外信息都没给,模型也没开放给外人试用,招来一片质疑太正常。有个AI工程师直接在X上说出了所有人的心声,说SubQ要么是Transformer问世以来最大的突破,要么就是AI版的Theranos,懂的都懂这是什么意思。过了一个月,这家公司才补上更多信息,包括专门做AI评估的第三方机构Appen的完整测试结果。
公司联合创始人兼CTO也坦诚,第一次发布没放第三方测试确实考虑不周,以后所有结果都会验证完再对外发。Appen的生成式AI研究总监看完数据也说,刚看到结果的时候真挺兴奋,确实验证了这家公司的新架构。她还说,大模型速度效率的瓶颈卡了太久,要是真成了绝对是改变行业的事,但结果好得太离谱,公司自己说确实没啥说服力。
要get到这件事的分量,得先聊聊现在主流大模型到底是怎么干活的。现在所有能打的大模型核心都是Transformer架构,最核心的操作叫稠密注意力,说直白点就是,你给模型一段文本,每个词都要和其他所有词两两算一遍关系,才能整段理解含义。文本越长,计算量涨得越疯,词数翻一倍,计算量差不多要翻四倍,这种涨法就是业内说的二次方扩展,也是大模型又贵又费电的根本原因。
举个例子,你要让模型给一整本《了不起的盖茨比》写摘要,那第一个词都得和最后一个词算一遍关系,中间所有组合一个都落不下,算下来那工作量能吓退不少人。这么多年大家都想改这个问题,思路其实很统一,就是把稠密注意力换成稀疏注意力,不用每个词都和所有词算,只挑有关系的算,一下子就能砍掉大半计算量。这个思路真不是这家初创先想出来的,这么多年试过的人不计其数,可没人能成事,改完之后模型效果肯定掉,远不如原来全算一遍的效果好。
Subquadratic说,这次他们真的做成了,SubQ是第一个性能能追平主流稠密注意力模型的稀疏注意力大模型。他们和之前那些失败方案不一样,之前的方案都是死规则,比如固定让第一个词配第五个词,太死板了,活的语言哪有这么多固定规矩。他们是让模型自己判断哪些词的关系重要,每段文本选出来的重点都不一样,还是实时计算的,这套就是他们压箱底的杀手锏,具体怎么实现的,现在还没对外公开。
Appen拿好几个行业通用的基准测试跑了一遍,先说纯速度,SubQ比之前用FlashAttention技术的模型还快56倍,这个提速幅度真的很夸张。编程能力测试用的是真实编程竞赛的题目,SubQ得分率89.7%,和其他顶尖编程模型排在同一档,Appen的研究人员也说它在编程上一直保持前沿水平。成本差距更是夸张,跑Nvidia设计的RULER 128信息检索测试,Anthropic的顶级模型跑一遍要花2600美元,SubQ只花了8美元。
业内常说的上下文窗口也就是模型的工作记忆,SubQ最长能到1200万个token,现在大多数顶级模型也就100万,刚好对得上他们说的12倍处理能力。创始人做过公开演示,让SubQ从400份文档里提取信息做推理,几秒钟就出结果,换现在流行的Perplexity搜索引擎,连400份文档都加载不完。还有专门测模型找信息能力的“大海捞针”测试,SubQ在600万和1200万token的规模下,正确率都拿到了98%,近乎完美,这个规模基本没几个模型敢测。
现在说这些成绩其实都还太早,基准测试只能测出模型能力的一部分,特定条件下拿了高分,不代表放到所有真实场景都好用。这家公司把SubQ定位成编程和超大数据搜索的专用模型,没说要一下子取代所有现有顶级模型,只是说某些场景下能靠极低的成本换极大的速度提升。他们说长远来看这套方法能改变大模型的制作方式,过个三五年,没人会再基于原来的Transformer做模型了,这话放出来真的够狂。
现在说它是骗局还是突破都为时尚早,毕竟到现在也没多少外部人士真的亲手用上它。这家公司说已经有几万人注册了早期使用权,还有五百多家企业客户,只是公司太小人手不够,排队的人多,真正用上的没几个。有个点挺让人犯嘀咕,SubQ搭建的时候复用了开源模型通义千问某个版本的权重,不是从头训练的,这事本身在行业里很常见,但和他们说的“彻底重新发明大模型工作方式”的说法,多少有点违和。
前OpenAI员工、现在的独立AI研究者也说,他们可能确实造出了一个有用的东西,但就目前公开的信息来看,还不够支撑“已经解决二次方注意力瓶颈”这个天大的结论。Subquadratic的CTO也挺坦诚,说他们比OpenAI这种大厂更输不起,想要做出有竞争力的模型,只能走不一样的路。现在整个AI圈都在盯着这家小公司,要是真的成了,那整个行业的成本都能打下来,普通用户也能用上更便宜更快的大模型。
参考资料:澎湃新闻 美初创称破解大模型十年核心瓶颈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.