一条不到一毫米长的线虫,成了Liquid AI整套技术路线的起点。这家公司的CEO Ramin Hasani在Latent Space播客里解释,秀丽隐杆线虫的神经元不发放脉冲,活动可以用连续时间微分方程描述。这个特性让团队能构建出可微、可训练的液态神经网络。
更让人意外的是规模。线虫只有302个神经元,却能控制95个肌肉细胞。Ramin提到,2016至2017年时,这套系统的表现优于当时世界上任何机器人系统。几十到几百个神经元就能控制机器人,计算效率极高。
![]()
从线虫到基础模型的瓶颈
当团队把规模扩展到处理音频、视觉、文本时,RNN的顺序计算成了瓶颈。非线性循环算子难以在GPU上并行,而Transformer因为本质是矩阵乘法,天然容易扩展。
团队试过将非线性系统线性化,获得了并行能力,却损失了表达能力。状态空间模型就是RNN的线性版本,计算高效,但难以学习长上下文依赖,表达能力不及Transformer。
Liquid的选择是不押注单一架构。他们把各技术的发明者聚在一起,搭建了meta-AI搜索系统STAR,在算子空间中为GPU、NPU等目标硬件搜索混合架构。
架构跟着芯片走
搜索产出了LFM系列。LFM2约80%为双门控一维卷积,约20%为分组查询注意力,结构精简,专为CPU优化。Ramin的判断很直接:目标设备基本决定了混合架构该是什么样。每代LFM都会把新算子加入大规模meta-AI搜索系统。
在基础模型上跑scaling law还发现了一条规律:构建通用智能架构时,规模越大越要去掉系统里的偏置与复杂反馈结构,LFM2已无gate、delta net等;而在内存受限的小规模场景,增加反馈循环与复杂性反而能提升动态表现。循环本身也被视为一种偏置。
上设备不等于下载模型
商业落地方面,Liquid与梅赛德斯-奔驰合作,将约600MB的模型部署到车内,通过OTA更新,芯片成本约100美元,覆盖北美第三代车型。与Shopify的合作则让Shopify渠道月请求超10亿次,模型下载超4000万次。
Ramin强调,设备端模型需要处理温度控制、长上下文表现与可靠性问题。这不是从开源社区下载一个模型,再把它放到设备上就算成功了。本地部署还带来隐私、离线和成本优势。
企业市场的现实则更冷静。Liquid约已与财富500强中的200家企业接触,企业普遍疲惫:约80%的POC达不到生产级。Ramin认为,定制化不止后训练,而是从预训练到推理的全流程,可贯穿预训练、中期训练、后训练、数据生成与RL,再让agent循环起来形成递归。Liquid正从设计合作伙伴模式走向自助平台。
研究前沿上,Liquid关注视频、音频、文本的联合训练,也用连续时间动力系统处理DNA这类词表极小但序列极长的数据。Ramin认为仅靠前向计算的竞争不够,把前向与自适应路径结合、多agent认知架构与光子计算等新基质,可能是下一代架构的方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.