![]()
让算法、模型和应用一诞生即可运行在不同厂商、不同架构和不同代际的硬件上。
本文为IPO早知道原创
作者|苏打
据IPO早知道消息,7月19日,“先进计算网络与算电协同论坛”于2026人工智能大会期间举行。
论坛由院士领衔,围绕新一代人工智能基础设施这一战略命题,汇聚鹏城国家实验室、怀柔国家实验室、北京智源人工智能研究院、中国移动等政产学研顶尖力量,从Z级算力、P级光网络、GW级电力三大维度展开深度研讨。
现场,北京智源人工智能研究院副院长兼总工程师林咏华于《众智Flag OS:共建开放智算生态》演讲中,详细阐述了在芯片硬件快速发展但软件生态存在壁垒的现状下,构建开放共享的AI计算生态的重要性,以及Flag OS的最新进展。
以下为林咏华演讲内容精编:
随着过去几年国在芯片行业的发展,我们硬件、超节点等方面已经能做出越来越好的芯片,但芯片上的软件生态依然是一个很大挑战。
众所周知,英伟达之所以处于全球领先,并非是单单在芯片上做得好,更重要的是CUDA生态,在全球占据90%-95%的垄断地位。另外,过去的一段时间,很多人说大模型企业似乎越来越少,是不是收敛了?其实并没有。
大家能看到的只是语言模型,如果看多模态模型,尤其是生成类的多模态模型,还有世界模型、具身智能模型、AI for Science模型,目前正百花齐放,根本没有收敛。
过去,我们只解决了单芯片这一个问题,但当板间互联、机间互联需要高速互联时,出现了超节点。今年WAIC展台上,几乎所有芯片公司都展示了“三板斧”——芯片、服务器、超节点。
超节点就是scale-up的做法,这也是由于工艺和产线的制约,让我们不得不另辟蹊径,比如3D堆叠、韬抛定律,包括in memory、computing等等,使得我们有架构上的创新或者是弯道超车的很大可能性。目前要跟我们合作的很多芯片企业,虽然没有出现在本次WAIC展览中,但都蓄势待发。
另外,我们也看到更多更加专用的计算方式正在涌现,例如专门做Toeken的 processor,专门做decoding的processor,还有质量质融合这种新的计算架构。这都意味着,我们的确需要在硬件这条路上走得更快、变得领先,才有可能解决今天耗费大量算力和能源来解决问题的瓶颈。
上层的模型和算法不断演进,正推动下层的硬件同步演进,因此我们提出开放计算。
这个愿景很简单,我们希望让正在蓬勃发展的算法、模型和应用,一诞生就可以很容易地运行在不同厂商、不同架构和不同代际的硬件上。只有构建一个开放、共享的AI生态,才可能共享未来。
为什么开放计算相当重要?第一,只有更多选择才能够降低门槛与成本。开放计算能够支持云、边端和多种芯片,让用户根据应用、性能与预算选择最合适的算力。
第二,共享生态,激发硬件创新,以前我们觉得后发者没有先机,其实不是,尤其在芯片这个领域,有很多初创公司因为知道前面踩过的坑,反而可以避开一些教训,用更少的负担、更激进、更领先的技术去做新的设计。
以前我们在做很多激进的架构改变时候,往往会担心没有软件支持。但如果有一个开放共享的生态,新进入场的这些芯片就可以大胆在底层做创新,上面的软件依托生态来做。
最后一个我觉得相当重要,延长生命周期,促进可持续发展。
今天最新的大模型都要去摸高,使用最领先的硬件的特性,例如相浮点计算,甚至fp4。但今年上半年市场上连fp8的硬件芯片都只有一两家,fp4部署的几乎为0。芯片企业当然很希望更迭,一旦有新的代际,大家马上都去买新的产品。但目前国内85%以上的计算中心投资都是过去一年甚至两年之前的代际。
如果数据中心这么大的建设只有一两年的生命周期,试问下一轮谁敢投?
所以我们希望可以延长这些不同代际的芯片的生命周期。以智源研究院为例,我们的平台管理超2万片集群,其中有很多种芯片。到今年下半年,有些芯片已经有第三代出现在我们的同一集群,80%以上的芯片都会出现第两代际共存。
开放计算能够让我们最新的模型也能跑在前一两个代际上,从而延续投资的生命周期。我们有幸与国内的最好的高校和团队,包括北京大学、清华大学以及众多的芯片企业,一同努力打造了众智Flag OS的软件,并完全开源。
目前该软件已经可以做到一次编写多次运行,成为目前全球支持芯片种类最多的开源的系统软件站。
在底层,我们支持的包括数据中心的芯片、边缘设备、Arm设备,甚至RISC AI芯片。今年三四月份,我们还支持了量子计算。这个其实很难做,因为底层有很多不同的芯片,所以在第一阶段我们设置了一个统一的编译器FlagTree,两年前便已经实现了多种芯片的接入。第二阶段,我们进行了面向人类+Agent的语言扩展,让开发者高效开发高性能算子;第三阶段,我们统一了硬件中间层IR的定义,让算子在不同架构芯片上能高效运行。
比如通过扩展语言,我们实现了比Triton加速比到几十倍。
在英伟达CUDA上,通过TLE优化重点模型的Attention算子,性能达到业界SOTA。但Flag的目标并不是在英伟达上做更强的优化。英伟达已经有很多开发者和团队为它优化,而我们希望在非英伟达的底层上进行更好的优化。
面向不同的芯片,我们实现了较它们原生C语言更好的加速比,也赢得了大家的信心。
目前,我们已构建起全球最大的算子库,囊括几百个算子,支持语言芯片种类最多,目前也是全球的除CUDA以外最重要的多芯片算子库。
另外,由于今天的模型运行在很多的高层框架上,经过半年努力,在几个最主流的框架上我们也做了统一的芯片插件进行支持。截至6月份,我们已经在推理、训练、强化学习领域支持了多个框架,芯片厂商无需自己更迭版本,跟着我们自然就可以享受到每周的版本更迭。
有一些框架是英伟达开源出来,现在他们也觉得在全球生态下需要有更开放的合作,所以正积极接入FlagOS。
还有一个问题是如何把芯片联通起来。2024年底我们做了FlagCX统一通信库,已经通过开源接入了超过10款不同的芯片,目前已立项力争成为全球第一个AI芯片领域的通讯库的标准。
有了这些东西我们可以做什么?
第一,一次编写,多芯运行。得益于跟国内多个大模型团队的合作,我们会与其进行Day0适配,通过我们的技术栈取代他们之前对CUDA的依赖,令其可以适配到多种芯片,并在他们发布的24小时之内,同步发布我们的多芯片版本。我们开源到CUDA上后,用户可直接下载,开箱可用。
第二,聚合异构算力。这实际上是个保险性的任务,随着芯片的迭代,数据中心肯定会因为芯片的持续迭代,囊括不同代际的芯片。有了异构混训技术,就能保证无论芯片怎么换,都可以让集群做同一件高性能的训练的任务。
第三,跨芯推理、训练任务迁移。异构算力迁移可将运行中的训练与推理任务迁移至不同厂商的异构算力,如英伟达到昆仑芯,实现跨架构的算力流动,盘活闲置算力。其中的核心是Flag OS的技术栈。
最后,支持新计算架构创新探索。目前第一个激进探索“量质融合”新架构。基于Flag OS体系,我们打造了Flag Quantum这一面向量子计算框架。目前量子计算的硬件太少,因此当我们做量子计算的探索时,仍旧需要用AI的芯片和加速卡来做模拟。英伟达也已经很快地进入到这个领域。
目前,我们已经能够在包括英伟达、海光、摩尔线程上进行高效的、支持多比特数的并行量子计算模拟。同时,它也可以让同一份代码跑在真实的量子硬件,包括国内的夸父、本源,国外的IBM等,真正做到了智算的统一框架。
第二个探索是与RISC- V AI芯片的创新。目前已覆盖北京开源芯片研究院、奕行智能EVAS、进迭时空SpacemiT、中移芯昇、奕斯伟ESWIN的5家芯片,四种技术路线,完成了全周期验证。
实际上,计算的鸿沟在全球更为明显。过去的一年,我们也在跟联合国在探讨基于Flag OS的跨代际、多芯片支持,以支撑全球发展中地区的AI教育。很多数据中心利用率低,主要因为芯片代际落后,所以我们将其group起来,装上我们统一的计算软件,提供给发展中地区,让他们做AI的人才教育。
很多时候我们说AI出海,首先是生态出海,我们是通过教育让生态出海。
今年上半年,我们第一期就支持了非洲10个国家的高校老师前来接受培训。他们回国后,利用我们来自几个厂商上一代芯片做远程AI教育。下半年,我们正在跟联合国包括教科文组织、非洲联盟等一起做更大范围推广,也包括亚洲地区。
我们希望通过智源研究院及众多高校团队,包括鹏程实验室等一起构建一个全球的开放生态,同时保持与全球国际社区的紧密合作,把我们的自主生态做成一个重要的全球AI生态,为未来的探索打下计算的基础。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.