9月23日-27日,第五届全球数字贸易博览会期间,曦望Sunrise携专为大模型和Agent打造的原生推理GPU启望S3与搭载S3的256卡超节点"推理巨兽"亮相展会。同期,曦望Sunrise董事长徐冰在杭州市政府、联合国国际贸易中心主办的"数字贸易与人工智能对话"上分享智能体浪潮下算力需求变局的一线洞察。
徐冰认为,Token消耗结构正发生根本变化:同等任务下,Agent完成一条人类指令所消耗的Token数量已达人类百倍乃至千倍;具身智能作为物理世界的Agent将7×24小时持续消耗Token。他预计,未来3至5年内数字与物理世界的Agent对Token消耗总量将超过全人类。
据介绍,启望S3不追求训推一体,精简训练模块,将节省的晶体管与功耗预算全部投入推理;国内率先采用LPDDR6内存(兼容LPDDR5X)并原生支持FP4低精度。曦望方面表示,相比上一代S2,启望S3推理性能提升约5倍,单位Token推理成本下降约90%。
搭载S3的"推理巨兽"超节点依托高速互联架构,让256张卡实现一级互联,可支持万亿乃至更大参数量的多模态MoE模型,在大EP部署下吞吐率可提升20倍以上。曦望展台同时展示了计算卡、计算模组、服务器、液冷工作站、一体机及自研SIRE软件栈,覆盖金融、制造、公共事业等行业推理解决方案。(袁宁)
