允中 发自 凹非寺
量子位 | 公众号 QbitAI
7月23日,智象未来(HiDream.ai)宣布完成15亿元C轮融资
这是这家多模态大模型公司在近三个月内完成的第三轮融资。
三轮密集融资超21亿元后,智象未来估值超过10亿美金,正式跻身全球AI独角兽行列。
![]()
但真正让人感兴趣的从来不是钱本身,而是谁在给钱,以及为什么给。
这一轮的投资人名单,堪称“神仙打架”。
公开信息显示,本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投。
老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。
风格、布局逻辑截然不同的资本,罕见扎堆押注同一家创业公司。
![]()
这不禁让人好奇,这些人在智象身上看到了怎样的未来?
LLM估值红利见顶,视觉模型的想象空间正在被打开
智象C轮融资的这个时间点很微妙,恰好踩中了AI行业范式切换的关键拐点。
此前,大语言模型凭借代码生成、文本交互能力,长期占据资本与市场的核心焦点,参数规模、推理速度成为核心竞争标尺。
近期,随着新一代开源/开放权重模型密集发布,市场对大语言模型估值溢价的分歧明显加剧,部分已上市AI模型公司股价波动加大。
过去,资本愿意为更大的参数规模、更高的Benchmark分数、更强的通用能力支付溢价;
但当模型能力迭代越来越快、领先窗口越来越短,单纯“做大模型”已经不再是足够稳固的估值锚点。
相比继续押注参数规模,资本的目光正在从AI“现在能做什么”,移向“未来能成为什么”
市场正在形成共识:大语言模型的领先优势极具短暂性,单纯依靠参数堆叠、文本能力领跑的模式,已逼近工程天花板。
同一时间,AI视觉赛道却呈现出截然不同的景象,迎来资本集中爆发。
据不完全统计,2026年国内AI视觉领域的融资总额已逼近300亿元。
大厂背景的字节系Seedance、可灵ARR数据大幅增长,一众独立创业公司接连落地大额融资,赛道整体进入技术落地、商业兑现的黄金周期。
可以说,多模态已经成为自AI Coding之后,AI商业化确定性最高的赛道之一。
智象未来能在资本市场受到瞩目,当然离不开这个时代的“大气候”。
多元资本共同押注了一个怎样的技术叙事?
赛道升温,不代表所有人的机会均等,市场只会把筹码押给真正的头部玩家。
而一家公司的投资方阵容,往往就是最直接的信任投票。
翻看智象未来投资人名单,几个鲜明的特征跃然纸上:国家级资本站台、多元资本集结、以及“首次出手”的稀缺性。
公开信息显示,这是社保基金作为LP首次投资多模态大模型方向的公司,更是工银资本第一次出手多模态大模型企业。
跟投名单里,还站着来自安徽、上海、浙江、福建、湖南多地的国资。上影股份、华策影视两家头部影视上市公司并肩入局。
此外,还有东方富海、弘颐资管、敦鸿资本这些顶级的市场化VC。
这种多元化的投资人结构,在当下的一级市场中并不多见。
通常情况下,一家AI创业公司的融资轮次越往后,股东构成会趋于收敛,集中在少数几类财务或产业资本手中。
智象未来的情况——国资、产业方、市场化VC在同一轮次密集参与,至少说明一个问题:不同属性的资金,在这里看到了不同的价值锚点。
对国家级资本而言,关注的是“路线”。
全模态世界模型是否成立,目前尚无定论,但如果这一方向最终跑通,其战略意义将不止于单一商业场景,而可能成为下一代AI基础设施的重要组成部分。
影视产业资本,此次投资是卡位内容产业革命的前置布局。
因此,可以看到上影股份、华策影视与智象未来达成了多项合作,比如新型内容创制、院线场景升级、AI跨屏整合营销、AI大屏制片标准与工作流程制定等方向协同。这显然不是一次简单的财务布局,双方都志在长远。
对地方国资而言,算的是产业账。
AI竞赛已进入贴身肉搏阶段,各地都在寻找自己的“标志性项目”。
过去十年,合肥接连投资了长鑫科技、京东方等高科技企业,这座城市在过去反复证明了一件事:它擅长在行业黎明期下重注。如今,智象未来被摆在了相似的位置上。
而敦鸿资本、弘颐资管、东方富海等市场化顶级机构集体入局,则是基于硬核技术落地价值的专业判断。
多家机构更是首次布局视觉大模型赛道,这也从侧面印证了智象未来的技术路线、团队积淀与商业化能力,具备一定的行业稀缺性与差异化优势。
不同背景的出资人,从各自坐标出发,看到了同一个方向上的不同切面。但这些切面最终拼出的那个完整图景,才是真正值得追问的问题——
他们共同押注的,究竟是一个什么样的技术叙事?
颠覆行业“缝合架构”,UiT跑出原生全模态新路径
要回答这个问题,需要回到一个更底层的判断:大模型通往AGI的路径,正在发生一次根本性的路线分歧。
过去两三年,AI行业的主流叙事是“规模法则”——参数越大、数据越多、算力越强,模型就越聪明。
杨立昆对此立场鲜明,甚至近乎偏激,他曾多次表示,三到五年内,世界模型将取代LLM成为主流AI架构。
这一判断是否准确另当别论,但它指向了一个大模型无法回避的先天缺陷:LLM本质上是“书斋里的思想家”,它的智能被局限在人类文明已编码的符号系统之内。
世界模型试图解决的就是这个问题:让AI不仅仅处理符号,而是理解物理世界中的空间、时间、因果和交互。
智象未来选择从视觉像素出发,构建原生全模态架构。
这个选择的背后有一个核心判断:图像是信息密度极高的模态之一。
一张图片定格的是某一时刻物理世界的完整状态,空间关系、光影变化、物体材质、色彩信息,所有这些都被压缩在像素矩阵中。
传统的多模态模型,本质上是“缝合怪”,在语言模型之外挂一个图片理解模块,再补一个生成模块,各模态分别编码,最后在外层拼接。
文字是主轴,其他模态是插件。信息在不同模块之间传递时,每一次转换都在损耗。
智象的UiT架构试图颠覆这个范式。
它将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号,由同一套Transformer完成理解、生成和推理。
不设独立的文本编码器,不用VAE作为模态间的传导介质,所有信号统一tokenization,端到端地在同一网络中完成多任务处理:文生图、长文本渲染、指令编辑、主体驱动、故事板生成,全部由同一个模型完成。
全模态世界模型不是一个停留在论文里的学术概念。2026年5月,原生全模态架构迎来了第一个关键节点。
智象旗下HiDream-O1-Image(8B参数开源版本)以「Peanut」匿名上榜全球知名独立AI模型评测平台Artificial Analysis、并登上文生图榜单开源模型第一,成为榜单前20名模型中参数最小的版本。
随后,商用版HiDream-O1-Image-1.5再次成为该榜单排名最高的中国图像模型,位列全球前三,在光影、复杂构图、指令跟随和中英文字渲染上表现突出。
![]()
当然,一次评测登顶不意味着终局。
视觉大模型的竞争才刚刚进入深水区,榜单排名的变动周期正在从季度缩短到月度。
但这件事的坐标意义在于:当行业还在争论“世界模型到底能不能work”的时候,至少有一条技术路线,已经在第三方评测体系里交出了可被验证的答卷。
多路资本集体重仓,固然有赛道的热度使然,但更深层的驱动力,恐怕还要回到智象未来在底层架构上的差异化选择。
这让智象未来在众多AI创业公司中,呈现出了一种不太一样的质地。
这段“荒诞科幻片”,可能比SOTA更有说服力
区别于多数重技术、轻落地的AI创业公司,智象未来早已搭建起成熟可落地的“1+1+3”商业化体系,实现底层技术、平台能力、场景应用的三级跳落地。
- 体系第一层为HiDream全模态大模型底座,承载所有底层技术创新与算力支撑;
- 第二层为HiHarness企业能力中台,对外输出标准化、可复用的模型能力,适配企业定制化需求;
- 第三层聚焦商业营销、影视创作、社媒创作三大垂直场景,打造专属AI智能体产品,深度嵌入产业工作流。
其中,本次WAIC重磅发布的vivago R1多模态创作智能体,成为技术落地的核心标杆产品。
针对行业视频生成时长受限、画面跳变、人设错乱、可用性低等长期痛点,vivago R1实现了突破性革新,成为全球首款支持无限时长视频自主生成与编辑的创作智能体。
产品搭载长链路叙事规划能力,摒弃传统“抽卡式”随机生成模式,先完成整体脚本与镜头规划,再分段落地生成、智能纠错,单段任务失败独立重试,不影响整体创作进度。
依托这一架构革新,vivago R1将AI内容商用有效成功率提升至85%,跨过了企业规模化商用的核心门槛,让AI正式从辅助工具,升级为内容生产的核心生产力。
![]()
这套技术参数落到实际创作中是什么效果?
近期有一个来自用户的测试案例在创作者社群中流传甚广,有人在vivago R1上输入了一组相当刁钻的指令:
生成一部“叶什尔查姆风格”的荒诞科幻短片。
叶什尔查姆(Yeşilçam)是土耳其上世纪六七十年代为核心的商业电影黄金时代。
它整体上类似“土耳其好莱坞”,以高产、明星制和类型片著称;其中一支后期低成本山寨片,因为粗粝道具、拼贴素材和夸张表演,后来在海外电影圈走红,《土耳其星战》就是最著名的代表——
真人套着硬纸板喷银漆的怪兽服、泡沫塑料制作的石头道具、手绘的外星球背景、演员绑着石头在蹦床上模拟飞行、直接剪辑真实爆炸镜头入画。
它的精髓是“廉价到极致,反而形成了一种独特的幽默感”。
对于AI视频模型来说,这种风格真正的考验在于:它要求模型理解“不完美”,既要输出符合物理规则的画面,又要刻意保持低成本的质感,还要在“假”与“可笑”之间精确地踩中那个风格阈值。
大多数模型在面对这类指令时,会倾向于输出“好看的画面”而非“对的风格”。
而vivago R1的处理结果,至少在创作者社群的反馈中,被认为是“精准捕捉到了那种荒谬感”——硬纸板怪兽、手绘背景、廉价特效的质感都被复现,同时镜头之间的叙事逻辑保持了连贯。
一个把“假”做到极致的风格,反而成了检验模型对“真实”理解深度的试金石。
这个案例之所以值得被提及,不是因为它展示了多精美的画面,而是因为它指向了一个更本质的能力:一个真正可用的创作工具,必须能理解风格、执行意图、保持叙事连贯,而不只是生成漂亮的单帧画面。
扎实的产品能力也收获了全球市场认可。
目前vivago海外版已覆盖全球100多个国家和地区,累计服务超5000万用户,今年5月灰度版登顶Product Hunt日榜第一,被硅谷知名product hunter Chris Messina强力推荐,评价为“Think Claude Code,but for video”,商业化落地能力稳居行业第一梯队。
如果说前两年的AI竞赛比的是谁更能“读懂”人类已有的知识,那么从现在开始,比的是谁更能“看懂”并“推演”这个物理世界
这是一场从文本智能到物理智能的范式跃迁,也是世界模型赛道最迷人的不确定性。
沿着这条原生全模态技术路线,智象未来的演进节奏与落地效果,值得长期追踪。
它不仅是国产AI在底层架构上的一次主动突围,更可能为“大模型如何跨越纸上谈兵、真正走进物理世界”这一命题,提供了一个值得挖掘的范本。
随着这一轮融资尘埃落地,世界模型的牌桌摆开,真正的竞赛,才刚刚鸣枪。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.