![]()
随着国内 AI 市场竞争持续加剧,对越来越多企业而言,出海正在成为拓展增长空间的一种选择,海外市场较高的付费意愿也带来了新的商业机会。对 AI 企业而言,业务进入不同市场后,算力供给、Token 效率、数据合规和本地化运营都会影响产品的部署成本、服务稳定性和扩张速度。
在这样的背景下,7月18日,InfoQ 极客传媒与 GMI Cloud 联合发布《中国 AI 产业核心要素出海发展白皮书》。火山引擎、小米 MiMo、快手、出门问问、商汤科技等多家产业链企业参与联合出品,「有新」作为媒体特别支持单位参与此次发布。
白皮书以算力、Token 和出海为三条线索,汇集基础设施、基础模型、MaaS 平台和垂直应用等环节的调研与实践,梳理中国 AI 企业全球化过程中面对的成本、效率与合规问题,并探讨产业链各方的分工协作方式,为相关企业推进海外业务提供参考。
目前,白皮书已开放下载。读者可关注 GMI Cloud 公众号并回复【白皮书】,或访问 https://www.infoq.cn/minibook/GSbtyU9968lerf5gwPpU下载查看。
![]()
▍AI 竞争正在转向推理效率
全球 AI 投入仍在持续增长。国际研究咨询机构 Gartner 预计,2026 年全球 AI 总支出将达到 2.59 万亿美元,其中生成式 AI 市场支出同比增长 59%。全球 AI 加速器市场规模也已经突破 2000 亿美元,英伟达 Blackwell 系列 GPU 仍是当前智算基础设施的重要选择。
随着 AI 从技术验证走向高频生产应用,产业投入重点也更多转向推理基础设施、模型服务和应用部署。模型调用更加频繁,应用任务也变得更加复杂,行业逐步进入以高频调用和复杂推理任务为特征的“推理经济”。
企业关注的重点随之从参数规模转向推理速度、服务稳定性和单位 Token 成本。Token 由此成为衡量 AI 产出、核算推理成本的重要尺度,也被视为 AI 时代的“数字石油”。
智能体(Agentic AI)和多模态实时交互正在进入更多业务场景,进一步推高了推理负载。中国日均 Token 调用量已经突破 140 万亿,两年内增长超过 1000 倍。Zylos Research 的研究显示,企业运行模型产生的推理支出已经占到企业 AI 预算的 85%,约占全球 AI 总算力开支的三分之二。
在调用规模和推理支出持续增长的情况下,企业对 Token 的关注也从调用单价延伸到使用效率。相同 Token 消耗能够带来多少有效信息和实际任务产出,开始影响模型服务的成本和交付质量。
在这个“推理称王”的阶段,底层算力与 Token 商业化形成了更紧密的双向制约。算力卡的显存容量和带宽,直接影响超长上下文及 KV Cache 的处理上限。反过来,Token 调用量的快速增长,也在推动全球数据中心将架构重点转向更高的推理吞吐效率。
▍出海落地,成本与合规挑战显现
AI 企业业务进入海外市场后,需要重新面对不同地区的技术条件、成本结构和市场规则。算力首先带来直接的成本压力。高端智算硬件的供应相对集中,供应链、政策和资源分布又存在地区差异,企业在不同市场获得算力的价格并不一致。由此形成的“算力溢价”,会抬高海外部署和扩容成本,也压缩产业链的利润空间。
算力成本还会进一步传导到 Token 使用。全球 MaaS 市场普遍采用差异化定价,部分主流模型的输出 Token 价格约为输入 Token 的 3 至 10 倍,不同能力层级的模型之间也存在明显的成本梯度。
非英语语种还可能因为底层编码效率较低而消耗更多 Token,并出现一定程度的语义损失。对 AI 企业而言,Token 效率会直接影响单次任务的成本和产品交付效果。
当产品进入真实业务场景,合规和本地化又成为落地过程中需要持续处理的问题。欧美等主要市场对数据主权、隐私保护和数据“零留存”提出了更细致的要求,例如欧盟 GDPR。企业需要同步处理数据存储、跨境流动、内容治理和审计等事项。
不同市场在文化习惯、用户交互和支付环境等方面也存在差异,产品的内容表达、功能设计和运营方式都需要相应调整。
这三类问题彼此关联,企业需要同时处理算力布局、模型接入、合规建设和本地化运营,单独优化其中一个环节,很难解决整体落地问题。
AI 出海因此逐渐从单一的“产品输出”转向多方协同的“生态输出”。重资产的物理算力需要通过统一调度和服务封装,转化为可以按需使用、灵活扩缩的弹性资源;模型服务和基础设施平台负责降低接入与部署门槛;应用企业则可以将更多精力放在具体场景、本地运营和用户需求上。
围绕 Token 效率和海外适配,产业链不同环节已经展开实践。快手 StreamLake 通过统一资源池、多云调度和 Token 计费看板控制调用成本。像素绽放 PixelBloom 利用语义缓存和分布记忆减少重复计算,将单次请求的综合算力成本降至行业平均水平的三分之一。出门问问 TicNote 支持 100 多种语言的实时转写,并围绕上下文管理、用量监控和海外数据合规调整产品架构。
在这套协作体系中,GMI Cloud 作为产业链中游的 AI 原生云及基础设施服务商,承担算力供给、资源调度和推理服务等工作。GMI Cloud 是全球七家 Reference Platform NVIDIA Cloud Partner 之一。依托硅谷团队的技术积累和全球数据中心布局,其 AI Native Cloud 可提供 GB300、B300、B200、H200 等高端算力资源。
为适配不同类型的 AI 任务,GMI Cloud 推出 Cluster Engine(Compute Engine)和 Inference Engine 两大平台,分别承担算力调度和模型推理工作,为 AI Agent 业务提供从算力资源到模型调用的服务。
算力调度首先需要适应不同任务的资源需求。训练任务通常需要持续占用大规模资源,Agent 和生成式 AI 应用的负载则会随着用户流量变化。针对这两类需求,GMI Cloud Cluster Engine 提供裸金属和容器两种服务形态。
裸金属算力服务支持一键创建、全球网络访问、SDN 和性能监控,适合对稳定性和资源控制要求较高的生产任务。容器算力服务提供更细粒度的资源配置,由平台统一编排和调度,无需企业自行维护底层环境。实例可实现秒级启动,以应对业务高峰和突发负载。企业可以根据任务特点,在稳定性、使用弹性和总体拥有成本之间进行选择。
算力资源确定后,企业还需要处理模型接入和在线推理问题。GMI Cloud Inference Engine 提供多模型统一接入和在线推理服务,底层搭载 H200、H100 及 GB 系列芯片,并接入 Gemini、OpenAI、DeepSeek、Qwen、Kimi 等近百个模型及服务。企业可以通过统一入口完成模型调用和管理,减少分别对接不同模型与算力资源的工程投入。
对于海外业务而言,模型服务还需要应对不同地区的流量变化和网络条件。针对跨区域部署需求,平台可根据负载自动扩缩,并通过全球边缘网关和多地区算力节点进行就近调度,减少闲置成本和跨境访问延迟。平台同时提供审计日志和内容治理能力,以配合不同市场的监管要求。
这些能力已经应用于生成式视频、大模型训练和弹性推理等生产场景。实时生成式视频企业 Higgsfield 将重度视频生成负载部署在 GMI Cloud 后,p95 推理延迟降低 65%,计算成本下降 45%,峰值流量下的请求成功率保持在 99.9%。
大模型开发商 Mirelo AI 通过更灵活的算力配置,将模型训练成本降低 40%,迭代时间缩短 20%。此外,HeyGen、Utopai、Eigen AI 等 AI 团队也在使用 GMI Cloud 的相关服务。
对整个产业链而言,AI 出海的下一步仍取决于不同环节能否形成持续协作。GMI Cloud 中国区总裁蒋剑彪表示:“全球 AI 产业已经进入算力、Token、应用三位一体的竞争阶段,单一企业很难独自承担全球算力布局、合规体系搭建的高额投入。GMI Cloud 将持续发挥产业枢纽价值,依托全球分布式智算底座,为 AI 应用企业提供合规、低成本、高弹性的全球化算力基础设施,共建全球 AI 产业新生态。”
▍持续学习:让经历改变下一次行动
从企业实践回到产业层面,AI 出海的下一步仍取决于不同环节能否形成持续协作。
展望未来,多主体协同的产业模式将重构传统的产业发展形态。技术、算力、场景和合规四项要素,将通过模型服务、资源调度和应用反馈形成持续联动。基础模型的算法能力与 MaaS 平台的算力调度相互配合,可以提高底层资源的使用效率;应用企业在海外积累的市场数据、场景需求和合规经验,则会推动模型与服务持续调整。
这种协作方式能够减少不同环节的重复建设,共同分担研发、算力运维和合规适配成本。在全球产业格局不断变化、不同地区市场规则存在差异的背景下,也有助于增强 AI 企业的市场适配能力和风险应对能力。
![]()
✦精选内容✦
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.