作者 | 平章
出品 | 《易现场》
2026年,大模型竞赛进入“下半场”。当互联网巨头仍在比拼云端模型的参数规模与推理速度时,手机厂商却正在悄然开启一场“端侧革命”。
9月16日,2026 vivo开发者大会现场,vivo副总裁、OS领域副总裁、vivo AI全球研究院院长周围向《易现场》等阐述了端侧大模型、系统底座与个人化智能的问题。
相较往年“不盲目追参数量”的保守口径,这次周围明确表态vivo已开始预研蓝心30B MOE端侧模型,并把“专家稀疏加载”作为手机跑大模型的核心解法。在他看来,端侧大模型不是“能不能跑”的问题,而是“为什么必须跑”的战略必选项——隐私控制权、个人化智能、系统级执行,以及芯片硬化带来的功耗优化,共同构成了手机厂商必须走端侧的核心动因。
这不仅是一次技术释疑,背后更是一家头部手机厂商对“为什么必须走端侧”的深层思考。
为什么从“全量加载”转向30B MOE端侧模型
周围一开场就坦言,去年vivo对端侧大模型的判断偏谨慎:7B、3B全量载入已对内存形成压力。
周围复盘了这一转变:“好家伙,在今年年初的时候发现,大模型其实不是要一次就加载完的,它是可以MOE,每次只要加载几个专家模型就行了。”在他看来,手机本身拥有512GB甚至1TB的存储空间,旗舰机内存也普遍来到12GB,拿出2-3G内存运载MOE模型,让端侧跑大模型变成了现实。
![]()
按vivo当前预研口径,30B并非“稠密模型全跑”,而是总参数切分为数十到上百个专家,单次推理动态激活1-3B,内存占用可压到2-4GB。
“30B给大家的错觉是很大,其实只是把它切成了30块或者100块。”周围解释道。作为参照,Qwen3-30B-A3B总参约30.5B、激活约3.3B,在桌面全量量化仍常需20GB级内存;vivo的2-4GB属于高度量化、按需分页、只常驻部分专家的端侧工程口径。
周围坦言,30B MOE目前仍是工程验证,不会立刻上量产机型。原因有两层:模型本身需调校,硬件需等芯片规划,“今年提液态玻璃是因为24个月前就规划了芯片,今年提MOE,同样需要24个月后对应的芯片规划落地。”
他预测,到2028年底,MOE实现大模型能力在端侧一定会变成现实。
功耗与常驻:端侧该如何“跑”?
端侧30B最容易被质疑的是续航。对此,周围向《易现场》做出阐述:专家常驻RAM本身耗电极低,真正耗电在于“搬运”--从存储或闲置专家区调参进计算单元。
据周围透露,3B级初期方案工作电流曾约800mA,迭代后可降到500-600mA;30B MOE若只切专家、由算力芯片完成搬运与推理,理想工作电流约500mA,而2028年其工程目标为600mA上下。
这要求系统层做三件事:其一是统一渲染与计算资源调度。OriginOS 7的通透玻璃、动态光影并非纯软实现,2024年vivo已把高斯模糊、图层合并硬化进芯片,避免走CPU软绘带来的功耗崩塌;其二是模型权重分层,高频专家常驻、低频专家存储待命,跨域任务只换专家不换全模型;其三是端侧推理与OS Harness融合,蓝心小V调用相册、日历、设置等本机功能时不必每次传云。
周围以相册为例,“端侧模型后台默默感知并记忆了特征,用户问‘国庆带小孩在海边’的照片,瞬间就能完成。相册100GB照片如果在服务器跑要半天,但端侧模型在Main-Loop里早就建好了个人化存储空间。”这类感知记忆,正是30B MOE后续替代小模型、做个人化编排的基础。
手机厂商为什么一定要走端侧?
把30B MOE放在vivo整体AI战略里,把Agent从“语音触发—云上推理—返回结果”改成了“本地理解—本地预判—人工确认”。
为什么手机厂商必须走端侧?以下是vivo高管们强调的核心逻辑。
第1, 隐私与数据控制权。周围多次强调,手机是贴身设备,相册、聊天记录、家庭关系等敏感数据若全部上云,隐私风险不可控。而鉴于vivo秉承着“用户是机场塔台,飞机起不起飞由用户说了算”的安全原则,可在本地完成感知、记忆和推理的端侧模型,数据不出端,用户可一键删除所有AI记忆,这就是vivo坚持自研端侧模型、而非完全依赖云的重要因素。
第2, 个人化智能需要本机全量上下文。vivo AI产品总经理关岩冰指出,大家用各种Agent时总要反复输入背景信息,而手机上存着用户最全的个人数据。
![]()
周围举了一个生动的例子:做旅游攻略,第三方APP也能做,但如果你老婆怀孕了,你可能忘了跟第三方APP说;而蓝心小V会很贴心地说“能不能带个折叠小凳子?”还有,你看了《飞驰人生》聊了巴音布鲁克,小V去新疆就会建议你去巴音布鲁克。“只有懂你家庭关系、社会关系和行为偏好的Harness,才能做出让你尖叫的产品。”这种个人化,必须依赖端侧长期记忆和本地模型。
第3, 系统级执行与原子能力调用。vivo当前已把本机6000个原子能力接入小V,长期目标按PC Harness标准补足到约3万个接口。30B MOE可作为本机编排大脑,直接调用设置、相册、日历、通信等,不必所有步骤走GUI自动化。
周围直言:“即使在PC上,私有应用对GUI的支持也非常弱,手机不需要那么执着。”端侧模型可以直接理解意图、调用底层功能,这是第三方云助手无法做到的,它们没有系统权限。
第四,芯片硬化与功耗优化的终端厂商优势。纯软算法无法实现液态玻璃效果,vivo在2024年就把高斯模糊硬化进芯片;同样,端侧大模型的低功耗运行必须依赖NPU、内存带宽和算力的协同设计。周围表示,只有终端厂商去和芯片厂商合作,才能把这个端侧做得比较好。这也是为什么vivo坚持自研模型并走端侧路线。
第五,无网络场景与无障碍刚需。周围特意表示,vivo的无障碍功能(如vivo听见)在飞机上无网络时,依然可以全程端侧语音识别,服务听障人群。这证明端侧模型不是噱头,而是真实场景的必选项。
基于以上原因,vivo判断:未来Agent手机的核心竞争力不在于云端基模有多大,而在于端侧模型能否与系统深度融合,形成个人化智能。
采访最后,周围再次强调了vivo的产品哲学:“产品的竞争力不是和友商比,而是是否真正让用户满意。就像无障碍功能,我们做出了让用户偏爱的、好很多的产品。未来,蓝心小V会成为你专属的个人助理,这是我们的愿景。”
