2026年,旗舰手机和笔记本电脑上已经实打实地跑起了开源大模型。这不是PPT上的路线图,也不是实验室里的演示——华硕Zenfone 12 Ultra出厂即搭载Meta的Llama 3-8B,在完全离线的情况下完成文章摘要、文档总结、通话翻译和语音转文字。苹果的Apple Intelligence和谷歌的Gemini Nano也早已把端侧推理作为默认路径,只有任务超出芯片能力时才会上云。
换句话说,本地大模型不是"即将到来",而是"已经在你的口袋里"。真正决定体验的,不是芯片厂商反复宣传的TOPS算力,而是一个很少被写进参数表的数据:内存带宽。
![]()
8B模型已上手机,离线推理不是噱头
华硕Zenfone 12 Ultra是目前最直白的例证。据mtechresearch.tech的分析,这款手机出厂预装Meta的Llama 3-8B,用于本地文章和文档摘要,同时支持AI通话翻译和AI转录功能,全程无需网络连接。一个80亿参数的开源权重模型,经过量化压缩后塞进手机内存,干的是两年前还得靠云端API才能完成的活。
苹果的路线在架构上不同,但哲学上同源。Apple Intelligence的写作工具、摘要和Image Playground功能优先在设备端运行,只有当任务超出芯片承载能力时,才升级到Private Cloud Compute——苹果经过认证和审计的服务器层。据elephas.app的数据,整个端侧层在M系列Mac或iPhone 15 Pro及后续机型上约占7GB存储空间,而且完全免费,没有订阅解锁更多功能的设定。
谷歌的对应方案是Gemini Nano,驱动Pixel 8 Pro的录音摘要和离线智能回复;三星Galaxy AI的Circle to Search和Live Translate也支持端侧模式,由Knox认证层把关。这些厂商没有一家在应用商店页面里高喊"开源权重",但Llama出现在华硕手机上,是行业里最清晰的一次公开承认:真正在跑推理的是一个有名有姓的开源权重模型,而不是一个没人能说清的黑盒专有模型。
内存带宽才是真正的天花板
决定手机能跑多大模型的,不是NPU的TOPS数字,而是内存带宽。weeklyreviewer.com的拆解把账算得很明白:一个70亿参数模型,4-bit量化后大约需要3.5GB工作内存,在目前Copilot+ PC标准的40GB/s LPDDR5X带宽下,每秒能生成25到35个token——这个速度已经足够流畅对话。如果把参数规模推到130亿(量化后约7GB),吞吐量就掉到每秒12到18个token,被形容为"交互可用性的外沿"。
这个数字对比揭示了端侧AI的真实处境:模型规模每上一个台阶,内存带宽就卡一次脖子。手机厂商能做的,是在量化精度、模型大小和用户体验之间反复权衡。苹果的M4 Neu
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.