开源项目FlashMoE近日在iPhone 17 Pro上实现了4000亿参数大语言模型的本地运行。该项目通过向GPU流式传输SSD数据,并结合混合专家模型(MoE)架构,使手机无需完整加载模型即可运行。实测显示,该设备生成Token速度为0.6个/秒,约每1.5至2秒输出一个单词。尽管速度缓慢,但这一突破表明,在优化技术支持下,未来智能手机本地运行超大参数模型具备可行性。目前,即使经量化压缩的4000亿参数模型仍需至少200GB内存,远超iPhone 17 Pro的12GB LPDDR5X配置。本地运行模式可保障隐私安全且无需联网,但将显著增加设备耗电。(IT之家)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.