一个只有CPU、没有图形卡的小盒子,装得下350亿参数的大语言模型。POCKET团队周四公开了他们的设备端方案——完全跑在标准CPU上的35B模型,配合llama.cpp栈,实测吞吐量达到同类方案Bonsai的约3.4倍。
这组数据不是跑分技巧,而是一个硬件事实:在完全没有GPU参与的前提下,一台针对CPU推理做了深度工程优化的设备,已经把35B量级模型的本地响应速度提到了实用边界。POCKET Box这台专用CP U-Only主机,把软件层的优化连同固定硬件一并交付,目的是让设备端部署不用再看用户手里的显卡脸色。
![]()
模型分发走的全是开发者熟悉的通道。Ollama、Docker、ModelScope和Hugging Face GGUF同时上线,意味着使用范围覆盖了绝大多数本地推理工作流。拿到GGUF格式的量化文件后,开发者在Ollama环境里拉取运行,或者在Docker容器里调起服务,不需要额外适配专用安装器。这一点在设备端场景尤为重要——部署的卡点往往不是模型本身,而是打包格式和运行环境。
把大模型塞进CPU的代价是量化。团队坦率地指出了极限低比特量化的语言质量边界:采用IQ1这类极致压缩方案后,韩语生成质量会出现明显退化。想要在韩语场景获得可用输出,量化程度至少要控制在Q4及以上。这不是脚注式的提醒,而是直接影响韩国用户真实体验的硬约束。同一套让35B模型在CPU上跑起来的压缩技术,推到极致时反过来会伤到最需要语言质量的那群人。
从技术策略看,CPU优先路线瞄准的正是GPU短缺和成本造成的部署空白。在本地隐私推理、离线环境、以及无法挂载GPU的固定设备里,用llama.cpp把35B模型直接跑在CPU上的能力,可以一次性绕开显卡瓶颈。POCKET相对Bonsai的3.4倍提升,说明工程团队在llama.cpp栈上做了实打实的加速工作,而不是简单地给现有方案贴个新标签。
这份方案也有自己清晰的边界。3.4倍的对比基准是设备端方案Bonsai,不是GPU推理吞吐,也不是云端前沿性能。CPU推理35B模型虽然可用,但在绝对速度上仍然慢于GPU方案,而且输出质量严重依赖量化等级——IQ1对韩语不友好,Q4是实用底线。POCKET Box作为一台纯CPU硬件,继承了CPU推理的全部优势与限制。把它定位成一个强设备端、强边缘场景的本地无GPU方案,而不是通用GPU服务的替代品,就是在说明这件事的正确打开方式。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.