上周,乌克兰开发者Slava S把一个叫ESP32‑AI的开源项目扔上GitHub。他用10美元的ESP32‑S3微控制器跑通了一个2890万参数的语言模型,全程不联网,全靠芯片自身。
这件事之所以让人停下来多看两眼,是因为ESP32‑S3的硬件实在太过朴素:512KB SRAM、8MB PSRAM、外加16MB闪存,任何一张手机原片都比它的快存储大。推一个30M量级的模型,正常情况下,光把参数塞进内存就会直接爆掉。该平台此前的最好成绩还停留在约26万参数,由Dave Bennett完成。
![]()
Slava的做法是从谷歌Gemma架构里借了一个“逐层嵌入”的技巧。他先把模型量化到4比特,整体压缩到14.9MB,然后把2500万个参数的嵌入表整个扔进相对慢速的16MB闪存。因为这种模型每个token只需要从表里拉少量几行数据,闪存的吞吐延迟并不会堵死推理流程,真正需要高速运算的“思考核心”则安安稳稳待在512KB的SRAM里。
训练这个模型的数据集是TinyStories,所以它更接近一个微型语言模型。受训料限制,它只能生成结构简单的儿童故事式文本,远谈不上通用。但把接近三千万参数的量级塞进一个买汉堡都不够的芯片上,本身就是在挑战“本地AI一定要高性能硬件”的惯性想法。
在Reddit和X上,不少嵌入式开发者已经开始琢磨:同样的思路,能不能用在门锁、传感器或者穿戴设备上,让那些永远没机会碰到云端AI的角落,也长出一点本地的推理能力。当然前提是你能接受它只会讲极短的故事、回答语法正确但逻辑稚嫩的句子。但话又说回来,10美元还要什么自行车。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.