想不想要一个桌面小伙伴?它有复古游戏角色的手感,能陪你聊天、帮你盯着桌面计时器,或者在你卡bug的时候陪你捋一遍思路——而且,全程没有摄像头盯着你。
这个问题催生了 DinoDesk AI,也就是我们的乐高恐龙AI陪伴机器人。我和同事 Shama 从零开始,搭了一个低功耗的桌面机器人:8位音画风格的怀旧感、乐高机械组的拼装乐趣,再加上一套混合大模型切换架构(本地 ↔ 云端)。
![]()
做法是把一块树莓派放在桌上,本地PC当网关,同时跑 Gemma 4 和 Gemini Flash。最终得到的是一个视觉上100%保护隐私(没有摄像头)、本地闲聊零成本零延迟、需要时又能调用云端深度推理的桌面伙伴。
大脑放在哪,是个两难
做AI硬件陪伴产品,最大的纠结之一就是:大脑放哪儿?
如果全部跑在云端,每一句随口的“现在几点了”都要消耗API额度、增加网络延迟,还得把语音数据传到互联网上。反过来,如果严格限制只用一个小型端侧模型,那当你让它在一个庞大的代码库里新建功能,或者解释一个复杂话题时,它立刻就撑不住了。
所以我们决定做一套混合大模型架构,把统一的大模型网关(路由器)放在用户的主力PC上。桌上的树莓派通过Wi-Fi发送统一的、兼容OpenAI接口的请求,不管当前激活的是哪个引擎,请求格式都一样。
三种智能模式
整套系统围绕三种模式运转,切换方式各不相同:
- 本地模式(默认):激活模型是 Gemma 4(通过 LM Studio 运行)。优势是零成本、离线、100%私密,闲聊和桌面计时这类场景下首字延迟约200毫秒。
- 云端模式:激活模型是 Gemini Flash / Gemini Live。用于需要深度推理的复杂任务。
- 切换方式:由本地网关上的动态模型路由器负责调度。
树莓派这一端负责的是交互层:Pirate Audio 的LCD屏和I2S蜂鸣扬声器、一个按键,以及可选的传感器。它不关心背后是本地引擎还是云端引擎,只负责把统一的流式响应呈现出来。
为什么这个架构值得抄
把路由器放在PC而不是机器人本体上,好处是请求格式统一。树莓派发出去的是同一套兼容OpenAI的流式请求,本地引擎和云端引擎对上层来说是可以互换的。这意味着你换模型、加模型,都不用动桌面端那套代码。
另一个好处是隐私边界清晰。没有摄像头,视觉上就没有采集;默认走本地模式,日常对话不出局域网。只有当你主动需要云端推理能力时,数据才会离开本地。
至于成本,本地模式下的闲聊和计时器是零API开销的,这也是把默认模式设为本地的原因——高频、低难度的请求不该花钱。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.