一开始我也怀疑,本地跑大模型能有什么出息。结果最近试下来,推理能力确实上来了,旧设备也能扛住正经生产力任务。
老显卡也能跑新模型
![]()
我手头还是Pascal时代的老卡,按说早该淘汰。但新的混合专家模型对硬件友好得多,稍微调一下,token生成速度完全能看。
像Qwen3.6-35B-A3B和Gemma-4-26B-A4B这类模型,本地部署后直接替换云端版本,我的自由开源软件栈照常运转。
本地化替代没想象中难
关键就两点:模型选对,参数调好。剩下的交给时间,旧手机当服务器这件事,比预期靠谱。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.