这是根据您的删除建议优化后的 HTML 文章: html
大型语言模型(LLM)非常有用。它们并不完美,但如果提示得当并有效使用,它们可以提高你的生产力,并为你腾出宝贵的时间来处理其他任务。大部分苦力活都在云端干完了,例如 ChatGPT、Claude、NotebookLM 和 Copilot 等。数据中心里的服务器会临时调配起来,专门应对进来的请求,你可能已经读过一两篇新闻报道,了解这些庞大的设施在处理人工智能时需要消耗多少电力。如果你认为比特币挖矿是在浪费资源,看到人工智能也这么干,你准得傻眼。
但这就是自己跑 LLM 的用武之地,效果完全是两码事。能够将高度优化的模型加载到免费且开源的软件上,只需一台 PC 即可运行,每次系统开足马力处理你的请求时,也就费点电而已。它肯定没法和云端 AI 比,没那么顺溜也没那么能打,但只要别抱太大期望,并学会如何最好地提示每个模型,你光靠一块独立显卡和一台普通台式机,就能搞出一些让人难以置信的成绩。再塞一块 Nvidia GeForce RTX 5090 进去,你就能突然使用一些非常强大的模型。
使用基于 LXC 的 Ollama 和 Open WebUI
它简单、快速,而且是我已经熟悉的东西
我以前压根懒得碰 CPU,或者更具体地说,懒得碰芯片上集成的 GPU。直到我实在受不了我那台 LLM 机器,闲着没事就干耗 100 瓦电,处理请求时更是狂吃电,能飙到 300 瓦左右。我把它换成了一台小巧省电的迷你 PC,处理器也就那么回事,结果并没有我预期的那么糟糕。我决定让这台迷你 PC 继续运行,作为我的新 LLM 机器,还挺期待未来能在不少硬性限制下,进一步优化模型、提升表现。你该在便宜的小迷你 PC 上跑 LLM 吗?要是你指望它有 ChatGPT 那反应速度,那还是算了吧,不过当个乐子搞搞也挺有意思的。
我在迷你PC上启动了Proxmox,确认所有可用的CPU核心和内存都已准备就绪。然后,顺手去Proxmox社区脚本页面逛了一圈,获取安装Open WebUI with Ollama的命令。安装完成后,通过OPNsense为其配置了专用IP地址——替换了之前运行在更强大PC上的Open WebUI——搞定,直接开干。就像许多其他家庭实验室项目一样,实现方法数不胜数,但我认为Proxmox和LXC是充分利用现有硬件的最佳方式。
我不是冲着最佳性能去的(该CPU的TDP仅为15W),至少现在还不是。我知道在涉及Ollama的任何事情之前,我会遇到硬件限制。使用llama.cpp可能会带来性能提升,但即便如此,是否值得仍是个问题。这是我稍后会研究的事情。作为参考,这台Minisforum U850迷你PC搭载了英特尔酷睿i5-10210U CPU,拥有四个核心,并配备16 GB DDR4-2666内存。对于本地LLM来说,这配置有点不够看,尤其是内存方面,因为主要靠CPU扛,而且跟DDR5和独显比,这内存太拉胯了。
低功耗CPU的表现出乎意料地强大
但跟专用硬件比,那真是差远了
配置Open WebUI也挺简单的。在创建第一个账户(同时具有管理员权限)后,我下载了qwen3:4b-14_k_m和qwen2.5coder:7b-instruct-q4_k_s,这俩模型就当我的测试平台,看看这系统跑那些小但优化得很好的LLM到底行不行。结果真没想到,正如我尊敬的同事Ayush Pande在对配备Intel N100 CPU的迷你PC进行类似测试时发现的那样。在我的紧凑型系统上运行Qwen3时,4B模型在回答简单问题(例如询问XDA Developers是什么)时,速度约为4 tok/s。虽然不咋地,但边干别的边查东西,那是绰绰有余了。
Intel Core i5-10210U在设计时从未考虑过本地LLM。它就是块移动芯片,硬塞进迷你PC主板上的。要是让它干重活,那等起来可够呛,但四个物理核心和可升级的RAM确实为更重的任务(如运行本地模型)提供了一些回旋余地。我发现10B以下的模型都能跑,根本不用碰交换空间,也不用干等CPU慢慢磨。下载的测试模型qwen3:4b非常适合一般查询,而大一点的qwen2.5coder:7b,拿来辅助干活也挺稳的。
我真心觉得挺逗的,Qwen3 居然以为 XDA 不报道大语言模型和 PC 硬件,不过有意思的是,这模型还挺依赖那个社区论坛的。这就是那些参数少、体型小的模型的特点。你得用对方法去引导它们,才能把这技术玩明白。光问 XDA 报不报 PC 硬件和大语言模型是没用的,尤其是你刚问过 XDA 是啥之后。这模型会拿论坛里的内容来接着回答,但问题就出在这儿——大家跟本地或云端模型打交道时,往往就在这一步卡壳。
它并非理想的日常使用工具
虽说每秒 4 个 token 对我用本地模型来说完全够使,但要是天天跑模型,这配置可不算理想。你要是想要响应快、准确率高,那就得上云,或者搞套给力的硬件全在本地跑,可这么一来电费又是个事儿。有时候,得看你住哪儿、手头有啥电脑配件,云端 AI 反而可能更划算。像我们这种不介意等个一两分钟才出结果、只是拿大模型干点特定活儿的人,就算是一台像这样带 15W CPU 的低功耗便宜迷你主机,也完全能搞定。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.