网易首页 > 网易号 > 正文 申请入驻

大模型量化翘楚,Unsloth 出桌面客户端了,这次没忘 Windows 用户

0
分享至

大模型量化翘楚 Unsloth 出原生桌面客户端了,macOS、Linux、Windows 三端齐发


Unsloth 是本号常客,几乎每个开源模型发布之后都有它的身影,T+1 就能拿出不同精度的量化版本。今晚,大家可以猜猜多久可以看到 Unsloth 放出的 GGUF

今年 3 月我写过它的 Studio,5 月写过它的 API:

那时候它的形态是浏览器里的 web UI,命令行敲一条装完,开 127.0.0.1:8888

Desktop 是把 Studio 包成了原生窗口,功能上更加完善、强大


我感觉,这次真正值得关注的地方,在于它把「本地模型」和「Agent 工具链」这两件事缝到了一起,加配本地部署的 Qwen3.8-27B,就能得到一个完全免费,离线运行、 安全可控的 Harness

Unsloth Desktop 是什么

一句话:免费、开源的本地模型客户端,跑模型和训练模型都在里面

  • 三平台全给 :Windows .exe 、macOS .dmg 、Linux 有 deb / AppImage / ARM64

  • 模型类型 :LLM、扩散图像/视频、MLX、GGUF、音频模型都能跑,也都能训

  • 硬件 :NVIDIA、AMD、Intel、Mac 的 GPU 和 CPU 都支持,多卡自动识别,纯 CPU 也能聊天

  • 许可 :双许可结构,核心包 Apache 2.0,Studio UI 部分是 AGPL-3.0

  • 隐私 :官方明确说无遥测,只采集 GPU 型号和设备类型用于兼容性判断,可以完全离线运行

Unsloth 现在实际是三个东西,我列个表:

形态

是什么

适合谁

Unsloth Desktop

原生桌面 App,双击安装

不想碰命令行的人,官方推荐从这里开始

Unsloth Studio

浏览器里的 web UI,命令行装

服务器、Colab、远程机器

Unsloth Core

pip 装的 Python 包

写代码微调的人


unsetunset安装unsetunset

Desktop 从官网或 GitHub Releases 下对应平台的包,安装就是双击的事儿


不过它要后台安装整套的 Unsloth Studio 这一步有点慢


unsetunset使用unsetunset 选模型:Model hub

模型中心有很多本地部署可用的模型,这块是 Unsloth 最有优势的地方,Dynamic GGUF 本来就是它家的东西,别人的客户端是去 HF 拉别人的量化版,它自己就是量化版的生产方

搜索、下载、切换都在一个界面里,还能自动检测你的电脑是否满足部署条件


也可以接入第三方模型,比如我配上了 DeepSeek


再回到主界面就可以直接调用了,本地和云端模型共用同一个聊天界面,云端这边还带 prompt caching,多轮下来省不少 token


功能设计上,感觉比之前 Studio 细节多了很多


图像、视频、音频的生成和训练都考虑到了


训练也都是 0 代码


再介绍几个我觉得比较亮眼的设计吧,很多其实都是底层实现,前端感受不到

一、自愈式工具调用,让本地小模型能干活

官方给的数字:工具调用准确率提升 50%,各模型区间是 30% 到 80% 更准,格式坏掉的 tool call 会被自动修复重试,单轮允许的工具调用次数放到 25 次以上,调用终止也更可靠,减少死循环

它放了一组 unsloth/Qwen3.5-4B-GGUF (UD-Q4_K_XL) 开启搜索、代码执行和思考的对比,最直观的一项是 XML 泄漏从 10/10 降到 0/10

本地跑 4B、9B 这个量级的模型,模型聪不聪明其实排在后面,真正卡住人的是它 tool call 格式吐错,整条链当场断掉,前面思考得再好也白搭。这个能力补上,本地小模型才从「能聊天」跨到「能干活」

代码执行也是真沙箱,Bash 和 Python 都能跑,模型可以自己写脚本、跑出结果、验证答案,Claude Artifacts 那类程序也在沙箱里。MCP 也能接,本地模型可以调你自己那套工具

二、Deep Research:本地模型也有了带引用的研究模式

普通搜索是模型思考过程中顺手查,Deep Research 是完整流程:先出计划(你可以先审再改),再去搜、读、整理,最后产出带完整引用的报告

有两个设计蛮不错:

  • 写报告之前它会自查一遍 没有依据的断言、前后矛盾、还没填上的空白 ,没有直接证据支撑的建议会被标成「可验证推断」,跟事实分开摆

  • 搜索走 DuckDuckGo 的私有 API, 真的进页面抓正文 ,不只读搜索结果摘要

想更狠一点,可以设 UNSLOTH_RESEARCH_AUTO_SCRAPE=1 打开全页 grounding,把 top 结果整页读进临时 RAG 再合成,默认关着,因为费时间也吃上下文

多个对话现在可以同时生成,一边等报告一边聊别的,互不挡着

三、unsloth start:一行命令把本地模型接进 Claude Code

这个是较早之前就有的功能了,安装客户端的时候,自动就把 unsloth 命令行工具装好了


Claude Code 里跑的是 unsloth/Qwen3.5-9B-GGUF,正常读文件、跑命令、写文档

启动 Unsloth、加载模型、进项目目录,然后:

unsloth start claude

claude 换成别的就是别的 Agent:

Agent

命令

Claude Code

unsloth start claude

OpenAI Codex

unsloth start codex

Hermes Agent

unsloth start hermes

OpenClaw

unsloth start openclaw

OpenCode

unsloth start opencode

Pi Coding Agent

unsloth start pi

端点、API key、provider、模型、上下文长度这五样它自动配好,而且用的是临时或会话级注入,不会往你 Agent 的正式配置文件里塞东西,这个设计很克制,谁都不想为了试一下本地模型就让工具的全局配置被改乱

还能指定模型和量化版本,:UD-Q4_K_XL 这个后缀就是选 GGUF 量化档,本机没启 Unsloth 时它会拉一个临时 server,Agent 退出就自动关掉

我个人最喜欢的是 --as-subagent

unsloth start claude --as-subagent --model unsloth/model-GGUF:quant

Claude Code、Codex、Pi 保持自己的主力云端模型不变,只把本地模型挂成 subagent 去干脏活累活。批量读文件、跑格式化、整理日志这类不需要智商但很烧 token 的任务交给本地模型,主力模型的额度留给真正需要脑子的地方,这个组合拳比「全用本地模型」现实得多

配套的 API 面板长这样,设置里建 token,OpenAI 兼容和 Anthropic 兼容两套格式都支持:


这条路上有几个坑,官方文档里写了,我给挑出来

  • Claude Code 自带一条减速带 :它往系统提示最前面插一行每次都变的 attribution header,KV cache 每轮全部失效,本地模型直接慢 90%。启动时加 --settings '{"env":{"CLAUDE_CODE_ATTRIBUTION_HEADER":"0"}}' ,或者写进 ~/.claude/settings.json

  • Codex 目前必须用 GGUF 走 llama-server 后端 ,transformers 后端它不认

  • Codex、OpenClaw、Hermes、Pi 这四个的托管目录默认是临时的,想续会话,**第一次启动就得加 --persist **,后面每次也要加,再配 Agent 自己的 resume 参数

  • --yolo 映射到各 Agent 的免确认模式,Agent 可以不问就执行命令,只在你能接受这个后果的环境用

四、远程访问:--secure

unsloth studio --secure

这算是一个骚操作

一条命令开一个免费 Cloudflare 隧道,拿到一个公网 https://*.trycloudflare*com 地址,手机上就能看模型、看训练进度

关键在于它的默认姿态:进程仍然只绑 127.0.0.1,只通过隧道对外,隧道起不来就直接不启动(官方叫 fail closed),裸端口一次都不会露出去。对比之前那种 -H 0.0.0.0 直接把裸端口开在所有网卡上,安全性完全是两回事

这里必须把风险讲清楚,官方文档自己也写了:服务端工具(联网搜索、Python、终端代码执行)默认是开着的,而且以你的用户身份运行。谁拿到链接和 API key,谁就能在你这台机器上执行代码。对外暴露的时候,请加 --disable-tools,API key 千万别贴到截图和日志里

还有个实用细节:Cloudflare 快速隧道不支持 SSE,走隧道调 API 得把 stream 设成 false

五、训练:完全零代码

这算是 Unsloth 的老本行:500+ 模型,2 倍速度,省 70% 显存,无精度损失,LoRA、QLoRA、全参微调、预训练、RL、GRPO、DPO、FP8、DoRA 全套都在,多 GPU 自动生效。文本、视觉、TTS 音频、embedding 模型都能训

Unsloth 把整套能力放到了客户端上

数据集不用自己攒,扔 PDF、CSV、JSON、DOCX、TXT 进去就行:


Data Recipes 的官方配方:从答案反推指令、PDF 文档问答、OCR 抽取、文本转 Python,标了难度等级

Data Recipes 是图节点式的工作流,底层用的是 NVIDIA NeMo 的 Data Designer。「PDF Document QA」这个配方对企业场景挺实用,一堆非结构化 PDF 直接转成有出处的问答训练对

训起来之后有完整的监控面板:


训练监控:step 27/30、loss 1.1352、grad norm 0.041,右侧 GPU 利用率和显存占用实时刷,下面是 loss 和梯度范数曲线

loss、梯度范数、GPU 利用率、显存实时曲线,还能在手机上看进度,配合上面的 --secure,出门在外也能盯着自己那台机器在跑什么

训完导出给 safetensors、GGUF、NVFP4、FP8,直接进 llama.cpp、vLLM、Ollama、LM Studio。训练历史会存着,随时回去重导

Mac 用户也不用担心:训练、MLX 推理、GGUF 推理在 macOS 上全都支持,这在同类工具里不多见

几个已知局限

  1. 还是 Beta ,v0.1.70-beta,图省事可以,别往生产环境放

  2. 推理有时候会更慢 ,官方在 FAQ 里直接承认:联网搜索、代码执行、tool call 自愈这三样都吃时间,全关掉之后速度才等于普通 llama.cpp 应用。如果你只要纯推理速度,这些功能记得关

  3. 纯 CPU 目前只支持聊天和 Data Recipes ,训练还是得 NVIDIA、AMD 或者 Mac

  4. Vulkan 只加速 GGUF 推理 ,训练仍然需要 PyTorch 或 MLX 后端,别指望 Intel 核显能训模型

  5. 老硬件官方明说可能支持不好 ,太旧的卡先别抱期望

  6. Deep Research 目前 只支持本地模型 ,每个对话同时只能跑一个

总结

Unsloth 从一个加速微调的 Python 库,到浏览器里的 web UI,再到今天的原生桌面客户端。它一直在做的一件事,是把「本地跑大模型」从工程师的手艺变成普通人的按钮

具体到该不该装,我的建议:

  • Windows 用户,想在本地跑模型,又不想碰命令行 :直接下 exe,这是目前门槛最低的一条路,没有理由再等

  • 已经在用 LM Studio 或 Ollama 的 :值得迁过来的理由在 tool call 自愈、能直接训练、Data Recipes 这三样,纯推理速度它没有优势,官方自己都承认开了功能会变慢。迁移成本也低,你在 HF 缓存和 LM Studio 里下过的 GGUF 它自己就认出来了,不用重下

  • 想在 Claude Code、Codex 里省 token 的 :直接从 unsloth start claude --as-subagent 开始,本地模型当 subagent 干脏活,这是我看到的收益最实在的用法

  • 要微调但不想写代码的 :五步向导 + Data Recipes + 导出 GGUF 这条链是闭环的,目前本地方案里完整度最高

从哪一步开始?装完先只干一件事:下一个 20GB 以内的模型,把 unsloth start 接到你平时用的那个 Agent 上,跑一个真实的小任务,面对这类客户端,别看它宣传了几十个功能,就看一件事:它能不能接住你手上那个真实任务

目前我内网跑的还是 OpenWebUI,也在想要不要上个 Unsloth DeskTop 呢?


既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彩票出现断崖式暴跌,“2元中500万”为何没人信了?原因引人深思

彩票出现断崖式暴跌,“2元中500万”为何没人信了?原因引人深思

阿振观点
2026-08-21 05:38:20
6-4!亚洲黑马首进欧冠正赛:连扳4球大逆转 补时绝平+加时赛制胜

6-4!亚洲黑马首进欧冠正赛:连扳4球大逆转 补时绝平+加时赛制胜

我爱英超
2026-08-26 05:29:31
江苏吾悦广场捉奸现场失控:丈夫当众护小三按倒原配,女方身份曝光引全网哗然

江苏吾悦广场捉奸现场失控:丈夫当众护小三按倒原配,女方身份曝光引全网哗然

老猫观点
2026-08-25 10:55:58
你好,湖人,库明加改变主意了,一场没打就交易

你好,湖人,库明加改变主意了,一场没打就交易

体育新角度
2026-08-26 19:52:51
段睿37岁生日这天,患渐冻症7年的蔡磊的做法,打了多少夫妻的脸

段睿37岁生日这天,患渐冻症7年的蔡磊的做法,打了多少夫妻的脸

调侃国际观点
2026-08-25 19:13:11
殡葬师说漏嘴:人死后,无论火葬还是土葬,千万别买寿衣!

殡葬师说漏嘴:人死后,无论火葬还是土葬,千万别买寿衣!

小陆搞笑日常
2026-08-23 11:02:08
专家公开怒撕汤家凤:整日网上怼天怼地!看似仗义执言,实则不务正业、疯狂蹭热点

专家公开怒撕汤家凤:整日网上怼天怼地!看似仗义执言,实则不务正业、疯狂蹭热点

小徐讲八卦
2026-08-26 09:40:25
转告父母:这5处出现皮肤瘙痒,或是大病来临的征兆?千万别大意

转告父母:这5处出现皮肤瘙痒,或是大病来临的征兆?千万别大意

读懂世界历史
2026-08-26 10:42:41
下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

思思夜话
2026-08-18 10:44:09
梁靖崑:本以为有2个儿子已经够幸福,没想到,现在幸福又升级了

梁靖崑:本以为有2个儿子已经够幸福,没想到,现在幸福又升级了

秋风悲画芯
2026-08-26 04:16:24
罗永浩方已向湖南“扶老人被索赔1.9万元”店主捐助10万元,本人发文谈初衷:做好事反被讹诈的人,应当得到来自社会的情感支持和“奖励”

罗永浩方已向湖南“扶老人被索赔1.9万元”店主捐助10万元,本人发文谈初衷:做好事反被讹诈的人,应当得到来自社会的情感支持和“奖励”

极目新闻
2026-08-26 11:44:22
研究发现:喝一碗绿豆汤,就等于给血管添一次堵?医生道出真相

研究发现:喝一碗绿豆汤,就等于给血管添一次堵?医生道出真相

芹姐说生活
2026-08-23 22:40:25
美国慌了!华盛顿终于发现:没有中国点头,美军根本打不了仗

美国慌了!华盛顿终于发现:没有中国点头,美军根本打不了仗

史怌的生活科普
2026-08-20 04:32:51
我正陪省纪委书记吃饭,妻子被单位领导免职,他放下筷子:哪个局

我正陪省纪委书记吃饭,妻子被单位领导免职,他放下筷子:哪个局

千秋文化
2026-08-26 20:43:05
歼-20歼-35要小心了,美国突然公开新型导弹,射程远超霹雳-15

歼-20歼-35要小心了,美国突然公开新型导弹,射程远超霹雳-15

影孖看世界
2026-08-25 20:45:04
通宵9小时手术休息15分钟被罚款,我当场辞职,次日医院换董事长

通宵9小时手术休息15分钟被罚款,我当场辞职,次日医院换董事长

红豆讲堂
2025-08-19 13:25:03
特朗普:对伊朗在霍尔木兹海峡布雷“零容忍”

特朗普:对伊朗在霍尔木兹海峡布雷“零容忍”

新华社
2026-08-25 22:52:26
绯闻作废!孙颖莎王楚钦真实关系曝光,这才是少年最干净的羁绊

绯闻作废!孙颖莎王楚钦真实关系曝光,这才是少年最干净的羁绊

调侃国际观点
2026-06-29 12:28:51
最矮奥运冠军:身高1米37无人追,退役后二次发育,如今遇到真爱

最矮奥运冠军:身高1米37无人追,退役后二次发育,如今遇到真爱

贵州小娟
2026-08-24 20:27:33
赴韩领毕业证中国女留学生遇害案嫌犯为该校讲师,同班同学称每周上一次他的课,受害人姐姐连发三句“要他死”

赴韩领毕业证中国女留学生遇害案嫌犯为该校讲师,同班同学称每周上一次他的课,受害人姐姐连发三句“要他死”

极目新闻
2026-08-26 13:26:21
2026-08-26 21:47:00
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3517文章数 11195关注度
往期回顾 全部

科技要闻

DeepSeek被曝前七个月收入4.75亿元

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

头条要闻

男子未领证办婚礼后离世留400万财产 女方要求分200万

体育要闻

兑现五年之约,含梗量最高的世界冠军诞生

娱乐要闻

包文婧当初担心包贝尔出轨,预言成真

财经要闻

洪灏:人民币是全球最被低估的货币

汽车要闻

硬派增程SUV新选手 北汽泰钽700上市焕新价24.98万起

态度原创

本地
数码
教育
旅游
公开课

本地新闻

无印良品竟是桐乡造?这座小城藏着一个刀具帝国

数码要闻

三星在2026年科隆游戏展发布P9、P7便携式SSD 全面转向USB4

教育要闻

关于2026年悦读相伴项目申请结果的公示

旅游要闻

“必吃榜”境外再拓20城,更多异国地道风味被中国游客“吃”上榜

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版