一台只有4GB显存的机器,能把一个0.8B的小模型,在决策类任务上的综合准确率从20.7%拉到74.3%。这不是换了个更大的模型,而是换了一套训练方式。
Unsloth 放出了开源教程和配套 Notebook,目标很直接:让普通人也能在本地训练出自己的决策模型,就像 Jev 那样。
![]()
三个基准,一个数字
这次提升是在3个决策基准上测出来的综合准确率。基座是 Qwen3.5 0.8B,训练全程只用了4GB显存。对本地玩家来说,这个门槛意味着不需要多贵的卡,一台普通设备就能跑起来。
更关键的是方法本身不挑模型。按官方说法,你可以把 Qwen3.8、Gemma 4 这类任意 LLM,通过 Unsloth 的开源仓库改造成决策模型。
怎么做到的:一个 Clef 头 + LoRA
具体做法是用 Unsloth 加 LoRA 微调,秩设为 r=64,只训练一个 epoch,再配上一个 Clef 头。结果是下游准确率从 30–37% 提升到 78%。
这里有两个值得注意的点:
- 只跑一个 epoch,说明不是靠堆训练量硬磨出来的
- LoRA 秩 64 属于轻量适配,改动的是模型的适配层,不是重训整个网络
换句话说,成本被压在了显存和训练轮次两头,而收益体现在决策类任务的下游准确率上。
为什么决策模型值得单独练
通用 LLM 在决策类任务上往往表现平平,20.7% 这个起点就说明了问题——它不是一个为“做选择”优化的模型。而决策任务的特点是:答案空间有限、判断标准明确,正好适合用小规模微调去对齐。
把 0.8B 这种体量的模型在特定任务上拉到 74.3%,意味着很多场景下你不需要调用大模型 API,本地就能跑一个够用的决策器。
官方放出了 GitHub 仓库和文档、Notebook,路径是 github.com/unslothai/unsloth 和 unsloth.ai/docs/basics/training。想复现的话,硬件门槛已经写在明面上了:4GB 显存起步。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.