近期,围绕大语言模型微调(fine-tuning)的关注度快速上升。LangSmith 团队发布了一份实操指南,介绍如何利用其平台完成数据集管理与评估,并分别基于开源模型和 OpenAI 的微调服务进行了验证。
微调热度来自两个变化
![]()
一方面,开源大模型生态在过去约一年里进步明显,从大幅落后于前沿水平,发展到接近前沿水平,部分模型已经可以在消费级笔记本上运行。另一方面,OpenAI 为 gpt-3.5-turbo 等较新模型开放了微调支持,改变了此前只有较旧模型可微调的局面。
这份指南把模型权重比作长期记忆,把提示词比作短期记忆。微调更像是考前一周集中复习,而把知识放进提示词里,则像开卷考试。因此,团队不建议用微调来教模型记住新的事实,因为微调可能增加幻觉;它更适合用来训练明确的专门任务。
用 LangSmith 跑通完整流程
指南以知识图谱三元组抽取作为测试任务,使用从 LangSmith 导出的训练数据,分别对 LLaMA2-7b-chat 和 gpt-3.5-turbo 进行微调,再用 LangSmith 对结果做评估。训练环节既覆盖了 CoLab 与 HuggingFace 上的开源模型路径,也覆盖了 OpenAI 的新微调服务。
团队还提到,在考虑微调之前,可以先评估提示词或检索增强生成(RAG)是否已经够用。对于有充足示例、且模型少样本学习能力不足的明确任务,微调会更合适。指南希望帮助使用者判断何时微调、如何微调,并借助 LangSmith 管理数据和评估效果。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.