网易首页 > 网易号 > 正文 申请入驻

如何在自己的数据集上微调Qwen3-VL

0
分享至

来源:市场资讯

(来源:OpenCV与AI深度学习)

视觉/图像重磅干货,第一时间送达!

什么是Qwen3-VL?

Qwen3-VL是阿里云视觉语言模型系列的第三代,详见其技术报告(arXiv:2511.21631)。该版本于2025年9月发布,相较Qwen2.5-VL带来了有意义的升级:原生256K令牌上下文窗口(原为128K)、DeepStack集成(一种多尺度特征融合机制,从ViT编码器的不同层提取表示,赋予语言模型比单层输出更丰富的视觉细节),以及通过增强的交错MRoPE(多模态旋转位置嵌入)改进的时空建模。

该模型保留了基于ViT的视觉编码器,支持动态分辨率,按原生宽高比处理图像,而非强制裁剪。该型号家族涵盖六个尺寸:


对于自定义数据集的微调,8B版本达到了最佳平衡点:足够大以捕捉复杂的视觉模式,又足够小,可以在单一GPU上用LoRA微调。

VLM输出与传统CV模型的区别

如果你用过像YOLO这样的物体检测模型,输出格式会很熟悉:边界框,每个框都有类别标签和置信度分数。大多数部署的 YOLO 模型只能检测它们训练时使用的类。(像YOLO-World这样的开放词汇变体开始模糊这一界限,但它们仍属例外。)

VLM的工作方式不同。它们输入图片和文本提示,然后生成自然语言作为输出。这开启了三种传统CV模型无法产生的截然不同的输出类型。


传统的 CV 模型输出结构化的边界框和类标签。VLM生成自然语言:短语基础、视觉问答和自由文本描述。

比较YOLO对象检测输出与VLM输出,如短语定位、VQA和自由文本描述。

短语定位

你给模型一个自然语言描述,它会返回该描述的边界框坐标。(参见Vi文档中的“接地概念”一词。)你可以用灵活的表达方式查询,而不是用“车”或“人”等固定类别,比如“车架左侧的红色车”或“焊接处附近的划痕”。这对于需要检测的对象频繁变化或过于特定,无法用预定义标签集的情况非常强大。

视觉问答(VQA)

你向模型提出关于图像的问题,它会生成一个自然语言的回答。(详见Vi文档中的VQA概念。)“这个组件还缺了多少螺丝?”“标签方向正确吗?”“第三个烧杯里的液体是什么颜色?”该模型关注视觉内容,并以纯文本而非结构化坐标进行响应。

自由文本描述

模型生成图像内容的开放式描述。(详见 Vi 文档中的自由形式概念。)这对于为大型图片集合制作字幕、报告和创建可搜索元数据非常有用。结合思维链推理,模型可以一步步分析观察结果,最终得出结论。

关键的权衡是:YOLO能让你快速、结构化,且易于程序化解析。VLM为你提供灵活且富有表现力的输出,能够处理新颖的查询。对于许多实际应用,你需要两者兼用,VLM用于需要推理的任务,传统模型用于高通量检测。

Datature vi 上的 Qwen3-VL 微调

本指南的其余部分将详细介绍Datature Vi的完整工作流程:标注数据、配置训练、监控运行以及导出模型。每个部分都包含平台界面的截图。

步骤1:为VLM标注你的数据

VLM注释不同于传统的包围框或多边形标记。你不是画形状和分配类别标签,而是创建文本和图像对,教模型如何解读和回应视觉内容。

Datature Vi 支持三种 VLM 训练数据集类型:

短语定位

短语定位将自然语言描述与边界框配对。按照短语基础注释指南开始。你在物体周围画一个框,写下描述:“引脚3上的焊点裂纹”或“第二行成熟的番茄”。模型学习基于灵活文本查询而非固定类别来定位对象。

这是最接近传统对象检测的VLM注释类型,但有一个关键区别:标签是自由文本短语,而非下拉菜单中的类别。同一对象根据上下文可以有不同的描述方式。


为了实现制作质量的短语基础,Datature 建议在100张或更多图像中至少使用500对短语框。在描述中包含具体属性(颜色、位置、大小、材质),并调整措辞,使模型能够超越精确措辞的泛化。

视觉问答(VQA)

VQA注释是与图像绑定的问题-答案对。请参阅VQA注释指南中的逐步说明。你写一个关于图片内容的问题并提供正确答案。模型学习推理视觉信息并生成准确的文本回答。

好的VQA注释涵盖多种题型:计数(“货架上有多少物品?”)、空间推理(“标签是在条码上还是下面?”)、属性识别(“警示灯是什么颜色?”)以及是非验证(“安全防护罩是否就位?”)。

每张图片都应提出多样化的问题。关于同一图像的五个不同问题,可以让模型在五张图像中学习超过五个相同的问题。为了获得一个稳健的起始数据集,目标是至少100张图像中500对或更多质量保证对。答案格式的一致性很重要:尽早决定是/否题是“是”/“否”还是更长的回答。

思维链推理

对于需要多步推理的任务,你可以用标签写包含明确思考步骤的注释(参见Vi文档中的思维链推理)。模型学会在给出最终答案前展示其工作,类似于推理时的思维链提示,但现在推理模式通过训练被嵌入模型权重中。

这对于复杂的检查任务尤为重要。注释不仅仅标注零件“有缺陷”,而是详细说明了原因:“表面在边缘附近显示一条约2厘米长的线性痕迹。该标记比周围材料更深,并沿纹理方向排列。这种图案符合冲压过程中的工具拖拽痕迹,而非材料缺陷。”

步骤2:配置模型训练

数据集标注完成后,下一步就是建立训练流程。Datature Vi 引导你通过四个配置界面:系统提示、数据集、模型架构和训练设置。

系统提示词

系统提示词定义模型的任务和行为。它告诉模型在图像中应该寻找什么,以及如何格式化回答。Datature Vi 为短语基础和 VQA 任务提供预设提示,或者你可以为你的特定领域编写自定义提示。

一个好的系统提示词应具体说明任务、输出格式和领域上下文。对于制造检验的应用场景,你的提示可能会说明:“你是一名质量检验员,正在分析焊接接头的图像。识别所有可见缺陷,描述其位置、类型和严重程度。把你的发现输出成结构化的清单。”


在我们的案例中,我们想在系统提示词中添加短语接地规范,因为我们希望它能提供输出框,以便以后渲染以供视觉辅助。我们指定边界框的坐标格式、JSON 对象以及其他我们希望输出在推理时拥有的约束条件。总结一下——系统提示会附带在每个训练示例的顶部,随后是你的图片和注释——模型会在此推断,应用approaite loss函数。因此,如果你更改系统提示词,通常情况下,如果它指定了完全不同的约束(例如输出多边形遮罩代替边界框,或者限制最大段落数等),你就得重新运行训练。


模型架构:LoRA 与全微调

Datature Vi 提供两种训练模式(详见模型架构和模型设置以获取详细信息):

LoRA(低秩适应)在保持基础参数冻结的同时,将小型可训练的低秩矩阵注入模型现有权重层。它只占用一小部分内存(适用于显存少于32GB的GPU),训练更快,而且可以低成本尝试多种配置。权衡是与全微调相比,精度的潜在差距较小。

全面微调更新所有模型参数。它能挤出最佳精度,但需要更多GPU内存(32GB或更多)和更长的训练时间。当准确性至关重要且你有足够的计算预算时,选择它。

对于大多数从 Qwen3-VL 开始的用户,推荐从 8B 版本开始的 LoRA。一旦验证了数据集和任务定义,你总可以扩展到完全微调或更大模型变体。

你可以配置的更多模型设置:


GPU 选择

Datature Vi提供从入门级NVIDIA T4卡到H200和B200硬件的GPU层级。多GPU配置可提升训练速度:4倍A10G配置的运行速度大约是单张显卡的3.5倍。


步骤3:监测训练并评估效果

一旦开始跑步,Datature Vi 会实时追踪训练进展。

损失曲线

主要指标是全损,衡量模型预测与地面真实标注的距离。训练损失(每步记录)和验证损失(评估间隔记录)分别绘制为不同的曲线。健康的训练运行显示两条曲线都在下降,验证损失跟踪接近训练损失。

未训练模型的起始损失在2.0到6.0之间,训练良好的模型则降至0.5到1.5。如果验证损失开始攀升而训练损失持续下降,说明模型在过拟合。这是停止训练、缩小历元或增加训练数据的信号。


高级评估

高级评估标签页提供并排对比界面。左侧你可以看到地面真实标注。右边是模型的预测图。检查点滑块让你可以快速浏览训练阶段(第0、5、10、15、20步......),观察模型随着时间的提升。

这时你会发现一些细微的问题:边界框过于松散,图像中不存在的幻觉物体,或者技术上正确但错失重点的VQA答案。早期检查点预测会很差。最终检查点应与你的实际情况紧密对齐。

对于短语定位,检查框框紧凑,所有地面真实对象均被检测到,误报最小。对于VQA,要检查答案是否符合实际含义,基于可见图片内容的事实正确,并且能优雅地处理边缘情况。

步骤4:导出并部署你的模型

训练完成且对评估结果满意后,导出你微调后的Qwen3-VL模型。

通过平台下载

进入你的训练项目中的“模型”标签,点击模型上的三点菜单,选择“导出模型”。(详见文档中的“下载模型”。)平台会生成一个可用的Python代码片段,并预先填写你的凭证。

通过Vi SDK下载

如需程序访问,请直接使用 Vi SDK:

from vi.inference import ViModel# Download your fine-tuned modelmodel = ViModel(    run_id="your-run-id",    secret_key="your-secret-key",    organization_id="your-organization-id")

下载的软件包包含模型权重(如适用,包含完整参数和LoRA适配器)、配置文件、训练元数据以及训练运行的性能数据。

加载与运行推理

下载后,运行推理非常简单:

# Single image inferenceresult, error = model(    source="/path/to/image.jpg",    user_prompt="Describe any defects visible in this image.")if error is None:    print(result.result)

SDK支持批处理、流式输出以及通过量化优化内存:

# Batch process an entire folderresults = model(    source="./test_images/",    user_prompt="What objects are visible?",    show_progress=True,    recursive=True)for result, error in results:    if error is None:        print(result.result)# Load with 8-bit quantization for lower memory usagemodel = ViModel(    run_id="your-run-id",    load_in_8bit=True,    device_map="auto")

在生产部署中,你也可以用NVIDIA NIM容器化模型实现可扩展的服务。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
直降10万!大众突然降价,19.99万起

直降10万!大众突然降价,19.99万起

科技堡垒
2026-07-18 10:45:38
马斯克确认:特斯拉FSD重大转向,记住车主操作,告别通用方案

马斯克确认:特斯拉FSD重大转向,记住车主操作,告别通用方案

野生运营
2026-07-20 03:16:54
广州“发哥”1个半月花40多万元去现场看世界杯:今年看了23场,连续六届看了104场比赛

广州“发哥”1个半月花40多万元去现场看世界杯:今年看了23场,连续六届看了104场比赛

新浪财经
2026-07-19 23:07:52
无人机在8861米抓住的铁证:珠峰的雪,正被南亚的“脏东西”染黑

无人机在8861米抓住的铁证:珠峰的雪,正被南亚的“脏东西”染黑

蜉蝣说
2026-07-18 23:15:00
舞厅里的黑灯时段,成了让人避之不及的尴尬陷阱

舞厅里的黑灯时段,成了让人避之不及的尴尬陷阱

成都人的故事
2026-07-20 11:45:22
菲律宾政坛大地震,弹劾副总统的法庭,不料成了清算前朝旧账现场

菲律宾政坛大地震,弹劾副总统的法庭,不料成了清算前朝旧账现场

福建睿平
2026-07-20 06:14:55
美军连轰八天,伊朗怒了,最高领袖拍板:特朗普无信誉,协议已废

美军连轰八天,伊朗怒了,最高领袖拍板:特朗普无信誉,协议已废

国际法大视野
2026-07-19 20:58:05
谢贤去世了!他一生深爱的3个女人,谁会是他临终前首先想到的?

谢贤去世了!他一生深爱的3个女人,谁会是他临终前首先想到的?

草莓解说体育
2026-07-20 17:29:01
7月20日,CCTV8 北京卫视共排播5部悬疑剧,于和伟 胡歌 黄景瑜主演

7月20日,CCTV8 北京卫视共排播5部悬疑剧,于和伟 胡歌 黄景瑜主演

草莓解说体育
2026-07-20 15:59:07
上海房价正式跌破5万

上海房价正式跌破5万

谭谈财经
2026-07-18 20:20:56
李国旭:球队状态非常好,相信我们会赢下比赛

李国旭:球队状态非常好,相信我们会赢下比赛

懂球帝
2026-07-20 19:14:19
斯卡洛尼:西班牙赢球实至名归,但我很想知道若没红牌会如何

斯卡洛尼:西班牙赢球实至名归,但我很想知道若没红牌会如何

懂球帝
2026-07-20 08:33:10
突发!日本入管厅将严查非法在留外国人

突发!日本入管厅将严查非法在留外国人

今日日本
2026-07-20 18:34:03
伊朗西部连发两次5级以上地震

伊朗西部连发两次5级以上地震

财联社
2026-07-20 14:16:02
西班牙毫不费力锁死梅西,亨利:他仿佛整个人沉入水底喘不过气来

西班牙毫不费力锁死梅西,亨利:他仿佛整个人沉入水底喘不过气来

杨华评论
2026-07-20 08:29:11
我被开除军籍,爷爷来部队接我,营长红了眼眶:我找了您20年

我被开除军籍,爷爷来部队接我,营长红了眼眶:我找了您20年

千秋文化
2026-07-17 18:59:00
俄罗斯教授提醒本国人,趁早放弃幻想吧,中国以自己利益优先

俄罗斯教授提醒本国人,趁早放弃幻想吧,中国以自己利益优先

别让往昔的悲伤和对未来的恐惧
2026-07-20 17:13:15
终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

终于有经济学家批评体制内退休金太高、加剧代际矛盾,评论区炸锅

慧翔百科
2026-06-23 08:47:02
这次踢准了,帕雷德斯两年前谈爆射荷兰替补席:很遗憾踢偏了

这次踢准了,帕雷德斯两年前谈爆射荷兰替补席:很遗憾踢偏了

懂球帝
2026-07-20 15:40:09
第一批性爱机器人,满足了谁?

第一批性爱机器人,满足了谁?

最人物
2026-07-20 12:29:39
2026-07-20 21:12:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4133783文章数 8905关注度
往期回顾 全部

科技要闻

中兴阶跃荣耀齐出手,AI手机争夺系统入口

头条要闻

两中企高管在菲律宾遭绑架遇害 嫌犯从美国被遣返回国

头条要闻

两中企高管在菲律宾遭绑架遇害 嫌犯从美国被遣返回国

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

WAIC专访 | 了得科技CEO薛飞:仿生是人形机器人的终局

态度原创

健康
教育
家居
亲子
时尚

“斑块”患者要小心中风?

教育要闻

7月18日雅思大作文示范写作 | 现代人日常活动催生压力的原因与解决方法

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

娘家准备一桌饭菜,龙宝帮太姥姥干活真有样,这样的画面真温馨

看来看去夏天还是穿T恤最合适,不用买太贵,舒适百搭又经典

无障碍浏览 进入关怀版