网易首页 > 网易号 > 正文 申请入驻

华为开源7B多模态模型,视觉定位和OCR能力出色,昇腾端侧新甜点

0
分享至

允中 发自 凹非寺
量子位 | 公众号 QbitAI

7B量级模型,向来是端侧部署与个人开发者的心头好。

轻量化特性让它能灵活适配各类终端场景,而强劲性能又能覆盖图像信息抽取、文档理解、视频解析、物体定位等高频需求。

刚刚,华为重磅推出开源新玩家openPangu-VL-7B,直接瞄准这一核心场景精准发力。

昇腾原生的模型结构,让openPangu-VL-7B的推理性能极具性价比:

720P图像在单张Ascend Atlas 800T A2卡上首字模型推理时延(ViT与LLM模型时延和)仅160毫秒,能够进行5FPS的实时推理;训练阶段的MFU更是达到42.5%

更值得关注的是,模型在预训练阶段完成了3T+tokens的无突刺集群长稳训练,为开发者使用昇腾集群提供了极具价值的实践参考。



openPangu-VL-7B在通用视觉问答、文档图表理解&OCR、视觉定位、短视频理解等核心任务上表现突出,在开源榜单中力压同量级模型,展现出强悍的综合实力。



官方提供的cookbook也展现了模型在这些领域的优异能力。

比如我们给模型一张菜品图,让模型找到一共有多少个樱桃番茄,模型能够点出所有的位置并正确计数。



给模型一张年报截图,模型也能将其转变为markdown格式,省去了人工摘录的痛苦。



除了亮眼的榜单成绩和针对昇腾的训推优化,技术报告中还披露了若干核心技术细节,揭秘模型高性能背后的设计巧思:

1)适配昇腾的高性能视觉编码器



业界传统视觉编码器多针对GPU架构设计,没有充分发挥昇腾硬件优势。

团队通过大量先导实验与性能分析,找到模型结构的最优平衡点——相同参数量下,该视觉编码器在昇腾芯片上的吞吐较使用窗注意力的ViT-H系列编码器提升15%。

同时,采用多标签对比学习框架,让模型具备更优的细粒度理解能力,为后续VLM训练中的视觉定位数据学习筑牢基础。

2)样本均衡的损失设计

为解决不同长度训练样本的学习均衡问题,openPangu-VL-7B创新采用 “加权逐样本损失+逐令牌损失” 的混合训练方案,加权系数由令牌位置和样本重要性动态决定。



这一设计让模型在训练中既能吃透长回复数据,也不忽视短回复信息,避免 “顾此失彼”,消融实验已充分验证其有效性。



3)带填充的定位数据格式

区别于业界主流的0-999定位方案,openPangu-VL-7B采用000-999千分位带填充相对坐标完成视觉定位

整齐的三个token进行位置回归,不仅降低了模型学习难度,更显著提升了格式遵从性,让定位任务的精度和效率同步提升。



此外,技术报告还深入探索了预训练数据配比、位置编码、模型融合等关键策略,为开发者提供了全面的技术细节参考

对于昇腾使用者而言,openPangu-VL-7B 的开源无疑是一大利好。

这款兼具轻量化、高性能与强通用性的多模态模型,既为端侧开发和个人使用提供了新选择,也将进一步丰富昇腾生态的应用场景,为创新注入新动力。

模型链接:
https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B
技术报告:
https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B/blob/main/doc/technical_report.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
比田朴珺更潇洒!王石邀请众人到家打牌聚餐,3位美女暗送秋波

比田朴珺更潇洒!王石邀请众人到家打牌聚餐,3位美女暗送秋波

揽星河的笔记
2026-01-07 19:21:08
去过养老院才发现:健康的老人并不受欢迎,有钱的也比没钱的痛苦

去过养老院才发现:健康的老人并不受欢迎,有钱的也比没钱的痛苦

人间百态大全
2026-01-07 06:40:02
双赢交易?小波特或赴活塞联手坎宁安,篮网获首轮签+即战力

双赢交易?小波特或赴活塞联手坎宁安,篮网获首轮签+即战力

夜白侃球
2026-01-08 21:35:05
万科郁亮36年传奇落幕,功过争议谁评说

万科郁亮36年传奇落幕,功过争议谁评说

地产微资讯
2026-01-08 20:26:24
斯诺克冷门不断!9冠军陪跑,中国5胜4负,2场5-4,保底7人进32强

斯诺克冷门不断!9冠军陪跑,中国5胜4负,2场5-4,保底7人进32强

刘姚尧的文字城堡
2026-01-09 06:56:41
WTT多哈冠军赛:女单16强出炉!国乒5人全胜不败,日本3胜2负

WTT多哈冠军赛:女单16强出炉!国乒5人全胜不败,日本3胜2负

全言作品
2026-01-09 03:36:22
体重可超一吨!2016年被专家宣布已灭绝,3年后竟在上海崇明重现

体重可超一吨!2016年被专家宣布已灭绝,3年后竟在上海崇明重现

万象硬核本尊
2025-12-25 19:18:58
500万美金解冻,马杜罗反杀不认罪!聘请哈佛天团,反手审判美国

500万美金解冻,马杜罗反杀不认罪!聘请哈佛天团,反手审判美国

阿天爱旅行
2026-01-08 18:59:20
中国人均一个的“作弊神器”!老外崩溃了...

中国人均一个的“作弊神器”!老外崩溃了...

毛豆论道
2025-12-31 19:03:49
雷军发文!网友彻底沸腾:赶紧约

雷军发文!网友彻底沸腾:赶紧约

大象新闻
2026-01-07 08:09:06
多哈赛1月9日:八强将产生,蒯曼战早田希娜,周启豪对决张本智和

多哈赛1月9日:八强将产生,蒯曼战早田希娜,周启豪对决张本智和

聊体育的小哥
2026-01-09 06:32:37
港府官员访美“急刹车”,中央政府下达指令,绝不给美国可乘之机

港府官员访美“急刹车”,中央政府下达指令,绝不给美国可乘之机

荐史
2026-01-08 11:28:17
17.68万起售!何小鹏一口气发了4款车,今年还有四款全新SUV

17.68万起售!何小鹏一口气发了4款车,今年还有四款全新SUV

车东西
2026-01-08 21:00:40
纪实:浙江女教师突然失踪6年,13岁儿子凭借一个梦找到母亲

纪实:浙江女教师突然失踪6年,13岁儿子凭借一个梦找到母亲

红豆讲堂
2024-10-25 09:45:59
消失百年被认为灭绝!四川又发现了近万只,花了14年被学术界接受

消失百年被认为灭绝!四川又发现了近万只,花了14年被学术界接受

万象硬核本尊
2026-01-06 17:31:23
广东外援萨姆纳:NBA合同实际到手吓你一跳 很多人说运动员退役了就会破产

广东外援萨姆纳:NBA合同实际到手吓你一跳 很多人说运动员退役了就会破产

篮球大图
2026-01-08 11:53:44
马杜罗迎来帮手,六国挺身而出,四国对美国发出通牒,特朗普急了

马杜罗迎来帮手,六国挺身而出,四国对美国发出通牒,特朗普急了

来科点谱
2026-01-06 09:00:36
袁世凯坐龙椅的真实老照片,接受群臣朝拜,“妃子们”也非常漂亮

袁世凯坐龙椅的真实老照片,接受群臣朝拜,“妃子们”也非常漂亮

文史微鉴
2025-12-13 22:13:15
山西省长治市副市长、市公安局局长秦书伟被查

山西省长治市副市长、市公安局局长秦书伟被查

新京报
2026-01-08 17:07:10
伊朗驻华大使回应美国威胁:伊朗已制定多种预案,对外部袭击采取“防御和攻击行动”

伊朗驻华大使回应美国威胁:伊朗已制定多种预案,对外部袭击采取“防御和攻击行动”

环球网资讯
2026-01-07 20:29:19
2026-01-09 11:04:49
量子位 incentive-icons
量子位
追踪人工智能动态
11989文章数 176356关注度
往期回顾 全部

科技要闻

17.68万起售!何小鹏一口气发了4款车

头条要闻

特朗普:我不需要国际法 只有我的道德观念能阻止我

头条要闻

特朗普:我不需要国际法 只有我的道德观念能阻止我

体育要闻

世乒赛银牌得主,说自己梦里都是孙颖莎

娱乐要闻

抗战剧《马背摇篮》首播,获观众好评

财经要闻

郁亮的万科35年:从"宝万之争"到"活下去"

汽车要闻

上汽大众首款“9系旗舰” ID. ERA 9X实车曝光

态度原创

本地
健康
手机
房产
公开课

本地新闻

1986-2026,一通电话的时空旅程

这些新疗法,让化疗不再那么痛苦

手机要闻

子系D9500性能机配置曝光:电池有望9开头,预计为一加新机

房产要闻

豪宅抢疯、刚需捡漏……2025年,一张房票改写了广州市场格局

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版