网易首页 > 网易号 > 正文 申请入驻

华为开源7B多模态模型,视觉定位和OCR能力出色,昇腾端侧新甜点

0
分享至

允中 发自 凹非寺
量子位 | 公众号 QbitAI

7B量级模型,向来是端侧部署与个人开发者的心头好。

轻量化特性让它能灵活适配各类终端场景,而强劲性能又能覆盖图像信息抽取、文档理解、视频解析、物体定位等高频需求。

刚刚,华为重磅推出开源新玩家openPangu-VL-7B,直接瞄准这一核心场景精准发力。

昇腾原生的模型结构,让openPangu-VL-7B的推理性能极具性价比:

720P图像在单张Ascend Atlas 800T A2卡上首字模型推理时延(ViT与LLM模型时延和)仅160毫秒,能够进行5FPS的实时推理;训练阶段的MFU更是达到42.5%

更值得关注的是,模型在预训练阶段完成了3T+tokens的无突刺集群长稳训练,为开发者使用昇腾集群提供了极具价值的实践参考。



openPangu-VL-7B在通用视觉问答、文档图表理解&OCR、视觉定位、短视频理解等核心任务上表现突出,在开源榜单中力压同量级模型,展现出强悍的综合实力。



官方提供的cookbook也展现了模型在这些领域的优异能力。

比如我们给模型一张菜品图,让模型找到一共有多少个樱桃番茄,模型能够点出所有的位置并正确计数。



给模型一张年报截图,模型也能将其转变为markdown格式,省去了人工摘录的痛苦。



除了亮眼的榜单成绩和针对昇腾的训推优化,技术报告中还披露了若干核心技术细节,揭秘模型高性能背后的设计巧思:

1)适配昇腾的高性能视觉编码器



业界传统视觉编码器多针对GPU架构设计,没有充分发挥昇腾硬件优势。

团队通过大量先导实验与性能分析,找到模型结构的最优平衡点——相同参数量下,该视觉编码器在昇腾芯片上的吞吐较使用窗注意力的ViT-H系列编码器提升15%。

同时,采用多标签对比学习框架,让模型具备更优的细粒度理解能力,为后续VLM训练中的视觉定位数据学习筑牢基础。

2)样本均衡的损失设计

为解决不同长度训练样本的学习均衡问题,openPangu-VL-7B创新采用 “加权逐样本损失+逐令牌损失” 的混合训练方案,加权系数由令牌位置和样本重要性动态决定。



这一设计让模型在训练中既能吃透长回复数据,也不忽视短回复信息,避免 “顾此失彼”,消融实验已充分验证其有效性。



3)带填充的定位数据格式

区别于业界主流的0-999定位方案,openPangu-VL-7B采用000-999千分位带填充相对坐标完成视觉定位

整齐的三个token进行位置回归,不仅降低了模型学习难度,更显著提升了格式遵从性,让定位任务的精度和效率同步提升。



此外,技术报告还深入探索了预训练数据配比、位置编码、模型融合等关键策略,为开发者提供了全面的技术细节参考

对于昇腾使用者而言,openPangu-VL-7B 的开源无疑是一大利好。

这款兼具轻量化、高性能与强通用性的多模态模型,既为端侧开发和个人使用提供了新选择,也将进一步丰富昇腾生态的应用场景,为创新注入新动力。

模型链接:
https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B
技术报告:
https://ai.gitcode.com/ascend-tribe/openPangu-VL-7B/blob/main/doc/technical_report.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
英媒:中国将中子弹纳入常规装备,若属实,代理人战争算是废了

英媒:中国将中子弹纳入常规装备,若属实,代理人战争算是废了

我心纵横天地间
2026-01-29 15:24:36
人老珠黄不值钱!54岁洪欣在小区商演走穴,寒风中穿吊带真心酸

人老珠黄不值钱!54岁洪欣在小区商演走穴,寒风中穿吊带真心酸

社会日日鲜
2026-02-23 05:50:07
谷爱凌回应万斯的批评:你不管别人,就只管我,那是因为我能赢

谷爱凌回应万斯的批评:你不管别人,就只管我,那是因为我能赢

我心纵横天地间
2026-02-21 18:50:22
威尔士公开赛:雷佩凡遭逆转绝杀爆冷出局,中国小将无缘32强!

威尔士公开赛:雷佩凡遭逆转绝杀爆冷出局,中国小将无缘32强!

世界体坛观察家
2026-02-23 21:54:06
官媒亲宣,33岁韦东奕再破天花板,让王虹和整个学术圈“沉默”了

官媒亲宣,33岁韦东奕再破天花板,让王虹和整个学术圈“沉默”了

趣文说娱
2026-01-24 15:17:05
库页岛有“三不”:不属于中国、不像俄罗斯、不承认过去

库页岛有“三不”:不属于中国、不像俄罗斯、不承认过去

黑哥讲现代史
2026-02-23 23:14:07
女孩故意穿丑去相亲,本想劝退竟被当场相中,网友:男子太精明了

女孩故意穿丑去相亲,本想劝退竟被当场相中,网友:男子太精明了

观察鉴娱
2026-02-11 15:07:58
起效速度是西地那非2倍!全球首款舌下ED药,千亿市场洗牌在即?

起效速度是西地那非2倍!全球首款舌下ED药,千亿市场洗牌在即?

思思夜话
2026-02-23 17:37:21
意天空:洛夫图斯-奇克接受面部手术后或只能长期靠吸管进食

意天空:洛夫图斯-奇克接受面部手术后或只能长期靠吸管进食

懂球帝
2026-02-23 09:13:43
李亚鹏年初六到陈光标家做客!为陈光标儿子送行,其妻子罕见露脸

李亚鹏年初六到陈光标家做客!为陈光标儿子送行,其妻子罕见露脸

无心小姐姐
2026-02-23 06:31:12
去了日本才发现:没人穿大鹅、始祖鸟,满大街都是北面、Montbell

去了日本才发现:没人穿大鹅、始祖鸟,满大街都是北面、Montbell

星Xin辰大海
2026-02-22 10:28:24
墨西哥被击毙的毒枭是谁?他领导的集团疯狂报复,当地如“鬼城”

墨西哥被击毙的毒枭是谁?他领导的集团疯狂报复,当地如“鬼城”

咸鱼金脑袋
2026-02-24 00:51:34
反转!妈祖巡游所换为女童,从着装能看出,被换女孩疑炒作删视频

反转!妈祖巡游所换为女童,从着装能看出,被换女孩疑炒作删视频

古希腊掌管松饼的神
2026-02-22 22:21:04
中美局势大变,24小时内,越南收到天大好消息,特朗普对华来阴的

中美局势大变,24小时内,越南收到天大好消息,特朗普对华来阴的

东极妙严
2026-02-22 13:12:53
中美被爆黄海对峙后,特朗普又夸起中国,认为中国阵容很强大

中美被爆黄海对峙后,特朗普又夸起中国,认为中国阵容很强大

轻扬墨雨
2026-02-21 07:19:47
妈祖开始惩罚这位姓许的有钱人了

妈祖开始惩罚这位姓许的有钱人了

麦杰逊
2026-02-21 18:12:33
在国安局食堂吃饭时,无意发现打菜的师傅,竟是我追踪的千面间谍

在国安局食堂吃饭时,无意发现打菜的师傅,竟是我追踪的千面间谍

千秋文化
2026-02-19 10:43:29
我国5600余个姓氏中只有8个姓氏从未衰落,看一下有你的姓氏吗?

我国5600余个姓氏中只有8个姓氏从未衰落,看一下有你的姓氏吗?

铭记历史呀
2026-01-07 02:22:59
拿1亿合同,从夺冠核心滑落到局外人!该退役了,你把名声打没了

拿1亿合同,从夺冠核心滑落到局外人!该退役了,你把名声打没了

老梁体育漫谈
2026-02-23 23:25:03
女子故意扮丑去相亲,男子一眼看中,女子吃惊:他是不是太饿了

女子故意扮丑去相亲,男子一眼看中,女子吃惊:他是不是太饿了

丫头舫
2026-02-10 22:18:05
2026-02-24 01:43:00
量子位 incentive-icons
量子位
追踪人工智能动态
12192文章数 176390关注度
往期回顾 全部

科技要闻

智谱、MiniMax合计蒸发近千亿市值,为何?

头条要闻

墨西哥最大毒枭被击毙:喜欢杀人灭门 几乎没人看见过他

头条要闻

墨西哥最大毒枭被击毙:喜欢杀人灭门 几乎没人看见过他

体育要闻

哈登版骑士首败:雷霆的冠军课

娱乐要闻

那艺娜账号被禁止关注,视频已清空!

财经要闻

美国海关将停止征收被裁定违法的关税

汽车要闻

续航1810km!smart精灵#6 EHD超级电混2026年上市

态度原创

本地
时尚
游戏
艺术
公开课

本地新闻

春花齐放2026:《骏马奔腾迎新岁》

今年春天一定要拥有的针织,这样穿减龄又好看!

海盗PvE生存冒险《风启之旅》Steam愿望单破100万

艺术要闻

十大名家画春,送给春天的你!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版