网易首页 > 网易号 > 正文 申请入驻

40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源

0
分享至



训练一个顶级文生图模型,到底需要多少钱?

Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳,其内部实践却始终不对外公开。对于绝大多数研究机构来说,这条赛道的入场券太贵了。

近日,华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了Boogu-Image-0.1—— 一个仅用2.08 亿张独立图像、理论训练成本约40 万美元,就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一,并支持华为昇腾 Ascend NPU,vLLM-Omni 框架等, ModelScope 和 ComfyUI 均已上线。



  • 论文标题:Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
  • arXiv 论文地址:https://arxiv.org/abs/2607.13125
  • HuggingFace 论文地址:https://huggingface.co/papers/2607.13125
  • 代码仓库:https://github.com/Boogu-Project/Boogu-Image
  • 在线试用:https://boogu.org/





从「文生图」到「需求生图」


Boogu 团队的核心判断是:图像生成正在从 Text-to-Image 走向Requirement-to-Image。

用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令,甚至跨模态上下文。而现实需求又极度多样:有的只想快速出图,有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。

因此,Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民,并将其拆解到系统的每一个环节:

  • 更强的指令编码器。团队把文本编码器类比为文生图模型的「传感器」:它决定了整个系统能获得的信息上限。系统性实验证实,冻结编码器的规模从 1.7B 扩到 14B,生成质量单调提升且未见饱和。最终 Boogu 选用 Qwen3-VL-8B,在能力与开源社区可部署性之间取得平衡。



  • Agentic 提示重写:做「翻译官」,不做「加戏者」。论文提出一个常被忽视的设计原则 —— 重写器应以恒等变换为下界:当用户 prompt 已经清晰完整时就原样保留,只在意图模糊时才介入。实验显示,重写模型越强,收益越大(0.8B 到 397B 呈近似对数线性提升),且在计数、推理、场景文字等维度上,能力定向的重写技能带来数倍优势。



  • 模型路由:让合适的模型干合适的活。Turbo 与 Base 在很多简单请求上输出几乎无差异,推理成本却相差 50 倍。Boogu 用 Agent 估计请求难度并动态分发,把重型模型留给真正复杂的任务。

在 Boogu 自建的 Arena 盲测中(与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986),Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一,仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上,其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分;编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。













敢说真话的技术报告

这份 71 页的技术报告有意思的地方,不只是结果,还有大量业内「靠试错才能学到」却很少被写进论文的细节。

公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数,发现明显的排名倒挂:人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高,但人评中仍不如 Nano-Banana-Pro。



「“足够” 的数据」是不够的,但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据(仅 2162 万独立样本)进行后训练反而能全面提升性能。原则很朴素:系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫,就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。

几个可复用的量化结论。一个汉字要被稳定渲染,训练中至少需要约 300 次曝光;覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份,需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者(也是论文作者之一)的 170 张日常照片做了完整消融。



不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷,它们反而能让模型学会理解并可控地规避(或复现)这些视觉元素。

慎用 RL。重度美学 RL 会让输出分布坍缩:让模型画「一位六十岁的中国女性」,重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。

此外,作为最早的原生 2K 训练的开源模型之一,团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢,并给出了简单有效的截断修正方案;附录还提出了免训练的推理增强方法 BOG(Boosted Orthogonal Guidance),把 DiT 预测视为二维矩阵做结构化归一化,强化垂直于 flow 流场的信息,一定程度提升照片摄影艺术质感。

Boogu-Image-0.1 当然有局限:世界知识仍落后于头部闭源系统,文字渲染只优化了中英双语,复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下,它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。

正如团队在结语中所说:希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。

团队介绍

Boogu 团队来自华为香港小艺大模型应用实验室(莱布尼茨所),联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei,通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究,模型、代码与训练配方均以 Apache 2.0 协议开源。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
LV上海大秀,刘亦菲罕见缺席,3人高调站台,更恶心的还在后面

LV上海大秀,刘亦菲罕见缺席,3人高调站台,更恶心的还在后面

寒士之言本尊
2026-07-29 13:40:22
阿根廷4600万人口,拥有超1500万辆汽车,福建4200万人有多少?

阿根廷4600万人口,拥有超1500万辆汽车,福建4200万人有多少?

抽象派大师
2026-07-29 16:26:26
张柏芝不再隐瞒,三胎儿子身份曝光,和谢贤的绯闻早已真相大白

张柏芝不再隐瞒,三胎儿子身份曝光,和谢贤的绯闻早已真相大白

静若梨花
2026-07-29 12:38:36
“影帝”也要降价卖房!香港豪宅降价潮来袭,周润发山顶豪宅售价再降18%,累减6000万港元仍难觅买家

“影帝”也要降价卖房!香港豪宅降价潮来袭,周润发山顶豪宅售价再降18%,累减6000万港元仍难觅买家

每日经济新闻
2026-07-29 22:14:15
怪不得曹彦灏输球后这么豪横,竟然敢对对手何睿宸“拳打脚踢”!

怪不得曹彦灏输球后这么豪横,竟然敢对对手何睿宸“拳打脚踢”!

故事终将光明磊落
2026-07-29 19:22:31
泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

泰山陪爬变陪“睡”?贴身搂抱、明码标价变味儿,这山爬得太辣眼

傲傲讲历史
2026-07-27 14:44:50
3.23亿老人等不起!国家出手了,这次养老方式要变天

3.23亿老人等不起!国家出手了,这次养老方式要变天

职场资深秘书
2026-07-29 15:38:07
沈敏娟履新外交部亚洲司司长

沈敏娟履新外交部亚洲司司长

界面新闻
2026-07-29 22:58:41
《庆余年》演员在山西一景区当NPC,身高2.16米,“我需要稳定收入养家,如今AI短剧普及,很多演员长期无戏可拍……”

《庆余年》演员在山西一景区当NPC,身高2.16米,“我需要稳定收入养家,如今AI短剧普及,很多演员长期无戏可拍……”

都市快报橙柿互动
2026-07-29 18:35:13
天王嫂又如何,方媛近况曝光,又矮又壮,一人吃8个菜引争议

天王嫂又如何,方媛近况曝光,又矮又壮,一人吃8个菜引争议

早起的鸟儿有饭吃
2026-07-29 16:33:43
0时0分准时生效,特朗普宣布掀牌,中美谈崩了?中方官员已回国

0时0分准时生效,特朗普宣布掀牌,中美谈崩了?中方官员已回国

共工之锚
2026-07-29 00:15:22
那英直播翻车,脱口骂冉莹颖“败家玩意儿”,三天后全网风向变了

那英直播翻车,脱口骂冉莹颖“败家玩意儿”,三天后全网风向变了

文文玩娱乐
2026-07-30 01:46:07
涉嫌严重违纪违法,闫增辉被查

涉嫌严重违纪违法,闫增辉被查

中国基金报
2026-07-29 21:01:30
人口学家梁建章曾说:若不尽早干预,40年后印度人口将是中国3倍

人口学家梁建章曾说:若不尽早干预,40年后印度人口将是中国3倍

刘浶开挖机
2026-07-30 00:29:47
战线突然出现缺口,乌军发动闪电登陆战斗,又开创首次世界第一!

战线突然出现缺口,乌军发动闪电登陆战斗,又开创首次世界第一!

阿龙聊军事
2026-07-14 20:29:33
迪拜联合官方:皮尔洛留任,俱乐部完全支持他

迪拜联合官方:皮尔洛留任,俱乐部完全支持他

懂球帝
2026-07-29 20:42:27
穆里尼奥惨遭重创!皇马天才意外重伤!新赛季计划全乱

穆里尼奥惨遭重创!皇马天才意外重伤!新赛季计划全乱

奶盖熊本熊
2026-07-29 05:09:06
男友必备技能,姆巴佩在船上游玩时各种姿势给女朋友拍照

男友必备技能,姆巴佩在船上游玩时各种姿势给女朋友拍照

懂球帝
2026-07-30 01:18:12
10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

10万入场费的“换妻”盛宴:记者冒死暗访,组织者3年狂赚2亿

说点事
2026-07-16 11:29:11
泰国汽车巨头:要么与中国同行合作,要么“手足无措”

泰国汽车巨头:要么与中国同行合作,要么“手足无措”

观察者网
2026-07-29 08:57:22
2026-07-30 03:27:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13632文章数 142707关注度
往期回顾 全部

科技要闻

Kimi K3火爆,奥特曼:开源一定有一席之地

头条要闻

男女酒后驾车坠河身亡女子家属索赔近200万 法院判了

头条要闻

男女酒后驾车坠河身亡女子家属索赔近200万 法院判了

体育要闻

毫无存在感的NBA状元,最先谢谢惠顾?

娱乐要闻

55岁影帝黄政民出轨

财经要闻

天丝红牛多地检出成分不合格 企业申诉

汽车要闻

MG 07预售12.59万起 高阶版配激光雷达+CDC

态度原创

教育
家居
数码
公开课
军事航空

教育要闻

南京民办学费又上涨了?!最新学费标准公布!

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

苹果又出新招?一件即可操控所有苹果设备

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美以领导人会晤后 伊朗发射多枚导弹突袭驻中东美军

无障碍浏览 进入关怀版