网易首页 > 网易号 > 正文 申请入驻

40万美元、2亿张图:华为联合6校训出2K模型 Boogu-Image-0.1,比肩闭源

0
分享至



训练一个顶级文生图模型,到底需要多少钱?

Qwen-Image、HunyuanImage 这些优秀的开源模型,预训练动辄用掉数十亿张图像;而 GPT-Image-2、Nano-Banana-Pro 等闭源系统虽然效果惊艳,其内部实践却始终不对外公开。对于绝大多数研究机构来说,这条赛道的入场券太贵了。

近日,华为香港莱布尼茨研究所小艺团队与港大、港科大、港中文等 6 校联合发布了Boogu-Image-0.1—— 一个仅用2.08 亿张独立图像、理论训练成本约40 万美元,就在多个基准上做到开源第一、逼近闭源水平的统一多模态模型家族。模型权重、代码与训练配方已全部以Apache 2.0 协议开源。Boogu 系列模型是最早支持原生 2K 的开源模型之一,并支持华为昇腾 Ascend NPU,vLLM-Omni 框架等, ModelScope 和 ComfyUI 均已上线。



  • 论文标题:Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
  • arXiv 论文地址:https://arxiv.org/abs/2607.13125
  • HuggingFace 论文地址:https://huggingface.co/papers/2607.13125
  • 代码仓库:https://github.com/Boogu-Project/Boogu-Image
  • 在线试用:https://boogu.org/





从「文生图」到「需求生图」


Boogu 团队的核心判断是:图像生成正在从 Text-to-Image 走向Requirement-to-Image。

用户早已不满足于给一句描述性 prompt—— 他们希望模型能理解复杂意图、隐含约束、多层指令,甚至跨模态上下文。而现实需求又极度多样:有的只想快速出图,有的需要精细排版的海报。单一模型配置很难同时服务好所有场景。

因此,Boogu 把「理解」提升为与数据质量、训练配方同等重要的一等公民,并将其拆解到系统的每一个环节:

  • 更强的指令编码器。团队把文本编码器类比为文生图模型的「传感器」:它决定了整个系统能获得的信息上限。系统性实验证实,冻结编码器的规模从 1.7B 扩到 14B,生成质量单调提升且未见饱和。最终 Boogu 选用 Qwen3-VL-8B,在能力与开源社区可部署性之间取得平衡。



  • Agentic 提示重写:做「翻译官」,不做「加戏者」。论文提出一个常被忽视的设计原则 —— 重写器应以恒等变换为下界:当用户 prompt 已经清晰完整时就原样保留,只在意图模糊时才介入。实验显示,重写模型越强,收益越大(0.8B 到 397B 呈近似对数线性提升),且在计数、推理、场景文字等维度上,能力定向的重写技能带来数倍优势。



  • 模型路由:让合适的模型干合适的活。Turbo 与 Base 在很多简单请求上输出几乎无差异,推理成本却相差 50 倍。Boogu 用 Agent 估计请求难度并动态分发,把重型模型留给真正复杂的任务。

在 Boogu 自建的 Arena 盲测中(与公开 LMArena 排名的 Spearman 相关系数达 1.0, Pearson 相关系数 0.986),Boogu-Image-0.1-Turbo-Thinking 以 1048 的 Elo 位列开源第一,仅次于 GPT-Image-2 和 Nano-Banana-Pro。在新发布的 Qwen-Image-Bench 上,其 Base-Thinking 变体在中英文双语下均取得开源模型最佳总分;编辑模型 Boogu-Image-0.1-Edit-Thinking 更是在 ImgEdit-Bench 上拿下全场最高的 4.64 分。













敢说真话的技术报告

这份 71 页的技术报告有意思的地方,不只是结果,还有大量业内「靠试错才能学到」却很少被写进论文的细节。

公开基准正在失效。团队用 6 个近期模型对比了 LMArena 人类偏好排名与 GenEval、DPG-Bench 分数,发现明显的排名倒挂:人类偏好最强的 GPT-Image-2 在两个学术基准上只排中游。团队直接宣布不再把这些基准作为主要评估,并呼吁社区重新审视其适用性 —— 甚至坦率指出自家模型在 ImgEdit-Bench 上分数虽高,但人评中仍不如 Nano-Banana-Pro。



「“足够” 的数据」是不够的,但结构化的数据可以很省。团队用 1.87 亿开源数据训练的模型明显撞上性能天花板;而利用少量按人类先验组织的「Boogu Syllabus」教学大纲式数据(仅 2162 万独立样本)进行后训练反而能全面提升性能。原则很朴素:系统性细粒度拆解、能力全覆盖、每个类别数据量充足 ——「如果模型训练时没见过猫,就默认它画不出猫」—— 数据的精细的 “质” 大于朴素地堆砌 “量”。

几个可复用的量化结论。一个汉字要被稳定渲染,训练中至少需要约 300 次曝光;覆盖 3500 个现代常用字即可满足日常中文渲染需求。让模型记住一个从未见过的人物身份,需要约 4500 次语言匹配的曝光 —— 团队用一位志愿者(也是论文作者之一)的 170 张日常照片做了完整消融。



不要盲目过滤「坏数据」。水印、过曝、运动模糊的图片不必丢弃 —— 只要在 caption 里明确详细地描述缺陷,它们反而能让模型学会理解并可控地规避(或复现)这些视觉元素。

慎用 RL。重度美学 RL 会让输出分布坍缩:让模型画「一位六十岁的中国女性」,重 RL 模型倾向输出精致妆容的理想化形象。Boogu 选择把人类偏好放进理解系统而非烙进生成器,只在肢体结构、文字渲染等不损害多样性的问题上使用 RL。

此外,作为最早的原生 2K 训练的开源模型之一,团队发现标准的动态时间偏移策略在 2K 分辨率会产生「过度挤压」效应导致收敛变慢,并给出了简单有效的截断修正方案;附录还提出了免训练的推理增强方法 BOG(Boosted Orthogonal Guidance),把 DiT 预测视为二维矩阵做结构化归一化,强化垂直于 flow 流场的信息,一定程度提升照片摄影艺术质感。

Boogu-Image-0.1 当然有局限:世界知识仍落后于头部闭源系统,文字渲染只优化了中英双语,复杂多人交互场景仍会出现肢体畸变。但在 40 万美元的预算约束下,它给出了一条可复现、可验证的路径 —— 并把过去藏在工业团队内部的工程经验摊开在了论文里。

正如团队在结语中所说:希望 Boogu-Image-0.1 让图像生成向「真正理解用户想要什么」的系统迈进一步。

团队介绍

Boogu 团队来自华为香港小艺大模型应用实验室(莱布尼茨所),联合香港大学、香港科技大学、香港理工大学、香港城市大学、香港中文大学与南京大学共同完成。项目负责人为 Chenyang Lei,通讯作者包括 Chenyang Lei、Rui Liu 与 Chao Huang。团队致力于以理解驱动的统一智能体多模态生成研究,模型、代码与训练配方均以 Apache 2.0 协议开源。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
601238,重组复牌,“一”字涨停!

601238,重组复牌,“一”字涨停!

证券时报
2026-09-29 10:38:10
交易换伦纳德后,英格拉姆被曝跟腱部分撕裂将缺席赛季开局

交易换伦纳德后,英格拉姆被曝跟腱部分撕裂将缺席赛季开局

坠入温柔晚风
2026-09-29 14:39:09
国常会重磅部署,推出一批增量政策

国常会重磅部署,推出一批增量政策

第一财经资讯
2026-09-29 09:50:16
糖尿病凶手竟是它!比白糖厉害20倍,很多人却不自知天天吃

糖尿病凶手竟是它!比白糖厉害20倍,很多人却不自知天天吃

健康科普365
2026-09-28 21:35:10
一查吓一跳!43岁独身住在北京的小尼,私下竟壕到这种地步

一查吓一跳!43岁独身住在北京的小尼,私下竟壕到这种地步

林轻吟
2026-09-28 09:31:28
放开式穿搭,在家也要高调!

放开式穿搭,在家也要高调!

飛尚日记
2026-09-20 06:31:52
女演员称在巴黎工作相机30秒就被偷:报警没用,在国内33年没遇到这种事

女演员称在巴黎工作相机30秒就被偷:报警没用,在国内33年没遇到这种事

观察者网
2026-09-29 10:24:16
心理学有个残忍发现:面对刻意激怒你的人,你的愤怒、隐忍、负面情绪,都称了对方的意,只用一招就能让对方彻底破防

心理学有个残忍发现:面对刻意激怒你的人,你的愤怒、隐忍、负面情绪,都称了对方的意,只用一招就能让对方彻底破防

罪案洞察者
2026-09-10 16:23:59
伊朗最高领袖穆杰塔巴最新发声

伊朗最高领袖穆杰塔巴最新发声

极目新闻
2026-09-29 11:51:10
苏州最新人事调整

苏州最新人事调整

新浪财经
2026-09-29 12:45:14
中美谈完后,普京马上“点到为止”,有两件事连他都不敢多说

中美谈完后,普京马上“点到为止”,有两件事连他都不敢多说

芳芳历史烩
2026-09-29 13:59:44
四川米易姑娘刘国怡获亚运会金牌,4个月前拿到2027年世锦赛入场券

四川米易姑娘刘国怡获亚运会金牌,4个月前拿到2027年世锦赛入场券

封面新闻
2026-09-29 11:13:03
一言不合就全裸出镜!女神的无删减影评,太生猛了

一言不合就全裸出镜!女神的无删减影评,太生猛了

来看美剧
2026-09-28 23:24:50
“嘌呤”不读 piāo líng,不要再读错了,我出过丑

“嘌呤”不读 piāo líng,不要再读错了,我出过丑

语丝纪
2026-09-14 16:07:19
亚运会男子多向飞碟赛:奥运亚军齐迎进决赛,中国队获团体第4名

亚运会男子多向飞碟赛:奥运亚军齐迎进决赛,中国队获团体第4名

全景体育V
2026-09-29 11:19:31
我隐瞒了剑桥学历在小公司做了整整三年文员,集团女总裁前来视察时突然看到我后愣住,恭敬喊道:学长好。

我隐瞒了剑桥学历在小公司做了整整三年文员,集团女总裁前来视察时突然看到我后愣住,恭敬喊道:学长好。

普陀动物世界
2026-09-29 07:30:46
表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

品读时刻
2026-09-22 09:04:55
日本性感女偶像站自己海报旁,竟没有粉丝认出,网发文道歉:可能有点出入

日本性感女偶像站自己海报旁,竟没有粉丝认出,网发文道歉:可能有点出入

日本物语
2026-09-28 22:38:59
大脑开始萎缩,喝水就知道?脑萎缩的人,喝水时多半有4个表现

大脑开始萎缩,喝水就知道?脑萎缩的人,喝水时多半有4个表现

芹姐说生活
2026-09-28 17:24:50
A股:2个消息来临,股市,很可能要开启大级别的趋势了?

A股:2个消息来临,股市,很可能要开启大级别的趋势了?

财经大拿
2026-09-29 06:05:17
2026-09-29 15:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14102文章数 142740关注度
往期回顾 全部

科技要闻

82亿美元收购!李飞飞将与苏姿丰并肩做AI

头条要闻

女教师被拖行5.9公里致死 妹妹:姐姐离世时全身拖痕

头条要闻

女教师被拖行5.9公里致死 妹妹:姐姐离世时全身拖痕

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

刘欢离世48小时 李湘一个举动口碑暴涨

财经要闻

伊朗找到了美债的七寸

汽车要闻

5.1米大车跑云南盘山路,海狮08试驾体验超预期

态度原创

艺术
游戏
旅游
本地
公开课

艺术要闻

投资几千万,结果烂成废墟!广西深山这片别墅群经历了啥?

《金刚狼》日本首发遇冷!实体销量仅占蜘蛛侠2三成

旅游要闻

强国有我·旅游|仰望苍穹 云卷云舒

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版