网易首页 > 网易号 > 正文 申请入驻

坚定地走开源路线,Llama3系列模型及首个Llama3-中文模型和Llama3多模态模型发布

0
分享至

始智AI wisemodel.cn开源社区

始智AI wisemodel.cn社区将打造成huggingface之外最活跃的中立开放的AI开源社区。欢迎《》以及《》。

最近Meta正式发布并开源了Llama 3系列模型,本次发布了8B和70B的预训练及指令微调语言模型。Llama-3-8B和Llama-3-8B-Instruct两个模型已经有社区用户发布到了始智AI wisemodel.cn开源社区, 欢迎大家把基于Llama3衍生的模型也发布 到wisemodel上来。wisemodel社区里已有基于预训练版基础上经过SFT微调的Llama3-Chinese-chat-8B,也是目前发布的首个Llama3的中文模型。智源研究院数据智能团队也发布了首个基于Llama3的多模态大模型Bunny-Llama-3-8B-V。

https://wisemodel.cn/models

最近wisemodel社区正在完善体验空间模块的功能,五一前后大家将可以直接在wisemodel社区的体验空间一键确认部署和体验Llama3-8B等系列模型,欢迎大家持续关注wisemodel社区的进展。

Llama 3 的亮点

1、基于超过 15T token 训练,相当于 Llama 2 数据集的 7 倍还多;

2、支持 8K 长文本,改进的 tokenizer 具有 128K token 的词汇量,可实现更好的性能;

3、在大量重要基准中均具有最先进性能;

4、新能力范畴,包括增强的推理和代码能力;

5、训练效率比 Llama 2 高 3 倍;

6、带有 Llama Guard 2、Code Shield 和 CyberSec Eval 2 的新版信任和安全工具。

Llama 3 性能评估

Llama 3 的8B和70B参数大小的模型相较于Llama 2是一个巨大的飞跃,得益于预训练和后训练的改进,预先训练模型和指令微调后的模型是目前存在的8B和70B参数规模下最好的模型,都在同等参数规模的模型上达到SOTA水准。在后训练过程中的改进显著降低了模型的错误拒绝率,改善了模型与人类指令的一致性,并增加了模型响应的多样性,在推理、代码生成和遵循指令等能力方面的大幅提升,使得Llama 3模型更加可控。Llama3-8B instruct模型在MMLU、GPQA、HumanEval等多项基准上均胜过Gemma 7B和Mistral 7B Instruct,Llama3-70B模型也超越了闭源的Claude 3 Sonnet,和谷歌的Gemini Pro 1.5性能相当。

Meta 还开发了一套新的高质量人类评估数据集。该评估集包含 1800 个提示,涵盖 12 个关键用例:寻求建议、头脑风暴、分类、封闭式问答、编码、创意写作、提取、塑造角色、开放式问答、推理、重写和总结。为了防止 Llama 3 在此评估集上出现过度拟合,Meta 表示他们自己的团队也无法访问该数据集。下图显示了针对 Claude Sonnet、Mistral Medium 和 GPT-3.5 对这些类别和提示进行人工评估的汇总结果。

模型架构

Llama 3 仍然是标准的decode-only的Transformer架构,相比 Llama 2的关键改进主要包括以下几点。首先,Llama 3 使用一个具有 128K 令牌词汇的 tokenizer,该词汇编码语言更高效,从而大幅改善了模型性能。其次,为了提高 Llama 3 模型的推理效率,在 8B 和 70B 大小上都采用了分组查询注意力(GQA)。然后,在 8,192 令牌的序列上训练了模型,并使用掩码来确保自注意力不跨文档边界。

训练数据

为了训练最好的语言模型,管理大型、高质量的训练数据集至关重要。Llama 3 使用超过 15T 的 token 进行了预训练,这些 token 都是从公开来源收集的。总体上讲,Llama 3 的训练数据集是 Llama 2 使用的数据集的七倍多,并且包含四倍多的代码。为了支持多语言需求, Llama 3 预训练数据集中高质量非英语数据超过 5%,涵盖 30 多种语言,Llama 3 在这些语言上的性能水平预计不会与英语相同。

为了确保 Llama 3 接受最高质量数据的训练,团队开发了一系列数据过滤pipeline,包括使用启发式过滤器(filter)、NSFW 过滤器、语义重复数据删除方法和文本分类器来预测数据质量。同时也使用 Llama 2来生成文本质量分类器的训练数据。团队还进行了系列的实验,以评估出在最终预训练数据集中不同来源数据的最佳混合方式,最终确保 Llama 3 在各种用例(包括日常问题、STEM、编码、历史知识等)中表现良好。

规模化预训练

为了在Llama 3模型中有效地利用预训练数据集,团队在大规模预训练方面投入了大量的精力,特别是为下游基准测试评估开发了一系列详细的scaling laws。这些方法对选择最佳的数据混合方案,以及最佳利用训练计算资源等方面有重要帮助。同时,基于这些方法,在实际训练模型之前就可以预测最大模型在关键任务上的性能(例如,在HumanEval基准测试上评估的代码生成能力等)。

在开发Llama 3的过程中,也有一些新的发现。例如,虽然对于8B参数模型来说,Chinchilla最优的训练计算量对应于约200B的token,但在两个数量级的更多数据上训练后,模型性能仍在持续提升。8B和70B参数模型在训练了高达15T个token后,性能仍然以对数线性方式提升。在Llama 3模型的训练过程中,采用了数据并行化、模型并行化和流水线并行化三种并行策略。

通过最高效的实现方式,他用1.6万个GPU同时训练时,每个GPU的计算利用率超过400 TFLOPS。Meta在分别在两个的2.4万个GPU的集群上进行了训练,并通过系列改进使得整体有效训练时间超过了95%。首先,开发了一个先进的新训练堆栈,用于自动化错误检测、处理和维护来提高GPU的有效训练时间。其次,提高了硬件的可靠性和对静默数据损坏的检测机制,并开发了一套新的可扩展存储系统,减少了检查点和回滚的开销。整体上,Llama 3训练的效率相比于Llama 2提高了约三倍。

指令微调

Meta对指令微调方法进行了创新,Llama 3 后训练方法将有监督微调(SFT)、拒绝采样、近端策略优化(PPO)和直接策略优化(DPO)几种方法组合到一起。SFT 中使用的 prompt 质量以及 PPO 和 DPO 中使用的偏好排序对模型对齐有着巨大的影响。此次模型质量的最大改进,来自于仔细整理数据以及对人类注释者提供的注释进行多轮质量保证。

通过 PPO 和 DPO 从偏好排序中学习,也极大地提高了 Llama 3 在推理和代码任务上的性能。Meta 发现,如果你向模型提出一个它难以回答的推理问题,该模型有时会产生正确的推理轨迹:模型知道如何产生正确的答案,但不知道如何选择。对偏好排序的训练使模型能够学习如何选择正确答案。

首个Llama3中文模型

ShareAI团队在Llama3发布之后第一时间基于ShareGPT、ruozhiba、zhihu、xiaohongshu等数据集进行SFT微调训练,并已经发布在wisemodel社区。

模型地址

llama3-Chinese-chat-8b:

https://wisemodel.cn/models/shareAI/llama3-Chinese-chat-8b

Meta-Llama-3-8B:

https://wisemodel.cn/models/breadhunter/Meta-Llama-3-8B

Meta-Llama-3-8B-Instruct:

https://wisemodel.cn/models/breadhunter/Meta-Llama-3-8B-Instruct

Bunny-Llama-3-8B-V:

https://wisemodel.cn/models/BAAI/Bunny-Llama-3-8B-V

----- END -----

欢迎加盟

始智AI wisemodel社区自2023年9月上线以来,取得了积极的进展,初步形成一定的影响力,为了加快公司发展,我们长期需要技术、运营等人才加盟,技术侧重在AI infra、后端开发,熟悉K8S、模型训练和推理等技术, 以及熟悉开发者生态运营的成员(根据个人意向可备注“求职”或“创业”),有意加盟的朋友也可以把简历投递到liudaoquan@wisemodel.cn。

wisemodel相关

系统升级

系列模型:

欢迎投稿

欢迎投稿分享人工智能领域相关的优秀研究成果,鼓励高校实验室、大企业研究团队、个人等,在wisemodel平台上分享各类优质内容,可以是AI领域最新论文解读、最新开源成果介绍,也可以是关于AI技术实践、应用和总结等。投稿可以发邮件到liudaoquan@wisemodel.cn,也可以扫码添加wisemodel微信。

持续关注和支持

开源社区建设需要长期坚持和投入,更需要广大用户的积极参与、贡献和维护。期待更多开发者将开源成果发布到 wisemodel.cn 社区,共建中立、开放的AI开源社区生态。欢迎扫码添加wisemodel微信,可以申请加入wisemodel社群,持续关注社区动态。

关于始智AI wisemodel.cn开源社区

始智AI wisemodel.cn开源社区由清华校友总会AI大数据专委会副秘书长刘道全创立,旨在打造和建设中立开放的AI开源创新社区,将努力打造成“HuggingFace”之外最活跃的社区,汇聚主要AI开源模型和数据集等,欢迎高校科研院所、大型互联网公司、创新创业企业、广大个人开发者,以及政府部门、学会协会、联盟、基金会等,还有投资机构、科技媒体等,共同参与建设AI开源创新生态。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
农业网红诋毁杂交水稻,媒体:一些人还是吃得太饱了!

农业网红诋毁杂交水稻,媒体:一些人还是吃得太饱了!

齐鲁壹点
2026-06-28 17:17:09
180元就能飞伦敦?国航多条飞伦敦航线现180元、200元低价票,客服:不含税费,实际总价为1800多元,且不能退票

180元就能飞伦敦?国航多条飞伦敦航线现180元、200元低价票,客服:不含税费,实际总价为1800多元,且不能退票

极目新闻
2026-07-20 13:26:11
心酸!香港知名歌手遭养老院虐待,一年半没洗澡,褥疮溃烂无人管

心酸!香港知名歌手遭养老院虐待,一年半没洗澡,褥疮溃烂无人管

白面书誏
2026-07-20 14:26:25
中国老师傅复活AE86,JDM正统竟在江苏县城

中国老师傅复活AE86,JDM正统竟在江苏县城

酷玩实验室
2026-07-20 14:43:32
Nice!正式加盟湖人!防守尖兵搭档东契奇

Nice!正式加盟湖人!防守尖兵搭档东契奇

技巧君侃球
2026-07-21 03:37:30
40岁梅根福克斯大晒性感照被批:这是妈妈该发的吗?

40岁梅根福克斯大晒性感照被批:这是妈妈该发的吗?

乡野小珥
2026-07-19 15:54:29
动物行为学发现一条违背直觉的铁律:对配偶越专一的雄性,体内睾酮水平却越低,不是忠诚让它变弱,而是专一本身在重塑它的生存策略

动物行为学发现一条违背直觉的铁律:对配偶越专一的雄性,体内睾酮水平却越低,不是忠诚让它变弱,而是专一本身在重塑它的生存策略

心理观察局
2026-07-18 06:35:11
法媒:梅西泪水落下,像输掉比赛后痛哭的孩子,时光仿佛从未改变

法媒:梅西泪水落下,像输掉比赛后痛哭的孩子,时光仿佛从未改变

砚底沉香
2026-07-20 14:14:04
捷克为何突然大转向?众议长访陆背后,是一笔让“台独”绝望的账

捷克为何突然大转向?众议长访陆背后,是一笔让“台独”绝望的账

阿天爱旅行
2026-07-21 00:28:46
CBA转会市场重磅消息:胡金秋争夺升级,广东新大外援正式宣布

CBA转会市场重磅消息:胡金秋争夺升级,广东新大外援正式宣布

舟望停云
2026-07-21 03:23:21
他曾与四大天王齐名,被富婆包养十年后变痴傻,舌头被割掉三分之二,如今看破红尘当了和尚

他曾与四大天王齐名,被富婆包养十年后变痴傻,舌头被割掉三分之二,如今看破红尘当了和尚

黎兜兜
2026-07-18 21:10:47
相比败光邹市明的2亿家底,冉莹颖更可恨是,不配为人母

相比败光邹市明的2亿家底,冉莹颖更可恨是,不配为人母

翰飞观事
2026-07-20 16:52:58
10起世界杯赌球大案公布:赌资超20亿、78人落网,有人投注133次

10起世界杯赌球大案公布:赌资超20亿、78人落网,有人投注133次

听心堂
2026-07-20 08:32:16
高市早苗“红漆马桶”式的外交与军国主义复刻,离下台还有多远

高市早苗“红漆马桶”式的外交与军国主义复刻,离下台还有多远

触摸史迹
2026-07-21 05:25:42
警告中国别动武?英媒提醒:中国正在打出一张王牌,比稀土更致命

警告中国别动武?英媒提醒:中国正在打出一张王牌,比稀土更致命

离离言几许
2026-06-24 14:16:39
美股三大股指期货走高,纳斯达克100指数期货涨超1%

美股三大股指期货走高,纳斯达克100指数期货涨超1%

每日经济新闻
2026-07-20 19:47:13
切尔西已与阿森纳目标谈妥个人条款,转会费或达5500万镑

切尔西已与阿森纳目标谈妥个人条款,转会费或达5500万镑

温柔且自由
2026-07-21 02:08:54
如何看待“如果严格执行劳动法,会有很多企业活不下去,发生大规模裁员”这种说法?

如何看待“如果严格执行劳动法,会有很多企业活不下去,发生大规模裁员”这种说法?

碧翰烽
2026-07-18 09:18:12
诺兰《奥德赛》全球开画狂揽26.4亿,R级片硬撼合家欢杀入年度前三

诺兰《奥德赛》全球开画狂揽26.4亿,R级片硬撼合家欢杀入年度前三

浅遇时光
2026-07-21 01:23:53
Bose顶级开放式耳机降价33%,仅售199美元创史低

Bose顶级开放式耳机降价33%,仅售199美元创史低

野生运营
2026-07-20 05:11:58
2026-07-21 06:16:49
wisemodel开源社区 incentive-icons
wisemodel开源社区
始智AI wisemodel.cn开源社区,打造中国版“huggingface”
490文章数 16关注度
往期回顾 全部

科技要闻

网易科技"未来大奖2026上半年AI榜单"揭晓

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

头条要闻

媒体:驱逐所有以色列人 马来西亚对以强硬几乎零成本

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

综合续航超1600km 2027款星途ES上市置换价16.99万起

态度原创

教育
本地
游戏
数码
公开课

教育要闻

大女儿一下治好了爸爸的哑巴!姐弟互动视频火了,爸爸偏心太明显

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

负债12亿超大零售商要倒闭!新主机迟迟不来影响太大

数码要闻

曝谷歌正研发全新Frozen v2芯片,可大幅提升Gemini模型运行效率

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版