网易首页 > 网易号 > 正文 申请入驻

大模型解剖图火了,30多个开源模型架构差异一目了然,还可接入AI

0
分享至

2026 年的前两个月,开源大模型的发布节奏已快至令人应接不暇。Arcee AI 的 Trinity Large、月之暗面的 Kimi K2.5、阿里的 Qwen3.5、智谱 AI 的 GLM-5、Cohere 的 Tiny Aya……它们的名称如流水般接踵而至,参数量从 3B 至 1T 不等,每一款都宣称是“SOTA”或者“最强开源”。

然而,如此快的更新速度,对于普通开发者而言,莫说深入研究,仅仅是分辨区别就已经耗费大量精力。更不用提许多技术报告的表述含糊,架构图绘制风格各异,想要进行横向对比十分困难。

为了解决这些问题,一个名为“LLM Architecture Gallery”(大语言模型架构画廊)的项目上线了。顾名思义,就是让你像逛“画廊”一样,浏览不同模型的架构图。

这个项目的作者是 Sebastian Raschka,是机器学习领域的知名研究者,写过《Python Machine Learning》和《Build a Large Language Model (From Scratch)》这两本深受欢迎的专业书籍。

他把过去几个月撰写的两篇长文《The Big LLM Architecture Comparison》和《A Dream of Spring for Open-Weight LLMs》中绘制的所有架构图抽取出来,用统一的视觉语言重新呈现,集中放在一个页面上。点击任意一张图可以放大,每张图下方附带一份“规格表”,列出模型的参数量、发布时间、注意力机制类型等关键信息。想深入某个模型,可以点开“view in article”页面会直接跳转到原文对应章节。

项目上线几小时后,Andrej Karpathy 在 X 上回复了 Raschka 的推文:“太好了!我的自动研究功能很需要这个内容的 Markdown 版本——一个创意池。”他最近发布的 autoresearch 项目:一个让 AI 自主跑实验的开源工具,正需要这类结构化的架构信息作为创意来源。

Raschka 也很快作出回复,并提供了 YAML 格式的元数据 GitHub 链接。Karpathy 随后表示他已经用 Obsidian 把博客文章导出成 markdown,并且“输入到了 autoresearch 循环中”。一个本意是方便人类阅读的架构图集,就这样被接入了 AI 自动化研究的工作流。

就在今天,这个项目也冲上了 Hacker News 首页。一位用户评论说:“这让我想起了当年的 Neural Network Zoo,也是用可视化的方式展示不同架构。”也有人继续帮忙优化细节:“能不能按时间排序,画出架构演化的家谱树?能不能加一个比例视图,让参数量的差异在视觉上直观可感?”对于这些建议,Sebastian 表示他后续会持续完善。

回到项目本身,目前,这份图集收录了三十多个模型架构,从 Llama 38B 到最新的 Qwen3.5、Sarvam 105B、Ling 2.5 1T。所有图都按同一套视觉规范绘制:配色、图例、字体统一,DeepSeek V3 和 Qwen3 235B-A22B 被放在一起时,你一眼就能看出前者用了 MLA(Multi-Head Latent Attention,多头潜在注意力),后者用的是 GQA(Grouped-Query Attention,分组查询注意力);DeepSeek V3 有一个“共享专家”模块,Qwen3 没有。

这类信息原本散落在几十页技术报告的不同角落,现在被压缩成一张对比图。

MoE(Mixture-of-Experts,混合专家模型)是 2025 年开源 LLM 的主旋律。所有主流的前沿开放权重模型都采用了这种架构。传统的“稠密”Transformer 会在每次生成 token 时激活全部参数,参数越多,算力成本越高。而 MoE 把参数分成若干“专家”,每次只激活其中一部分。DeepSeek V3 名义上有 6,710 亿参数,但实际运行时只激活 370 亿;Llama 4 Maverick 号称 4,000 亿参数,激活的只有 170 亿。

Raschka 在图集中把各模型的专家数量、激活比例、专家隐藏层尺寸都标注出来,让稀疏程度一目了然。Hacker News 上有人感慨:“我很惊讶这些模型在结构上有多相似,主要差异就是层的大小。”

另一位用户则看出了一些端倪,辣评“过去七年,LLM 架构有很多改进,但没有根本性的创新。今天最好的开放权重模型,如果你缩远了看,仍然很像 GPT-2,就是一堆注意力层和前馈层堆起来。”

这可以说是一个重要的观察。LLM 能力的惊人提升,更多来自训练方法的革新。比如 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励的强化学习),而不是架构本身的突破。架构层面的优化,更多是为了让训练和推理更高效、成本更低,而不是让模型根本上更聪明。理解这一点,对选型和预期管理都有帮助。

最后总结一下,这个大模型架构的图集的实际用法很简单。

首先,你可以把它当作速查手册:想知道 Qwen3 和 DeepSeek V3 在注意力机制上有什么区别?打开页面,找到两张图,直接对比。规格表里会告诉你 Qwen3 用 GQA,DeepSeek V3 用 MLA;前者没有共享专家,后者有。

其次,每张架构图都链接到 Raschka 原文中的对应章节,如果你想深入了解某个技术细节:比如 QK-Norm(一种应用于查询和键向量的归一化技术)是什么、为什么能稳定训练,点进去就能读到解释。

第三,图集附带一份“概念速查”,解释 GQA、MLA、SWA(Sliding Window Attention,滑动窗口注意力)、NoPE(No Positional Encoding,无位置编码)、Gated DeltaNet 等术语,适合快速补课。

并且,正如 Karpathy 的用法所示,这份图集的价值不仅在于人类可读,还在于它的结构化程度足以被机器解析。Raschka 在 GitHub 上提供了 YAML 格式的元数据,包含每个模型的参数量、发布日期、技术报告链接、注意力类型等字段。如果你想写脚本批量分析这些模型的共性和差异,或者像 Karpathy 那样把它们喂给 AI 做自动化研究,这份元数据是现成的起点。

Raschka 还把整套架构图打包成一个超高分辨率的 PNG 文件(56M,182 百万像素,上传到 Zazzle,可以直接下单打印成实体海报。他自己也订了一张,但“还没收到货,暂时不能保证印刷质量”。页面底部留了一个 Issue Tracker 链接,欢迎任何人提交纠错或建议。

对于正在选型的工程师来说,这份图集的价值在于节省时间。你不用再翻几十页技术报告去找一个数字,也不用自己画对比表格。对于想搞懂“这些模型到底在结构上有什么区别”的研究者来说,统一的视觉语言让跨模型对比成为可能。

1.项目地址:https://sebastianraschka.com/llm-architecture-gallery/#card-qwen3-5-397b

2.开发者主页:https://x.com/rasbt/status/2033167146302210058

运营/排版:何晨龙

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运会开幕式被吐槽!媒体人热议:怎么能诡异成这样,无法理解

亚运会开幕式被吐槽!媒体人热议:怎么能诡异成这样,无法理解

奥拜尔
2026-09-19 19:06:55
硫磺熏笋已失控!市监局证实:已发往全国多地,二氧化硫超标百倍

硫磺熏笋已失控!市监局证实:已发往全国多地,二氧化硫超标百倍

行者聊官
2026-09-18 19:32:09
徐湖平受贿被判3年,南京博物院丢失的5幅名画,最后1幅几乎不可能追回来了

徐湖平受贿被判3年,南京博物院丢失的5幅名画,最后1幅几乎不可能追回来了

六子吃凉粉
2026-09-19 14:29:55
被0-7打服?德甲队官方喊话:19岁亚马尔闭嘴!拜仁2人才配拿金球奖

被0-7打服?德甲队官方喊话:19岁亚马尔闭嘴!拜仁2人才配拿金球奖

我爱英超
2026-09-19 07:01:35
被骂尺度太大?池昌旭林珍娜的大胆出演,藏着最纯粹的演员初心

被骂尺度太大?池昌旭林珍娜的大胆出演,藏着最纯粹的演员初心

传递满满正能量
2026-09-19 06:08:21
丰田新车,10月1日正式上市!

丰田新车,10月1日正式上市!

电动内参
2026-09-19 18:29:21
32岁女子“肉偿”300万债务,2022年33个男子接受服务后,多名男子举报她

32岁女子“肉偿”300万债务,2022年33个男子接受服务后,多名男子举报她

汉史趣闻
2026-09-19 10:57:18
西贝被曝将彻底倒闭

西贝被曝将彻底倒闭

鞭牛士
2026-09-19 14:36:41
选不上就掀桌子?十月革命后的苏俄,为何没能快速俘获俄国人心

选不上就掀桌子?十月革命后的苏俄,为何没能快速俘获俄国人心

老达子
2026-09-17 06:25:03
先毁掉王治郅、再耗干姚明,他凭一己之力让中国篮球倒退了20年?

先毁掉王治郅、再耗干姚明,他凭一己之力让中国篮球倒退了20年?

贵州小娟
2026-08-26 15:11:56
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
想不到!新疆人第一次见自己的馕发霉震惊了,专家解析背后的原因

想不到!新疆人第一次见自己的馕发霉震惊了,专家解析背后的原因

西昆仑Bruce
2026-09-19 15:34:39
男子拿10多个西瓜连砸摊主头部,最新进展:摊主已获近7万元赔偿;摊主父亲:事发时摊上有两把西瓜刀,若还手不能收场

男子拿10多个西瓜连砸摊主头部,最新进展:摊主已获近7万元赔偿;摊主父亲:事发时摊上有两把西瓜刀,若还手不能收场

扬子晚报
2026-09-19 20:30:43
胡塞武装大败,王牌旅长当场阵亡

胡塞武装大败,王牌旅长当场阵亡

烽火观天下
2026-09-19 16:23:21
荷航前CEO坐自家航班,违规使用充电宝还睡着了,充电宝爆炸起火!航班已飞行5小时,被迫紧急返航

荷航前CEO坐自家航班,违规使用充电宝还睡着了,充电宝爆炸起火!航班已飞行5小时,被迫紧急返航

每日经济新闻
2026-09-19 19:17:57
许嵩冯禧官宣结婚,发文“我们的人生故事写到了新的一章”

许嵩冯禧官宣结婚,发文“我们的人生故事写到了新的一章”

韩小娱
2026-09-19 20:53:51
40岁歌手许嵩官宣结婚,小14岁妻子是他的粉丝,也是一名主持人,婚纱照曝光

40岁歌手许嵩官宣结婚,小14岁妻子是他的粉丝,也是一名主持人,婚纱照曝光

叨唠
2026-09-19 21:07:47
高市改组内阁大换血!转头向我国喊话,中日关系要变天?

高市改组内阁大换血!转头向我国喊话,中日关系要变天?

共工之锚
2026-09-19 00:14:00
他接受纪律审查和监察调查

他接受纪律审查和监察调查

锡望
2026-09-19 20:13:02
打爆日本队,中国男篮最新主教练备选人曝光,特别强,这次真稳了

打爆日本队,中国男篮最新主教练备选人曝光,特别强,这次真稳了

宗介说体育
2026-09-19 17:30:30
2026-09-19 22:59:00
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17272文章数 515218关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:男子赔近7万

头条要闻

男子拿10多个西瓜连砸摊主头部 最新进展:男子赔近7万

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

甜度爆表!许嵩冯禧晒婚纱照官宣结婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

家居
时尚
房产
游戏
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

早秋外套别总穿黑色,准备一件黄色针织衫,温柔大方又减龄

房产要闻

海口房价,降不动了!

《漫威金刚狼》热修复上线 削弱“放屁气体”效果

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版