网易首页 > 网易号 > 正文 申请入驻

10万美元的DGX Station有多猛?700B大模型跑到100 token/s

0
分享至


一台放在桌子上的工作站,开始跑700B级大模型了。更夸张的是,它一开始只有1 token/s。经过一轮模型权重调度和内存优化,速度被硬生生拉到了25~28 token/s;换上更适合这套架构的DeepSeek模型后,单路速度进一步来到约100 token/s,多路总吞吐超过200 token/s。

Level1Techs最近花了一周时间,实测了MSI版本的NVIDIA DGX Station——Expert Station WS300。这台接近10万美元的机器,核心是Grace CPU与Blackwell Ultra B300 GPU,配有约252GB HBM,同时拥有大容量LPDDR5内存。

为了摸清这台机器到底能干什么,他没有只跑几个短Prompt的Benchmark,而是直接把700B级大模型、百万Token上下文、27B全参数训练塞了进去。

最后得到的答案也很有意思:DGX Station最值得看的地方,可能还真不只是B300有多快。

753B模型从1 tok/s跑到25倍速

测试最开始并不顺利。他首先把GLM 5.3这样一个753B级模型丢进DGX Station。按照默认配置启动vLLM,结果只有大约1 token/s。

问题很快暴露出来。这台机器虽然有252GB左右的HBM,但显然装不下700B级模型全部参数。剩余权重需要进入Grace侧的LPDDR5内存,再通过NVLink C2C与GPU交换数据。

理论上,NVIDIA给出的C2C带宽可以达到900GB/s,但整套系统真正访问LPDDR5时,实测内存带宽大约在300~320GB/s。怎么把模型参数分配到HBM和LPDDR5里,直接决定了最终速度。

随后,他开始调整PyTorch CUDA内存分配、CPU Offload、Pinned Memory以及vLLM相关设置,同时尽量把更频繁访问的Expert留在HBM。

调整完成后,GLM 5.3从约1 token/s升到了25~28 token/s,速度提高了约25倍。此时还能腾出大约69GB HBM给KV Cache使用,上下文容量可以做到约150万Token。

这次测试也暴露出DGX Station很特殊的一面。同一块硬件,软件调度方式不同,最终性能可能差一个数量级。

模型架构同样影响巨大。他随后测试GPT-OSS 120B,单路推理直接跑到约380 token/s,4路并发总吞吐超过1000 token/s。百万Token上下文的“大海捞针”测试中,它还能保持完整的信息召回。

临近机器寄回MSI时,他又赶上DeepSeek 4.1 Flash发布。这个700B级模型与DGX Station的内存结构意外契合,一部分参数可以留在HBM,另一部分放进LPDDR5。

最终,视频中给出的成绩达到单路约100 token/s,多路Aggregate吞吐约230~270 token/s。

几天测试下来,他看到的已经不只是“显存够不够用”这个问题。HBM负责高频数据,LPDDR5承载大量模型参数,未来甚至还能把SSD加入缓存体系,大模型正在开始真正利用分层内存。

50GB模型,训练时吃掉451GB内存

推理只是其中一部分,他随后又做了一件更狠的事情:在这台桌面工作站上完整训练27B模型。

测试使用的是Dense版本Qwen 3.8 27B,约269亿参数。训练数据包含73000多段对话,总计约3.5亿输入Token,最长上下文达到14.2万Token。

这一次,他跑的是全参数训练。模型本身的权重只有大约50GB,但真正进入训练后,还需要保存Gradient、FP32 Master Weight和Adam Optimizer State。几项叠加之后,仅模型相关状态就膨胀到约451GB,还没有计算Activation以及额外的数据副本。

Grace的大容量内存终于开始发挥作用。训练过程中,模型计算和权重使用BF16,优化器的大量状态留在CPU内存,同时配合Flash Attention、Activation Checkpoint、CPU Offload和Gradient Accumulation,最终把整个训练任务跑了下来。

一个Epoch耗时约26.45小时,完成2291次参数更新,没有出现Skip,平均输入吞吐约3673 tokens/s。

功耗也在这里真正被拉满。

普通LLM推理时,他很难让整机墙上功耗长期超过1000~1100W;到了27B全参数训练,CPU和GPU模块瞬时功耗峰值达到约1.78kW,1秒平均模块功耗约1.5kW,其中GPU约1.32kW。

NVIDIA给DGX Station准备1600W级电源,很大一部分意义就在这种场景里。

买不买,最后算的是Token账

跑完这一圈后,他把问题重新拉回了价格。

对于机器人、实验室自动化、生物信息、敏感数据处理这类场景,本地运行本身就有价值。机器人控制需要低延迟,实验数据可能涉及隐私和合规,模型直接放在设备旁边,可以同时连接真实机器和本地数据。

DGX Station还支持MIG,可以把GPU划分成多个独立实例。一个团队可以同时跑不同仿真任务,也可以让多个真实设备分别接入不同实例。但如果用途主要是Coding Agent、软件开发和普通大模型调用,账就要重新算。

他的估算是,这类设备需要长期保持70%~90%的高利用率,才更容易与云端Token成本抗衡。否则,直接购买云端模型服务可能更省钱。

因此,他给自己设了一条大致的回本线:18个月。AI硬件和模型迭代太快,回本周期一旦拉得过长,下一代平台、模型架构和推理软件都有可能重新改写成本。

有趣的是,测试一周之后,他对这台机器的评价反而比预期更高。

700B级模型已经可以在桌面上跑到约100 token/s,120B模型能够做到数百token/s,27B Dense模型可以完成全参数训练,两台机器还能够通过ConnectX-8的800Gbps网络继续扩展。

过去这类工作通常属于机房里的大型GPU集群。现在,它被压进了一台桌边工作站里。而他最后留下的问题,也成了这台机器真正需要回答的问题:当本地AI开始拥有这种规模的算力之后,企业究竟还有多少Token,值得继续放在云上?

END本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
邓亚萍谈日本男单全军覆没:男团夺冠后兴奋过了头,对于年轻球员来讲,能战胜国乒一定出乎他们的意料

邓亚萍谈日本男单全军覆没:男团夺冠后兴奋过了头,对于年轻球员来讲,能战胜国乒一定出乎他们的意料

扬子晚报
2026-09-26 22:58:31
当着193国的面,泽连斯基把韩国卖了,李在明痛批“言而无信”

当着193国的面,泽连斯基把韩国卖了,李在明痛批“言而无信”

冰语历史
2026-09-27 12:28:48
十月中旬开始运势翻盘,纠结慢慢放下,好事接踵而至的三大生肖!

十月中旬开始运势翻盘,纠结慢慢放下,好事接踵而至的三大生肖!

情感事聊
2026-09-27 11:33:00
一种被误解的能力:022导弹艇在仁爱礁到底做了什么?

一种被误解的能力:022导弹艇在仁爱礁到底做了什么?

向阳热谈
2026-09-26 23:18:26
保质期是个大骗局,这些食物永远不会过期,放得越久越值钱,你却在扔掉它们

保质期是个大骗局,这些食物永远不会过期,放得越久越值钱,你却在扔掉它们

富贵说
2026-07-13 14:48:03
宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

宁可被骂也无所谓了!惠州女孩月薪3000扛不住6000房贷,发视频喊话国外前男友回来收回房子。

捣蛋窝
2026-09-09 13:59:20
中国文坛有哪些被捧得过高的作品?

中国文坛有哪些被捧得过高的作品?

侃神评故事
2026-09-26 07:15:09
东方树叶山姆上新,无糖茶卷出“新方向”?

东方树叶山姆上新,无糖茶卷出“新方向”?

整点消费
2026-09-23 08:02:56
真要睡地板了:13.96亿追偿,连带清偿!

真要睡地板了:13.96亿追偿,连带清偿!

商业模式桑博士
2026-09-01 07:27:31
随着张雪机车的德比斯在意大利站第4名完赛,WSBK最新积分榜出炉

随着张雪机车的德比斯在意大利站第4名完赛,WSBK最新积分榜出炉

俯身冲顶
2026-09-26 21:04:27
让男人产生多巴胺依赖的女人,身上只有一个共性,跟美貌无关

让男人产生多巴胺依赖的女人,身上只有一个共性,跟美貌无关

晓悦流年
2026-06-15 22:08:24
这年头有上进心是好是坏?心血来潮去赚钱结果赔了

这年头有上进心是好是坏?心血来潮去赚钱结果赔了

康富贵碎碎念
2026-09-27 11:56:03
她58岁仍是干净之身,至今没谈过恋爱,除非是最爱不然不会献身

她58岁仍是干净之身,至今没谈过恋爱,除非是最爱不然不会献身

春之韵
2026-09-26 11:28:37
只要不嫌脏不嫌丢人,就去干这9个冷门活路,闷声发财!

只要不嫌脏不嫌丢人,就去干这9个冷门活路,闷声发财!

另子维爱读史
2026-09-24 19:10:42
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
棋后诸宸:嫁卡塔尔王室后放弃中国籍,接受一夫多妻,如今后悔吗

棋后诸宸:嫁卡塔尔王室后放弃中国籍,接受一夫多妻,如今后悔吗

文史达观
2025-06-03 18:58:40
CBA最新消息,上海男篮新外援确定,北控放弃尼克斯,天津有望签约

CBA最新消息,上海男篮新外援确定,北控放弃尼克斯,天津有望签约

一网打尽全球焦点
2026-09-27 11:22:43
人有没有肝病,看喝酒就知?提醒:有肝病的人喝酒多会有 4 异常

人有没有肝病,看喝酒就知?提醒:有肝病的人喝酒多会有 4 异常

芹姐说生活
2026-04-15 13:53:38
英格兰2-3西班牙,赛后评分:不是亚马尔第一,西班牙15号第一

英格兰2-3西班牙,赛后评分:不是亚马尔第一,西班牙15号第一

侧身凌空斩
2026-09-27 04:47:47
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
2026-09-27 13:48:49
至顶AI实验室 incentive-icons
至顶AI实验室
一个专注于探索生成式AI前沿技术及其应用的实验室。
3520文章数 185关注度
往期回顾 全部

数码要闻

苹果iPad mini 8爆料:前摄改横向布局,A20 Pro芯片等

头条要闻

中美元首讲话共同谈起抗日历史 特朗普提起一个中文词

头条要闻

中美元首讲话共同谈起抗日历史 特朗普提起一个中文词

体育要闻

2-1!41岁魔笛世界波 克罗地亚欧国联开门红

娱乐要闻

刘欢被病痛裹挟,一生献给音乐与讲台

财经要闻

“为了看短剧,我妈两年花了22万 ”

科技要闻

星舰第14飞,为什么准备绕地球六圈?

汽车要闻

MAZDA EZ-60激光版上市 焕新全系11.39万元起

态度原创

本地
房产
游戏
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

全年霸榜TOP1!南海・叁號院周年官宣:新作即将登场

《GTA6》典藏版英国48小时售罄 玩家怒斥“割韭菜”

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

美官员:特朗普拒绝伊朗提议 并称或恢复对伊轰炸

无障碍浏览 进入关怀版