网易首页 > 网易号 > 正文 申请入驻

每兆瓦每秒7400 token,新指标重新定义大模型推理效率

0
分享至

评估大语言模型(LLM)推理能力,业界一直缺少一个兼顾性能与能耗的统一定量标准。近期,一个名为tok/s/MW的新指标进入视野:它衡量的是系统每消耗一兆瓦总配置功率,每秒能生成多少个token。

这一指标的提出,将推理效率的讨论从单纯的生成速度,拉向了算力投入的真实回报维度。它试图回答一个更本质的问题:在既定电力与硬件预算下,模型能跑多快。


一个具体的测算案例

以单并发用户场景为例,某B300配置在DeepSeek V4模型上,每块GPU可生成约14个输出token/秒。根据SemiAnalysis的数据中心行业模型估算,每块B300的配置功率为1.9千瓦,即0.0019兆瓦。

代入公式计算:14 tok/s ÷ 0.0019 MW = 7,368 tok/s/MW。这意味着,该配置下每消耗一兆瓦功率,系统每秒可产出约7,400个输出token。

这个数字为横向比较不同硬件方案、不同模型架构的推理效率,提供了一个可量化的新维度。对于关注数据中心运营成本与算力规划的技术决策者而言,它比单纯的token吞吐量更具参考价值。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杭州酒局事件仍在发酵!曝出新消息:一个未参加酒局的人受人之托,出面斡旋,结果把自己卷入漩涡

杭州酒局事件仍在发酵!曝出新消息:一个未参加酒局的人受人之托,出面斡旋,结果把自己卷入漩涡

火山詩话
2026-08-22 06:32:54
2026-08-23 19:59:00
闪存猎手
闪存猎手
全网蹲好价的野生捕手,算力与羊毛都不可辜负。
246文章数 69关注度
往期回顾 全部

科技要闻

“英伟达发通知:涨价15%以上”

头条要闻

员工称按店长要求帮其代打卡39次被公司开除 法院判了

头条要闻

员工称按店长要求帮其代打卡39次被公司开除 法院判了

体育要闻

46岁小罗复出,为什么选了一支意丙球队?

娱乐要闻

王传君的舞台,藏着与乔任梁的过往

财经要闻

加拿大宣布“全额对等报复”美国新关税

汽车要闻

华为乾崑全栈赋能/更倾向城市出行 猛士X700车展首秀

态度原创

旅游
游戏
亲子
健康
公开课

旅游要闻

洛阳栾川:康养留客 避暑产业热起来

LCK第三赛段:大局已定,无心恋战!HLE零封T1,锁定名次

亲子要闻

“这种头型,以后大概率是大饼脸”,家长晒照片,被批不用心

“矫正神器”真能治好脊柱侧弯吗?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版