网易首页 > 网易号 > 正文 申请入驻

在Claude上相同的TypeScript代码比在GPT上贵73%

0
分享至


测试汇总:

“Token”并非固定的文本量。每家供应商的tokenizer会将同一份文件分割成不同数量的片段,而你按片段付费。因此,不同供应商之间的$/Mtok(每百万token价格)是不可直接比较的。

Anthropic最新的tokenizer(Sonnet 5, Opus 4.8, Fable 5)对相同的代码产生的token数量比其之前的版本多约30%。标价并未改变。

在相同的文件上,它产生的token数量是GPT的1.36至1.73倍。TypeScript是最坏的情况,达到了1.73倍。

从有效成本来看,Opus 4.8的$5 / $25标价实际相当于$7.50 / $37.50,而Sonnet 5在促销期结束后则相当于$4.50 / $22.50。

此分析仅衡量输入token化。输出内容的长度、思考过程以及缓存会使整个任务的账单进一步变化;详情见末尾。

我们使用每家供应商自己的计数端点,对所有前沿模型的tokenizer统计了相同字节数,并与实际付费请求的计数进行了交叉核对。以下是具体数字以及它们对价目表上价格的实际影响。


为什么$/Mtok不是可比价格

模型的账单是两个数字的乘积:

成本 = (你的内容转换成的token数) x (每个token的价格)

定价页面显示的是第二个数字,并将第一个数字视为常数。但它并非常数。它取决于模型的tokenizer,而不同供应商的tokenizer差异很大。两个模型可能都标着“$5.00 / 1M 输入token”,但对于相同的段落,它们产生的账单却可能大不相同,因为其中一个会将该段落转换成更多的token。由于没有人公布每个token对应的内容量数据,我们进行了测量。

测量方法

我们选取了16个真实样例:英文散文、HTML页面、JavaScript、Python、TypeScript和Rust文件、JSON工具架构和工具结果、中文对话和散文、含大量符号的文本,以及我们自己的Agent系统提示词。我们使用每个模型的生产环境tokenizer,对每个样例逐字节进行了计数:

1. Anthropic模型使用官方的count_tokens端点进行计数,该端点返回的计数与Anthropic计费的依据相同。

2. OpenAI模型使用文档中记录的o200k_base tokenizer,通过tiktoken库进行计数。对于最新模型,我们通过与生产环境进行双重检查:我们向GPT-5.1、GPT-5.5和GPT-5.6 Sol发送了真实的API调用,并使用“长文本减短文本”差值法(以抵消请求框架的影响)将实际使用量与本地计数进行了比较。三者均与o200k_base完全匹配。

3. Gemini和Grok使用其提供商提供的token计数端点。

在整个分析中,GPT的o200k作为1.00倍基准,主要因为它已经冻结并被公开文档记录超过两年,而Claude的tokenizer则是发生变化的那一个。DeepSeek和GLM被完全排除在表格之外:我们只有粗略的“字符数除以四”的估算值,没有真实的tokenizer计数,而本文关注的是实际测量数据。

发现:相同标价,token数多约30%

Claude Opus 4.6 和 Opus 4.8 的标价同为 $5.00 / $25.00。两者之间的变化在于tokenizer。Sonnet 4.6 和 Opus 4.6 使用旧版tokenizer;Sonnet 5、Opus 4.8 和 Fable 5 使用新版。下表统计了相同的字节在Anthropic自己的端点上使用新旧tokenizer的计数结果:

内容

旧版Tokenizer

新版Tokenizer

变化

英文散文 (2,115字符)

476

636

+34%

HTML页面 (3,195字符)

1,131

1,302

+15%

JavaScript (1,933字符)

659

794

Python (2,251字符)

831

1,022

+23%

TypeScript (2,888字符)

898

1,178

+31%

Rust (2,924字符)

1,019

1,312

+29%

JSON工具架构 (9,948字符)

2,631

3,306

+26%

我们的Agent系统提示词 (42,661字符)

10,761

14,953

+39%

中文散文 (379字符)

435

433

如果按照真实的Agent请求构成(主要是英文系统提示词、工具架构、代码和JSON)对这些行进行加权,新版tokenizer每个请求大约增加+32%的token数。中文那一行几乎没有变化,因此token膨胀主要集中在英文和代码上。

Sonnet 5的发布价格,重新计算

Sonnet 5发布时的价格为 $2.00 / $10.00,低于Sonnet 4.6的 $3.00 / $15.00,看似是降价。但这是一个促销价,将于2026年8月31日结束。在促销期间,较低的费率略高于抵消额外的token数,因此对于相同的代码,Sonnet 5实际上比4.6稍便宜一些。从9月1日起,价格将回调至 $3.00 / $15.00,额外的token数依然存在,在相同的标价下,完成相同工作的成本将比Sonnet 4.6时高出约三分之一。

通过实际账单验证计数器

counttokens 是一个预测值,因此我们也发送了真实的付费请求(设置 maxtokens: 1),并读取了 usage.input_tokens,这是账单计费的依据。对于相同的内容,Opus 4.6 计费了 2,541 个输入token,Opus 4.8 计费了 3,191 个,每个都与它们的预测计数完全匹配。我们对Fable 5(该系列中最昂贵的模型)也进行了同样的检查,它计费了 3,191 个token,与 Opus 4.8 相同。因此,Fable 使用相同的新版tokenizer,并且其更高的标价背后没有隐藏额外的每token加价。整个验证过程花费约0.08美元。

发现:代码上的差距最大

跨供应商表格以GPT的o200k作为1.00倍基准。每个单元格的值是该模型对相同文件的token计数除以GPT的token计数,因此1.20倍意味着比GPT多20%的token。Claude的新旧tokenizer并排显示:

内容

Claude (新版)

Claude (旧版)

Gemini 3 Flash

Grok 4.5

TypeScript

1.73x

1.32x

1.16x

1.05x

Rust

1.58x

1.22x

1.19x

1.05x

JavaScript

1.52x

1.26x

1.23x

1.11x

Python

1.50x

1.22x

1.20x

1.09x

HTML页面

1.36x

1.18x

1.08x

1.04x

英文散文

1.40x

1.05x

1.01x

1.00x

中文散文

1.44x

1.45x

0.85x

0.86x

中文对话

1.53x

1.55x

0.91x

0.92x

代码行的数值远高于散文行:TypeScript为1.73倍,Rust为1.58倍,JavaScript为1.52倍,Python为1.50倍,而英文散文为1.40倍。代码是编程Agent处理的主要内容,因此对于此类工作负载,1.50-1.73倍的范围是相关的。

为什么TypeScript是最坏的情况?因为o200k在处理TypeScript时异常高效:大约每个token对应4.24个字符,这看起来像是在大量网络JavaScript和TypeScript上训练的结果,其中驼峰式标识符和JSX模式能被压缩成单个token。而在Rust上,其效率下降到大约每个token 3.51个字符。Claude的tokenizer在两种语言上的密度大致相同,因此差距最大的地方恰恰是GPT最强的地方。

中文表现不同。无论是旧版还是新版tokenizer,Claude都比GPT高出约1.45-1.55倍(在散文样例上为435对433个token,而GPT为300个),因此这是Claude系列在CJK文本上的长期属性,并非新版tokenizer引入的。实际上,Gemini在这里比GPT更高效,为256个token。哪种tokenizer对你来说成本更高,取决于你写什么。

这对价格意味着什么

将标价乘以测量到的差异,就能得到处理相同工作的有效价格。这里的差异是典型英文编码请求的混合倍数,以GPT的o200k为标准:

模型

标价 输入/输出 ($/Mtok)

差异倍数

有效价格 输入/输出 ($/Mtok)

GPT-5.1

$1.25 / $10.00

1.00x (基准)

$1.25 / $10.00

GPT-5.5

$5.00 / $30.00

1.00x

$5.00 / $30.00

GPT-5.6 Sol

$5.00 / $30.00

1.00x (已验证)

$5.00 / $30.00

Grok 4.5

$2.00 / $6.00

1.03x

$2.06 / $6.18

Gemini 3 Flash

$0.50 / $3.00

1.09x

$0.55 / $3.27

Claude Sonnet 4.6

$3.00 / $15.00

1.14x (旧版tokenizer)

$3.42 / $17.10

Claude Sonnet 5 (促销价)

$2.00 / $10.00

1.50x (新版tokenizer)

$3.00 / $15.00

Claude Sonnet 5 (自9月1日起)

$3.00 / $15.00

1.50x

$4.50 / $22.50

Claude Opus 4.6

$5.00 / $25.00

1.14x (旧版tokenizer)

$5.70 / $28.50

Claude Opus 4.8

$5.00 / $25.00

1.50x (新版tokenizer)

$7.50 / $37.50

Claude Fable 5

$10.00 / $50.00

1.50x (新版tokenizer)

$15.00 / $75.00

有几行值得再看一眼。Opus 4.6和4.8标价相同,但有效价格相差约32%。GPT-5.5和GPT-5.6 Sol共享tokenizer,因此它们相同的标价在效果上确实是相同的。Gemini 3 Flash运行的tokenizer比GPT略重,但仍以较大优势保持为最便宜的选择。

作为一个独立数据点:Ploy本周发布了一份迁移到GPT-5.6 Sol的生产报告,称在相同的构建任务中,输入token数为170万,而Claude Opus 4.8为260万,大约减少了35%。这衡量的是整个任务的账单而非单纯的tokenizer探测,因此它也包含了模型输出的长度因素,但指向了相同的方向。

输入比例未涵盖的内容

以上所有内容只衡量了一件事:相同的字节变成了多少个输入token。一个完整的Agent任务在此基础上增加了更多变量,而且这些变量影响很大。模型为达到相同结果花费了多少输出和思考token?执行器每步加载了多少上下文?它调用工具或产生子Agent的频率如何?供应商如何对缓存读取和写入定价?

有两个后果值得明确指出。首先,缓存流量也按token计费,因此一个产生32%更多token的tokenizer也会使每次缓存写入和读取的成本增加约32%,并且在长时间的Agent会话中,缓存读取占据了账单的大部分。其次,一旦将输出长度和思考过程计入,整个任务的成本差异可能远超1.73倍,向任一方向都有可能。当人们报告某个模型在Agent任务上“使用的token是另一个模型的2-4倍”时,这在他们特定的设置下可能是真的,即使我们样本中纯输入token化的差距从未超过1.73倍。这两个数字衡量的是不同层面。

按内容类型划分,我们测量到的Claude新版tokenizer相对于GPT的o200k的输入侧范围是:散文、HTML和JSON为1.36-1.42倍;代码为1.50-1.73倍,其中TypeScript最高;中文和含大量符号的文本为1.44-1.53倍。我们将TypeScript放在标题中,因为它既是范围的最高点,也是编程Agent整天处理的内容,而非因为所有情况都是1.73倍。

我们还在后续研究中直接测量了每个任务层的成本:九个相同的模型,分别给定一个相同的绘图任务,各尝试一次,每次尝试都根据提供商自己的使用量数据定价。相同的绘图任务,根据模型和推理力度,成本从$0.004到$0.80不等,而最大推理力度导致三个模型完全无法完成任务。

如何比较模型价格

1. 基于你自己的内容进行比较。你的语言和文件类型决定了倍数,因此在信任价目表之前,请通过每个tokenizer运行一个有代表性的样本。

2. 将tokenizer变更视为价格变更。当供应商以相同标价发布新模型时,请检查tokenizer是否发生了变化。从Opus 4.6到4.8是约32%的增长,而任何账单上都没有这个项目。

3. 衡量每完成一个任务的美元成本,而非每token的美元成本。这个单一数字同时包含了token化、输出长度、思考过程和缓存,而提供商的usage字段为你计算它提供了真实数据。

4. $/Mtok作为开场信息仍然有用。但它不够充分,并且在不同tokenizer之间不可比较。供应商明天就可以通过同时发布每字节的价格来解决这个问题;在有人这样做之前,转换工作就落在你身上了。

以上内容并不意味着某一个模型普遍正确。GPT-5.x在英文和代码上是token效率最高的选择,Gemini 3 Flash在有效价格上非常便宜,而Claude模型即使运行成本更高,也凭质量赢得了自己的地位。只需确保你比较的价格是在考虑tokenizer之后你实际支付的价格。

来源:Anthropic定价 (anthropic.com/pricing),OpenAI定价 (platform.openai.com/docs/pricing),Google Gemini API定价 (ai.google.dev),xAI定价 (docs.x.ai)。Token计数来自Anthropic的counttokens端点,OpenAI的o200kbase(已通过实时API使用情况验证),以及Google和xAI的计数端点。生成这些计数时未使用任何文本生成技术。

© THE END

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
20万人连夜出逃!法国西班牙烧成炼狱,欧洲的“末日”才刚开始

20万人连夜出逃!法国西班牙烧成炼狱,欧洲的“末日”才刚开始

李云飞Afey
2026-07-25 21:04:30
莱尔斯9秒79夺得美国田径锦标赛男子百米冠军,刷新今年世界最好成绩

莱尔斯9秒79夺得美国田径锦标赛男子百米冠军,刷新今年世界最好成绩

懂球帝
2026-07-26 20:16:07
不可思议!邹市明对冉莹颖就是生理性喜欢,3个儿子都是意外怀孕,评论炸锅

不可思议!邹市明对冉莹颖就是生理性喜欢,3个儿子都是意外怀孕,评论炸锅

火山詩话
2026-07-26 07:57:26
广东25年老厂突然结业,只发工资不提赔偿,老员工:心寒了

广东25年老厂突然结业,只发工资不提赔偿,老员工:心寒了

川渝视觉
2026-07-26 13:20:47
又一金饭碗走下神坛!曾经争抢加入银行的年轻人,如今开始辞职

又一金饭碗走下神坛!曾经争抢加入银行的年轻人,如今开始辞职

青眼财经
2026-07-25 10:23:37
深圳正在“清失”的人:1273台无人车背后1000万司机的下一站在哪

深圳正在“清失”的人:1273台无人车背后1000万司机的下一站在哪

侃故事的阿庆
2026-07-26 15:48:24
太贪婪!130 亿石油巨款仅到账 3 亿!美议员:钱全被特朗普私吞了?

太贪婪!130 亿石油巨款仅到账 3 亿!美议员:钱全被特朗普私吞了?

麓谷隐士
2026-07-26 07:10:03
全队的报价都看不上!太惨了!

全队的报价都看不上!太惨了!

柚子说球
2026-07-26 22:43:18
艺人李权哲高铁占座,铁路部门回应

艺人李权哲高铁占座,铁路部门回应

新京报
2026-07-26 18:30:44
黄仁勋、马斯克同日发声:中国的人工智能注定卓越 将成为全球领导者

黄仁勋、马斯克同日发声:中国的人工智能注定卓越 将成为全球领导者

财联社
2026-07-26 16:18:13
心理学:一个女人私生活乱不乱,不要去看脸,就看这2处,准确率接近99%

心理学:一个女人私生活乱不乱,不要去看脸,就看这2处,准确率接近99%

心理观察局
2026-07-25 07:03:13
泽连斯基收到最新情报,普京这次找东方盟友借兵,数量十分惊人

泽连斯基收到最新情报,普京这次找东方盟友借兵,数量十分惊人

共工之锚
2026-07-27 00:06:07
金价将重现历史?要有心理准备,下月,金价或将重演2015年历史

金价将重现历史?要有心理准备,下月,金价或将重演2015年历史

讯崽侃天下
2026-07-26 09:33:20
1小时预订10347台!东风官宣新车:顶配版预售30.99万

1小时预订10347台!东风官宣新车:顶配版预售30.99万

科技阿维
2026-07-25 09:51:43
中方当场离席后,澳方才发现坏事,真相被自家总理锁在52年前!

中方当场离席后,澳方才发现坏事,真相被自家总理锁在52年前!

故事终将光明磊落
2026-07-25 19:36:51
小舅子带人砸坏我新车,岳母劝我算了,我淡定报警:一个不放过

小舅子带人砸坏我新车,岳母劝我算了,我淡定报警:一个不放过

晓艾故事汇
2026-07-24 14:34:20
长鑫开盘价会疯吗?

长鑫开盘价会疯吗?

基精
2026-07-27 00:26:04
立下郑重誓言!刘德华官宣:2028年,我一定会成为真正的导演

立下郑重誓言!刘德华官宣:2028年,我一定会成为真正的导演

阿废冷眼观察所
2026-07-25 00:25:01
朱芳雨下课有几点原因,陈海涛忍无可忍,让儿子陈浩峰接任总经理

朱芳雨下课有几点原因,陈海涛忍无可忍,让儿子陈浩峰接任总经理

负面黑洞
2026-07-24 19:06:12
李小冉新家曝光:面积大约300平,采光很差,独居难掩落寞!

李小冉新家曝光:面积大约300平,采光很差,独居难掩落寞!

乡野小珥
2026-07-25 07:51:03
2026-07-27 01:47:00
水哥
水哥
搜狐科技2017年度十大作者,网易科技、钛媒体2018年度作者
234文章数 346关注度
往期回顾 全部

科技要闻

传DeepSeek 100亿元新一轮融资突然放缓

头条要闻

邓煜舅舅发声:我们全家学霸 他那辈全部保送顶尖学府

头条要闻

邓煜舅舅发声:我们全家学霸 他那辈全部保送顶尖学府

体育要闻

詹姆斯的最后一集,依旧最艰难的路?

娱乐要闻

演员王建隆在家中去世,年仅43岁

财经要闻

232亿,巴黎水被卖了

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

旅游
本地
手机
家居
公开课

旅游要闻

避开丽江人山人海,小众古风秘境,解锁原生态雪山风光!

本地新闻

跟着影视去旅行:西游篇

手机要闻

vivo X300 E 手机现身,参数细节再曝光 明日预售

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版