Token是什么?大模型为什么按Token计算费用
时间:2026-07-14 来源:华清远见
一、Token到底是什么
Token在大模型语境下翻译成中文常叫做令牌或者词元,它是大模型处理文本时的基本单位,可以理解为大模型“阅读”和“生成”文字时拆分出来的最小语义片段。
很多人会误以为Token就是单词或者汉字,其实两者并不完全对等,不同语言的拆分规则也有区别:
1.英文场景下的Token拆分:一个完整的英文单词不一定只对应一个Token,如果是比较短的常用词,比如cat、go、the会被拆成1个Token;如果是较长的专业词汇或者生僻词,会被拆成多个Token,比如unhappiness会被拆成un、happiness两个Token,更长的专业术语甚至可能被拆成三到四个Token。
2.中文场景下的Token拆分:由于中文没有天然的空格分隔,Token拆分逻辑和英文不同,一般来说,1个汉字通常对应约0.7~1个Token,常用单字会被识别为1个Token,生僻字或者多字词组可能会拆分出多个Token;整体估算下来,中文环境中大概1000个汉字对应大约1300~1500个Token。
举个更直观的例子,OpenAI给出的官方参考就是:1Token大约对应0.75个英文单词,或者1.3~1.5个中文汉字,也就是说,一段1000个汉字的中文文本,大概会被计算为1300~1500个Token,而同样字数的英文文本,Token数会比中文少一些。
除了普通的文本,标点符号、空格、换行符这些格式符号,也都会被算作独立的Token,因此排版和格式也会影响最终的Token数量。
二、大模型为什么要把文本拆成Token来处理
大模型本质是基于神经网络的概率模型,它不能直接理解自然语言的字符或者词语,必须先把人类的自然语言转换成模型能识别的数字向量,Token就是这个转换过程的中间载体。
为什么不能直接按单个字符或者完整单词来处理呢?主要原因有两个:
1.平衡模型容量和计算效率:如果按单个字符拆分,每个字符的语义信息太少,模型需要处理更长的序列才能理解完整语义,会大幅增加计算量,模型理解语义的准确性也会下降;如果按完整单词拆分,英文有数十万不同的单词,中文词汇量更是超过百万,模型的输入输出层需要对应百万级别的维度,会让模型体积暴涨,推理速度变得极慢,普通硬件根本跑不起来。而Token化拆分通过将常用词合并、生僻词拆分的方式,把整体词汇量控制在几万到十几万这个合理区间,既保证了每个Token带有足够的语义信息,又不会让模型体积过度膨胀,完美平衡了性能和效率。
2.适配不同语言的处理需求:不管是拼音文字还是象形文字,都可以通过字节对编码(BPE,当前大模型主流的Token拆分算法)统一拆成Token,不管用户输入什么语言,模型都可以用统一的方式处理,不需要针对不同语言单独修改结构,降低了多语言模型的开发难度。
三、大模型为什么按Token计算费用
目前几乎所有商用大模型API,包括OpenAI GPT系列、文心一言、通义千问、Claude等,都是按照输入Token数+输出Token数来计费,为什么不按请求次数、字符数或者完整字数计费?核心原因来自于大模型的运行机制和成本结构,主要有四点:
1. Token数量直接对应大模型的计算成本
大模型的推理成本和处理的Token数量是正相关的:每处理一个Token,大模型的每一层神经网络都需要做一次矩阵运算,Token数量越多,需要的浮点运算次数就越多,占用的GPU显存、计算时间也就越多。
举个例子,同样一次请求,用户输入100Token生成100Token,和用户输入1000Token生成1000Token,后者的计算量是前者的十几倍甚至几十倍,消耗的硬件成本差距非常大,如果统一按次收费,提供商肯定会亏损。而Token数量直接反映了计算资源的消耗,按Token计费可以准确对应成本,符合“多用量多花钱,少用量少花钱”的公平原则。
2. Token计费比按字数计费更准确公平
我们刚才说过,Token和字数不是一一对应的,生僻词、长词会拆分出更多Token,同样字数的不同文本,实际计算量并不一样:
比如一段全是生僻专业术语的学术文本,同样100个汉字,拆分出来的Token数量会比全是常用词的大白话多20%~30%,对应的计算量也更高。如果统一按汉字个数收费,对提供商不公平;如果完全按字符个数收费,英文一个单词五六个字符,中文一个汉字只算一个字符,同样字数下英文的计算量远高于中文,也会导致收费不公平。而Token拆分本身就已经根据语义和计算量做好了拆分,Token数直接对应实际计算量,不管什么语种、什么类型的文本,收费都能和成本匹配,更准确也更公平。
3. 和大模型的上下文窗口机制匹配
大模型的上下文窗口(也就是一次能处理的最大文本长度)本身就是用Token数量来定义的,比如GPT-3.5的默认上下文窗口是4k Token,GPT-4的上下文窗口是8k/32k/128k Token,Claude 3的上下文窗口达到了200k Token。计费单位和上下文窗口的单位保持一致,用户可以很清楚的知道自己的输入会不会超过窗口限制,也能直观估算自己的使用成本,不需要做额外的单位转换,降低了用户的理解成本。
4. 符合行业惯例,方便计量和统计
从大模型商业化开始,Token就是行业通用的计量标准,所有服务商、开发者都已经形成了统一认知,按Token计费不需要重新建立计量体系,用户也可以很方便的对比不同服务商的价格,不管是服务商的后台统计还是用户的成本核算,都非常清晰透明,不容易产生计量纠纷。

