大语言模型火了之后,token 这个词无处不在,但它的中文译名一直没定下来。目前最流行的是「词元」。我不同意——它译错了方向。更准确的译法应该是「模型字」,简称「字」。
为什么「词元」别扭、「模元」差在哪、为什么「模型字」更顺,下面分头说。
一、「词元」为什么别扭
1. 「词」先把你带偏
token 不一定是词。它可能是半个词、多个词、一个空格、一个标点、一个 emoji、半个汉字。叫「词元」,外行第一反应是「词的单位」,但 token 根本不是按词切的。名字里带「词」,等于在术语层面就预设了它是词——那些最常被分词器切碎的 subword、标点、空格,全都被这个译名屏蔽掉了。
2. 「元」太抽象、太漂浮
「元」在中文术语里经常表示「基本、最小、meta」:元素、单元、元数据、元语言、元宇宙。它没有具体形象。结果「词元」听起来像「词的某种抽象元素」,不直观。一个译名里最该具体的那部分(它到底是什么单位),恰恰是最含糊的。
3. 读音语感平
「词元」读 cí yuán,两个阳平,读起来平直,缺少重音收束。它也不像「字」那样能单用。你能说「这个词元」「那个词元」,但日常语感远不如「这个字」「那个字」。
4. 不能简称,搭配也弱
「词元」既不能简称成「词」(「词」已经指 word),也不能简称成「元」(「元」太泛)。搭配起来也怪:词元窗口、词元嵌入、词元化、按词元计费……都有一股论文腔,不顺。
5. 和已有词法术语纠缠
词、词素、语素、词根、词缀、词位、分词、词向量——「词元」挤进这一堆里,容易混。token 本来就不是词法单位,却被塞进「词」字辈,生态位不对。
二、「模元」对了第一步,卡在第二步
最近又冒出另一个译名:「模元」。它的提出者同样反对「词元」,这一脚踩得对——它把最误导人的「词」换成了「模」,切断了「token 是一个词」这个错误预设。这一步走对了。
但它的思路还停在「元」上。把「词」换成「模」,只是修好了错的那半截,虚的那半截原样留着:「元」还是那个漂浮、没有具体形象、不指向任何东西的尾巴。
更要命的是,「模元」没法简称,而没法简称就没法构词。「模型字」能简称成「字」,一整个术语族就顺理成章地铺开了:
简称“模”:会和模型、模态、模块、模板全撞;
简称“元”:元数据、元学习、单元、元素,太泛;
不简称:模元窗口、模元嵌入、模元化、多模元预测,能用,但长且生硬;“多模元”还很容易被读成“多模态”相关。
相比之下,“模型字”可以落到“字”,于是有字窗口、字嵌入、字化、字级、下一字预测、多字预测。这种构词能力在技术传播里是实打实的优势,不是修辞上的顺口而已。术语的能产性——能不能拆出一个短词根去生成新词——往往比术语本身的长度更重要。“模元”是一个封闭的双字整体,拆不开;而“模型字”的“字”可以反复复用。
这两个是 LLM 里最核心的技术术语。「下一字预测」顺口且准确——模型本来就是在预测下一个「字」;「多字预测」同理。换到「模元」上,你只能憋出「下一模元」「多模元」,又长又拗口;想简称成「元」,就成了「下一元预测」,丢了「模」,而且「多元预测」还会和统计里的「多元(multivariate)」撞车。换到「词元」更惨,「下一词」直接把人引回「词」的层面。
所以「模元」比「词元」好一点,但它卡在同一个地方:把一个没法简称、没法构词的字,放在了一个最需要构词的位置上。
三、「模型字」为什么更顺
1. 结构自然
「模型」限定,「字」作中心语:模型字 = 模型自己的字。这是汉语最熟悉的名词构造。
2. 「字」本来就不是汉字的专利
这是整件事的关键。谁说「字」就一定得是汉字?
计算机里早有现成的反例。CPU 的「字长」(word length)是它一次处理的数据宽度,「机器字」(machine word)是它眼里的基本单位——这些「字」和汉字八竿子打不着;「字节」(byte)也一样,带个「字」,却指 8 位数据单元。也就是说,中文「字」早就在计算机术语里占了坑,它的内核从来不是「书写字符」,而是「一个被识别、被计数、被处理的最小单位」。
把这个内核套到大模型上,严丝合缝:
- CPU 一次处理一个字长;
- LLM 一次生成一个 token。
两者在「按最小单位逐个处理」这件事上是同构的。区别只是:CPU 的字是硬件/指令集定义的固定位宽,模型的字是分词器/词表定义的离散符号——总而言之,都是「机器的字」,跟人类的「字 / 汉字」无关。
大模型确实就是「一个字一个字」地往下写:每个 token 对应词表里的一个 ID,模型预测下一个 ID。至于它的一个字对应几个「人类的字」,那是另一个问题——就像 CPU 的字长是 32 位还是 64 位,跟汉字也没关系。所以模型字不是汉字,逻辑上完全接得上。
3. 可简称、能产性强
无歧义时可以简称「字」:字窗口、字嵌入、字化、字表、按字计费,都比「词元窗口」「词元化」顺。一个「字」字辈可以自然扩展出一整个术语族,而「词元」族很难扩展。
4. 有歧义时能收束
正式场合说「模型字」,第一次定义清楚,后面简称「字」。这一点恰恰是「词元」做不到的——它想收束都找不到方向。
这里展开说:最常见的反驳是「字」有歧义、会被理解成汉字。但英文 token 自己就是个歧义巨大的词——编译器里是「词法记号」,安全领域是「访问令牌」,区块链里是「代币」,语言学里是「实例」(type/token 之分)。洋人靠限定词消歧:lexical token、access token、LLM token。中文加一个「模型」就能做到同样的事。「模型字」三个字,把歧义收得干干净净。
5. 语感更像母语
「模型字」三音节,虽然比「词元」长,但汉语本来就接受「机器人、区块链、数据库」这类三音节术语,而且末尾「字」是去声,收得住。「词元」两个阳平一路平下去,收不住。
结论
token 的最佳中文翻译,是「模型字」,简称「字」。
定义:模型字是模型词表里的一个离散符号 ID,是模型读写文本的最小单位。
- 「词元」错在:「词」字带偏、「元」字漂浮、读音平、不能简称,还把 token 硬塞进「词」字辈;
- 「模元」进了一步——丢掉「词」,却仍卡在「元」上,且没法简称、没法构词;
- 「模型字」好在:结构自然、有「机器字 / 字长」先例、可简称、能收束歧义、能产性强、语感像母语。
用法也很简单:首次出现写「模型字」,之后简称「字」——就像 CPU 语境里说「字长」,没人会以为是汉字。
Comments