人民网说,Token 该叫「词元」,Agent 该叫「智能体」,不然科技话语权要旁落。我按这个标准过了一天,发现最先旁落的不是话语权,是我把句子读完的能力。
2026 年 8 月 5 日,人民网观点频道发了一篇人民锐评,标题起得很满:《用“Token”还是“词元”,事关科技话语权》。
文章的意思大概是:Token、Agent、LLM 这些英文字母缩写,没有汉语的形音义,望文不能知义,缺乏文化底蕴,挤占表意空间,抬高门槛,加剧数字鸿沟,还暗藏母语体系被消解的深层危机。国内公共传播、教育教学、政策普及,必须大力推广「词元」「智能体」。
读完我先给自己鼓了鼓掌。原来我这几年写 max_tokens、对账 prompt tokens,不是在干活,是在把汉语体系一点点掏空。格局一下子就打开了。
然后我决定身体力行,用标准中文过完早上这一小时。
一、一份合格的、降低门槛的早晨
我从智能移动电话的就寝免打扰模式里醒来,点亮有机发光二极管显示屏,连接基于 IEEE 802.11 协议族的无线局域网络,解锁了视窗十一操作系统。
桌面上躺着聊天生成式预训练转换器。我想切到第五点四版本,系统提示:词元余额不足。我改用深度求索第四版闪电模型,又把克劳德代码的供应商拨过去。充电找的是通用串行总线丙型接口电源适配器。写这段话之前,我深吸了一口地表自由弥散的氮气氧气混合生命支持气体,点着一支卷状烟草不完全燃烧气溶胶释放装置,最后把它发到了限长社交网络公开文本即时广播单元上。
这叫降低大众理解前沿科技的门槛。
我读自己写的这段话,门槛高到我自己都进不去。
评论区比我写得更早,也更准。有人已经把「请把做饭还给做饭,用做爱」那套句式挪过来了:请把 Token 还给加密,用词元,谢谢大家。阴阳怪气归阴阳怪气,它点中的就是这件事最滑稽的地方——你以为在做翻译,其实在做拆说明书。
二、这把火是怎么烧起来的
先把时间线摆正,免得以后变成「民间一直这么叫」。
2026 年 3 月,全国科学技术名词审定委员会发公告,优先推荐「词元」作为人工智能领域 token 的中文名,面向全社会发布试用。注意动词:推荐,试用。不是刑法修正案。
差不多同时,人民网搞过「给 AI 取个好名字」的征集,智脑、灵机、芯力、慧矩、模元,提交了十来万个。读起来像给网游职业起名。
到了 8 月,锐评把音量拧到「科技话语权」。理由很熟悉:电脑、互联网当年译得好,所以今天也该给 Token 找个响当当的中文名;长期照搬英文符号,定义权和阐释权就在别人手里。
听着很雄壮。落到纸面上,是把一个行业里已经跑了好几年的两音节词,换成另一个两音节词,再宣布话语权开始回家。
我没有意见给科技术语起中文名。我有意见的是:把「起一个更好懂的名字」偷偷换成「不用原文就是爱母语」。这两个命题差了十万八千里。
三、有些词留着原文,就是为了能读完
电脑能活下来,不是因为它通过了形音义三查,是因为它短、准、人愿意说。互联网也是。博客也是。中央处理器也勉强算——试卷上写全称,嘴里还是 CPU。
失败的翻译同样一抓一大把,而且很多都印在课本第一页:
| 原文 | 课堂标准译名 | 人话 |
|---|---|---|
| Wi-Fi | 无线局域网 / 无线保真 | Wi-Fi。没人在路由器前面喊无线保真 |
| USB | 通用串行总线 | USB。你去电脑城说「来一根通用串行总线」,老板会请你走 |
| GPU | 图形处理器 | 显卡 / GPU,看场合 |
| ChatGPT | 聊天生成式预训练转换器 | ChatGPT。全称是一篇说明文 |
| Token | 词元 / 令牌 / 代币 | 看场景。写模型就 Token |
| Agent | 智能体 | 做产品介绍可以说智能体;写代码、看日志,还是 Agent |
| LLM | 大语言模型 | 这个中文其实还行,四个字没把句子勒死 |
| AI | 人工智能 | 两个都在用。谁也没把谁灭了,汉语也没因此消失 |
看见没有?真正能进公共语言的中文译名,都有一个共同点:说出来比原文更省事,或者至少不更费事。
「大语言模型」比 LLM 好懂,面向爸妈讲,我会用前者。「无线保真」比 Wi-Fi 难懂,所以它死了。USB 如果每次都展开成通用串行总线,一句口令会变成一段朗读材料。
Token 已经是两个音节。词元也是两个音节。你并没有把它变短,你只是把它从「全行业正在用的那个符号」换成「审定委员会正在试用的那个符号」。可读性账户上,余额没有增加,沟通成本先扣了一笔。
有人会说:普通人不懂 Token。对。普通人也不懂词元。这两个字并不会在他脑内自动播放「大模型处理信息的最小离散单元,同时也是计费锚点」。他照样要听你解释。解释清楚了,叫 Token 还是叫词元,是第二步。第一步是你别把句子写成说明书。
四、Token 自己就够乱了,再塞一个「词元」更乱
Token 在英文里本来就不是一个纯洁的孩子。它至少同时干三份工:
大模型:文本、图像、音频被切成的小块,计费单位
鉴权:登录之后那张通行证,access token、refresh token
区块链:代币、通证
行业里早就靠上下文活着:写 tokenizer 没人会理解成发币;写 bearer token 没人会理解成你在买 GPT 套餐。这是脏词的日常用法,工程里到处都是。
现在官方说:AI 领域请统一叫词元,结束「代币」「令牌」「标记」混用。
结束混用是好的。可「词元」并不能覆盖鉴权,也不能覆盖链上那堆东西。于是你得到的不是清场,是第四个译名入场:同一串字母,课本上叫词元,安全文档里叫令牌,交易所里叫代币,开源仓库里还是 token。
更别提多模态。一张图、一段音频切出来的块,也叫 token。硬锚在「词」上,图和声音就要在「词」这个字下面挤着住。有人提过「符元」,学理上未必更差,传播上一样进不了嘴巴。这恰恰说明:问题不是缺一个中文名,是这个概念本身就不是「一个汉字能望文知义」的那种东西。
望文知义是汉语的优点,不是所有技术对象都欠你这个优点。CPU 三个字母,没有文化底蕴,中国照样把芯片造了出来。没有人靠把 Central Processing Unit 念成中央处理器,就把话语权从 Intel 手里抢回来。
五、话语权不是改名改回来的
锐评里最重的那句,是定义权、阐释权若始终在别人手里,中国特色科技话语体系便无从建立。
这句话如果成立,我们现在应该去查另一件事:别人有没有在用你的东西。
别人抄你的 tokenizer,你的中文在词表里占的席位比英文还密,这叫话语权。别人接你的 API,按你的计费,跑你的模型,这叫话语权。别人论文里出现你提出的方法名,哪怕那个方法名是拼音、是英文、是四个汉字,这也叫话语权。
把 Token 改成词元,对上面这几条的效应量,我保守估计接近零。知乎上已经有人把这个账算过了,算得很干:改名这个变量几乎不解释任何结果。
一个不太礼貌的对照。公告发布试用四个月后,不少国产模型的定价页,写的还是百万 tokens。不是他们不爱国,是账单、日志、SDK、开源协议、Grafana 面板,全部按这个字段转。你在社论里改了,usage.prompt_tokens 不会跟着改。字段不改,工程师嘴里的词就不会改。嘴里的词不改,公共传播再怎么「必须大力推广」,最后就是新闻里一套、终端里一套、教室里再发明第三套。
三套并存,才是真的抬高门槛。
真正让中文在 AI 里变贵的,也不是有人说了 Token 这两个音节。是分词器把中文切得更碎,同样一句话要比英文多花词元——哦不,tokens。你要是真关心汉语的科技处境,去卷词表、卷数据、卷模型,比卷名词审定委员会有用得多。词元税这个梗难听,但它至少还在讨论一件能改变成本的事。
六、我的使用说明书就三句
面向爸妈、面向通稿、面向不想读英文的读者:能用大白话就用大白话。大语言模型、智能助手、上下文长度,这些中文我双手赞成。它们读得过去。
面向代码、日志、论文、SDK、账单:请把 Token 还给 Token,把 Agent 还给 Agent,把 API 还给 API。不是崇洋,是这些符号已经是接口的一部分。接口不是用来抒情的。
拿不准的时候,做一次朗读测试。如果一句话展开成中文全称之后,你自己都要换气,它就不是在降低门槛,是在生产新的不可读。
电脑成功了,无线保真失败了,博客活下来了,通用串行总线只活在教科书里。考试标准从来不是「有没有中文名」,是「人肯不肯用」。
AI 两个字母和人工智能四个字已经和平共处很多年。汉语没被消解,教材也没因此亡国。Token 这两个音节再多活几年,母语体系应当还撑得住。
所以我还是那句不好听的话:有些东西保留原本的写法,可读性更好。强行中文化,常常不是在翻译,是在给句子上刑。
写到这里,词元余额大概又少了一截。我就不深吸氮气氧气混合生命支持气体了。这篇东西,用词元时代的标准中文来收:我把它发到了博客上。
Token 还是 Token。