当你问 AI「今天天气怎么样」,它秒回一段话。你感觉像跟朋友聊天一样自然。但你看不到的背后,AI 先把你这句话拆成了一个个它能「嚼得动」的小碎片——这些小碎片就是 Token,中文名叫词元。
2026 年 3 月,全国科学技术名词审定委员会正式发布公告,将 AI 领域的 Token 统一命名为「词元」,定义是:人工智能领域智能设备中信息存储、处理和交换的具有一定语义的基本符号表达[1]。国家数据局局长刘烈宏进一步将它定位为**「智能时代的结算单位」**[2]。
这篇文章帮你彻底搞懂三件事:Token 到底是什么、现在用它干什么、未来会怎么用。
一、Token 到底是什么?
1.1 一个直观比喻
奇安信安全专家张勇用吃饭来比喻:「就像人吃饺子,不会一口吞下一整盘,而是一个一个吃。AI 处理文字时,也先把句子切成一个个它能处理的小块,这些小方块就叫 Token。」[^3]
更多例子:
- 「苹果」→ 1 个 Token
- 「Hello」→ 1 个 Token
- 「unbelievable」→ 可能被拆成 3 个 Token
- 「你好,世界」→ 大约 3-5 个 Token(因模型而异)
- 标点符号、空格 → 各自都算 Token
关键认知:Token ≠ 字,Token ≠ 词。 它是介于字符和单词之间的「子词」粒度——高频词完整保留,低频词拆成有意义的小片段。1 个 Token 约等于 0.75 个汉字,或 4 个英文字符[^4]。
1.2 计算机只认数字,Token 是翻译官
大模型不能直接吃人类语言。它需要一个「分词器」(Tokenizer)把文字翻译成数字。整个流程是:
输入文本 → Tokenizer 拆成 Token → 每个 Token 映射为 Token ID(数字编号)→ 模型内部计算 → 生成新的 Token ID → Tokenizer 还原为人类语言
这个过程遵循的核心算法叫 BPE(Byte Pair Encoding,字节对编码),最早由 Philip Gage 于 1994 年提出用于数据压缩,2016 年被 Sennrich 等人引入自然语言处理[^5]。
1.3 BPE 算法怎么工作?(用人类直觉理解)
BPE 的核心思想极其朴素:反复找到语料中出现频率最高的相邻符号对,把它们合并成一个新符号,直到词表达到预设大小。
举例说明。假设训练语料里有这些词:
low(5 次)、lower(2 次)、newer(6 次)、wider(3 次)
初始化:每个词拆成字符序列,加上词尾符号 </w>:
l o w </w> (5次)
l o w e r </w> (2次)
n e w e r </w> (6次)
w i d e r </w> (3次)
第 1 轮: 统计相邻符号对频率。(e, r) 出现 9 次,最高。合并为 er。语料变成:
l o w </w> (5)
l o w er </w> (2)
n e w er </w> (6)
w i d er </w> (3)
第 2 轮: (er, </w>) 出现 8 次,最高。合并为 er</w>。
第 3 轮: (l, o) 出现 7 次,合并为 lo。
第 4 轮: (lo, w) 合并为 low。
如此循环,直到词表达到目标大小(比如 GPT-2 的 50,257 个)[^5]。
最终得到的高频词会被保留为完整 Token(如 low、er),低频词和生僻字会被拆成更小的子词。 这就是 BPE 解决「未登录词」(OOV)问题的核心机制——最坏情况退化为字符级,保证任何输入都能被编码。
1.4 中文消耗的 Token 为什么通常比英文多?
中文没有空格,分词器需要更多「碎片」。而且英文中许多常见单词(如 the、is、ing)会被压缩成 1 个 Token,而中文的每个字通常独立占 Token。根据 OpenAI 官方数据,非英文文本通常比英文多消耗 20-50% 的 Token[^4]。
正因如此,用英文提问通常比中文更省 Token,但这不是一个固定比例——不同分词器的「拆法」完全不同,没有一个通用的 Token→字数换算公式,真要用的时候得拿目标模型的 Tokenizer 实际跑一遍。
1.5 不同模型,不同分词器,Token 不互通
每家模型都有自己从头训练的 Tokenizer,拆法规则完全不同。你在 A 模型里用的 Token,不能直接拿给 B 模型用——像各家的方言,互相不通[^6]。GPT 系列用的是 Byte-Level BPE(从 UTF-8 字节开始合并)[^5],BERT 用的是 WordPiece,T5 用的是 SentencePiece 的 Unigram 算法,原理各自不同。
二、Token 的具体应用场景
2.1 场景一:AI 服务的「计价器」
这是 Token 最直接的应用。几乎所有大模型 API 都按 Token 量收费:
费用 =(输入 Token 数 × 输入单价 + 输出 Token 数 × 输出单价)/ 1,000,000
比如你问 AI 一个问题(输入 200 Token),它回了一段话(输出 800 Token),假设模型定价是输入 ¥2/百万 Token、输出 ¥12/百万 Token,那这次对话的费用是:
(200 × 2 + 800 × 12) / 1,000,000 = ¥0.01
关键细节:输出通常比输入贵 2-4 倍,因为模型生成新 Token 时的计算量远大于理解输入时的计算量[^4]。
对于普通用户来说,花 1 元人民币,大概能买 8 万到 45 万个 Token,折合约 6 万到 34 万汉字——日常使用基本可以忽略不计。真正花大钱的,是每天处理几百万次客户对话的企业级调用[^2]。
DeepSeek 曾经便宜到离谱: V4-Flash 的缓存命中输入 Token,一百万只收两分钱——一杯奶茶钱够让 AI 写一百万字[^7]。OpenAI 的 GPT-5.4 输出价是 $15/百万 Token,Claude Opus 4.7 是 $25/百万 Token,而中国模型普遍在 ¥0.42-3.6/百万 Token,性价比极高[^4]。
2.2 场景二:上下文窗口——AI 的「记忆容量」
AI 一次能处理的内容上限叫「上下文窗口」(Context Window)。你问的问题 + AI 的回答,总共不能超过这个上限。
2026 年的格局[^8]:
| Token 量级 | 等价内容 | 典型场景 |
|---|---|---|
| 8K | 一篇 5000 字公众号文章 | 短文摘要、代码片段解释 |
| 32K | 20 页 PRD 文档 | 需求分析、会议纪要总结 |
| 128K | 一本《老人与海》(~10 万字) | 单本书问答、合同审阅 |
| 200K | 《哈利波特与魔法石》英文全本 | 长文分析、多轮对话 |
| 1M | 《三体》三部曲 | 整仓代码分析、企业尽调 |
| 2M | 整套年度财报 + 三年季报 | Kimi K2.6 支持 |
主流模型的上下文窗口:Gemini 2.5 Pro/Flash 1M、GPT-5.5 1M、Claude Opus 4.7 1M、DeepSeek V4 1M、Kimi K2.6 256K(还有部分国产达到 2M)[^8]。
一个重要陷阱:「中间遗忘」效应。 2023 年斯坦福大学研究发现,LLM 对上下文各部分的关注度不均匀——开头和结尾记得最牢,埋在中间的信息容易被忽略,准确率可能从 90%+ 骤降到 50-70%[^9]。即使模型支持 100 万 Token,也不意味着你应该全部填满。
2.3 场景三:衡量 AI 活跃度的「体温计」
Token 调用量已经成为衡量 AI 产业活跃度的核心指标。类比互联网时代的「流量」之于网站、电力时代的「千瓦时」之于经济,Token 调用量越庞大,说明 AI 应用渗透越深。
中国数据:日均 Token 调用量从 2024 年初的约 1000 亿,飙升至 2026 年 3 月的超过 140 万亿,两年暴涨超 1000 倍[^2]。
OpenRouter 数据显示,中国 AI 模型周调用量在 2026 年 3 月达到 4.69 万亿 Token,连续第二周超越美国,全球前三被中国模型包揽[^3]。
2.4 场景四:Agent 时代的「消耗黑洞」
这是 2025 年底以来最剧烈的变化。智能体(Agent)不是聊天机器人,而是能自主规划、多步推理、长时间执行任务的 AI 程序。
给 Agent 一个目标——比如「帮我调查这三家供应商并推荐最优方案」——它会自己搜索、比较、调用工具,持续消耗 Token,完全不需要人类参与。
行业测算:Agent 在完成同一业务目标时消耗的 Token 量,是传统 Bot 模式的 50 到 200 倍。一次看似简单的任务,背后可能是数十次甚至上百次内部推理循环[^10]。
以爆火的 OpenClaw(「养龙虾」)为例,黄仁勋在 GTC 2026 上将其形容为「人类历史上最受欢迎的开源项目」,本质上就是一个 Agent 操作系统的雏形[^11]。这类 Agent 的出现,直接把 Token 消耗模式从「人问一句 AI 答一句」变成了「机器自己开始大规模消费 Token」。
2.5 场景五:串联数据、算法、算力的「枢纽」
Token 不会凭空产生。它是由高性能 GPU 在消耗大量电能、完成数千亿次推理运算后产生的数字资产。每一个 Token 的生成,都对应着算力运转和电力消耗[^2]。
黄仁勋在 GTC 2026 上提出了一个关键概念:未来的数据中心不是存储文件的仓库,而是「生产 Token 的工厂」[^11]。在固定功率下,每瓦电的 Token 吞吐量直接决定了竞争力和收入。他预测到 2027 年,全球 AI 基础设施需求将达到 1 万亿美元。
行业测算:生成 100 万个 Token 大约需要消耗 15-20 度电[^12]。在这个尺度上,Token 串联起了数据、算法、算力、电力四要素,成为 AI 产业链的「价值中枢」。
三、未来 Token 应用的预想
3.1 Token 套餐与 Token 超市——从技术指标到消费品
2026 年,中国移动在云大会上发布了 Token 运营生态体系,计划推动 Token 像水电一样融入千行百业。运营商推出 Token 套餐,城市级 Token 超市上线,算力从重资产建设转向「按量付费」[^13]。
可以看到的趋势是:Token 正在从开发者文档中的技术参数,变成可以像话费、流量一样被大众购买和消费的商品。未来你打开 App Store,下载的可能不只是 App,而是接入某个 AI 服务的 Token 额度。
3.2 Token 纳入薪酬——硅谷的新招聘筹码
「你的 offer 里带多少 Token?」
黄仁勋在 GTC 2026 上提出,Token 可以直接提升工程师的生产效率,甚至可以成为薪酬的一部分。他举例说,一位工程师的基础年薪可能是几十万美元,公司再拿出大约一半的金额作为 Token 预算,让他们实现 10 倍效率提升[^11]。
在硅谷,这已经不只是一个概念——已经有公司在实践中探索:工程师拥有个人 Token 额度,可以自由用于辅助编程、运行测试、自动化重复任务。
3.3 Token 分层定价——从「卖模型」到「卖任务价值」
黄仁勋将 Token 商业化为五个层级:免费层(高吞吐)、中级层(约 $3/百万)、高级层(约 $6/百万)、高速层(约 $45/百万)、超高速层(约 $150/百万)[^14]。
这意味着未来的定价锚点会从「每百万 Token 多少钱」逐渐转向「完成一项任务需要多少总成本、能够创造多少实际价值」。长江证券指出,大模型市场已经从统一市场演化为分层市场——基础能力快速商品化,前沿推理能力保持显著溢价[^15]。
3.4 全民基础算力——Token 可能替代全民基本收入?
OpenAI CEO 山姆·奥特曼提出了一个极为宏大的构想:全民基础算力(Universal Basic Compute),取代传统意义上的全民基本收入(Universal Basic Income)[^16]。
他的设想是:未来每个人都能分配到一个先进 AI 模型的一部分算力份额(以 Token 等形式体现)。这些算力属于个人——可以用来提升自己的生产力,可以在市场上转售,也可以捐给癌症研究等公益项目。不是领钱,而是领「生产力本身」。
虽然这个愿景在近期看起来遥远,但它揭示了一个根本趋势:当 AI 成为核心生产力,Token(代表智能的「原子量」)就会变成新时代的价值载体。
3.5 计费模式演进——从按 Token 计费到按请求计费
一个正在发生的创新是 Oxlo.ai 的「按请求计费」模式:无论你发送 500 个 Token 还是 100,000 个 Token,一次 API 调用的价格完全相同。这消除了对长上下文的「征税」,让更复杂的 Agent 工作流在经济上变得可行[^17]。
这代表着一个趋势:计费单位正在从「单 Token」向更大的封装单元迁移——未来可能以「任务」「成果」「请求」为粒度定价,而不只是一个个最小的信息碎片。
3.6 Token 成为连接物理世界和数字世界的桥梁
Token 正在从纯技术概念演变为连接能源、算力、智能和现实生产力的通用度量单位。摩根大通预测,中国 AI 推理 Token 消耗量将从 2025 年的约 10 千万亿增长至 2030 年的约 3900 千万亿,五年增长约 370 倍[^10]。
当 Token 的物理成本(电力+芯片折旧+冷却)不断下降,而其承载的「智能价值」不断上升时——Token 可能成为数字时代最重要的「基础原材料」之一。
写在最后
总结一下,Token 的三个层次:
- 技术层:它是大模型理解和生成信息的最小单位,由 BPE 等算法在训练过程中自动学习出来的
- 商业层:它是 AI 服务的计价单位,连接技术供给和商业需求,1 元钱能买几十万个,「量越大越需要精打细算」
- 未来层:它正在成为一种新的价值载体——从薪酬福利到全民算力,从 Token 套餐到 Token 工厂,它串联起了能源、算力、智能和生产力
几年前我们还在问「AI 能干什么」,现在的问题是「每花 1 块钱,能买到多少高质量的智能」。在这个意义上,Token 就是智能的「千克」——你以为你在跟 AI 聊天,其实你是在超市里按斤买智能。

5313

被折叠的 条评论
为什么被折叠?



