Token 与上下文窗口

LLM 与 Prompt 基础入门4讲解 2

Token 是模型词表里的最小处理单位,数量是「文本 × 分词器」的函数而不是文本的属性;上下文窗口是一次推理里输入与输出共享的 token 预算。显存、计费、注意力有效性三层成本都叠在这一个维度上,所以它是大模型应用的第一约束。

也叫:Token · 词元 · 分词器 · Tokenizer · 上下文窗口 · context window · 窗口大小

核心概念:先打比方,再给定义出自 T0-1

Token(词元)。比喻:模型既不是逐字读,也不是逐词读,而是照着一本压缩字典的条目在读。unbelievable 可能是三个条目,一个生僻的中文人名可能被拆成两三个。定义:模型词表中的最小处理单位。

Tokenizer(分词器)。把文本切成 token 的那套字典与规则。这里有一个必须先立住的认知:token 数是「文本 × 分词器」的函数,不是文本的属性。同一段话,换个模型就是另一个数字。

Context window(上下文窗口)。一次推理里模型能同时看到的 token 总量上限,输入和输出共享这一个预算。比喻:它不是硬盘,是桌面——桌子大不代表你能同时看清桌上所有纸。

Autoregressive generation(自回归生成)。一次只产出一个 token,把它接到序列末尾,再算下一个,直到遇到停止条件。你看到的「打字机效果」不是前端动画,是生成机制本身。

KV Cache(键值缓存)。把已经算过的中间结果(每层每个位置的 Key 和 Value)存下来,避免每生成一个 token 就把整段前文重算一遍。

同一段话,换个模型就是另一个数字
两个比喻先立住:模型读的是压缩字典的条目,用的是一张桌子而不是一块硬盘

压缩字典 · 照条目读

既不逐字也不逐词,照条目切

unbelievable 可能是三个条目,一个生僻的中文人名可能被拆成两三个

对应
Token · 词元

模型词表中的最小处理单位

token 数是「文本 × 分词器」的函数,不是文本的属性

Tokenizer 分词器换模型即换字典Sonnet 5 约多 30%
桌面 · 不是硬盘

一次摊得开的纸就那么多

桌子大,不代表你能同时看清桌上所有的纸

对应
Context window · 上下文窗口

一次推理能同时看到的上限

输入和输出共享这一个 token 预算

注意力预算输入输出共享context rot
还有两个名词不在这张图里,但一起考:自回归生成是一次只产出一个 token、接到序列末尾再算下一个,你看到的打字机效果不是前端动画;KV Cache 是把算过的 K/V 存起来,免得每吐一个字就把整段前文重算一遍。

以上节选自T0-1 Token、上下文窗口与自回归生成:三个约束的同一个源头,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到3