Token 与上下文窗口
Token 是模型词表里的最小处理单位,数量是「文本 × 分词器」的函数而不是文本的属性;上下文窗口是一次推理里输入与输出共享的 token 预算。显存、计费、注意力有效性三层成本都叠在这一个维度上,所以它是大模型应用的第一约束。
也叫:Token · 词元 · 分词器 · Tokenizer · 上下文窗口 · context window · 窗口大小
核心概念:先打比方,再给定义出自 T0-1
Token(词元)。比喻:模型既不是逐字读,也不是逐词读,而是照着一本压缩字典的条目在读。unbelievable 可能是三个条目,一个生僻的中文人名可能被拆成两三个。定义:模型词表中的最小处理单位。
Tokenizer(分词器)。把文本切成 token 的那套字典与规则。这里有一个必须先立住的认知:token 数是「文本 × 分词器」的函数,不是文本的属性。同一段话,换个模型就是另一个数字。
Context window(上下文窗口)。一次推理里模型能同时看到的 token 总量上限,输入和输出共享这一个预算。比喻:它不是硬盘,是桌面——桌子大不代表你能同时看清桌上所有纸。
Autoregressive generation(自回归生成)。一次只产出一个 token,把它接到序列末尾,再算下一个,直到遇到停止条件。你看到的「打字机效果」不是前端动画,是生成机制本身。
KV Cache(键值缓存)。把已经算过的中间结果(每层每个位置的 Key 和 Value)存下来,避免每生成一个 token 就把整段前文重算一遍。
既不逐字也不逐词,照条目切
unbelievable 可能是三个条目,一个生僻的中文人名可能被拆成两三个
模型词表中的最小处理单位
token 数是「文本 × 分词器」的函数,不是文本的属性
一次摊得开的纸就那么多
桌子大,不代表你能同时看清桌上所有的纸
一次推理能同时看到的上限
输入和输出共享这一个 token 预算
以上节选自T0-1 Token、上下文窗口与自回归生成:三个约束的同一个源头,读全文能看到前后语境。