首页
看点啥
插画图片
首页 看点啥 token是什么?为什么大模型会有上下文长度限制

token是什么?为什么大模型会有上下文长度限制

2026-07-28 0

一、Token的定义

Token 是大语言模型(LLM)处理文本时的最小单位。

模型不会直接识别汉字、英文字母,它处理文本有自己的最小颗粒度,这个颗粒就叫 Token。所有的语义理解、内容生成都建立在 Token 的基础上,不会拆得比 Token 更小。

你可以把它理解为模型 "阅读" 文本时的 "碎片"—— 但这些碎片不一定对应我们日常理解的字或词。

二、Token 核心三点

2.1 分词过程

当你输入一句话时,模型会通过一个叫做 Tokenizer(分词器) 的组件,将文本切分成一个个 token。

比如「我喜欢猫」可能被切成 ["我", "喜欢", "猫"] 三个 token;而英文单词如 "unbelievable" 可能被拆成 ["un", "believ", "able"] 三个 token。

这是中英文分词的典型例子,背后是行业通用的 “子词分词” 思路:

2.2 向量化

模型会将每个 token 转换成一个高维向量(embedding),所有的计算(注意力机制、前馈网络等)都是在这些向量上进行的。

这句话讲的是 Token 的 “数字化” 过程:

2.3 计费单位

这也是大模型 API 按 token 数量收费的原因——输入和输出的 token 总数直接决定了计算量。

解释了大模型按 Token 计费的底层逻辑:

三、上下文长度限制

上下文长度限制即模型一次能处理的 token 数量上限,如 4K、128K、200K,存在的原因主要有以下几点:

先解释基础概念:

3.1 注意力机制的 "平方灾难"

Transformer 的核心是自注意力(Self-Attention),其计算复杂度与序列长度呈二次方关系(O(n²))。如果上下文从 4K 扩展到 128K,计算量不是增加 32 倍,而是增加约 1000 倍。这直接导致推理速度急剧下降、显存爆炸。

这里先补充两个核心术语:

  1. Transformer:2017 年谷歌团队提出的深度学习架构,是当前几乎所有主流大语言模型的底层基础。它最大的创新就是自注意力机制,让模型能同时捕捉文本里任意两个词的关联,并行计算效率远高于之前的模型。
  2. 自注意力(Self-Attention) :模型理解语义的核心能力 —— 处理每个 Token 时,都会去计算它和序列里所有其他 Token的关联程度(比如代词指代哪个名词、因果关系对应哪个内容),从而理解整句话的逻辑。

如果上下文从 4K 扩展到 128K,计算量不是增加 32 倍,而是增加约 1000 倍,这直接导致推理速度急剧下降、显存爆炸。

3.2 显存(GPU Memory)的物理限制

注意力机制需要存储一个 "注意力矩阵"(Attention Matrix),记录序列中每个 token 与其他所有 token 的关系。序列越长,这个矩阵占用的显存越大。

128K 长度的注意力矩阵需要占用数十 GB 的显存,这对硬件是巨大挑战。

可以做个简单估算:

3.3 长距离依赖的衰减

即使技术上能处理长文本,模型在长序列中的注意力分数会变得非常稀疏和稀释,导致模型 "看不清楚" 远距离的信息关联。

3.4 训练难度与成本

训练超长上下文模型需要更长的训练时间、更大的显存,且长序列的梯度传播更不稳定。

目前业界主要通过位置编码优化(如 RoPE、ALiBi)和稀疏注意力(如 Sliding Window Attention)等技术来缓解这些限制。

这句话讲了两类主流的长文本优化方案:

  1. 位置编码优化

    • 自注意力本身不识别顺序(“我打他” 和 “他打我” Token 完全一样),所以需要给每个 Token 加上位置信息,这就是位置编码。
    • RoPE(旋转位置编码)、ALiBi 是目前主流的两种方案,相比老式位置编码,它们能更好地支持超长上下文,泛化性更强。
  2. 稀疏注意力

    • 放弃 “每个 Token 和所有 Token 算注意力” 的全量模式,改成只和部分 Token 计算,把复杂度从 O (n²) 降到 O (n)。
    • 比如滑动窗口注意力(Sliding Window Attention) :每个 Token 只和它前后固定窗口内的 Token 算关联,不用管整个序列,大幅节省计算和显存。

无限进步,共勉~

喜欢(0)

上一篇

泳池赛事裁判及运动员目标检测数据集:3000张YOLO游泳赛事监测数据集 适用于智慧体育、AI辅助判罚与目标检测研究

泳池赛事裁判及运动员目标检测数据集:3000张YOLO游泳赛事监测数据集 适用于智慧体育、AI辅助判罚与目标检测研究

下一篇

DeepSeek 杀入多模态 识图功能正式上线!

DeepSeek 杀入多模态 识图功能正式上线!
猜你喜欢