Table of contents
Open Table of contents
一、什么是 Token Space?
定义
Token Space 指的是:
LLM 输入和输出的符号空间(Symbol Space)
模型看到的并不是:
苹果
ChatGPT
投资
而是:
12873
8921
6611
也就是:
Token ID
例子
假设输入:
苹果公司市值
经过 Tokenization(分词):
苹果 → token #12873
公司 → token #6611
市值 → token #3912
或者:
[12873, 6611, 3912]
这就是:
Token Space
特征
Token Space 的特点:
1. 离散(Discrete)
例如:
苹果 ≠ 香蕉
12873 ≠ 5621
没有“中间状态”。
2. 可读
人类可以直接理解:
苹果
香蕉
英伟达
3. 是输入/输出接口
LLM 最终:
输入:
文字 → Token
输出:
Token → 文字
类比
Token Space 像:
字典
例如:
#12873 = 苹果
#5621 = 香蕉
#8811 = 英伟达
二、什么是 Latent Space?
定义
Latent Space 指的是:
模型内部的隐藏语义空间(Hidden Semantic Space)
Token 会被转换成:
高维向量(Embedding)
例如:
苹果 → [0.23, -0.91, 0.44, ...]
这个向量所在的空间:
就是 Latent Space
为什么叫 Latent?
Latent = Hidden = 隐藏的
因为:
你看不到:
苹果
香蕉
而是:
[0.23, -0.91, 0.44, ...]
特征
Latent Space 的特点:
1. 连续(Continuous)
例如:
苹果 ←→ 香蕉 ←→ 水果
彼此距离可以计算。
2. 表示“意义”
例如:
“苹果”可能靠近:
水果
香蕉
iPhone
乔布斯
科技
离:
火车
水泥
恐龙
较远。
3. 推理发生在这里
LLM 真正的“思考”不是在 token 上。
而是在:
Latent Space
类比
Latent Space 像:
真实地图
例如:
东京
上海
北京 深圳
距离代表:
语义相似度
三、Token Space 与 Latent Space 的关系
完整流程:
用户输入文字
↓
Tokenization
↓
Token Space
↓
Embedding
↓
Latent Space
↓
Transformer 推理
↓
Latent Space
↓
Decoder
↓
Token Space
↓
输出文字
四、用“苹果”理解
输入:
苹果
在 Token Space
可能是:
12873
只是:
一个编号
模型还“不理解”。
在 Latent Space
可能是:
[0.23, -0.91, 0.44, ...]
并且靠近:
香蕉
水果
iPhone
乔布斯
模型开始:
理解“苹果”的语义。
五、上下文是如何改变 Latent 表示的?
输入:
苹果很好吃
模型倾向理解:
水果
输入:
苹果公司市值
模型倾向理解:
Apple Inc.
原因:
Transformer 会根据上下文,动态调整 token 在 Latent Space 中的位置。
所以:
同一个 Token,不同上下文,可以有不同 Latent 表示。
六、为什么 Latent Space 比 Token Space 更重要?
因为:
真正的推理,不在 Token 上发生。
而在:
Latent Space
Token 更像:
输入输出接口。
Latent 更像:
大脑内部的概念网络。
七、和 Embedding / RAG 的关系
例如:
查询:
英伟达 GPU
Embedding 后:
在 Latent Space 里可能靠近:
CUDA
AI
Tensor
算力
半导体
离:
白酒
地产
旅游
较远。
所以:
RAG 检索,本质是在 Latent Space 里找“语义邻居”。
八、和摄影的类比(帮助记忆)
Token Space
像:
RAW 文件里的像素编号
例如:
R
G
B
只是:
原始数据。
Latent Space
像:
Lightroom 里的:
- 色彩关系
- 质感
- 风格
- 对比度
你看到的是:
“胶片感”
背后是:
高维表示。
九、核心区别总结
| 维度 | Token Space | Latent Space |
|---|---|---|
| 本质 | 符号 | 语义 |
| 类型 | 离散 | 连续 |
| 是否可读 | 是 | 否 |
| 是否直接可见 | 是 | 否 |
| 是否推理发生地 | 否 | 是 |
| 类比 | 字典 | 地图 |
| 数据形式 | Token ID | 高维向量 |
十、一句话总结(建议记住)
LLM 不是在 Token 上思考,而是在 Latent Space 上推理;Token 只是思考前后的编码与解码。