Skip to content
Figo Blogs
Go back

LLM 中的 Token Space 与 Latent Space

Contents

Table of contents

Open Table of contents

一、什么是 Token Space?

定义

Token Space 指的是:

LLM 输入和输出的符号空间(Symbol Space)

模型看到的并不是:

苹果
ChatGPT
投资

而是:

12873
8921
6611

也就是:

Token ID


例子

假设输入:

苹果公司市值

经过 Tokenization(分词):

苹果     → token #12873
公司     → token #6611
市值     → token #3912

或者:

[12873, 6611, 3912]

这就是:

Token Space


特征

Token Space 的特点:

1. 离散(Discrete)

例如:

苹果 ≠ 香蕉
12873 ≠ 5621

没有“中间状态”。


2. 可读

人类可以直接理解:

苹果
香蕉
英伟达

3. 是输入/输出接口

LLM 最终:

输入:

文字 → Token

输出:

Token → 文字

类比

Token Space 像:

字典

例如:

#12873 = 苹果
#5621  = 香蕉
#8811  = 英伟达

二、什么是 Latent Space?

定义

Latent Space 指的是:

模型内部的隐藏语义空间(Hidden Semantic Space)

Token 会被转换成:

高维向量(Embedding)

例如:

苹果 → [0.23, -0.91, 0.44, ...]

这个向量所在的空间:

就是 Latent Space


为什么叫 Latent?

Latent = Hidden = 隐藏的

因为:

你看不到:

苹果
香蕉

而是:

[0.23, -0.91, 0.44, ...]

特征

Latent Space 的特点:

1. 连续(Continuous)

例如:

苹果 ←→ 香蕉 ←→ 水果

彼此距离可以计算。


2. 表示“意义”

例如:

“苹果”可能靠近:

水果
香蕉
iPhone
乔布斯
科技

离:

火车
水泥
恐龙

较远。


3. 推理发生在这里

LLM 真正的“思考”不是在 token 上。

而是在:

Latent Space


类比

Latent Space 像:

真实地图

例如:

        东京

   上海

北京        深圳

距离代表:

语义相似度


三、Token Space 与 Latent Space 的关系

完整流程:

用户输入文字
      ↓
Tokenization
      ↓
Token Space
      ↓
Embedding
      ↓
Latent Space
      ↓
Transformer 推理
      ↓
Latent Space
      ↓
Decoder
      ↓
Token Space
      ↓
输出文字

四、用“苹果”理解

输入:

苹果

在 Token Space

可能是:

12873

只是:

一个编号

模型还“不理解”。


在 Latent Space

可能是:

[0.23, -0.91, 0.44, ...]

并且靠近:

香蕉
水果
iPhone
乔布斯

模型开始:

理解“苹果”的语义。


五、上下文是如何改变 Latent 表示的?

输入:

苹果很好吃

模型倾向理解:

水果


输入:

苹果公司市值

模型倾向理解:

Apple Inc.

原因:

Transformer 会根据上下文,动态调整 token 在 Latent Space 中的位置。

所以:

同一个 Token,不同上下文,可以有不同 Latent 表示。


六、为什么 Latent Space 比 Token Space 更重要?

因为:

真正的推理,不在 Token 上发生。

而在:

Latent Space

Token 更像:

输入输出接口。

Latent 更像:

大脑内部的概念网络。


七、和 Embedding / RAG 的关系

例如:

查询:

英伟达 GPU

Embedding 后:

在 Latent Space 里可能靠近:

CUDA
AI
Tensor
算力
半导体

离:

白酒
地产
旅游

较远。

所以:

RAG 检索,本质是在 Latent Space 里找“语义邻居”。


八、和摄影的类比(帮助记忆)

Token Space

像:

RAW 文件里的像素编号

例如:

R
G
B

只是:

原始数据。


Latent Space

像:

Lightroom 里的:

  • 色彩关系
  • 质感
  • 风格
  • 对比度

你看到的是:

“胶片感”

背后是:

高维表示。


九、核心区别总结

维度Token SpaceLatent Space
本质符号语义
类型离散连续
是否可读是否
是否直接可见是否
是否推理发生地否是
类比字典地图
数据形式Token ID高维向量

十、一句话总结(建议记住)

LLM 不是在 Token 上思考,而是在 Latent Space 上推理;Token 只是思考前后的编码与解码。


Share this post:

Previous Post
2026:当 OpenCode / Claude Code 已经很好用时,底层 Agent 框架还有多大意义?
Next Post
RAG 处理 Word 与扫描版 PDF 最终优化方案