02 文本数据处理:分词、BPE 与词嵌入——给 LLM 准备“燃料”

02 文本数据处理:分词、BPE 与词嵌入——给 LLM 准备“燃料” 02 文本数据处理:分词、BPE 与词嵌入——给 LLM 准备“燃料”系列第 2 篇。上一讲我们理解了 LLM 是什么、为什么要从零构建。这一讲进入第一个"动手"环节:如何把原始文本变成模型能处理的数字。本篇覆盖《从零构建大模型》第 2 章:文本 → token → token ID → 嵌入向量的完整流水线,包括 GPT-2 的 BPE 分词原理、特殊 token、滑动窗口数据采样,以及词嵌入与位置嵌入。1. 为什么文本必须"数字化"?神经网络只认数字,不认字符。所以任何 LLM 的第一步,都是把原始文本转换为连续的向量表示。完整流水线如下:原始文本 │ ① 分词 (tokenization):拆成 token(词/子词/字符) ▼ token 列表 │ ② 查表映射:每个 token 查词汇表得到唯一 ID ▼ token ID 序列 │ ③ 嵌入层:查嵌入矩阵,得到稠密向量 ▼ 嵌入向量(供模型处理)三个关键设计点:分词粒度:词(word)、子词(subwor