04 注意力机制(下):因果掩码与多头注意力 📅 发布时间:2026/9/3 20:44:34 👁 浏览次数: 04 注意力机制(下):因果掩码与多头注意力系列第 4 篇。上一讲我们实现了自注意力并推导出softmax(QKᵀ/√d_k)V。这一讲解决两个关键工程问题:因果掩码(causal mask):让 GPT 的注意力"只往前看",保证自回归生成不被未来信息污染;多头注意力(multi-head attention):多个"关注头"并行捕捉不同模式,以及它的高效矩阵实现。对应《从零构建大模型》第 3 章后半部分。1. 因果注意力:为什么 GPT 不能"偷看未来"?1.1 问题:注意力默认是全双向的上篇实现的注意力,每个 token 都能看到整个序列(包括未来的 token)。这在 BERT(编码器)里没问题,但对 **GPT(解码器)**是灾难——因为:GPT 是自回归生成:预测第 t 个词时,只知道 1…t-1 的词。如果注意力能看到 t+1 的词,训练时就"泄漏了答案",模型会退化成"抄答案"而不是"学预测"。换个更直白的说法:如果把未来的词给模型看,那么"预测下一个词"这个任务就变成了"把下一格的答案抄过来"——