语言模型与Transformer架构
语言模型 (Language Model, LM) 是自然语言处理的核心,其根本任务是计算一个词序列(即一个句子)出现的概率。
P(s) = 每个词出现概率连乘,直接计算不可能
引入马尔可夫假设,单个词出现概率只与上一个词有关
基本上两步:P(第一个词),P(第一个词基础上第二个词)依次类推累乘
两大缺陷:数据稀疏(没见过的算不了),泛化不行(无法理解类似词汇)
用连续的向量来表词的前馈神经网络
构造语义空间:用向量来表示词简称词向量汇聚而成的向量空间
映射:基于上下文学习