自回归语言模型¶ 自回归语言模型使用概率链式法则,把序列联合概率分解为逐词条件概率: \[ P(x_{1:T})=\prod_{t=1}^{T}P(x_t\mid x_{<t}). \] 训练时最小化下一个词元的交叉熵;生成时将已生成的词元作为上下文,反复预测后续词元。