跳转至

自注意力机制

自注意力让同一序列中的每个位置根据内容聚合其他位置的信息。输入 \(X\) 经线性投影得到 \(Q=XW_Q\)、\(K=XW_K\) 和 \(V=XW_V\):

\[ \operatorname{Attention}(Q,K,V) =\operatorname{Softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right)V. \]

它可以并行计算全局依赖,但标准实现的注意力矩阵需要 \(O(n^2)\) 的时间和空间。