自注意力机制¶
自注意力让同一序列中的每个位置根据内容聚合其他位置的信息。输入 \(X\) 经线性投影得到 \(Q=XW_Q\)、\(K=XW_K\) 和 \(V=XW_V\):
\[
\operatorname{Attention}(Q,K,V)
=\operatorname{Softmax}\!\left(\frac{QK^\top}{\sqrt{d_k}}\right)V.
\]
它可以并行计算全局依赖,但标准实现的注意力矩阵需要 \(O(n^2)\) 的时间和空间。
自注意力让同一序列中的每个位置根据内容聚合其他位置的信息。输入 \(X\) 经线性投影得到 \(Q=XW_Q\)、\(K=XW_K\) 和 \(V=XW_V\):
它可以并行计算全局依赖,但标准实现的注意力矩阵需要 \(O(n^2)\) 的时间和空间。