[Long Review] Axial Attention in Multidimensional Transformers

Tutorials

[長篇評論] Axial Attention in Multidimensional Transformers

對影像或影片進行完整自注意力在計算上極其昂貴,那麼如何在不引入二次方複雜度的情況下保持Transformer的表現力?

對影像或影片進行完整自注意力在計算上極其昂貴,那麼如何在不引入二次方複雜度的情況下保持Transformer的表現力?Ho、Kalchbrenner、Weissenborn和Salimans提出Axial Attention:每次只沿著張量的一個軸進行注意,堆疊各軸,你就能以一小部分計算量恢復完整上下文。

這篇Axial Transformers論文的長篇評論從頭到尾介紹了架構、軸向注意層如何組合、為什麼半並行解碼結構在沒有獨立性假設的情況下實際有效,以及該模型如何在ImageNet-32、ImageNet-64和BAIR Robotic Pushing上取得最先進的結果。語音工程師應該關注:同樣的技巧適用於任何高維張量,包括頻譜圖時頻網格,而且論文已開源。這篇深入分析為對音頻或多模態工作的高效注意力感興趣的讀者逐一介紹了每個設計選擇。