[长评] 多维Transformer中的Axial Attention
对图像或视频进行完整自注意力的计算成本太高,那么你如何在不产生二次计算爆炸的情况下保持Transformer的表达能力呢?
对图像或视频进行完整自注意力的计算成本太高,那么你如何在不产生二次计算爆炸的情况下保持Transformer的表达能力呢?Ho、Kalchbrenner、Weissenborn和Salimans提出了Axial Attention:每次只沿张量的一个轴进行注意力计算,堆叠各轴的结果,你就能用较少的计算量恢复完整上下文。
这篇Axial Transformers论文的长评论端到端地讲解了架构、Axial Attention层如何组合、为什么半并行解码结构无需独立性假设就能工作,以及模型如何在ImageNet-32、ImageNet-64和BAIR Robotic Pushing上获得最先进的结果。语音工程师应该注意:相同的技巧适用于任何高维张量,包括频谱图时间-频率张量,论文已开源。如果你在考虑音频或多模态工作的高效注意力,这篇深入讲解会讲解每个设计选择。