[LG]《FlashAttention for Scalable Vector Architectures》S R Gupta, N Papadopoulou, M Pericàs [Chalmers University of Technology & University of Glasgow] (2026)
在长向量CPU架构上运行Transformer,注意力计算是悬而未决的难题。过去的FlashAttention向量化方法受困于注意力头维度D,本质原因是当硬件向量长度超过D时,SIMD单元利用率饱和,无法进一步加速。
本文的核心洞见是:把并行化单元从头内元素,重新看作多个独立的注意力头。由此,“跨头封装”这一关键操作将多个头的数据打包进一个长向量寄存器,使硬件在向量长度远超头维度时也能被充分利用,从而解开瓶颈。
这项工作真正留下的遗产是为长向量CPU高效运行注意力机制提供了一套可扩展范式。它为后来者打开的新门是,证明了向量长度扩展至4096比特依然有收益,但尚未跨过的门槛是,常用量化格式的内存布局成为新瓶颈,其结构与长向量存在根本冲突。
arxiv.org/abs/2608.18656