摘要:大语言模型的注意力机制在处理长序列时面临严峻的计算与显存挑战, 现有解决方案主要从算法优化和序列并行两个维度展开. 在算法层面, 块稀疏注意力机制通过在掩码矩阵中引入块稀疏性质降低计算复杂度, 其中Atrous稀疏和垂直-斜线稀疏是两种经典的稀疏模式; 在序列并行层面, 环形注意力通过高效扩展设备数量支持处理任意长度的序列. 然而, 当二者结合时, 环形注意力仍然采用密集注意力的序列切分方式, 导致大量无效的通信开销与计算开销, 难以实现预期加速效果. 本文针对Atrous和垂直-斜线两种经典的稀疏模式, 提出了定制化的序列切分方案以及高效简明的分布式计算方案: 对于Atrous稀疏模式, 采用分组计算策略, 将数据与设备均匀划分为相同数量的组, 在不同组内执行独立的环形注意力大幅提升计算效率; 对于垂直-斜线稀疏模式, 采用分解计算方案, 将其拆分为斜线稀疏和垂直稀疏两个子任务, 其中斜线稀疏部分实现无通信开销的本地计算, 垂直稀疏部分通过去除无关键值块的计算通信开销实现性能加速. 实验结果表明, 新的分布式优化方案在Atrous稀疏设置下实现了3–10.9倍的性能提升, 在垂直-斜线稀疏设置下实现了3–10.5倍的性能提升.