摘要:现有的 Transformer 模型在建模序列依赖方面表现优异, 但在处理具有非欧几里得结构的人体骨骼关键点数据时, 却缺乏对图结构的有效建模能力. 相比之下, 图卷积网络(graph convolutional network, GCN)更擅长捕捉关键点之间的拓扑关系与局部结构信息. 基于此, 本文提出了一种Transformer架构——GET. 该方法将GCN与Transformer相融合, 构建了一个兼顾图结构建模与全局上下文建模的统一框架, 从而增强了对人体骨骼表征的学习能力, 并有效克服了现有基于Transformer的三维人体姿态估计方法的缺陷, 即其自注意力机制中Q、K、V向量的推导均基于简单线性映射. 进一步地, GET在保持Transformer灵活性的同时, 引入图卷积来建模人体骨骼的结构先验知识, 使模型能够同时捕捉局部关节关系和全局时空依赖. 大量实验结果表明, 本文提出的GET在Human3.6M和MPI-INF-3DHP两个数据集上均取得了当前最优性能, 充分验证了其在非欧几里得结构数据建模中的有效性与通用性.