摘要:近年来, 随着计算机视觉与自然语言处理领域的迅猛发展, 这一研究方向引起了学术界的广泛关注. 传统Transformer处理图像等数据时生成字幕缺乏细节, 往往忽略了图像的局部特征, 难以实现精准的语义对齐. 为了解决这个问题, 提出一种融合视觉注意模块的多视角图像字幕生成模型. 首先, 该模型将图像复制16份, 每份都加入独立的随机噪声, 每份在空间特征中都存在微小差异, 让模型拥有多个“视角”, 并添加可学习二维相对位置编码; 其次, 在两阶段特征优化阶段模拟不同区域之间的信息交互, 显式建模不同区域的上下文依赖关系, 自动生成一个更具判别性, 聚焦于显著区域的增强全局视觉表述, 提升对图像细和局部语义的捕捉能力. 文本嵌入通过两层交叉注意力机制直接查询全部视觉patch, 实现每个生成token对图像区域的选择性关注. 最后, 生成器完成图像字幕生成后, 系统会通过多维度自动化评估指标(如BLEU、ROUGE、CIDEr、METEOR等)对生成的字幕进行判别, 确认生成文本是否能准确反映图像内容、具备流畅性和语义合理性, 从而衡量模型输出是否符合人类描述标准. 实验结果表明, 该方法与现有方法相比, BLEU1提升了5.17%, CIDEr提升了8.78%, ROUGE-L提升了12.52%, METEOR提升了17.24%.