Transformer 是什么意思?
Transformer 是指 2017 年引入的一种深度学习模型架构。它利用一种称为"自注意力"的机制来处理顺序数据,从根本上改变了自然语言处理及其他领域的方法。
核心解答
答案
与 RNN 或 LSTM 等前身不同,Transformer 完全依赖注意力机制来权衡输入序列不同部分的重要性,无论距离如何。这实现了训练期间的高度并行计算。核心组件包括由多个相同层组成的编码器和解码器堆栈,每层包含多头自注意力和逐位置前馈网络。位置编码被添加以嵌入序列顺序信息。
Transformer 已成为众多 NLP 任务的主导架构,包括机器翻译、文本摘要和问答(例如 BERT 和 GPT 等模型基于 Transformer)。其有效性源于高效捕获复杂的长距离依赖关系。其应用还扩展到计算机视觉、音频处理和多模态任务,推动了 AI 能力的重大进步。
相关关键词