返回
概念与选型FAQ

Transformer 是什么意思?

Transformer 是指 2017 年引入的一种深度学习模型架构。它利用一种称为"自注意力"的机制来处理顺序数据,从根本上改变了自然语言处理及其他领域的方法。

01

核心解答

答案

与 RNN 或 LSTM 等前身不同,Transformer 完全依赖注意力机制来权衡输入序列不同部分的重要性,无论距离如何。这实现了训练期间的高度并行计算。核心组件包括由多个相同层组成的编码器和解码器堆栈,每层包含多头自注意力和逐位置前馈网络。位置编码被添加以嵌入序列顺序信息。

Transformer 已成为众多 NLP 任务的主导架构,包括机器翻译、文本摘要和问答(例如 BERT 和 GPT 等模型基于 Transformer)。其有效性源于高效捕获复杂的长距离依赖关系。其应用还扩展到计算机视觉、音频处理和多模态任务,推动了 AI 能力的重大进步。

相关关键词

AI 智能客服FastGPT开源 AI企业 AI智能助手
FAQ

相关问题

返回