基于 Transformer 的序列到序列模型
原始 Transformer 以自注意力为核心,编码器—解码器之间还通过交叉注意力传递信息,并抛弃了循环与卷积。训练阶段可以并行处理整个序列;生成式解码仍需按位置逐步生成。它也成为许多大模型架构的基础。
图片来源:Google AI Blog
原始 Transformer 以自注意力为核心,编码器—解码器之间还通过交叉注意力传递信息,并抛弃了循环与卷积。训练阶段可以并行处理整个序列;生成式解码仍需按位置逐步生成。它也成为许多大模型架构的基础。
图片来源:Google AI Blog