可视化资源

基于 Transformer 的序列到序列模型

原始 Transformer 以自注意力为核心,编码器—解码器之间还通过交叉注意力传递信息,并抛弃了循环与卷积。训练阶段可以并行处理整个序列;生成式解码仍需按位置逐步生成。它也成为许多大模型架构的基础。

Transformer 编码器—解码器
Transformer 编码器与解码器并行处理序列。
来源:Google AI Blog · Transformer

图片来源:Google AI Blog