Veja o fluxo residual como um rio brilhante do qual cada camada lê e no qual cada camada escreve, com afluentes de atenção e MLP adicionando características.
Traduzido automaticamente a partir do original em inglês. Abrir original em inglês
Cada camada de um Transformer não realiza seus cálculos sozinha — ela lê e escreve em um único fluxo compartilhado, o fluxo residual. Aqui o observamos como um rio brilhante que corre da entrada até a saída. Cada vez que o rio passa por uma camada, um pouco mais de informação é adicionado e ele fica mais brilhante.
Observe o rio fluir da entrada até a saída, ficando mais brilhante à medida que passa por cada camada.
attn: reúne o contexto / mlp: finaliza antes da saída. A camada final organiza o todo e conclui a representação entregue à previsão do próximo token.