Observa el flujo residual como un río luminoso del que cada capa lee y en el que escribe, con afluentes de atención y MLP que añaden características.
Traducido automáticamente del original en inglés. Abrir original en inglés
Cada capa de un Transformer no calcula por su cuenta: lee y escribe en un único flujo compartido, el flujo residual. Aquí lo observamos como un río resplandeciente que corre desde la entrada hasta la salida. Cada vez que el río atraviesa una capa, se añade un poco más de información y brilla con más intensidad.
Observa cómo el río fluye desde la entrada hasta la salida, brillando cada vez más al atravesar cada capa.
attn: reúne el contexto / mlp: da el acabado final antes de la salida. La capa final ordena todo y termina la representación que se entrega a la predicción del siguiente token.