Voyez le flux résiduel comme une rivière lumineuse dans laquelle chaque couche lit et écrit, avec des affluents d’attention et de MLP qui ajoutent des caractéristiques.
Traduction automatique depuis l’original anglais. Ouvrir l’original anglais
Chaque couche d’un Transformer ne calcule pas de façon isolée — elle lit et écrit dans un flux partagé unique, le flux résiduel. Ici, nous l’observons comme une rivière lumineuse qui s’écoule de l’entrée vers la sortie. Chaque fois que la rivière traverse une couche, un peu plus d’information s’y ajoute et elle devient plus brillante.
Observez la rivière s’écouler de l’entrée vers la sortie, s’illuminant à mesure qu’elle traverse chaque couche.
attn : rassembler le contexte / mlp : finaliser avant la sortie. La dernière couche met de l’ordre dans l’ensemble et achève la représentation transmise à la prédiction du prochain jeton.