Zobacz strumień rezydualny jako świecącą rzekę, z której każda warstwa czerpie i do której zapisuje, a dopływy attention i MLP dodają cechy.
Przetłumaczone maszynowo z oryginału w języku angielskim. Otwórz oryginał w języku angielskim
Każda warstwa Transformera nie oblicza w oderwaniu — czerpie z jednego wspólnego przepływu i zapisuje do niego, strumienia rezydualnego. Obserwujemy go tutaj jako świetlistą rzekę płynącą od wejścia do wyjścia. Za każdym razem, gdy rzeka przepływa przez warstwę, dodawana jest odrobina więcej informacji i rzeka staje się jaśniejsza.
Obserwuj, jak rzeka płynie od wejścia do wyjścia, jaśniejąc za każdym razem, gdy przechodzi przez warstwę.
attn: zbierz kontekst / mlp: ostatnie szlify przed wynikiem. Ostatnia warstwa porządkuje całość i kończy reprezentację przekazywaną do przewidywania kolejnego tokenu.