Xem residual stream như một dòng sông phát sáng mà mọi lớp đều đọc và ghi vào, với các nhánh attention và MLP bổ sung đặc trưng.
Được dịch máy từ bản gốc tiếng Anh. Mở bản gốc tiếng Anh
Mỗi lớp trong một Transformer không tự mình tính toán — nó đọc từ và ghi vào một dòng chảy chung, chính là residual stream. Ở đây, chúng ta quan sát nó như một dòng sông phát sáng chảy từ đầu vào đến đầu ra. Mỗi khi dòng sông đi qua một lớp, thêm một chút thông tin được bổ sung và nó trở nên sáng rực hơn.
Quan sát dòng sông chảy từ đầu vào đến đầu ra, sáng dần lên khi đi qua từng lớp.
attn: thu thập ngữ cảnh / mlp: hoàn thiện trước khi xuất ra. Lớp cuối cùng hoàn thiện toàn bộ và tinh chỉnh biểu diễn được chuyển giao cho dự đoán token tiếp theo.