Residual Attention

Bài giải thích tương tác trên một trang về bài báo Attention Residuals của đội ngũ Kimi: các phần hướng dẫn bằng ảnh động về hiện tượng pha loãng theo độ sâu, Full AttnRes và phép tính hai pha của Block AttnRes, kèm công thức KaTeX. Trường hợp này được tạo bởi Kimi K3.

Loading preview...
Bắt đầu với prompt này

Bài giải thích có hoạt ảnh về sự pha loãng theo chiều sâu, Full AttnRes và cơ chế tính toán hai pha của Block AttnRes, kèm công thức KaTeX và điều chỉnh tốc độ.

Thử Deep Research
Tạo một bài giải thích tương tác bằng tiếng Anh trong một tệp duy nhất cho bài báo Attention Residuals của nhóm Kimi. Dành cho độc giả có nền tảng deep learning: trước tiên, minh họa vấn đề pha loãng theo chiều sâu của việc tích lũy residual PreNorm (độ lớn hidden state tăng theo chiều sâu và các lớp đầu bị pha loãng); sau đó giải thích Full AttnRes, trong đó một pseudo-query có thể học được thực hiện attention trên mọi đầu ra của các lớp trước với trọng số softmax; cuối cùng trình bày Block AttnRes với cơ chế tính toán hai pha (residual thông thường bên trong một block, attention giữa các block), và khép lại bằng phần so sánh chi phí bộ nhớ và truyền thông. Hiển thị công thức bằng KaTeX (dự phòng bằng văn bản LaTeX thô nếu CDN không hoạt động), có điều hướng theo phần, điều chỉnh được tốc độ hoạt ảnh, bố cục học thuật gọn gàng, và một tệp HTML tự chứa duy nhất hoạt động ngoại tuyến.
Tạo phiên bản tiếng Trung

Cùng hoạt ảnh và công thức, nhưng được trình bày bằng tiếng Trung tự nhiên.

Thử Deep Research
Tạo bằng tiếng Anh một bài giải thích tương tác trong một tệp duy nhất cho bài báo Attention Residuals. Dành cho độc giả có nền tảng deep learning: trước tiên, minh họa vấn đề pha loãng theo chiều sâu của việc tích lũy residual PreNorm (độ lớn hidden state tăng theo chiều sâu và các lớp đầu bị pha loãng); sau đó giải thích Full AttnRes, trong đó một pseudo-query có thể học được thực hiện attention trên mọi đầu ra của các lớp trước với trọng số softmax; cuối cùng trình bày Block AttnRes với cơ chế tính toán hai pha (residual thông thường bên trong một block, attention giữa các block), và khép lại bằng phần so sánh chi phí bộ nhớ và truyền thông. Hiển thị công thức bằng KaTeX (dự phòng bằng văn bản LaTeX thô nếu CDN không hoạt động), có điều hướng theo phần, điều chỉnh được tốc độ hoạt ảnh, bố cục học thuật gọn gàng, và một tệp HTML tự chứa duy nhất hoạt động ngoại tuyến.
Chuyển sang linear attention

Giữ hình thức hoạt ảnh ba hồi nhưng thay vào đó giải thích Mamba và linear attention.

Thử Deep Research
Tạo một bài giải thích tương tác bằng tiếng Anh trong một tệp duy nhất cho bài báo Attention Residuals của nhóm Kimi. Dành cho độc giả có nền tảng deep learning: trước tiên, minh họa vấn đề pha loãng theo chiều sâu của Sự tích lũy residual PreNorm (độ lớn trạng thái ẩn tăng theo độ sâu và các lớp đầu bị pha loãng), sau đó giải thích Full AttnRes, trong đó một pseudo-query có thể học được attention trên toàn bộ đầu ra của các lớp trước bằng trọng số softmax, và cuối cùng đến với Block AttnRes với phép tính hai pha (residual thông thường trong một block, attention giữa các block), và khép lại bằng phần so sánh chi phí bộ nhớ và truyền thông. Hiển thị công thức bằng KaTeX (dự phòng bằng văn bản LaTeX thô nếu CDN không hoạt động), có điều hướng theo phần, điều chỉnh được tốc độ hoạt ảnh, bố cục học thuật gọn gàng, và một tệp HTML tự chứa duy nhất hoạt động ngoại tuyến.
Thêm các điểm kiểm tra kiến thức

Thêm các bài kiểm tra ngắn ở cuối mỗi phần; khi trả lời sai, chúng sẽ quay lại ảnh động tương ứng.

Thử Deep Research
Xây dựng một bài giải thích tương tác bằng tiếng Anh trong một tệp duy nhất về bài báo Attention Residuals của đội ngũ Kimi. Dành cho độc giả có nền tảng deep learning: trước tiên, minh họa bằng ảnh động vấn đề pha loãng theo độ sâu trong sự tích lũy residual PreNorm (độ lớn trạng thái ẩn tăng theo độ sâu và các lớp đầu bị pha loãng), sau đó giải thích Full AttnRes, trong đó một pseudo-query có thể học được attention trên toàn bộ đầu ra của các lớp trước bằng trọng số softmax, và cuối cùng đến với Block AttnRes cùng phép tính hai pha (residual thông thường trong một block, attention giữa các block), khép lại bằng phần so sánh chi phí bộ nhớ và giao tiếp. Hiển thị công thức bằng KaTeX (dùng văn bản LaTeX thô nếu CDN không hoạt động), có điều hướng giữa các phần, tốc độ ảnh động có thể điều chỉnh, bố cục học thuật gọn gàng, một tệp HTML độc lập duy nhất hoạt động ngoại tuyến.