Attention Residuals

คำอธิบายเชิงโต้ตอบหน้าเดียวสำหรับบทความ Attention Residuals ของทีม Kimi: มีการอธิบายแบบภาพเคลื่อนไหวเกี่ยวกับการลดทอนตามความลึก, Full AttnRes และการคำนวณสองระยะของ Block AttnRes พร้อมสูตร KaTeX กรณีนี้สร้างโดย Kimi K3

Loading preview...
เริ่มด้วยพรอมป์ต์นี้

คำอธิบายแบบแอนิเมชันเกี่ยวกับการเจือจางตามความลึก, Full AttnRes และการคำนวณสองเฟสของ Block AttnRes พร้อมสูตร KaTeX และการควบคุมความเร็ว

ลองใช้ Deep Research
สร้างคำอธิบายแบบอินเทอร์แอกทีฟภาษาอังกฤษในไฟล์เดียวสำหรับบทความของทีม Kimi เรื่อง Attention Residuals สำหรับผู้อ่านที่มีพื้นฐานด้าน deep learning: เริ่มจากทำแอนิเมชันปัญหาการเจือจางตามความลึกของการสะสม residual แบบ PreNorm (ขนาดของ hidden state เพิ่มขึ้นตามความลึก และเลเยอร์ช่วงต้นถูกเจือจาง) จากนั้นอธิบาย Full AttnRes ซึ่ง pseudo-query ที่เรียนรู้ได้จะทำ attention กับเอาต์พุตของทุกเลเยอร์ก่อนหน้าโดยใช้น้ำหนัก softmax และปิดท้ายด้วย Block AttnRes ที่มีการคำนวณสองเฟส (residual ปกติภายในบล็อก และ attention ข้ามบล็อก) พร้อมเปรียบเทียบต้นทุนด้านหน่วยความจำและการสื่อสาร แสดงผลสูตรด้วย KaTeX (หาก CDN ใช้งานไม่ได้ ให้ใช้ข้อความ LaTeX ดิบแทน) มีการนำทางตามส่วน ปรับความเร็วแอนิเมชันได้ เลย์เอาต์เชิงวิชาการที่สะอาดตา และเป็นไฟล์ HTML เดียวที่ทำงานแบบออฟไลน์ได้
สร้างฉบับภาษาจีน

ใช้แอนิเมชันและสูตรเดิม แต่ถ่ายทอดเป็นคำอธิบายภาษาจีนที่เป็นธรรมชาติ

ลองใช้ Deep Research
สร้าง ภาษาอังกฤษ คำอธิบายแบบอินเทอร์แอกทีฟในไฟล์เดียวสำหรับบทความของทีม Kimi เรื่อง Attention Residuals. สำหรับผู้อ่านที่มีพื้นฐานด้าน deep learning: เริ่มจากทำแอนิเมชันปัญหาการเจือจางตามความลึกของการสะสม residual แบบ PreNorm (ขนาดของ hidden state เพิ่มขึ้นตามความลึก และเลเยอร์ช่วงต้นถูกเจือจาง) จากนั้นอธิบาย Full AttnRes ซึ่ง pseudo-query ที่เรียนรู้ได้จะทำ attention กับเอาต์พุตของทุกเลเยอร์ก่อนหน้าโดยใช้น้ำหนัก softmax และปิดท้ายด้วย Block AttnRes ที่มีการคำนวณสองเฟส (residual ปกติภายในบล็อก และ attention ข้ามบล็อก) พร้อมเปรียบเทียบต้นทุนด้านหน่วยความจำและการสื่อสาร แสดงผลสูตรด้วย KaTeX (หาก CDN ใช้งานไม่ได้ ให้ใช้ข้อความ LaTeX ดิบแทน) มีการนำทางตามส่วน ปรับความเร็วแอนิเมชันได้ เลย์เอาต์เชิงวิชาการที่สะอาดตา และเป็นไฟล์ HTML เดียวที่ทำงานแบบออฟไลน์ได้
เปลี่ยนไปใช้ linear attention

คงรูปแบบแอนิเมชันสามองก์ไว้ แต่เปลี่ยนไปอธิบาย Mamba และ linear attention

ลองใช้ Deep Research
สร้างคำอธิบายแบบอินเทอร์แอกทีฟภาษาอังกฤษในไฟล์เดียวสำหรับ บทความของทีม Kimi เรื่อง Attention Residuals. สำหรับผู้อ่านที่มีพื้นฐานด้าน deep learning: เริ่มจากทำแอนิเมชัน ปัญหาการเจือจางตามความลึก ของ การสะสม residual แบบ PreNorm (ขนาดของ hidden state เพิ่มขึ้นตามความลึก และชั้นต้น ๆ ถูกลดทอน), จากนั้นอธิบาย Full AttnRes ซึ่ง pseudo-query ที่เรียนรู้ได้จะทำ attention กับเอาต์พุตของทุกชั้นก่อนหน้าโดยใช้น้ำหนัก softmax, และปิดท้ายด้วย Block AttnRes ที่มีการคำนวณสองระยะ (residual ปกติภายในบล็อก และ attention ข้ามบล็อก), ปิดท้ายด้วยการเปรียบเทียบ ต้นทุนด้านหน่วยความจำและการสื่อสาร. แสดงผลสูตรด้วย KaTeX (หาก CDN ใช้งานไม่ได้ ให้ใช้ข้อความ LaTeX ดิบแทน) มีการนำทางตามส่วน ปรับความเร็วแอนิเมชันได้ เลย์เอาต์เชิงวิชาการที่สะอาดตา และเป็นไฟล์ HTML เดียวที่ทำงานแบบออฟไลน์ได้
เพิ่มจุดตรวจแบบทดสอบ

เพิ่มแบบทดสอบสั้น ๆ ท้ายแต่ละส่วน ซึ่งจะย้อนกลับไปยังแอนิเมชันที่ตรงกันเมื่อผู้ใช้ตอบผิด

ลองใช้ Deep Research
สร้างคำอธิบายเชิงโต้ตอบแบบไฟล์เดียวเป็นภาษาอังกฤษสำหรับบทความ Attention Residuals ของทีม Kimi สำหรับผู้อ่านที่มีพื้นฐานด้าน deep learning: เริ่มด้วยการแสดงภาพเคลื่อนไหวของปัญหาการลดทอนตามความลึกในการสะสม residual แบบ PreNorm (ขนาดของ hidden state เพิ่มขึ้นตามความลึก และชั้นต้น ๆ ถูกลดทอน) จากนั้นอธิบาย Full AttnRes ซึ่ง pseudo-query ที่เรียนรู้ได้จะทำ attention กับเอาต์พุตของทุกชั้นก่อนหน้าโดยใช้น้ำหนัก softmax และปิดท้ายด้วย Block AttnRes ที่มีการคำนวณสองระยะ (residual ปกติภายในบล็อก และ attention ข้ามบล็อก) พร้อมสรุปเปรียบเทียบต้นทุนด้านหน่วยความจำและการสื่อสาร แสดงสูตรด้วย KaTeX (หาก CDN ใช้ไม่ได้ ให้แสดงข้อความ LaTeX ดิบแทน) มีระบบนำทางระหว่างส่วน ปรับความเร็วแอนิเมชันได้ เลย์เอาต์เชิงวิชาการที่สะอาดตา และเป็นไฟล์ HTML เดียวแบบครบในตัวที่ใช้งานแบบออฟไลน์ได้.