Flash Attention Là Gì? Giải Thích Dễ Hiểu Về Kỹ Thuật Tối Ưu Transformer
Flash Attention Là Gì? Flash Attention là thuật toán tối ưu hóa attention computation trong Transformer, giúp giảm đáng kể việc sử dụng bộ nhớ...
Đọc tiếp →Kiến trúc Transformer là nền tảng của mọi LLM hiện đại. Giải thích self-attention, encoder-decoder, positional encoding dễ hiểu cho người mới.
12 bài viết
Flash Attention Là Gì? Flash Attention là thuật toán tối ưu hóa attention computation trong Transformer, giúp giảm đáng kể việc sử dụng bộ nhớ...
Đọc tiếp →BERT Là Gì? BERT (Bidirectional Encoder Representations from Transformers) là mô hình ngôn ngữ do Google công bố năm 2018, thay đổi cách máy hiểu...
Đọc tiếp →
Sequence Length Là Gì? Sequence length (độ dài chuỗi) là số lượng phần tử trong một chuỗi dữ liệu mà mô hình AI xử lý...
Đọc tiếp →KV Cache La Gi? KV Cache la bo nho dem chua cap Key-Value duoc tinh toan truoc do trong Transformer, giup model khong phai tinh...
Đọc tiếp →Residual Connection Là Gì? Residual Connection, hay còn gọi là shortcut connection hay skip connection, là một kỹ thuật trong mạng nơ-ron nhân tạo cho...
Đọc tiếp →Multi-Head Attention Là Gì? Multi-Head Attention là cơ chế cho phép AI nhìn cùng một đoạn văn bản từ nhiều góc độ khác nhau cùng...
Đọc tiếp →
Attention Mechanism Là Gì? Attention Mechanism (cơ chế chú ý) là một kỹ thuật trong deep learning cho phép mô hình tự quyết định phần...
Đọc tiếp →Ngay 17/6/2026, Noam Shazeer — một trong 8 tác giả của bài báo “Attention Is All You Need” (2017), người đứng sau kiến trúc Transformer...
Đọc tiếp →SubQ là gì và tại sao bạn nên quan tâm? SubQ là model AI thương mại đầu tiên không dùng kiến trúc Transformer — nền...
Đọc tiếp →