Cơ chế attention (cơ chế chú ý) là cách mô hình AI quyết định, khi xử lý một từ, cần “nhìn” vào những từ nào khác trong đoạn văn và mức độ quan trọng của từng từ. Mỗi token tạo ra một câu hỏi (query), so với nhãn (key) của các token khác để tính điểm liên quan, rồi gom thông tin (value) theo tỷ trọng đó. Self-attention là trái tim của kiến trúc Transformer, nền tảng của hầu hết mô hình ngôn ngữ lớn. Nhờ attention, AI hiểu ngữ cảnh xa; nhưng chi phí tính toán tăng nhanh theo độ dài, nên ngữ cảnh dài vẫn có giới hạn.
Cơ chế attention là gì, giải thích bằng ví dụ
Cơ chế attention là phương pháp giúp mạng nơ-ron tập trung vào phần thông tin liên quan nhất khi xử lý từng phần của dữ liệu. Thay vì đọc văn bản như một băng chuyền, mỗi từ chỉ nhớ mơ hồ những từ trước, attention cho phép mỗi từ “liếc” trực tiếp đến mọi từ khác và chọn từ nào đáng chú ý.
Xét câu: “Kế toán gửi báo cáo cho giám đốc vì cô ấy cần duyệt trước thứ Sáu.” Con người biết “cô ấy” nhiều khả năng là giám đốc, vì người cần duyệt là giám đốc. Khi xử lý “cô ấy”, attention sẽ cho điểm cao với “giám đốc” và “duyệt”, điểm thấp với “báo cáo”, “thứ Sáu”.
Một hình ảnh dễ nhớ: bạn đang họp và ghi chép. Khi sếp nói “làm như phương án hôm trước”, bạn lật sổ, lướt nhanh và dừng lại ở trang ghi “phương án”. Attention là cách AI lật sổ ghi chép đó, chỉ khác là nó làm cùng lúc cho mọi từ và mọi vị trí.
Query, key, value: ba vai trò trong mỗi token
Về kỹ thuật, attention biến mỗi token thành ba vector:
- Query (truy vấn): “Tôi đang tìm thông tin gì?”
- Key (khóa): “Tôi chứa loại thông tin gì?”, như nhãn trên tập hồ sơ.
- Value (giá trị): nội dung thật sự được lấy ra nếu khớp.
Các bước tính, rút gọn
- Lấy query của token hiện tại nhân với key của từng token khác để ra điểm liên quan.
- Chia điểm cho một hằng số để ổn định, rồi đưa qua hàm softmax để thành tỷ trọng cộng lại bằng 1.
- Cộng các value theo tỷ trọng đó, tạo thành biểu diễn mới của token, đã “thấm” ngữ cảnh.
Hình dung như tủ hồ sơ công ty: bạn cầm phiếu yêu cầu (query), so với nhãn từng ngăn (key), ngăn nào khớp nhiều thì lấy nhiều tài liệu (value) từ ngăn đó. Mọi phép so sánh này đều là phép nhân ma trận, việc mà GPU làm rất nhanh, đó là lý do AI hiện đại gắn chặt với card đồ họa.
Self-attention và multi-head attention trong Transformer
Năm 2017, bài báo “Attention Is All You Need” của nhóm nghiên cứu Google giới thiệu kiến trúc Transformer, trong đó attention là thành phần chính thay cho mạng hồi quy (RNN) trước đó.
- Self-attention: các token trong cùng một chuỗi chú ý lẫn nhau. Đây là cách mô hình hiểu quan hệ trong câu, trong đoạn, thậm chí giữa trang 1 và trang 20 của tài liệu.
- Multi-head attention: chạy nhiều “đầu” attention song song. Mỗi đầu có thể học một kiểu quan hệ: một đầu theo dõi chủ ngữ và đại từ, đầu khác theo dõi số liệu và đơn vị, đầu khác theo dõi cấu trúc câu.
- Causal attention: trong mô hình sinh văn bản như GPT, mỗi token chỉ được nhìn các token phía trước, không được “nhìn trộm” tương lai.
- Cross-attention: một chuỗi chú ý sang chuỗi khác, ví dụ mô hình tạo ảnh để prompt văn bản dẫn dắt quá trình vẽ.
Một mô hình ngôn ngữ lớn xếp chồng hàng chục lớp attention. Lớp đầu nắm quan hệ gần, lớp sau nắm ý nghĩa trừu tượng hơn.
Attention khác cách AI đọc văn bản trước đây thế nào
Trước Transformer, mô hình ngôn ngữ phổ biến là RNN và LSTM, đọc lần lượt từng từ và truyền “trí nhớ” qua từng bước. Cách đó gặp vấn đề quên thông tin ở xa và khó tính song song.
Ví dụ: khi dịch một email dài, RNN có thể quên chủ ngữ ở câu đầu khi đến câu thứ mười, dẫn tới dịch sai giới tính, số ít số nhiều. Attention cho phép từ ở câu thứ mười tra lại trực tiếp câu đầu. Đổi lại, attention tốn tài nguyên hơn khi văn bản rất dài, như bảng dưới cho thấy. Hiện nay vẫn có các hướng nghiên cứu kết hợp ưu điểm của cả hai, như mô hình không gian trạng thái (state space model), nhưng Transformer với attention vẫn là kiến trúc phổ biến nhất trong các sản phẩm doanh nghiệp đang dùng.
| Tiêu chí | RNN/LSTM | Self-attention (Transformer) |
|---|---|---|
| Cách đọc | Tuần tự từng từ | Mọi từ nhìn nhau cùng lúc |
| Nhớ ngữ cảnh xa | Yếu dần theo khoảng cách | Truy cập trực tiếp mọi vị trí |
| Tính song song trên GPU | Hạn chế | Rất tốt khi huấn luyện |
| Chi phí theo độ dài | Tăng tuyến tính | Tăng nhanh, xấp xỉ bình phương độ dài |
| Ứng dụng hiện nay | Một số bài toán chuỗi thời gian, thiết bị nhỏ | Hầu hết LLM, mô hình đa phương thức |
Vì sao ngữ cảnh dài vẫn có giới hạn
Điểm yếu của self-attention là chi phí: mỗi token so với mọi token khác, nên số phép so sánh tăng xấp xỉ theo bình phương độ dài. Gấp đôi độ dài văn bản, phần tính attention có thể tăng khoảng bốn lần. Bộ nhớ lưu kết quả trung gian (KV cache) cũng tăng theo độ dài ngữ cảnh.
Các nhà phát triển dùng nhiều kỹ thuật để giảm gánh nặng: FlashAttention tối ưu cách đọc ghi bộ nhớ GPU, sliding window attention chỉ nhìn một khung gần, grouped-query attention chia sẻ key và value giữa các đầu. Nhờ vậy cửa sổ ngữ cảnh của nhiều mô hình đã lên hàng trăm nghìn token.
Ý nghĩa với người chạy AI cục bộ
Khi chạy mô hình bằng Ollama hay LM Studio, tăng độ dài ngữ cảnh sẽ tăng VRAM cần dùng, có thể thêm vài GB tùy mô hình và cài đặt. Máy 12 GB VRAM chạy mô hình 8B lượng tử hóa thoải mái với ngữ cảnh ngắn có thể bị tràn sang RAM và chậm hẳn khi đặt ngữ cảnh rất dài. Đây là lý do cấu hình máy AI cần tính cả độ dài tài liệu bạn định đưa vào.
Hiện tượng “lạc giữa chừng” và cách viết prompt cho phù hợp
Có ngữ cảnh dài không có nghĩa mô hình chú ý đều mọi chỗ. Nhiều nghiên cứu ghi nhận hiện tượng “lost in the middle”: thông tin ở đầu và cuối ngữ cảnh thường được dùng tốt hơn thông tin nằm giữa một tài liệu rất dài. Mức độ khác nhau giữa các mô hình và đang được cải thiện.
Áp dụng vào công việc hằng ngày:
- Đặt yêu cầu chính ở cuối sau khi dán tài liệu, hoặc nhắc lại ngắn gọn ở cuối.
- Dùng tiêu đề, nhãn rõ ràng như “TÀI LIỆU 1: Hợp đồng”, “TÀI LIỆU 2: Phụ lục” để mô hình định vị.
- Chỉ đưa phần liên quan: thay vì dán cả sổ tay nhân sự 80 trang, trích chương về nghỉ phép.
- Yêu cầu trích dẫn: “ghi rõ thông tin lấy từ mục nào” để kiểm tra mô hình có chú ý đúng chỗ.
- Dùng RAG khi kho tài liệu lớn: hệ thống tìm đoạn liên quan trước, rồi mới đưa vào ngữ cảnh.
Hiểu lầm thường gặp về attention
- “Attention là AI hiểu như người”: attention là phép tính tỷ trọng thống kê. Nó giúp mô hình bắt quan hệ rất tốt nhưng không đảm bảo hiểu đúng ý định hay sự thật.
- “Bản đồ attention giải thích được vì sao AI trả lời như vậy”: trực quan hóa attention có ích cho nghiên cứu nhưng không phải lời giải thích đầy đủ về quyết định của mô hình.
- “Ngữ cảnh càng dài càng tốt”: nhồi nhiều tài liệu không liên quan làm loãng sự chú ý, tăng chi phí và độ trễ.
- “Attention chỉ dùng cho văn bản”: mô hình thị giác (Vision Transformer), mô hình giọng nói và tạo ảnh đều dùng attention.
Khi nào người dùng doanh nghiệp không cần đào sâu
Nếu bạn chỉ dùng chatbot để soạn email, tóm tắt cuộc họp, bạn không cần hiểu công thức. Chỉ cần nhớ hai nguyên tắc: đưa ngữ cảnh đủ và gọn, đặt yêu cầu rõ ở cuối.
Attention liên quan gì đến lựa chọn mô hình và phần cứng
Với người ra quyết định, hiểu attention giúp đặt đúng câu hỏi khi chọn giải pháp:
- Cần đọc tài liệu dài bao nhiêu? Hợp đồng vài trang khác hẳn bộ hồ sơ thầu hàng trăm trang. Câu trả lời quyết định nên dùng ngữ cảnh dài hay RAG.
- Bao nhiêu người dùng đồng thời? Mỗi phiên giữ KV cache riêng trong bộ nhớ GPU, nên server phục vụ 20 người cần nhiều VRAM hơn máy cá nhân.
- Cần tốc độ phản hồi ra sao? Ngữ cảnh dài làm thời gian đến token đầu tiên lâu hơn.
- Phần mềm phục vụ có tối ưu attention không? Các công cụ như vLLM, llama.cpp tích hợp nhiều kỹ thuật tối ưu; phiên bản và cấu hình ảnh hưởng đáng kể đến hiệu năng.
Khi lập kế hoạch máy chủ AI nội bộ cho văn phòng, hãy mô tả tình huống sử dụng thật (độ dài tài liệu, số người, thời gian chờ chấp nhận được) để người tư vấn tính đúng dung lượng VRAM thay vì chỉ nhìn số tham số mô hình.
Khi dán tài liệu dài vào chatbot, hãy gắn nhãn từng phần và nhắc lại câu hỏi chính ở cuối prompt; đây là cách đơn giản nhất để tận dụng cơ chế attention mà không cần biết công thức.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Attention và Transformer khác nhau thế nào?
Attention là một cơ chế tính toán, còn Transformer là kiến trúc mô hình hoàn chỉnh dùng attention làm thành phần chính, kèm các lớp khác như mạng truyền thẳng và chuẩn hóa.
Vì sao gọi là “Attention Is All You Need”?
Đó là tên bài báo năm 2017 giới thiệu Transformer, nhấn mạnh rằng chỉ dùng attention, bỏ mạng hồi quy, vẫn đạt kết quả tốt hơn trong dịch máy.
Cửa sổ ngữ cảnh dài có làm AI chậm hơn không?
Có. Ngữ cảnh càng dài, phần tính attention và bộ nhớ KV cache càng lớn, nên thời gian phản hồi và chi phí tăng.
Attention có giúp AI bớt bịa thông tin không?
Attention giúp mô hình dùng ngữ cảnh tốt hơn, nhưng không ngăn được hallucination. Cần cung cấp nguồn đúng, yêu cầu trích dẫn và kiểm chứng kết quả.
Chạy AI cục bộ, tăng context length có tốn thêm VRAM không?
Có. KV cache tăng theo độ dài ngữ cảnh, có thể cần thêm vài GB tùy mô hình. Nếu thiếu VRAM, phần mềm sẽ chạy chậm hẳn hoặc báo lỗi.
Mô hình tạo ảnh có dùng attention không?
Có. Mô hình tạo ảnh dùng cross-attention để prompt văn bản dẫn dắt từng bước tạo ảnh, và nhiều mô hình mới dùng hẳn kiến trúc transformer.
Bài viết liên quan
- Transformer là gì? Kiến trúc đứng sau ChatGPT, Gemini, Claude
- Context window (cửa sổ ngữ cảnh) là gì? Ảnh hưởng gì khi dùng AI
- LLM là gì? Giải thích cho người không chuyên
- Tokenizer là gì? Vì sao tiếng Việt tốn nhiều token hơn
- Cần bao nhiêu VRAM để chạy LLM 7B, 14B, 32B, 70B?
- Mạng nơ-ron nhân tạo là gì? Hình dung đơn giản
- RAG là gì? Cho AI đọc tài liệu nội bộ