Context window (cửa sổ ngữ cảnh) là lượng văn bản tối đa, tính bằng token, mà mô hình AI có thể xem cùng lúc trong một lượt làm việc, gồm chỉ dẫn, tài liệu đính kèm, lịch sử trò chuyện và cả câu trả lời. Vượt quá giới hạn thì phần cũ bị cắt hoặc yêu cầu bị từ chối. Cửa sổ lớn giúp đọc tài liệu dài, nhưng không bảo đảm mô hình chú ý đều mọi chi tiết.
Cửa sổ ngữ cảnh giống trí nhớ làm việc
Hãy hình dung AI như một người chỉ được nhìn vào một chiếc bàn có kích thước cố định. Mọi thứ cần cho công việc, gồm yêu cầu của bạn, tài liệu, các tin nhắn trước đó, phải nằm trên bàn. Bàn đầy thì phải dọn bớt giấy cũ. Đó là lý do trong cuộc trò chuyện rất dài, AI có thể “quên” những gì bạn dặn từ đầu.
Mô hình không có trí nhớ dài hạn giữa các cuộc trò chuyện, trừ khi sản phẩm có tính năng ghi nhớ riêng, thực chất là lưu thông tin rồi đưa lại vào cửa sổ ngữ cảnh.
Lớn hơn có luôn tốt hơn
Các mô hình hiện nay có cửa sổ ngữ cảnh từ vài chục nghìn đến hàng trăm nghìn token, một số còn lớn hơn. Tuy vậy, nhiều thử nghiệm cho thấy mô hình có thể bỏ sót chi tiết nằm giữa tài liệu dài. Ngoài ra, đưa càng nhiều nội dung thì chi phí và thời gian trả lời càng tăng.
| Tình huống | Cách phù hợp |
|---|---|
| Tóm tắt một báo cáo dài | Đưa cả tài liệu, yêu cầu tóm tắt theo từng phần |
| Hỏi đáp trên kho hàng trăm tài liệu | Dùng RAG để chỉ đưa đoạn liên quan |
| So sánh hai hợp đồng | Đưa cả hai, chỉ rõ các điều khoản cần so |
| Trò chuyện kéo dài nhiều ngày | Tóm tắt định kỳ, mở cuộc trò chuyện mới kèm bản tóm tắt |
Dấu hiệu bạn đã chạm giới hạn
- AI quên quy định đã dặn từ đầu cuộc trò chuyện.
- Câu trả lời bỏ qua phần cuối của tài liệu.
- Công cụ báo lỗi tài liệu quá dài hoặc tự cắt bớt.
- Kết quả kém dần khi cuộc trò chuyện kéo dài.
Cách làm việc với tài liệu dài
- Đặt yêu cầu quan trọng nhất ở đầu và nhắc lại ở cuối.
- Chia tài liệu thành phần có tiêu đề, xử lý từng phần rồi tổng hợp.
- Yêu cầu AI trích dẫn đoạn nguồn để bạn kiểm tra nhanh.
- Với kho tài liệu lớn và hỏi thường xuyên, xây hệ thống RAG thay vì dán cả kho vào mỗi lần hỏi.
Ví dụ: hỏi đáp trên sổ tay nhân viên 80 trang
Cách đơn giản nhất là dán cả sổ tay vào mỗi lần hỏi. Nếu mô hình có cửa sổ đủ lớn, cách này chạy được, nhưng mỗi câu hỏi tốn token cho cả 80 trang và mô hình có thể bỏ sót điều khoản nằm giữa tài liệu. Cách tốt hơn là chia sổ tay thành từng mục, lưu vào hệ thống tìm kiếm ngữ nghĩa, mỗi câu hỏi chỉ lấy 3 đến 5 mục liên quan nhất đưa vào cửa sổ ngữ cảnh, kèm yêu cầu trích dẫn số mục.
Kết quả là câu trả lời nhanh hơn, rẻ hơn và dễ kiểm chứng. Đây chính là nguyên lý của RAG, nền tảng cho hầu hết trợ lý AI nội bộ trong doanh nghiệp.
Khi cuộc trò chuyện với AI đã dài mà kết quả bắt đầu lệch, hãy nhờ nó tóm tắt các quyết định đã chốt, rồi mở cuộc trò chuyện mới và dán bản tóm tắt vào. Kết quả thường ổn định trở lại.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Context window có phải là trí nhớ của AI không?
Gần giống trí nhớ ngắn hạn trong một lượt làm việc. Mô hình không tự nhớ giữa các phiên nếu sản phẩm không có tính năng lưu trữ riêng.
Câu trả lời có tính vào cửa sổ ngữ cảnh không?
Có. Tổng đầu vào và đầu ra phải nằm trong giới hạn, và nhiều mô hình còn có giới hạn riêng cho độ dài đầu ra.
Muốn AI đọc cả kho tài liệu công ty thì sao?
Nên dùng RAG: lưu tài liệu vào hệ thống tìm kiếm, mỗi lần hỏi chỉ lấy đoạn liên quan đưa vào cửa sổ ngữ cảnh.
Cửa sổ ngữ cảnh lớn có tốn tiền hơn không?
Khi dùng API, bạn trả tiền theo số token thực tế đưa vào, nên đưa càng nhiều nội dung thì càng tốn, bất kể cửa sổ tối đa là bao nhiêu.
Bài viết liên quan
- Token trong AI là gì? Vì sao AI tính phí theo token
- RAG là gì? Cho AI đọc tài liệu nội bộ
- Context engineering là gì? Đưa đúng thông tin cho AI
- LLM là gì? Giải thích cho người không chuyên
- Transformer là gì? Kiến trúc đứng sau ChatGPT, Gemini, Claude