Token là đơn vị văn bản nhỏ nhất mà mô hình ngôn ngữ xử lý, có thể là một từ, một phần của từ, dấu câu hoặc khoảng trắng. Mô hình đọc câu hỏi và viết câu trả lời dưới dạng chuỗi token. Giới hạn độ dài (cửa sổ ngữ cảnh) và chi phí khi gọi AI qua API đều được tính theo số token đầu vào và đầu ra.
Token trông như thế nào
Mỗi mô hình có bộ tách token (tokenizer) riêng. Với tiếng Anh, một từ phổ biến thường là một token, từ dài hoặc hiếm bị tách thành nhiều mảnh. Tiếng Việt có dấu và nhiều âm tiết nên một từ thường tốn nhiều token hơn tiếng Anh, tùy bộ tách của từng mô hình.
Ví dụ trực quan: câu “Máy in không nhận lệnh in” có thể được tách thành hơn chục token, trong khi câu tương đương bằng tiếng Anh ít token hơn. Con số cụ thể khác nhau giữa các mô hình, nên muốn chính xác cần dùng công cụ đếm token của nhà cung cấp.
Vì sao token quan trọng với doanh nghiệp
- Chi phí: dịch vụ API tính tiền theo số token đầu vào và đầu ra, thường đầu ra đắt hơn đầu vào.
- Giới hạn độ dài: mỗi mô hình chỉ xem được một số token nhất định trong một lần (cửa sổ ngữ cảnh). Tài liệu dài quá phải cắt hoặc chia nhỏ.
- Tốc độ: câu trả lời càng dài thì càng mất thời gian tạo.
- Giới hạn sử dụng: gói thuê bao và API thường giới hạn số token theo phút, ngày hoặc tháng.
Ước tính chi phí theo token
Cách ước tính đơn giản: lấy số lượt gọi dự kiến nhân với số token trung bình mỗi lượt (đầu vào cộng đầu ra), rồi nhân với đơn giá của mô hình. Bảng giá thay đổi thường xuyên nên luôn lấy số liệu từ trang giá chính thức của nhà cung cấp tại thời điểm tính.
| Yếu tố | Ví dụ | Cách giảm |
|---|---|---|
| Chỉ dẫn hệ thống dài | Quy định trả lời dài vài trang | Rút gọn, bỏ phần lặp |
| Tài liệu đính kèm | Đưa cả hợp đồng 50 trang | Chỉ đưa đoạn liên quan (RAG) |
| Lịch sử hội thoại | Giữ toàn bộ cuộc trò chuyện | Tóm tắt lịch sử cũ |
| Câu trả lời dài | Yêu cầu giải thích chi tiết | Giới hạn độ dài, yêu cầu định dạng ngắn |
Mẹo tiết kiệm token
- Chọn mô hình nhỏ, rẻ cho việc đơn giản như phân loại, trích xuất; dành mô hình lớn cho việc khó.
- Dùng tính năng lưu đệm prompt (prompt caching) nếu nhà cung cấp hỗ trợ, khi phần chỉ dẫn lặp lại nhiều lần.
- Chỉ gửi phần tài liệu liên quan thay vì toàn bộ.
- Yêu cầu đầu ra có cấu trúc ngắn gọn như JSON hoặc bảng.
- Theo dõi số token theo từng tính năng để phát hiện chỗ tốn kém bất thường.
Token và chất lượng tiếng Việt
Vì tiếng Việt thường bị tách thành nhiều token hơn, cùng một lượng nội dung sẽ chiếm nhiều chỗ hơn trong cửa sổ ngữ cảnh và tốn chi phí hơn khi gọi API. Các mô hình mới có xu hướng cải thiện bộ tách token cho nhiều ngôn ngữ, nên chênh lệch đang giảm, nhưng vẫn nên đo thực tế với nội dung của bạn.
Một mẹo hữu ích: chỉ dẫn hệ thống (system prompt) có thể viết bằng tiếng Anh ngắn gọn nếu đội kỹ thuật quen, còn yêu cầu đầu ra là tiếng Việt. Cách này giảm token cho phần lặp lại nhiều lần mà không ảnh hưởng chất lượng câu trả lời tiếng Việt. Tuy nhiên, với chỉ dẫn về văn phong tiếng Việt, nên giữ ví dụ mẫu bằng tiếng Việt để mô hình bắt đúng giọng.
Khi thử nghiệm, hãy ghi lại số token thực tế của 20 đến 30 lượt gọi tiêu biểu. Con số trung bình đó giúp ước tính ngân sách hằng tháng sát hơn nhiều so với đoán theo số từ.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
1 token bằng bao nhiêu chữ?
Không cố định. Với tiếng Anh, nhà cung cấp thường ước lượng khoảng 4 ký tự một token. Tiếng Việt thường tốn nhiều token hơn trên cùng nội dung.
Dùng ChatGPT bản web có tính theo token không?
Gói thuê bao tính theo tháng, nhưng bên trong vẫn có giới hạn sử dụng. Tính tiền trực tiếp theo token áp dụng khi dùng qua API.
Ảnh và file PDF có tính token không?
Có. Ảnh và tài liệu được quy đổi thành token theo cách riêng của từng mô hình, nên tài liệu nhiều trang có thể tốn đáng kể.
Làm sao đếm token chính xác?
Dùng công cụ đếm token hoặc thư viện của nhà cung cấp mô hình, hoặc xem số token được trả về trong kết quả mỗi lần gọi API.
Bài viết liên quan
- Context window (cửa sổ ngữ cảnh) là gì? Ảnh hưởng gì khi dùng AI
- API AI là gì? Cách doanh nghiệp gọi mô hình AI qua API và tính phí
- Ước tính chi phí API AI: cách tính token và kiểm soát ngân sách
- LLM là gì? Giải thích cho người không chuyên
- RAG là gì? Cho AI đọc tài liệu nội bộ