Chi phí API AI thường tính theo số token đầu vào (prompt, tài liệu, lịch sử) và token đầu ra (câu trả lời), với đơn giá khác nhau theo mô hình; token đầu ra thường đắt hơn đầu vào. Công thức ước tính: chi phí mỗi lần gọi = token vào × đơn giá vào + token ra × đơn giá ra; chi phí tháng = chi phí mỗi lần × số lần gọi. Với tiếng Việt, số token thường nhiều hơn tiếng Anh cho cùng nội dung. Giảm chi phí bằng cách chọn mô hình vừa đủ cho từng bước, rút gọn ngữ cảnh, dùng prompt caching, xử lý theo lô, giới hạn độ dài đầu ra, và đặt hạn mức chi tiêu, cảnh báo trên tài khoản.
Hiểu token
Token là đơn vị văn bản mà mô hình xử lý, có thể là một từ, một phần từ hoặc dấu câu. Tiếng Việt có dấu thường tạo nhiều token hơn tiếng Anh cho cùng ý nghĩa, tùy bộ tách từ của mô hình. Mỗi nhà cung cấp có công cụ đếm token để ước tính chính xác hơn.
Các yếu tố ảnh hưởng chi phí
Yếu tố chính và cách tối ưu.
| Yếu tố | Ảnh hưởng | Cách tối ưu |
|---|---|---|
| Mô hình | Mô hình mạnh đắt hơn nhiều | Mô hình nhỏ cho việc đơn giản |
| Ngữ cảnh đầu vào | System prompt, tài liệu, lịch sử | Rút gọn, chỉ đưa phần liên quan |
| Độ dài đầu ra | Token ra thường đắt hơn | Giới hạn độ dài, định dạng gọn |
| Số lần gọi | Agent nhiều bước tốn hơn | Workflow cố định khi có thể |
| Nội dung lặp lại | System prompt dài mỗi lần gọi | Prompt caching |
| Thời gian thực | Gọi đồng bộ | Batch API cho việc không gấp |
Cách ước tính cho một ứng dụng
- Lấy 20 mẫu thật, đếm token vào và ra bằng công cụ của nhà cung cấp.
- Tính trung bình token mỗi lần gọi.
- Nhân đơn giá hiện hành của mô hình dự định dùng.
- Nhân số lần gọi dự kiến mỗi tháng, cộng dự phòng cho lần thử lại.
- Chạy thử một tuần, so sánh chi phí thực với ước tính.
Kiểm soát ngân sách
- Đặt hạn mức chi tiêu và cảnh báo trên bảng điều khiển nhà cung cấp.
- Giới hạn số lượt mỗi người dùng chatbot để tránh lạm dụng.
- Giới hạn số bước tối đa cho agent.
- Theo dõi chi phí theo ứng dụng, theo ngày.
- Bảo vệ khóa API để tránh bị lợi dụng.
Lưu ý về đơn giá
Đơn giá API thay đổi thường xuyên và thường có xu hướng giảm theo thời gian với cùng mức năng lực. Luôn kiểm tra bảng giá hiện hành trên trang chính thức của nhà cung cấp trước khi ước tính, và xem lại lựa chọn mô hình định kỳ.
Hãy bắt đầu với mô hình rẻ nhất có thể cho mỗi bước, chỉ nâng lên mô hình mạnh hơn ở bước mà chất lượng chưa đạt. Cách này thường giảm chi phí đáng kể so với dùng mô hình mạnh nhất cho mọi việc.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Gói ChatGPT Plus có bao gồm API không?
Không; API là dịch vụ riêng tính phí theo lượng sử dụng.
Chatbot website tốn bao nhiêu?
Phụ thuộc lượng hội thoại, độ dài, mô hình; ước tính bằng cách đo mẫu thật.
Mô hình mã nguồn mở có rẻ hơn?
Không tốn phí API nhưng có chi phí máy chủ, GPU và vận hành.
Prompt caching là gì?
Tính năng lưu phần prompt lặp lại để giảm chi phí và độ trễ cho các lần gọi sau.
Bài viết liên quan
- Token trong AI là gì? Vì sao AI tính phí theo token
- API AI là gì? Cách doanh nghiệp gọi mô hình AI qua API và tính phí
- Chi phí triển khai AI cho doanh nghiệp nhỏ gồm những khoản nào
- Context window (cửa sổ ngữ cảnh) là gì? Ảnh hưởng gì khi dùng AI
- Small Language Model (SLM) là gì? Mô hình AI nhỏ chạy được trên máy
- AI Automation có đáng đầu tư không? Cách ước tính lợi ích