Batch API là cách gọi mô hình AI theo lô: bạn gom nhiều yêu cầu vào một tệp, gửi lên một lần và nhận kết quả sau một khoảng thời gian, thường trong vòng 24 giờ theo cam kết của nhà cung cấp. Đổi lại việc không cần phản hồi tức thì, yêu cầu theo lô được tính giá thấp hơn đáng kể so với gọi đồng bộ và ít bị giới hạn tốc độ hơn. Batch API phù hợp với phân loại dữ liệu, trích xuất thông tin, dịch, viết mô tả sản phẩm số lượng lớn; không phù hợp với chatbot hay bất kỳ việc nào khách đang chờ.
Batch API là gì
Batch API là chế độ gọi mô hình AI bất đồng bộ theo lô. Thay vì gửi từng câu hỏi và chờ câu trả lời ngay, bạn chuẩn bị một danh sách hàng trăm đến hàng chục nghìn yêu cầu, gửi lên nhà cung cấp, rồi quay lại lấy kết quả khi hoàn tất.
Có thể so sánh với hai cách gửi hàng: chuyển phát hỏa tốc và chuyển phát tiết kiệm. Hỏa tốc đến ngay trong ngày nhưng đắt; tiết kiệm đến chậm hơn vài ngày nhưng rẻ hơn. Với nhà cung cấp AI, yêu cầu theo lô cho họ tự do xếp lịch xử lý vào lúc hệ thống rảnh, nên họ có thể giảm giá.
Một số điểm chung của Batch API ở các nhà cung cấp lớn, tại thời điểm viết:
- Đầu vào thường là một tệp JSONL, mỗi dòng là một yêu cầu hoàn chỉnh kèm mã định danh do bạn đặt.
- Có cửa sổ hoàn thành tối đa, phổ biến là 24 giờ, nhiều lô xong sớm hơn.
- Giá thấp hơn đáng kể so với gọi thường; mức giảm cụ thể xem bảng giá hiện hành.
- Giới hạn tốc độ tách riêng, không chiếm hạn mức của ứng dụng đang chạy trực tiếp.
Batch API khác gọi API thông thường thế nào
Gọi API thông thường (đồng bộ) phù hợp khi có người đang chờ. Batch API phù hợp khi chỉ có hệ thống chờ. Bảng dưới tóm tắt khác biệt để bạn chọn đúng chế độ cho từng việc.
| Tiêu chí | Gọi đồng bộ | Batch API |
|---|---|---|
| Thời gian nhận kết quả | Vài giây | Vài phút đến tối đa theo cam kết, thường 24 giờ |
| Chi phí mỗi token | Giá chuẩn | Thấp hơn đáng kể |
| Giới hạn tốc độ | Chia sẻ với mọi tính năng | Hạn mức riêng, thường rộng hơn |
| Cách gửi | Từng yêu cầu | Tệp gồm nhiều yêu cầu |
| Xử lý lỗi | Thử lại ngay | Đọc tệp lỗi, gửi lại lô mới |
| Phù hợp | Chatbot, trợ lý, voice bot | Phân loại, trích xuất, viết hàng loạt |
Doanh nghiệp dùng Batch API vào việc gì
Mọi việc có số lượng lớn, đầu vào sẵn có và không gấp đều là ứng viên tốt. Một vài ví dụ thực tế với doanh nghiệp Việt Nam:
- Shop online 2.000 sản phẩm: viết lại mô tả chuẩn SEO, tạo thẻ tiêu đề, gợi ý từ khóa cho toàn bộ danh mục trong một đêm.
- Phòng chăm sóc khách hàng: phân loại 10.000 tin nhắn cũ theo chủ đề và mức độ hài lòng để tìm vấn đề lặp lại.
- Văn phòng kế toán: trích xuất số hóa đơn, mã số thuế, tổng tiền từ văn bản OCR của hàng nghìn chứng từ, rồi đưa vào bảng tính để kế toán đối chiếu.
- Phòng nhân sự: tóm tắt và chấm sơ bộ hồ sơ ứng viên theo tiêu chí có sẵn, nhân sự xem lại danh sách rút gọn.
- Đội nội dung: dịch bộ tài liệu hướng dẫn sản phẩm sang tiếng Anh.
- Đánh giá chất lượng AI: chạy bộ evals hàng nghìn câu hỏi mỗi khi đổi prompt.
Khi nào KHÔNG nên dùng
Không dùng cho bất cứ việc nào có người chờ: trả lời khách trên Zalo, hỗ trợ nhân viên trực tiếp. Cũng không nên dùng khi chỉ có vài chục yêu cầu, vì công sức chuẩn bị tệp lớn hơn phần tiết kiệm được.
Các bước sử dụng Batch API
Chuẩn bị
- Tài khoản API với quyền dùng Batch, API key được bảo mật.
- Dữ liệu đầu vào đã làm sạch, mỗi bản ghi có mã định danh riêng.
- Prompt đã thử nghiệm kỹ ở chế độ đồng bộ với 20–50 mẫu.
Các bước
- Tạo tệp JSONL: mỗi dòng một yêu cầu, ghi mô hình, prompt, tham số và mã định danh như
sp-00125. - Tải tệp lên theo hướng dẫn của nhà cung cấp.
- Tạo lô xử lý trỏ tới tệp vừa tải, nhận về mã lô.
- Theo dõi trạng thái định kỳ: đang xử lý, hoàn thành, thất bại, hết hạn.
- Tải tệp kết quả và tệp lỗi khi lô hoàn thành.
- Ghép kết quả về dữ liệu gốc theo mã định danh, không dựa vào thứ tự dòng vì kết quả có thể không cùng thứ tự với đầu vào.
- Gửi lại các yêu cầu lỗi trong một lô mới.
Với người không lập trình, có thể làm phần lớn các bước bằng một kịch bản Python ngắn do đội IT viết sẵn, hoặc tích hợp vào n8n bằng các nút gọi HTTP.
Kiểm tra kết quả và kiểm soát chất lượng
Xử lý hàng loạt nghĩa là lỗi cũng hàng loạt. Một prompt sai có thể tạo ra 5.000 kết quả sai trong một đêm. Áp dụng các chốt kiểm tra sau:
- Chạy lô thử nhỏ: 50–100 yêu cầu trước khi gửi toàn bộ.
- Ép định dạng đầu ra: yêu cầu JSON theo cấu trúc cố định hoặc dùng tính năng structured output nếu có, để dễ kiểm tra tự động.
- Kiểm tra tự động: trường bắt buộc có đủ không, giá trị có nằm trong danh sách cho phép không, độ dài có hợp lý không.
- Lấy mẫu kiểm tra thủ công: người phụ trách đọc ngẫu nhiên 2–5% kết quả.
- Không ghi đè dữ liệu gốc: lưu kết quả vào cột hoặc bảng mới, duyệt xong mới cập nhật.
Chỉ số nên theo dõi
- Tỷ lệ yêu cầu thành công trên tổng số.
- Tỷ lệ kết quả đạt kiểm tra tự động.
- Tỷ lệ lỗi phát hiện khi lấy mẫu thủ công.
- Chi phí mỗi bản ghi so với gọi đồng bộ hoặc làm tay.
Lỗi thường gặp với Batch API
- Ghép kết quả theo thứ tự dòng: kết quả trả về có thể lệch thứ tự, phải ghép theo mã định danh.
- Mã định danh trùng nhau: làm mất hoặc lẫn kết quả.
- Vượt giới hạn kích thước tệp hoặc số yêu cầu mỗi lô: cần chia thành nhiều lô.
- Hứa hẹn thời hạn cho người khác dựa trên tốc độ lô trước: thời gian hoàn thành dao động, chỉ nên dựa vào cửa sổ cam kết tối đa.
- Quên xử lý tệp lỗi: vài phần trăm yêu cầu thất bại bị bỏ sót, dữ liệu thiếu mà không ai biết.
- Đưa dữ liệu nhạy cảm không cần thiết: chỉ gửi trường cần cho tác vụ; ẩn số điện thoại, số tài khoản nếu không cần.
- Bỏ qua prompt caching: nếu các yêu cầu có chung hướng dẫn dài, một số nhà cung cấp cho phép kết hợp hai cơ chế để giảm thêm chi phí; kiểm tra tài liệu.
Cuối cùng, hãy lưu lại tệp đầu vào, tệp kết quả và phiên bản prompt của mỗi lô. Khi có thắc mắc về một kết quả cụ thể, bạn truy lại được chính xác điều gì đã được gửi đi.
Hãy rà lại danh sách việc AI đang chạy ở chế độ đồng bộ và hỏi: có ai thật sự đang chờ kết quả này không? Những việc trả lời 'không' là ứng viên đầu tiên để chuyển sang Batch API.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Batch API rẻ hơn bao nhiêu so với gọi thường?
Mức giảm khác nhau giữa các nhà cung cấp và có thể thay đổi. Hãy xem bảng giá hiện hành của từng hãng để tính toán chính xác cho khối lượng của bạn.
Batch API mất bao lâu để có kết quả?
Nhà cung cấp thường cam kết hoàn thành trong một cửa sổ tối đa, phổ biến là 24 giờ. Thực tế nhiều lô nhỏ xong sớm hơn nhiều, nhưng không nên dựa vào điều đó.
Chất lượng câu trả lời qua Batch API có kém hơn không?
Không. Cùng mô hình, cùng prompt và tham số thì chất lượng tương đương gọi đồng bộ; chỉ khác thời điểm xử lý và giá.
Không biết lập trình có dùng Batch API được không?
Khó dùng trực tiếp vì cần tạo tệp JSONL và gọi API. Cách thực tế là nhờ đội IT viết sẵn kịch bản hoặc dựng workflow để nhân viên chỉ cần đưa vào bảng tính.
Hủy lô đang chạy được không?
Thường có thể hủy, và các yêu cầu đã hoàn thành trước khi hủy vẫn có kết quả. Cách tính phí khi hủy xem trong tài liệu nhà cung cấp.
Batch API có dùng được với mô hình chạy cục bộ không?
Khái niệm tương tự có thể làm bằng cách xếp hàng đợi và chạy ban đêm trên máy chủ nội bộ. Các công cụ như vLLM có chế độ suy luận theo lô hiệu quả cho việc này.
Bài viết liên quan
- Prompt caching là gì? Cách giảm chi phí và độ trễ API AI
- Ước tính chi phí API AI: cách tính token và kiểm soát ngân sách
- API AI là gì? Cách doanh nghiệp gọi mô hình AI qua API và tính phí
- Độ trễ và thông lượng AI là gì? Đọc thông số thế nào cho đúng
- Token trong AI là gì? Vì sao AI tính phí theo token
- Evals là gì? Đánh giá chất lượng ứng dụng AI
- Zapier, Make và n8n: so sánh
- Bảo mật API key AI: lỗi thường gặp và cách khắc phục