Evals (viết tắt của evaluations) là bộ bài kiểm tra có hệ thống dùng để đo chất lượng một ứng dụng AI cụ thể, như chatbot chăm sóc khách hàng, trợ lý đọc tài liệu nội bộ hay quy trình trích xuất hóa đơn. Một bộ evals gồm danh sách đầu vào mẫu, kết quả mong đợi hoặc tiêu chí chấm, và cách chấm (so khớp tự động, người chấm hoặc dùng một mô hình AI chấm). Khác benchmark công khai đo năng lực chung của mô hình, evals đo đúng việc của bạn. Có evals, mỗi lần đổi prompt hay mô hình bạn chạy lại và biết ngay kết quả tốt hơn hay kém đi.
Evals là gì và vì sao ứng dụng AI cần nó
Evals là quy trình và bộ dữ liệu dùng để đánh giá định kỳ đầu ra của hệ thống AI theo tiêu chí đã thống nhất. Hãy hình dung nó như bộ đề kiểm tra cố định cho nhân viên mới: cùng một bộ câu hỏi, chấm theo cùng thang điểm, để so sánh trước và sau đào tạo.
Phần mềm truyền thống có kiểm thử: nhập A thì phải ra B. Ứng dụng AI khó hơn vì:
- Đầu ra không cố định: cùng câu hỏi, mỗi lần trả lời một kiểu.
- Nhiều câu trả lời đúng: “Shop mở cửa 8 giờ sáng” và “Dạ, 8h sáng shop mở ạ” đều đúng.
- Thay đổi nhỏ, ảnh hưởng lớn: sửa một câu trong prompt hệ thống có thể làm chatbot trả lời tốt hơn ở câu hỏi giá nhưng tệ hơn ở câu hỏi bảo hành.
- Mô hình được nhà cung cấp cập nhật: phiên bản mới có thể hành xử khác.
Không có evals, đội ngũ thường thử năm bảy câu, thấy “có vẻ ổn” rồi triển khai. Lỗi chỉ lộ ra khi khách hàng phàn nàn. Evals biến cảm giác “có vẻ ổn” thành con số theo dõi được.
Evals khác benchmark mô hình như thế nào
Nhiều người nhầm evals với các bảng xếp hạng mô hình AI. Thực ra chúng phục vụ hai câu hỏi khác nhau: benchmark trả lời “mô hình nào giỏi chung chung hơn”, evals trả lời “hệ thống của tôi có làm tốt việc của tôi không”.
Một mô hình đứng đầu benchmark toán học chưa chắc trả lời đúng chính sách đổi trả của cửa hàng bạn. Vì vậy benchmark dùng để chọn danh sách ứng viên, còn evals dùng để quyết định cuối cùng và theo dõi lâu dài.
| Tiêu chí | Benchmark công khai | Evals của doanh nghiệp |
|---|---|---|
| Mục đích | So sánh năng lực chung giữa mô hình | Đo chất lượng ứng dụng cụ thể |
| Dữ liệu | Bộ đề chuẩn, công khai | Câu hỏi, tài liệu thật của công ty |
| Người xây | Nhà nghiên cứu, tổ chức | Đội dự án cùng người làm nghiệp vụ |
| Đối tượng đo | Mô hình đơn lẻ | Cả hệ thống: prompt, RAG, công cụ, mô hình |
| Tần suất | Khi có mô hình mới | Mỗi lần thay đổi và định kỳ |
Thành phần của một bộ evals
Một bộ evals tối thiểu có bốn phần:
- Bộ ca kiểm thử (test cases): danh sách đầu vào đại diện cho tình huống thật. Với chatbot, đó là câu hỏi khách hàng; với trích xuất hóa đơn, đó là file hóa đơn mẫu.
- Kết quả mong đợi hoặc tiêu chí: có thể là đáp án chính xác (mã số thuế, tổng tiền), hoặc tiêu chí mô tả (“phải nhắc khách mang hóa đơn khi bảo hành”, “không hứa giao trong ngày”).
- Cách chấm: tự động, bằng người, hoặc bằng mô hình AI làm giám khảo.
- Báo cáo: tỷ lệ đạt theo từng nhóm câu hỏi, so với lần chạy trước.
Nên phân nhóm ca kiểm thử
- Câu hỏi thường gặp, chiếm phần lớn lưu lượng.
- Câu hỏi khó, nhiều điều kiện.
- Câu hỏi ngoài phạm vi, AI phải từ chối lịch sự hoặc chuyển người.
- Câu hỏi cố tình phá, như yêu cầu bỏ qua hướng dẫn, hỏi thông tin khách khác.
Phân nhóm giúp bạn thấy hệ thống yếu ở đâu thay vì chỉ có một con số trung bình.
Ba cách chấm điểm: tự động, con người và LLM làm giám khảo
Mỗi cách chấm có điểm mạnh riêng; bộ evals tốt thường kết hợp cả ba.
Chấm tự động bằng quy tắc
Dùng khi đáp án rõ ràng: so khớp số tiền, kiểm tra JSON đúng cấu trúc, câu trả lời có chứa số hotline, độ dài không quá 100 từ. Nhanh, rẻ, khách quan.
Người chấm
Dùng cho tiêu chí tinh tế: giọng văn có lịch sự không, có đúng tinh thần chính sách không. Người chấm nên là nhân viên nghiệp vụ, như trưởng nhóm chăm sóc khách hàng, kế toán trưởng. Chậm và tốn công, nên dùng cho mẫu nhỏ.
LLM làm giám khảo (LLM-as-a-judge)
Dùng một mô hình AI chấm câu trả lời theo thang điểm và tiêu chí bạn viết sẵn, ví dụ: Chấm 1–5: câu trả lời có đúng với {chính sách} không, có bịa thông tin không có trong {tài liệu} không. Giải thích ngắn rồi cho điểm.
Cách này mở rộng được cho hàng trăm ca, nhưng giám khảo AI cũng có thể sai hoặc thiên vị câu dài. Hãy định kỳ lấy 20–30 ca để người chấm song song, kiểm tra mức đồng thuận giữa người và máy.
Hướng dẫn xây bộ evals đầu tiên trong một tuần
Ví dụ: công ty phân phối thiết bị văn phòng 30 người đang thử chatbot trả lời khách về sản phẩm, giao hàng, bảo hành.
Chuẩn bị
- Lịch sử tin nhắn Zalo, Facebook, email khách hàng 2–3 tháng gần nhất (đã ẩn thông tin cá nhân).
- Tài liệu chính sách hiện hành.
- Một người nghiệp vụ dành vài giờ chấm mẫu.
Các bước
- Chọn 50–100 câu hỏi thật, phân nhóm như phần trên.
- Với mỗi câu, ghi tiêu chí đạt: thông tin bắt buộc có, điều cấm nói.
- Đưa toàn bộ vào bảng tính: cột câu hỏi, nhóm, tiêu chí, câu trả lời AI, điểm, ghi chú.
- Chạy chatbot với toàn bộ câu hỏi, dán câu trả lời vào bảng (hoặc dùng script, n8n để tự động).
- Chấm: quy tắc tự động trước, giám khảo AI sau, người kiểm tra mẫu.
- Tổng hợp tỷ lệ đạt theo nhóm, ghi lại làm mốc ban đầu.
Kiểm tra kết quả
Đọc kỹ các ca trượt, phân loại nguyên nhân: thiếu tài liệu, prompt mơ hồ, mô hình bịa, câu hỏi quá khó. Mỗi nguyên nhân có cách sửa khác nhau.
Chỉ số nên theo dõi cho từng loại ứng dụng AI
Không có một chỉ số dùng chung. Chọn chỉ số theo loại ứng dụng:
- Chatbot chăm sóc khách hàng: tỷ lệ trả lời đúng chính sách, tỷ lệ chuyển người đúng lúc, tỷ lệ bịa thông tin, giọng văn phù hợp.
- Trợ lý đọc tài liệu (RAG): tìm đúng đoạn tài liệu không (độ chính xác truy xuất), câu trả lời có bám tài liệu không (faithfulness), có trích dẫn đúng nguồn không.
- Trích xuất dữ liệu (hóa đơn, CV, hợp đồng): độ chính xác từng trường, tỷ lệ file xử lý hoàn toàn đúng, tỷ lệ JSON hợp lệ.
- Phân loại email, ticket: tỷ lệ phân loại đúng, nhầm lẫn giữa các nhóm.
- Viết nội dung: đúng giọng thương hiệu, không sai thông tin sản phẩm, đúng độ dài, không lặp ý.
Bên cạnh chất lượng, nên ghi kèm độ trễ và số token mỗi ca để thấy đánh đổi: phiên bản prompt mới đúng hơn 3% nhưng tốn gấp đôi token có đáng không là quyết định kinh doanh, và evals cho bạn số liệu để quyết định.
Lỗi thường gặp khi làm evals
- Bộ câu hỏi quá dễ: chỉ toàn câu mẫu đội dự án tự nghĩ, không có câu khách hỏi thật, sai chính tả, viết tắt kiểu “sp nay con hok shop”.
- Chỉ nhìn điểm trung bình: 90% đạt nhưng 10% trượt đều rơi vào câu hỏi về hoàn tiền, nhóm rủi ro nhất.
- Dùng chính mô hình đang đánh giá làm giám khảo mà không đối chiếu với người, dễ “tự chấm cho mình”.
- Không cập nhật bộ evals: chính sách đổi, sản phẩm mới, nhưng tiêu chí chấm vẫn cũ.
- Tối ưu quá mức cho bộ evals: sửa prompt chỉ để qua đúng 50 câu kiểm tra, trong khi câu hỏi thật đa dạng hơn. Nên giữ một phần câu hỏi “ẩn” không dùng khi chỉnh prompt.
- Đưa dữ liệu khách hàng thật vào công cụ bên ngoài mà chưa ẩn danh.
Khi nào chưa cần evals phức tạp
Nếu AI chỉ hỗ trợ cá nhân soạn nháp và người dùng luôn đọc lại, một danh sách 10–20 câu thử nhanh là đủ. Evals bài bản cần thiết khi AI trả lời trực tiếp khách hàng hoặc xử lý dữ liệu tự động không có người duyệt.
Đưa evals vào quy trình vận hành hằng tháng
Evals phát huy giá trị khi trở thành thói quen, không phải việc làm một lần:
- Trước mỗi thay đổi: đổi prompt, đổi mô hình, thêm tài liệu, đổi cách chia đoạn RAG đều chạy lại evals và so với mốc.
- Định kỳ hằng tháng: chạy lại kể cả khi không đổi gì, vì nhà cung cấp có thể cập nhật mô hình.
- Bổ sung ca mới từ thực tế: mỗi lần khách phàn nàn hoặc nhân viên phát hiện câu trả lời sai, thêm ca đó vào bộ evals.
- Lưu lịch sử: phiên bản prompt, mô hình, ngày chạy, kết quả, để truy vết khi chất lượng giảm.
- Phân công người chịu trách nhiệm: một người nghiệp vụ duyệt tiêu chí, một người kỹ thuật vận hành công cụ.
Công cụ có thể bắt đầu bằng Google Sheets, sau đó chuyển sang nền tảng chuyên dụng như OpenAI Evals, Promptfoo hoặc tính năng đánh giá trong LangSmith, Langfuse khi số ca lớn. Điều quan trọng là bộ câu hỏi và tiêu chí, không phải công cụ.
Mỗi lần khách hàng phàn nàn về câu trả lời của chatbot, hãy biến đúng câu hỏi đó thành một ca kiểm thử mới; sau vài tháng, bộ evals của bạn sẽ phản ánh sát nhất những điểm yếu thật của hệ thống.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Evals khác kiểm thử phần mềm thông thường thế nào?
Kiểm thử thông thường so đầu ra với một đáp án cố định. Evals cho AI phải chấp nhận nhiều cách trả lời đúng, nên thường chấm theo tiêu chí và thang điểm, có cả người hoặc AI làm giám khảo.
Cần bao nhiêu câu hỏi cho bộ evals?
Bắt đầu với 50–100 ca đại diện là đủ để thấy xu hướng. Ứng dụng quan trọng nên tăng dần lên vài trăm ca, bổ sung từ lỗi thực tế.
Có thể dùng ChatGPT hay Claude để chấm điểm không?
Có, gọi là LLM-as-a-judge. Cần viết tiêu chí rõ ràng và định kỳ so với người chấm để kiểm tra giám khảo AI có chấm lệch không.
Doanh nghiệp không có lập trình viên có làm evals được không?
Được. Có thể làm thủ công bằng Google Sheets: cột câu hỏi, tiêu chí, câu trả lời AI, điểm. Khi số ca lớn mới cần tự động hóa.
Bao lâu nên chạy lại evals?
Trước mỗi thay đổi về prompt, mô hình hoặc tài liệu, và ít nhất định kỳ hằng tháng vì nhà cung cấp có thể cập nhật mô hình.
Điểm evals cao có chắc chatbot không sai không?
Không. Evals chỉ đo trên các ca bạn đã chuẩn bị. Vẫn cần giám sát thực tế, kênh báo lỗi và người duyệt cho tình huống rủi ro.
Bài viết liên quan
- AI benchmark là gì? Đọc bảng xếp hạng mô hình AI sao cho đúng
- AI hallucination là gì? Cách giảm sai sót khi dùng AI
- Red teaming AI là gì? Kiểm thử tấn công chatbot trước khi ra mắt
- Guardrails AI là gì? Hàng rào an toàn cho chatbot doanh nghiệp
- Kiểm thử, giám sát và vận hành workflow tự động hóa
- Đo hiệu quả AI: ROI cần theo dõi những gì
- RAG là gì? Cho AI đọc tài liệu nội bộ