Dữ liệu tổng hợp (synthetic data) là dữ liệu được tạo ra bằng thuật toán hoặc mô hình AI thay vì thu thập từ sự kiện thật, nhưng được thiết kế để có cấu trúc và đặc điểm thống kê giống dữ liệu thật. Doanh nghiệp dùng synthetic data để kiểm thử phần mềm và chatbot mà không đụng tới dữ liệu khách hàng, tạo bộ câu hỏi đánh giá, bổ sung ví dụ hiếm cho huấn luyện mô hình. Giới hạn chính là dữ liệu giả có thể sai lệch so với thực tế, khuếch đại thiên lệch và vẫn có nguy cơ làm lộ thông tin nếu sinh từ dữ liệu thật không được xử lý cẩn thận.
Synthetic data là gì và khác dữ liệu ẩn danh thế nào
Synthetic data là dữ liệu nhân tạo: các bản ghi khách hàng, đơn hàng, đoạn hội thoại, hình ảnh không tương ứng với người hay sự kiện có thật, nhưng trông và hành xử giống dữ liệu thật ở những đặc điểm cần thiết.
Cần phân biệt với dữ liệu ẩn danh. Ẩn danh là lấy dữ liệu thật rồi xóa hoặc che tên, số điện thoại, địa chỉ. Mỗi dòng vẫn tương ứng với một người thật, và việc kết hợp nhiều trường còn lại đôi khi đủ để nhận diện lại. Synthetic data thì mỗi dòng được tạo mới, không có người thật đứng sau.
Ba mức độ tổng hợp
- Dữ liệu giả theo quy tắc: sinh tên, số điện thoại, địa chỉ ngẫu nhiên theo định dạng Việt Nam để kiểm thử phần mềm. Không cần dữ liệu gốc.
- Dữ liệu mô phỏng thống kê: học phân bố từ dữ liệu thật (tỷ lệ đơn theo khu vực, giá trị trung bình) rồi sinh dữ liệu mới theo phân bố đó.
- Dữ liệu sinh bằng AI tạo sinh: dùng mô hình ngôn ngữ viết câu hỏi khách hàng, email, đoạn hội thoại; dùng mô hình ảnh tạo ảnh sản phẩm lỗi.
Doanh nghiệp dùng dữ liệu tổng hợp vào việc gì
Với doanh nghiệp nhỏ và vừa, giá trị lớn nhất của synthetic data thường không nằm ở huấn luyện mô hình lớn, mà ở kiểm thử và đánh giá.
| Tình huống | Dữ liệu tổng hợp tạo ra | Lợi ích |
|---|---|---|
| Kiểm thử phần mềm bán hàng mới | Hàng nghìn khách hàng, đơn hàng giả | Không lộ dữ liệu khách thật cho bên phát triển |
| Đánh giá chatbot trước khi ra mắt | Bộ câu hỏi đa dạng cách diễn đạt | Phát hiện câu hỏi chatbot trả lời sai |
| Đào tạo nhân viên chăm sóc khách | Kịch bản khách khó tính, khiếu nại | Luyện tập mà không cần hội thoại thật |
| Huấn luyện mô hình phân loại | Ví dụ cho nhóm hiếm như khiếu nại bảo hành đặc thù | Cân bằng dữ liệu, giảm bỏ sót |
| Demo cho đối tác | Báo cáo, dashboard với số liệu giả lập | Trình bày tính năng không lộ số liệu kinh doanh |
Cách tạo dữ liệu tổng hợp bằng AI từng bước
Ví dụ: một công ty dịch vụ IT 30 người muốn tạo 300 câu hỏi kiểm thử cho chatbot hỗ trợ khách hàng.
Chuẩn bị
- Danh sách chủ đề cần phủ: cài máy in, lỗi Wi-Fi, gia hạn bảo trì, lịch kỹ thuật viên.
- Vài chục câu hỏi thật đã che thông tin cá nhân, làm mẫu phong cách.
- Mô tả các kiểu người hỏi: chủ shop lớn tuổi, nhân viên văn phòng gõ vội, người hỏi bằng tiếng Việt không dấu.
Các bước
- Viết prompt sinh dữ liệu: nêu rõ chủ đề, kiểu người hỏi, độ dài, yêu cầu đa dạng cách diễn đạt và mức độ khó.
- Sinh theo lô nhỏ: mỗi lô 20–30 câu cho một chủ đề, tránh mô hình lặp lại mẫu câu.
- Lọc trùng: loại câu gần giống nhau, có thể dùng embedding để phát hiện.
- Gắn đáp án kỳ vọng: người hiểu nghiệp vụ viết hoặc duyệt câu trả lời đúng.
- Duyệt mẫu: đọc ngẫu nhiên khoảng 10%, loại câu vô lý hoặc không ai hỏi kiểu đó.
- Trộn với dữ liệu thật: giữ một phần câu hỏi thật trong bộ đánh giá để không chỉ đo trên dữ liệu giả.
Kiểm tra kết quả
So sánh phân bố chủ đề, độ dài, tỷ lệ câu không dấu giữa dữ liệu tổng hợp và log thật. Chênh lệch lớn nghĩa là bộ dữ liệu chưa phản ánh đúng người dùng.
Rủi ro và giới hạn của synthetic data
Dữ liệu tổng hợp hữu ích nhưng không phải dữ liệu thật. Những giới hạn cần biết:
- Sai lệch so với thực tế: mô hình AI viết câu hỏi ‘gọn gàng, đúng chính tả’ hơn khách thật nhiều. Chatbot đạt điểm cao trên dữ liệu giả có thể vẫn kém với khách thật.
- Khuếch đại thiên lệch: nếu dữ liệu gốc chủ yếu là khách ở TP.HCM, dữ liệu tổng hợp sẽ càng ít khách tỉnh.
- Thiếu tình huống hiếm thật sự: AI chỉ tạo ra những gì nó ‘tưởng tượng’ được, các tình huống bất ngờ của thực tế thường không có.
- Rò rỉ dữ liệu gốc: khi sinh dữ liệu từ dữ liệu thật, mô hình có thể sao chép gần nguyên văn bản ghi thật. Cần kiểm tra trùng khớp với dữ liệu gốc.
- Vòng lặp mô hình: huấn luyện mô hình liên tục trên dữ liệu do mô hình khác tạo ra có thể làm chất lượng giảm dần theo thời gian, hiện tượng được giới nghiên cứu thảo luận nhiều.
- Điều khoản sử dụng: một số nhà cung cấp mô hình có quy định về việc dùng đầu ra để huấn luyện mô hình cạnh tranh. Kiểm tra điều khoản hiện hành.
Synthetic data và quyền riêng tư dữ liệu cá nhân
Một lý do nhiều doanh nghiệp quan tâm synthetic data là giảm việc dùng dữ liệu cá nhân thật trong phát triển và kiểm thử. Đây là hướng đúng, nhưng cần hiểu đúng mức.
- Dữ liệu sinh theo quy tắc, không dựa trên dữ liệu thật: rủi ro về dữ liệu cá nhân rất thấp. Phù hợp cho môi trường kiểm thử, demo.
- Dữ liệu sinh từ việc học dữ liệu thật: vẫn cần đánh giá khả năng tái nhận diện. Bản ghi tổng hợp quá giống một khách hàng cụ thể vẫn có thể bị coi là liên quan đến người đó.
- Quy trình nội bộ: quyết định ai được truy cập dữ liệu gốc dùng để sinh, nơi lưu, thời gian lưu.
Pháp luật Việt Nam về bảo vệ dữ liệu cá nhân có những yêu cầu cụ thể về xử lý dữ liệu. Doanh nghiệp nên kiểm tra văn bản pháp luật hiện hành và hỏi ý kiến chuyên gia pháp lý khi dữ liệu gốc là dữ liệu khách hàng, nhân viên, thay vì mặc định rằng dữ liệu đã ‘tổng hợp’ thì không còn nghĩa vụ gì.
Nguyên tắc thực tế
Nếu mục đích là kiểm thử phần mềm, ưu tiên sinh dữ liệu từ quy tắc thay vì từ dữ liệu thật. Chỉ dùng dữ liệu thật làm nguồn khi thực sự cần giữ đặc điểm thống kê.
Khi nào nên và không nên dùng dữ liệu tổng hợp
Nên dùng khi
- Cần môi trường kiểm thử phần mềm, website, chatbot mà không được phép dùng dữ liệu khách thật.
- Cần bộ câu hỏi đánh giá đa dạng nhưng log thật còn ít, ví dụ chatbot sắp ra mắt.
- Một nhóm dữ liệu quá hiếm, cần thêm ví dụ để mô hình phân loại không bỏ qua.
- Đào tạo nhân viên bằng tình huống mô phỏng.
Không nên dựa hoàn toàn khi
- Ra quyết định kinh doanh: dự báo doanh thu, định giá, chọn thị trường. Quyết định cần dữ liệu thật.
- Đánh giá cuối cùng trước khi ra mắt: luôn cần một phần dữ liệu thật hoặc người dùng thật thử.
- Lĩnh vực có hậu quả lớn như y tế, tài chính, pháp lý mà không có chuyên gia kiểm tra dữ liệu tổng hợp.
Cách hiểu đúng: synthetic data là công cụ bổ sung, giúp bạn bắt đầu sớm hơn và an toàn hơn, nhưng thực tế vẫn là phép thử cuối cùng. Một bộ đánh giá cân bằng thường kết hợp dữ liệu thật đã che thông tin với dữ liệu tổng hợp để phủ các trường hợp còn thiếu.
Khi dùng AI sinh câu hỏi kiểm thử, hãy yêu cầu thêm lỗi chính tả, viết tắt và tiếng Việt không dấu. Khách thật hiếm khi gõ chỉnh chu như câu do AI viết, và đó chính là chỗ chatbot hay vấp.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Dữ liệu tổng hợp có thay thế được dữ liệu thật không?
Không hoàn toàn. Nó hữu ích cho kiểm thử, bổ sung và bảo vệ quyền riêng tư, nhưng đánh giá cuối cùng và quyết định kinh doanh vẫn cần dữ liệu thật.
Có thể dùng ChatGPT để tạo dữ liệu test không?
Có. Mô hình ngôn ngữ tạo tốt câu hỏi, hội thoại, email mẫu. Với bảng dữ liệu lớn như danh sách khách hàng, công cụ sinh dữ liệu theo quy tắc thường nhanh và nhất quán hơn.
Dữ liệu tổng hợp có vi phạm quy định dữ liệu cá nhân không?
Dữ liệu sinh hoàn toàn theo quy tắc thường không chứa dữ liệu cá nhân thật. Nếu sinh từ dữ liệu khách hàng thật, cần đánh giá rủi ro tái nhận diện và kiểm tra quy định hiện hành.
Synthetic data dùng trong huấn luyện mô hình AI thế nào?
Nó được dùng để bổ sung ví dụ hiếm, tạo cặp câu hỏi đáp cho tinh chỉnh, hoặc trong kỹ thuật chưng cất mô hình. Chất lượng mô hình phụ thuộc nhiều vào việc lọc và kiểm tra dữ liệu sinh ra.
Làm sao biết dữ liệu tổng hợp đủ tốt?
So sánh phân bố với dữ liệu thật, cho người hiểu nghiệp vụ đọc mẫu, và kiểm tra hệ thống được đánh giá trên dữ liệu tổng hợp có cho kết quả tương tự khi gặp dữ liệu thật hay không.
Bài viết liên quan
- Evals là gì? Đánh giá chất lượng ứng dụng AI
- Chưng cất mô hình (distillation) là gì? Mô hình nhỏ học từ mô hình lớn
- Fine-tuning là gì? Khi nào doanh nghiệp cần tinh chỉnh mô hình AI
- Dữ liệu cá nhân khi dùng AI: doanh nghiệp Việt Nam cần lưu ý gì
- Quản trị dữ liệu cho AI: chuẩn bị dữ liệu trước khi triển khai
- Generative AI (AI tạo sinh) là gì? Cách hoạt động và ứng dụng
- Machine Learning là gì? Học máy giải thích dễ hiểu
- Red teaming AI là gì? Kiểm thử tấn công chatbot trước khi ra mắt