Multimodal AI (AI đa phương thức) là mô hình AI có thể hiểu và xử lý nhiều loại dữ liệu cùng lúc như văn bản, hình ảnh, âm thanh và video, thay vì chỉ một loại. Ví dụ bạn chụp ảnh màn hình báo lỗi và hỏi bằng lời, AI đọc ảnh rồi giải thích. Các trợ lý như ChatGPT, Gemini, Claude đều đã hỗ trợ đầu vào hình ảnh, nhiều sản phẩm hỗ trợ cả giọng nói.
Đa phương thức nghĩa là gì
“Phương thức” (modality) là dạng dữ liệu: chữ viết, hình ảnh, âm thanh, video. AI đời đầu thường chuyên một dạng: mô hình nhận diện ảnh không đọc được câu hỏi, chatbot văn bản không xem được ảnh. AI đa phương thức kết hợp các dạng này trong một mô hình, nên có thể trả lời câu hỏi về một bức ảnh, mô tả biểu đồ, hay nghe đoạn ghi âm rồi tóm tắt.
Ứng dụng thực tế
Những việc trước đây cần nhiều công cụ nay có thể làm trong một cuộc trò chuyện.
| Bộ phận | Đầu vào | AI làm gì |
|---|---|---|
| Kế toán | Ảnh chụp hóa đơn, phiếu thu | Trích xuất số tiền, ngày, mã số thuế |
| Kỹ thuật, IT | Ảnh màn hình báo lỗi | Giải thích lỗi, gợi ý bước kiểm tra |
| Kinh doanh | Ảnh sản phẩm | Viết mô tả, gợi ý tiêu đề |
| Quản trị | Ảnh biểu đồ, bảng số liệu | Đọc số liệu, nêu xu hướng |
| Họp, đào tạo | File ghi âm, video | Chép lời, tóm tắt, lập danh sách việc cần làm |
Hạn chế cần lưu ý
- Đọc sai chi tiết nhỏ: số liệu trong ảnh mờ, chữ viết tay, bảng phức tạp vẫn có thể bị đọc nhầm.
- Đếm và định vị chưa tốt: đếm số vật thể hay đo kích thước trong ảnh dễ sai.
- Dữ liệu nhạy cảm: ảnh chứng từ, căn cước, hợp đồng chứa thông tin cá nhân cần được xử lý theo quy định.
- Chi phí: ảnh và video quy đổi thành nhiều token, có thể tốn hơn văn bản.
Mẹo dùng hiệu quả
- Chụp ảnh rõ, thẳng, đủ sáng; cắt bớt phần không liên quan.
- Nói rõ AI cần làm gì với ảnh: trích xuất trường nào, định dạng đầu ra ra sao.
- Với số liệu quan trọng, yêu cầu AI trả về bảng để đối chiếu với ảnh gốc.
- Kết hợp với kiểm tra tự động, ví dụ tổng tiền phải bằng tổng các dòng.
Đa phương thức trong quy trình tự động
Giá trị lớn nhất của AI đa phương thức không nằm ở việc thỉnh thoảng hỏi về một bức ảnh, mà ở việc tự động hóa các quy trình có nhiều loại dữ liệu. Ví dụ: khách gửi ảnh thiết bị hỏng qua Zalo, hệ thống dùng AI nhận diện loại thiết bị và lỗi sơ bộ, tạo phiếu yêu cầu với thông tin đã điền sẵn và chuyển cho đúng kỹ thuật viên. Hay bộ phận kế toán nhận ảnh chứng từ qua email, AI trích xuất dữ liệu thành bảng để kế toán viên chỉ cần duyệt.
Để làm được, cần kết nối AI với phần mềm qua API, đặt ngưỡng tin cậy và luôn có bước người kiểm tra với trường hợp AI không chắc chắn.
Khi gửi ảnh màn hình lỗi cho AI, chụp cả phần thông báo lỗi và vài dòng xung quanh, kèm một câu mô tả bạn vừa làm gì trước khi lỗi xuất hiện. Câu trả lời sẽ sát hơn rất nhiều.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
ChatGPT có đọc được ảnh không?
Có. ChatGPT, Gemini, Claude đều cho phép tải ảnh lên và hỏi về nội dung ảnh, tùy gói và giới hạn của từng sản phẩm.
AI đa phương thức có tạo được ảnh không?
Một số có. Hiểu ảnh và tạo ảnh là hai khả năng khác nhau; có sản phẩm làm được cả hai, có sản phẩm chỉ hiểu ảnh.
Có dùng để đọc hóa đơn hàng loạt được không?
Được, nhưng nên làm qua quy trình tự động có bước kiểm tra, thay vì tải từng ảnh lên giao diện trò chuyện.
AI có nhận diện được người trong ảnh không?
Nhiều dịch vụ chủ động từ chối nhận diện danh tính người thật vì lý do quyền riêng tư.
Bài viết liên quan
- Computer Vision là gì? Thị giác máy tính và ứng dụng thực tế
- AI có thể nhìn và phân tích hình ảnh không
- AI đọc hóa đơn điện tử và chứng từ: cách làm, độ chính xác, lưu ý
- Speech-to-text là gì? AI chuyển giọng nói thành văn bản
- Generative AI (AI tạo sinh) là gì? Cách hoạt động và ứng dụng