Vision language model (VLM, mô hình thị giác ngôn ngữ) là mô hình AI nhận đầu vào gồm cả hình ảnh và văn bản, rồi trả lời bằng văn bản. Bạn có thể đưa cho VLM ảnh chụp hóa đơn, ảnh kệ hàng hay ảnh chụp màn hình lỗi và hỏi “Tổng tiền là bao nhiêu?”, “Kệ nào đang trống?”, “Lỗi này nghĩa là gì?”. VLM ghép một bộ mã hóa ảnh với một mô hình ngôn ngữ lớn, nên nó vừa nhận ra vật thể, chữ, bố cục, vừa suy luận và diễn đạt được. VLM mạnh ở việc hiểu ngữ cảnh ảnh, nhưng vẫn có thể đọc sai số nhỏ hoặc bịa chi tiết, nên kết quả quan trọng cần người kiểm tra.
Vision language model là gì và khác LLM thông thường ở đâu
Vision language model là mô hình AI được huấn luyện để hiểu đồng thời hình ảnh và ngôn ngữ. Đầu vào là một hoặc nhiều ảnh kèm câu hỏi, đầu ra là câu trả lời dạng chữ. Một LLM thông thường chỉ đọc được văn bản: nếu bạn dán ảnh vào, nó không “thấy” gì. VLM bổ sung khả năng nhìn cho LLM.
Ba khái niệm hay bị nhầm lẫn:
- LLM: mô hình ngôn ngữ lớn, chỉ xử lý chữ.
- VLM: một dạng cụ thể của AI đa phương thức, tập trung vào cặp ảnh và chữ.
- Multimodal AI: khái niệm rộng hơn, có thể gồm ảnh, âm thanh, video, dữ liệu cảm biến.
Trong thực tế, các trợ lý AI phổ biến hiện nay đều đã có khả năng thị giác ở mức nào đó, nên khi bạn tải ảnh lên khung chat và nhận được mô tả, phía sau chính là một VLM. Với doanh nghiệp, điểm đáng giá của VLM là nó không chỉ nhận ra “đây là cái bàn” mà còn hiểu được quan hệ: chữ nào nằm ở cột nào trong bảng, sản phẩm nào đặt sai kệ, nút nào trên màn hình đang báo lỗi.
VLM hoạt động thế nào phía sau
Phần lớn VLM hiện nay gồm ba khối ghép lại:
- Bộ mã hóa ảnh (vision encoder): thường là một mạng Vision Transformer. Ảnh được cắt thành nhiều ô nhỏ (patch), mỗi ô được chuyển thành một vector số mô tả nội dung.
- Lớp chiếu (projector hoặc adapter): chuyển các vector ảnh sang “ngôn ngữ” mà LLM hiểu được, tức là thành các token ảnh nằm cùng không gian với token chữ.
- Mô hình ngôn ngữ: nhận chuỗi token ảnh cộng token câu hỏi, rồi sinh câu trả lời từng token như một LLM bình thường.
Vì sao ảnh “tốn” ngữ cảnh
Mỗi ảnh có thể được chuyển thành vài trăm đến vài nghìn token tùy độ phân giải và cách mô hình chia ô. Ảnh càng lớn, càng chi tiết thì càng tốn ngữ cảnh và thời gian xử lý. Một số mô hình tự thu nhỏ ảnh trước khi xử lý, khiến chữ nhỏ trên hóa đơn bị mờ đi. Đây là lý do cùng một hóa đơn, chụp cận cảnh từng phần thường cho kết quả đúng hơn chụp cả tờ từ xa.
Quá trình huấn luyện VLM thường dùng lượng lớn cặp ảnh và chú thích, sau đó tinh chỉnh bằng dữ liệu hỏi đáp về ảnh để mô hình biết làm theo yêu cầu.
Doanh nghiệp dùng VLM vào những việc gì
VLM hữu ích ở mọi chỗ nhân viên đang phải “nhìn rồi gõ lại”. Một số tình huống phổ biến tại doanh nghiệp vừa và nhỏ ở Việt Nam:
- Kế toán: chụp phiếu chi viết tay, biên lai giao hàng, yêu cầu AI trích ngày, số tiền, nội dung thành bảng.
- Bán hàng online: từ ảnh sản phẩm, gợi ý mô tả, chất liệu nhìn thấy được, màu sắc, đề xuất tiêu đề.
- Kho vận: kiểm tra ảnh giao hàng có đúng kiện, đúng tem, có móp méo không.
- IT nội bộ: nhân viên gửi ảnh chụp màn hình báo lỗi, VLM đọc thông báo và gợi ý hướng xử lý.
- Quản lý: chụp biểu đồ trong báo cáo giấy, hỏi xu hướng chính.
| Loại việc | Ví dụ thực tế | Mức phù hợp |
|---|---|---|
| Mô tả, phân loại ảnh | Phân loại ảnh khách gửi: sản phẩm lỗi hay hóa đơn | Cao |
| Trích thông tin từ chứng từ in rõ | Hóa đơn bán lẻ, phiếu xuất kho | Khá, cần đối chiếu số |
| Đọc chữ viết tay tiếng Việt | Phiếu ghi chép của thợ kỹ thuật | Trung bình, phụ thuộc nét chữ |
| Đếm chính xác số lượng lớn | Đếm 200 thùng hàng trong kho | Thấp, dễ sai |
| Đo kích thước, phát hiện lỗi nhỏ | Vết xước 1 mm trên linh kiện | Thấp, nên dùng thị giác máy chuyên dụng |
VLM khác OCR và computer vision truyền thống thế nào
OCR chỉ làm một việc: chuyển chữ trong ảnh thành chữ máy đọc được. Computer vision truyền thống được huấn luyện cho một nhiệm vụ hẹp như phát hiện người, đếm xe, nhận diện lỗi sản phẩm. VLM thì linh hoạt: bạn đổi câu hỏi là đổi nhiệm vụ, không cần huấn luyện lại.
Đổi lại, VLM kém ổn định hơn ở những việc cần độ chính xác tuyệt đối và tốc độ cao. Cách làm hợp lý thường là kết hợp: dùng OCR để lấy chữ chính xác, rồi dùng VLM hoặc LLM để hiểu, phân loại và đối chiếu.
| Tiêu chí | OCR | Computer vision chuyên dụng | VLM |
|---|---|---|---|
| Đầu ra | Chữ thô | Nhãn, khung, số đếm | Câu trả lời tự nhiên |
| Đổi nhiệm vụ | Không | Cần huấn luyện lại | Chỉ cần đổi câu hỏi |
| Hiểu ngữ cảnh, bố cục | Hạn chế | Theo nhiệm vụ đã huấn luyện | Tốt |
| Độ ổn định, lặp lại | Cao với ảnh rõ | Cao trong phạm vi huấn luyện | Trung bình, có thể bịa |
| Tốc độ cho dây chuyền | Nhanh | Rất nhanh | Chậm hơn |
Có những vision language model nào
Tại thời điểm viết, VLM chia thành hai nhóm chính. Danh sách thay đổi nhanh, nên hãy kiểm tra trang chính thức của từng nhà cung cấp trước khi chọn.
Mô hình thương mại qua dịch vụ đám mây
Các dòng mô hình của OpenAI, Google Gemini, Anthropic Claude đều nhận ảnh đầu vào trong ứng dụng chat và qua API. Ưu điểm là chất lượng cao, không cần phần cứng, có gói miễn phí/trả phí (xem bảng giá hiện hành). Nhược điểm là ảnh được gửi ra ngoài công ty, cần xem điều khoản xử lý dữ liệu, nhất là với chứng từ có thông tin khách hàng.
Mô hình mở có thể tự chạy
Các họ mô hình như LLaVA, Qwen-VL, Gemma có bản thị giác, Llama có bản Vision cho phép tải trọng số về và chạy trên máy chủ nội bộ, thông qua công cụ như Ollama hoặc vLLM. Nhóm này phù hợp khi dữ liệu nhạy cảm hoặc khối lượng ảnh lớn, đều đặn. Chất lượng đọc tiếng Việt khác nhau đáng kể giữa các mô hình, nên cần thử trên chính ảnh thật của doanh nghiệp, không chỉ dựa vào bảng xếp hạng.
Khi so sánh, hãy để ý giới hạn số ảnh mỗi lần hỏi, độ phân giải tối đa, khả năng đọc nhiều trang PDF và việc mô hình có trả về JSON ổn định hay không.
Chạy VLM cục bộ cần phần cứng thế nào
Nếu muốn ảnh chứng từ không rời khỏi văn phòng, bạn có thể chạy VLM mở trên máy chủ hoặc PC có GPU. Các con số dưới đây chỉ là ước lượng tham khảo, phụ thuộc phiên bản mô hình, mức lượng tử hóa, độ phân giải ảnh và độ dài ngữ cảnh:
- VLM cỡ 7B–8B lượng tử hóa 4-bit: thường cần khoảng 6–8 GB VRAM, phần dư dành cho token ảnh. GPU 12 GB VRAM cho cảm giác thoải mái hơn.
- VLM cỡ 11B–14B: thường cần khoảng 10–14 GB VRAM ở 4-bit.
- VLM cỡ 30B trở lên: thường cần 24 GB VRAM trở lên hoặc chia trên nhiều GPU.
So với mô hình chỉ có chữ cùng cỡ, VLM cần thêm bộ nhớ cho bộ mã hóa ảnh và cho token ảnh, nên đừng tính sát. RAM hệ thống 32 GB và SSD NVMe giúp nạp mô hình nhanh và xử lý hàng loạt ảnh ổn định.
Khi nào nên tự chạy
Tự chạy hợp lý khi mỗi ngày có hàng trăm ảnh chứng từ, khi chính sách công ty không cho đưa ảnh khách hàng lên dịch vụ ngoài, hoặc khi cần tích hợp vào quy trình nội bộ qua n8n. Nếu chỉ thỉnh thoảng hỏi vài ảnh, dùng dịch vụ đám mây đơn giản hơn nhiều.
Giới hạn và lỗi thường gặp của VLM
VLM rất thuyết phục khi trả lời, nên lỗi của nó khó phát hiện hơn lỗi OCR. Những kiểu sai hay gặp:
- Đọc nhầm số: nhầm 8 với 6, 1 với 7, đặc biệt trên ảnh mờ hoặc chụp nghiêng. Với số tiền, đây là lỗi nghiêm trọng.
- Bịa chi tiết: mô tả một dòng chữ không có trong ảnh, hoặc “đoán” mã số thuế bị che.
- Đếm sai: khi có nhiều vật giống nhau, VLM thường đếm thiếu hoặc thừa.
- Sai dấu tiếng Việt: chữ in nhỏ hoặc viết tay dễ mất dấu, đổi nghĩa từ.
- Bỏ sót phần ảnh: ảnh quá dài như sao kê nhiều trang bị thu nhỏ, phần cuối bị bỏ qua.
Khi nào KHÔNG nên dùng VLM
Không nên để VLM tự quyết định trong việc cần độ chính xác tuyệt đối mà không có người kiểm tra, như nhập số tiền vào sổ sách, đánh giá hàng lỗi để từ chối nhận hàng, hoặc nhận diện danh tính người. Những việc tốc độ cao trên dây chuyền sản xuất cũng nên dùng mô hình thị giác chuyên dụng.
Cách giảm lỗi: chụp ảnh thẳng, đủ sáng; hỏi từng phần; yêu cầu mô hình ghi “không đọc được” thay vì đoán; đối chiếu tổng tiền với tổng các dòng.
Bắt đầu thử VLM trong công ty theo 5 bước
Một pilot VLM nhỏ có thể làm trong một đến hai tuần mà không cần đội lập trình lớn:
- Chọn một loại ảnh duy nhất: ví dụ phiếu giao hàng của một nhà cung cấp. Gom 30–50 ảnh thật, đã che thông tin không cần thiết.
- Viết câu hỏi chuẩn: yêu cầu trả về các trường cố định như ngày, số phiếu, mặt hàng, số lượng, kèm ghi chú nếu không chắc.
- Thử trên hai đến ba mô hình: một dịch vụ đám mây và một mô hình mở nếu có máy. Ghi kết quả vào bảng tính.
- Chấm điểm bằng tay: đếm số trường đúng, sai, bỏ trống. Ghi rõ loại lỗi.
- Quyết định: nếu tỷ lệ đúng đủ cao cho trường không quan trọng, cho chạy tự động phần đó; trường quan trọng như số tiền vẫn để người duyệt.
Sau pilot, bạn mới nên nối VLM vào quy trình lớn hơn như tự động nhận ảnh qua Zalo hoặc email, ghi vào Google Sheets và gửi cảnh báo khi có sai lệch.
Đừng đánh giá VLM bằng ảnh mẫu đẹp trên mạng. Hãy thử bằng chính những ảnh xấu nhất nhân viên của bạn hay chụp: nghiêng, thiếu sáng, bị gập, vì đó mới là dữ liệu thật mỗi ngày.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Vision language model có phải là OCR không?
Không. OCR chỉ chuyển chữ trong ảnh thành văn bản. VLM hiểu được cả nội dung, bố cục và trả lời câu hỏi về ảnh, nhưng độ chính xác từng ký tự có thể kém OCR chuyên dụng.
ChatGPT có phải là vision language model không?
Ứng dụng ChatGPT dùng các mô hình có khả năng nhận ảnh, nên khi bạn tải ảnh lên và hỏi, phía sau là một mô hình thị giác ngôn ngữ. Gemini và Claude cũng tương tự.
VLM đọc hóa đơn tiếng Việt có chính xác không?
Với hóa đơn in rõ, chụp thẳng, các mô hình tốt thường đọc khá đúng. Chữ viết tay, ảnh mờ hoặc số nhỏ dễ sai, nên số tiền luôn cần người đối chiếu.
Chạy VLM trên máy tính cá nhân được không?
Được, với mô hình mở cỡ nhỏ qua Ollama hoặc LM Studio. Mô hình 7B lượng tử hóa 4-bit thường cần khoảng 6–8 GB VRAM, tùy phiên bản và độ phân giải ảnh.
Gửi ảnh chứng từ cho AI có an toàn không?
Phụ thuộc điều khoản của dịch vụ và loại tài khoản. Tài khoản doanh nghiệp thường có cam kết không dùng dữ liệu để huấn luyện; với dữ liệu nhạy cảm, cân nhắc chạy mô hình nội bộ.
VLM có nhận diện được khuôn mặt người không?
Nhiều dịch vụ chủ động từ chối nhận diện danh tính người. Doanh nghiệp cũng không nên dùng VLM cho việc này vì rủi ro sai và rủi ro về dữ liệu cá nhân.
Bài viết liên quan
- Multimodal AI là gì? AI đa phương thức đọc ảnh, nghe tiếng, xem video
- Computer Vision là gì? Thị giác máy tính và ứng dụng thực tế
- OCR là gì? Đọc hóa đơn, chứng từ tự động
- AI có thể nhìn và phân tích hình ảnh không
- AI đọc hóa đơn điện tử và chứng từ: cách làm, độ chính xác, lưu ý
- Từ điển thuật ngữ AI cho người làm doanh nghiệp (A–Z)
- Máy tính chạy AI cục bộ: chọn cấu hình theo nhu cầu và ngân sách