Lỗi thường gặp khi chạy AI cục bộ chia thành năm nhóm: thiếu bộ nhớ (out of memory, mô hình quá lớn so với VRAM), không dùng được GPU (driver cũ, phần mềm không nhận card nên chạy bằng CPU rất chậm), lỗi kết nối (cổng bị chiếm, Open WebUI trong Docker không gọi được Ollama, máy khác trong mạng không truy cập được), lỗi chất lượng (trả lời sai tiếng Việt, quên ngữ cảnh) và lỗi phần cứng (quá nhiệt, sập nguồn). Cách xử lý chung là đọc log, kiểm tra GPU bằng nvidia-smi, giảm kích thước mô hình hoặc ngữ cảnh, rồi thay đổi từng thứ một.
Lỗi thường gặp khi chạy AI cục bộ chia thành mấy nhóm
Lỗi khi chạy AI cục bộ là những sự cố xảy ra khi tự chạy mô hình AI trên máy tính hoặc server của mình bằng Ollama, LM Studio, llama.cpp, Open WebUI. Dù thông báo lỗi rất đa dạng, gần như tất cả đều thuộc một trong năm nhóm:
- Bộ nhớ: mô hình hoặc ngữ cảnh không vừa VRAM, RAM.
- GPU và driver: phần mềm không nhận GPU hoặc nhận sai.
- Mạng và kết nối: giao diện không gọi được máy chủ mô hình.
- Chất lượng trả lời: mô hình chạy nhưng trả lời kém, sai ngôn ngữ, lặp lại.
- Phần cứng và hệ thống: quá nhiệt, sập nguồn, ổ đầy.
Xác định đúng nhóm trước khi sửa giúp tiết kiệm rất nhiều thời gian. Ví dụ “trả lời chậm” có thể là lỗi nhóm 2 (đang chạy bằng CPU) chứ không phải do máy yếu.
Chuẩn bị trước khi xử lý lỗi
- Ghi lại chính xác thông báo lỗi và thời điểm xảy ra.
- Biết phiên bản phần mềm, tên mô hình và mức lượng tử hóa đang dùng.
- Mở công cụ theo dõi GPU (nvidia-smi hoặc Task Manager) song song khi tái hiện lỗi.
Bảng tra nhanh lỗi, nguyên nhân và cách sửa
Bảng dưới gom các triệu chứng hay gặp nhất khi vận hành AI cục bộ ở văn phòng. Đọc từ cột triệu chứng, thử cách sửa theo thứ tự từ trên xuống.
| Triệu chứng | Nguyên nhân thường gặp | Cách sửa |
|---|---|---|
| Báo out of memory hoặc tải mô hình thất bại | Mô hình hoặc ngữ cảnh vượt VRAM | Dùng bản lượng tử hóa thấp hơn, mô hình nhỏ hơn, giảm độ dài ngữ cảnh |
| Trả lời rất chậm, GPU gần như không hoạt động | Phần mềm chạy bằng CPU | Cập nhật driver, kiểm tra log nhận GPU, cài đúng bản hỗ trợ GPU |
| Tốc độ giảm mạnh khi đổi sang mô hình lớn | Một phần mô hình bị đẩy sang RAM | Kiểm tra tỷ lệ chạy trên GPU, chọn mô hình vừa VRAM |
| Open WebUI báo không kết nối được Ollama | Sai địa chỉ khi chạy trong Docker | Dùng địa chỉ máy chủ thay cho localhost, kiểm tra cổng 11434 |
| Máy khác trong mạng không truy cập được | Ollama chỉ nghe trên 127.0.0.1, firewall chặn | Cấu hình OLLAMA_HOST, mở cổng trong mạng nội bộ |
| Máy tự tắt khi đang chạy nặng | Nguồn yếu hoặc quá nhiệt | Kiểm tra nguồn, vệ sinh, giới hạn công suất GPU |
| Tải mô hình dừng giữa chừng | Ổ đầy hoặc mạng chập chờn | Dọn ổ, đổi thư mục lưu mô hình, tải lại |
Lỗi hết bộ nhớ (out of memory) và cách khắc phục
Đây là lỗi phổ biến nhất. Bộ nhớ GPU phải chứa cả trọng số mô hình lẫn bộ nhớ đệm ngữ cảnh (KV cache). Ngữ cảnh càng dài và càng nhiều người hỏi cùng lúc, bộ nhớ đệm càng lớn.
Các bước xử lý
- Xem dung lượng file mô hình so với VRAM. Nếu file mô hình đã gần bằng VRAM, gần như chắc chắn sẽ thiếu khi thêm ngữ cảnh.
- Chuyển sang bản lượng tử hóa thấp hơn, ví dụ từ 8-bit xuống 4-bit. Chất lượng giảm nhẹ nhưng dung lượng giảm gần một nửa.
- Giảm độ dài ngữ cảnh trong cài đặt (num_ctx trong Ollama, Context Length trong LM Studio) xuống mức thật sự cần.
- Giảm số yêu cầu xử lý song song nếu nhiều người dùng chung.
- Đóng các ứng dụng khác dùng GPU: trình duyệt bật tăng tốc phần cứng, phần mềm đồ họa, mô hình khác đang nạp.
- Nếu vẫn thiếu, chọn mô hình nhỏ hơn một bậc hoặc nâng cấp GPU.
Kiểm tra kết quả
Chạy lại cùng câu hỏi dài nhất mà người dùng hay gửi, theo dõi VRAM sử dụng. Nên chừa ít nhất 10–15% VRAM trống để tránh lỗi khi có nhiều người hỏi cùng lúc.
Lỗi không nhận GPU, mô hình chạy bằng CPU
Triệu chứng: mọi thứ vẫn chạy, không báo lỗi, nhưng trả lời chậm như rùa. Mở trình theo dõi thấy CPU tăng cao còn GPU gần như đứng yên. Đây là lỗi “im lặng” khiến nhiều người kết luận nhầm là máy không đủ mạnh.
Nguyên nhân thường gặp
- Driver GPU quá cũ so với phiên bản phần mềm AI.
- Cài nhầm bản chỉ hỗ trợ CPU của một số công cụ hoặc thư viện.
- Trên laptop có hai GPU, phần mềm chạy trên GPU tích hợp.
- Card AMD không nằm trong danh sách hỗ trợ của công cụ.
- Chạy trong Docker nhưng chưa cấu hình cho container truy cập GPU.
Cách sửa
- Chạy
nvidia-smi. Nếu lệnh lỗi, cài lại driver NVIDIA bản mới từ trang chính thức. - Xem log khởi động của Ollama: dòng phát hiện GPU sẽ cho biết card nào được nhận và bao nhiêu VRAM.
- Trong LM Studio, kiểm tra runtime đang chọn và mức GPU offload.
- Trên laptop, chọn chế độ hiệu năng cao cho ứng dụng trong cài đặt đồ họa của Windows.
- Với Docker, cài NVIDIA Container Toolkit và chạy container với tùy chọn cấp GPU.
Lỗi kết nối: cổng, Docker và truy cập từ máy khác
Khi chuyển từ dùng một mình sang phục vụ cả văn phòng, lỗi kết nối bắt đầu xuất hiện.
Cổng bị chiếm
Ollama mặc định dùng cổng 11434. Nếu đã có một bản Ollama khác chạy nền (ví dụ bản cài sẵn tự khởi động cùng Windows), lần chạy thứ hai sẽ báo cổng đang được dùng. Tắt bản đang chạy ở khay hệ thống hoặc dịch vụ trước khi khởi động lại.
Open WebUI trong Docker không thấy Ollama
Bên trong container, localhost là chính container chứ không phải máy chủ. Cần trỏ địa chỉ Ollama tới máy chủ, ví dụ dùng host.docker.internal trên Docker Desktop, hoặc đặt cả hai dịch vụ trong cùng một mạng Docker và gọi bằng tên dịch vụ.
Máy khác trong mạng không truy cập được
Mặc định Ollama chỉ nghe kết nối từ chính máy đó. Đặt biến môi trường OLLAMA_HOST để nghe trên địa chỉ mạng nội bộ, khởi động lại dịch vụ và mở cổng trên firewall của máy chủ cho dải IP văn phòng.
Lưu ý an toàn: chỉ mở trong mạng nội bộ. Không mở cổng Ollama trực tiếp ra internet vì giao diện API mặc định không có xác thực; nếu cần truy cập từ xa, dùng VPN hoặc đặt sau reverse proxy có đăng nhập.
Lỗi chất lượng: trả lời sai tiếng Việt, lặp lại, quên ngữ cảnh
Mô hình chạy được nhưng trả lời kém là nhóm lỗi gây thất vọng nhất với người dùng văn phòng.
- Trả lời lẫn tiếng Anh, tiếng Trung hoặc sai dấu: chọn mô hình có hỗ trợ tiếng Việt tốt hơn, đặt lời nhắc hệ thống yêu cầu trả lời bằng tiếng Việt, tránh bản lượng tử hóa quá thấp với mô hình nhỏ.
- Lặp đi lặp lại một câu: kiểm tra mẫu hội thoại (chat template) có khớp mô hình không, nhất là khi tự nhập file GGUF; điều chỉnh tham số chống lặp.
- Quên nội dung đầu cuộc trò chuyện hoặc tài liệu dài: độ dài ngữ cảnh mặc định có thể ngắn hơn bạn nghĩ. Tăng ngữ cảnh nếu VRAM cho phép, hoặc dùng RAG thay vì dán cả tài liệu.
- Bịa thông tin về công ty: mô hình không biết dữ liệu nội bộ. Cần nạp tài liệu qua tính năng chat với tài liệu và yêu cầu trích nguồn.
- Chất lượng tụt sau khi cập nhật: ghi lại phiên bản mô hình đang dùng ổn định để có thể quay lại.
Mẹo: chuẩn bị một bộ 10–15 câu hỏi mẫu sát công việc thật. Mỗi lần đổi mô hình hoặc cài đặt, chạy lại bộ câu hỏi này để so sánh thay vì đánh giá theo cảm giác.
Lỗi phần cứng và hệ thống: quá nhiệt, sập nguồn, ổ đầy
- Máy tự khởi động lại khi chạy nặng: thường do nguồn không đủ hoặc đã xuống cấp; GPU có đỉnh tải ngắn vượt công suất trung bình. Thử giới hạn công suất GPU; nếu hết lỗi, nhiều khả năng cần nguồn tốt hơn.
- Tốc độ giảm dần sau 10–20 phút: GPU quá nóng và tự hạ xung. Vệ sinh bụi, thêm quạt hút, đặt máy nơi thông thoáng.
- Ổ đầy: mỗi mô hình có thể chiếm vài GB đến vài chục GB. Xóa mô hình không dùng bằng lệnh của Ollama, hoặc chuyển thư mục lưu mô hình sang ổ khác qua biến môi trường.
- Máy treo khi mất điện ngắn: lắp UPS sóng sin và cấu hình tự tắt máy.
- Cập nhật Windows tự khởi động lại máy chủ: đặt khung giờ cập nhật ngoài giờ làm việc.
Khi nào nên gọi kỹ thuật
Nếu máy sập nguồn kể cả khi đã giới hạn công suất, có mùi khét, GPU báo lỗi bộ nhớ khi chạy công cụ kiểm tra, hãy ngừng sử dụng và nhờ kỹ thuật viên kiểm tra phần cứng. Cố chạy tiếp có thể làm hỏng thêm linh kiện.
Mỗi lần chỉ thay đổi một thứ (driver, mô hình, ngữ cảnh hoặc cài đặt) rồi kiểm tra lại; thay nhiều thứ cùng lúc sẽ khiến bạn không biết điều gì thật sự sửa được lỗi hay gây ra lỗi mới.
Cần máy tính hoặc server chạy AI cho công ty? PCTech tư vấn cấu hình theo mô hình và số người dùng, lắp ráp, cài sẵn Ollama/Open WebUI, bảo hành tận nơi tại TP.HCM.
Nhập mô hình muốn chạy và số người dùng, nhận gợi ý GPU, RAM, SSD ngay. Dùng thử ngay
Câu hỏi thường gặp
Vì sao Ollama chạy chậm dù máy có card NVIDIA?
Thường do Ollama không nhận GPU vì driver cũ, hoặc mô hình quá lớn nên một phần bị đẩy sang CPU. Kiểm tra log của Ollama và lệnh ollama ps để xem tỷ lệ chạy trên GPU.
Lỗi CUDA out of memory nghĩa là gì?
GPU không còn đủ VRAM để nạp mô hình hoặc xử lý yêu cầu. Giảm kích thước mô hình, mức lượng tử hóa hoặc độ dài ngữ cảnh sẽ khắc phục được đa số trường hợp.
Làm sao cho máy khác trong văn phòng dùng Ollama trên máy chủ?
Đặt biến môi trường OLLAMA_HOST để Ollama nghe trên địa chỉ mạng nội bộ, khởi động lại và mở cổng 11434 trên firewall cho dải IP văn phòng. Không mở cổng này ra internet.
Open WebUI báo lỗi kết nối Ollama phải làm sao?
Kiểm tra địa chỉ Ollama trong cài đặt Open WebUI. Nếu Open WebUI chạy trong Docker, không dùng localhost mà dùng host.docker.internal hoặc tên dịch vụ trong cùng mạng Docker.
Mô hình AI cục bộ trả lời tiếng Việt kém thì sửa thế nào?
Thử mô hình khác có hỗ trợ tiếng Việt tốt hơn, dùng bản lượng tử hóa cao hơn và đặt lời nhắc hệ thống yêu cầu trả lời tiếng Việt. Mô hình quá nhỏ thường khó trả lời tiếng Việt tự nhiên.
Xóa mô hình Ollama không dùng để giải phóng ổ cứng thế nào?
Dùng lệnh ollama list để xem danh sách, rồi ollama rm kèm tên mô hình để xóa. Có thể đổi thư mục lưu mô hình sang ổ khác bằng biến môi trường OLLAMA_MODELS.
Bài viết liên quan
- Cài Ollama trên Windows và chạy mô hình AI đầu tiên
- Ollama là gì? Chạy mô hình AI miễn phí trên máy của bạn
- LM Studio là gì? Giao diện chạy AI cục bộ cho người không chuyên
- Cần bao nhiêu VRAM để chạy LLM 7B, 14B, 32B, 70B?
- Chạy AI trên máy tính cá nhân (local AI): cần gì và có đáng không
- Docker cho ứng dụng AI nội bộ: vì sao nên dùng và triển khai thế nào
- CUDA là gì? Vì sao AI thường cần GPU NVIDIA
- Nguồn và tản nhiệt cho máy tính chạy GPU AI liên tục