Chạy AI bằng CPU là đủ khi bạn dùng mô hình nhỏ (khoảng 1B–4B tham số, lượng tử hóa 4-bit), một người dùng, câu trả lời ngắn và chấp nhận tốc độ vài token mỗi giây. GPU trở nên cần thiết khi chạy mô hình từ 7B trở lên cho nhiều người, xử lý tài liệu dài, tạo ảnh, chuyển giọng nói thành văn bản số lượng lớn hoặc huấn luyện, tinh chỉnh mô hình. Lý do là GPU có băng thông bộ nhớ cao và hàng nghìn lõi tính song song, trong khi CPU mạnh ở xử lý tuần tự. Cách chắc chắn nhất là thử mô hình thật trên máy hiện có rồi mới quyết định.
Chạy AI bằng CPU hay GPU: khác nhau ở đâu
CPU là bộ xử lý trung tâm, có ít lõi nhưng mỗi lõi rất mạnh và linh hoạt. GPU là bộ xử lý đồ họa, có hàng nghìn lõi nhỏ chuyên làm phép nhân ma trận song song. Mô hình AI, đặc biệt là mô hình ngôn ngữ lớn (LLM), về bản chất là rất nhiều phép nhân ma trận lặp lại, nên GPU có lợi thế tự nhiên.
Tuy vậy, khi chạy một mô hình đã huấn luyện sẵn để trả lời câu hỏi (gọi là suy luận), yếu tố giới hạn thường không phải sức tính mà là băng thông bộ nhớ. Mỗi token sinh ra, máy phải đọc gần hết trọng số mô hình một lần. VRAM trên card đồ họa có băng thông cao hơn RAM hệ thống nhiều lần, đó là lý do GPU sinh chữ nhanh hơn rõ rệt.
Hai giai đoạn cần phân biệt
- Đọc đầu vào (prompt processing): nặng về tính toán, GPU nhanh hơn CPU rất nhiều.
- Sinh chữ (generation): nặng về đọc bộ nhớ, CPU với RAM nhanh vẫn tạm chấp nhận được với mô hình nhỏ.
Hiểu hai giai đoạn này giúp bạn đoán đúng: dán tài liệu 20 trang vào máy chỉ có CPU sẽ chờ lâu ở bước đọc, dù câu trả lời ngắn.
Những việc AI mà CPU làm tốt
Nhiều tác vụ AI văn phòng không đòi hỏi GPU. Nếu nhu cầu nằm trong danh sách dưới đây, máy có CPU đời mới và đủ RAM thường đã dùng được:
- Chat với mô hình nhỏ: các mô hình 1B–4B bản 4-bit chạy được trên CPU phổ thông, phù hợp viết nháp email, tóm tắt đoạn văn ngắn, phân loại tin nhắn.
- Tạo embedding cho tìm kiếm tài liệu: mô hình embedding nhỏ chạy trên CPU ổn nếu số tài liệu vừa phải và chỉ cần lập chỉ mục một lần.
- Nhận dạng chữ (OCR) cơ bản, phân loại văn bản, trích xuất trường dữ liệu đơn giản.
- Tự động hóa có gọi AI đám mây: khi mô hình chạy trên máy chủ của nhà cung cấp, máy bạn chỉ cần gửi yêu cầu, CPU nào cũng đủ.
Ví dụ: một cửa hàng điện thoại muốn AI phân loại tin nhắn khách thành “hỏi giá”, “bảo hành”, “khiếu nại” vào cuối ngày. Khối lượng vài trăm tin, không cần trả lời tức thì, nên một máy tính văn phòng chạy mô hình nhỏ bằng CPU vào buổi tối là hợp lý.
Khi nào bắt buộc phải có GPU
GPU tạo khác biệt lớn, thậm chí là điều kiện bắt buộc, trong các trường hợp sau:
- Mô hình từ 7B trở lên dùng thường xuyên: trên CPU, tốc độ sinh chữ thường chỉ vài token mỗi giây, người dùng sẽ thấy chậm khi trả lời dài.
- Nhiều người dùng chung: phòng 10–20 nhân viên cùng hỏi một máy chủ AI nội bộ, CPU không đáp ứng kịp.
- Tài liệu dài, RAG nhiều đoạn: bước đọc đầu vào trên CPU chậm, mỗi câu hỏi có thể chờ hàng chục giây.
- Tạo ảnh bằng Stable Diffusion, FLUX: trên CPU mất rất lâu cho một ảnh, gần như không thực dụng.
- Chuyển giọng nói thành văn bản số lượng lớn: ghi âm cuộc họp hàng ngày nên dùng GPU.
- Huấn luyện hoặc tinh chỉnh (fine-tune) mô hình: cần GPU có VRAM lớn.
Một dấu hiệu đơn giản: nếu người dùng phải chờ quá lâu đến mức quay về dùng công cụ cũ, đó là lúc cần GPU hoặc chuyển sang dịch vụ AI đám mây.
Bảng so sánh CPU và GPU cho từng tác vụ AI
Bảng dưới đây là định hướng chung, tốc độ thực tế phụ thuộc đời CPU, loại RAM, mô hình và phiên bản phần mềm.
| Tác vụ | Chỉ dùng CPU | Có GPU rời | Gợi ý |
|---|---|---|---|
| Chat mô hình 1B–4B, 1 người | Dùng được | Rất nhanh | Bắt đầu bằng CPU |
| Chat mô hình 7B–8B, 1 người | Chậm nhưng chạy được | Thoải mái | GPU nếu dùng hằng ngày |
| Mô hình 14B trở lên | Rất chậm | Cần VRAM đủ lớn | GPU hoặc đám mây |
| Hỏi đáp tài liệu dài (RAG) | Chờ lâu ở bước đọc | Nhanh | Nên có GPU |
| Tạo ảnh | Gần như không thực dụng | Phù hợp | Bắt buộc GPU |
| Chuyển giọng nói thành văn bản | Được với file ngắn | Nhanh với khối lượng lớn | GPU nếu xử lý hằng ngày |
| Fine-tune mô hình | Không phù hợp | Cần VRAM lớn | GPU hoặc thuê đám mây |
Điều kiện để CPU chạy AI ổn định
Nếu quyết định chạy AI bằng CPU, hãy tối ưu đúng những yếu tố ảnh hưởng tốc độ:
- RAM chạy hai kênh (dual channel): cắm hai thanh thay vì một thanh, vì băng thông RAM quyết định tốc độ sinh chữ trên CPU.
- RAM thế hệ mới hơn: DDR5 thường cho băng thông cao hơn DDR4 cùng cấu hình kênh.
- Dung lượng RAM dư: tổng RAM nên lớn hơn kích thước mô hình cộng phần dành cho hệ điều hành và ứng dụng khác. Mô hình 4B bản 4-bit thường chiếm khoảng 3 GB, nên máy 16 GB là mức tối thiểu dễ chịu.
- CPU hỗ trợ tập lệnh AVX2 hoặc AVX-512: phần lớn công cụ như llama.cpp tận dụng các tập lệnh này.
- Chọn bản lượng tử hóa 4-bit: nhỏ hơn, đọc nhanh hơn, chất lượng vẫn chấp nhận được cho tác vụ văn phòng.
Số luồng CPU
Nhiều luồng hơn chưa chắc nhanh hơn, vì nút thắt nằm ở bộ nhớ. Thường đặt số luồng bằng số nhân thật là hợp lý; hãy thử vài mức để tìm điểm tốt nhất trên máy của bạn.
GPU tích hợp và NPU có thay được GPU rời không
Nhiều máy văn phòng đời mới có GPU tích hợp (iGPU) hoặc bộ xử lý thần kinh (NPU). Câu hỏi hay gặp là liệu chúng có thay thế được card rời.
- iGPU: dùng chung RAM hệ thống nên không giải quyết được nút thắt băng thông. Một số công cụ hỗ trợ tăng tốc qua Vulkan hoặc nền tảng của hãng, có thể nhanh hơn CPU thuần ở bước đọc đầu vào, nhưng hiệu quả khác nhau theo phần mềm.
- NPU: tiết kiệm điện, phù hợp các tính năng AI nhỏ tích hợp trong hệ điều hành như làm mờ phông nền, khử ồn, phụ đề trực tiếp. Việc chạy LLM tùy ý trên NPU đang phụ thuộc nhiều vào hỗ trợ của từng công cụ tại thời điểm viết.
Kết luận thực tế: iGPU và NPU là điểm cộng, không phải lý do để kỳ vọng chạy mô hình lớn. Nếu nhu cầu chính là LLM 7B trở lên, GPU rời có VRAM đủ lớn vẫn là lựa chọn rõ ràng nhất.
Cách tự kiểm tra: máy hiện tại chạy AI bằng CPU được không
Trước khi mua thiết bị, hãy thử nghiệm 30 phút trên máy đang có:
- Cài một công cụ chạy mô hình cục bộ như Ollama hoặc LM Studio.
- Tải một mô hình nhỏ bản 4-bit (khoảng 3B–4B) và một mô hình 7B–8B bản 4-bit.
- Chuẩn bị ba câu hỏi đúng công việc thật: tóm tắt một email dài, viết phản hồi khách, trích thông tin từ đoạn hợp đồng.
- Ghi lại thời gian bắt đầu có chữ đầu tiên và tốc độ sinh chữ (công cụ thường hiển thị token/giây).
- Mở Task Manager xem RAM có bị đầy, máy có chuyển sang dùng bộ nhớ ảo không.
- Nhờ người dùng thật đánh giá: tốc độ và chất lượng có chấp nhận được không.
Nếu mô hình nhỏ đã đủ chất lượng và tốc độ ổn, bạn tiết kiệm được khoản đầu tư GPU. Nếu chỉ mô hình 7B mới đủ chất lượng nhưng quá chậm, đó là bằng chứng rõ ràng để đầu tư card đồ họa.
Lỗi thường gặp khi chọn CPU hay GPU cho AI
- Mua CPU nhiều nhân thật đắt để chạy LLM: tốc độ sinh chữ ít tăng vì nút thắt là băng thông RAM.
- Mua GPU mạnh nhưng VRAM nhỏ: mô hình không nạp hết vào VRAM, phần còn lại chạy trên CPU và kéo tốc độ xuống.
- Chỉ cắm một thanh RAM: mất một nửa băng thông, CPU chạy AI chậm hẳn.
- Đánh giá bằng câu hỏi quá ngắn: thử “xin chào” thì máy nào cũng nhanh; hãy thử với tài liệu thật.
- Quên tính số người dùng: một người thấy ổn không có nghĩa mười người dùng chung vẫn ổn.
- Bỏ qua lựa chọn đám mây: nếu dữ liệu không nhạy cảm và tần suất thấp, dịch vụ AI đám mây có thể hợp lý hơn đầu tư phần cứng.
Khi nào không nên đầu tư GPU
Khi nhu cầu chỉ là vài câu hỏi mỗi ngày, dữ liệu không nhạy cảm và công ty đã có tài khoản AI đám mây. Lúc này phần cứng đắt tiền dễ bị bỏ không.
Hãy để người dùng thật thử ba câu hỏi công việc trên máy hiện có trước khi mua GPU. Số token/giây trên màn hình chỉ có ý nghĩa khi đi kèm cảm nhận chờ đợi của người dùng.
Cần máy tính hoặc server chạy AI cho công ty? PCTech tư vấn cấu hình theo mô hình và số người dùng, lắp ráp, cài sẵn Ollama/Open WebUI, bảo hành tận nơi tại TP.HCM.
Nhập mô hình muốn chạy và số người dùng, nhận gợi ý GPU, RAM, SSD ngay. Dùng thử ngay
Câu hỏi thường gặp
Máy không có card đồ họa rời có chạy được ChatGPT offline không?
ChatGPT không chạy offline, nhưng bạn có thể chạy các mô hình mã nguồn mở nhỏ bằng CPU qua Ollama hoặc LM Studio. Mô hình 1B–4B bản 4-bit là điểm khởi đầu hợp lý cho máy văn phòng.
CPU chạy LLM 7B có nhanh không?
Chạy được nhưng thường chỉ vài token mỗi giây, tùy CPU và RAM. Đủ cho thử nghiệm hoặc câu trả lời ngắn, chưa thoải mái cho dùng cả ngày.
Nâng RAM có giúp chạy AI bằng CPU nhanh hơn không?
Thêm dung lượng giúp nạp được mô hình lớn hơn, còn tốc độ phụ thuộc băng thông. Cắm đủ hai thanh để chạy hai kênh thường cải thiện rõ hơn chỉ tăng dung lượng.
Laptop có NPU có thay được GPU để chạy AI không?
NPU tốt cho các tính năng AI nhỏ tích hợp trong hệ điều hành. Để chạy LLM tùy ý, hỗ trợ NPU còn phụ thuộc từng công cụ; GPU rời vẫn linh hoạt hơn.
Tạo ảnh AI bằng CPU được không?
Về kỹ thuật là được nhưng rất chậm, không thực dụng cho công việc hằng ngày. Tạo ảnh nên dùng GPU hoặc dịch vụ đám mây.
Doanh nghiệp nhỏ nên đầu tư GPU hay dùng AI đám mây?
Nếu dữ liệu nhạy cảm và dùng nhiều mỗi ngày, GPU tại chỗ đáng cân nhắc. Nếu dùng ít và dữ liệu thông thường, AI đám mây thường gọn nhẹ hơn.
Bài viết liên quan
- Máy tính chạy AI cục bộ: chọn cấu hình theo nhu cầu và ngân sách
- Cần bao nhiêu VRAM để chạy LLM 7B, 14B, 32B, 70B?
- Máy tính chạy AI cần bao nhiêu RAM?
- Card đồ họa cho AI: cần GPU gì để chạy mô hình AI tại chỗ
- NPU và AI PC là gì? Có cần mua laptop AI không
- Chạy mô hình AI nhỏ trên máy văn phòng cũ: được đến đâu
- GPU đám mây vs server tại chỗ cho AI doanh nghiệp: chọn hướng nào
- Dual Channel là gì? Có cần cắm 2 thanh RAM không