Máy tính chạy AI cục bộ là máy tính (PC, máy trạm hoặc server) đủ sức chạy mô hình AI như LLM, nhận dạng giọng nói hay tạo ảnh ngay trên phần cứng của bạn, không gửi dữ liệu lên dịch vụ đám mây. Linh kiện quyết định là GPU và dung lượng VRAM, sau đó đến RAM hệ thống, SSD NVMe và nguồn. Với nhu cầu chat, tóm tắt tài liệu cho một người, GPU 12–16 GB VRAM và 32 GB RAM thường đủ chạy mô hình 7B–14B lượng tử hóa. Phục vụ nhiều người hoặc mô hình 32B trở lên cần 24 GB VRAM trở lên và 64 GB RAM.
Máy tính chạy AI cục bộ là gì và ai nên đầu tư
Máy tính chạy AI cục bộ là máy có phần cứng đủ mạnh để tự chạy mô hình AI bằng các công cụ như Ollama, LM Studio hoặc llama.cpp. Câu hỏi được gửi tới mô hình nằm ngay trên ổ cứng, câu trả lời được tính toán bằng GPU hoặc CPU của máy, không cần tài khoản dịch vụ đám mây.
Nhóm nên cân nhắc đầu tư gồm:
- Doanh nghiệp có dữ liệu nhạy cảm: hồ sơ kế toán, hợp đồng, dữ liệu khách hàng không muốn đưa lên dịch vụ bên ngoài.
- Công ty 20–50 người muốn có trợ lý AI nội bộ: một máy chủ chạy Open WebUI để cả văn phòng hỏi đáp quy trình, soạn email, tóm tắt biên bản.
- Phòng kỹ thuật, lập trình: cần thử nghiệm nhiều mô hình mở, chạy RAG trên tài liệu nội bộ, không muốn phụ thuộc hạn mức API.
- Cá nhân làm nội dung, thiết kế: chạy mô hình tạo ảnh, chuyển giọng nói thành văn bản hằng ngày.
Khi nào KHÔNG nên mua máy riêng
Nếu bạn chỉ thỉnh thoảng hỏi AI vài câu, cần chất lượng ngang các mô hình thương mại lớn nhất, hoặc không có người quản trị máy, dịch vụ đám mây có gói miễn phí/trả phí thường hợp lý hơn. Máy chạy AI cục bộ đáng giá khi bạn dùng đều đặn, có yêu cầu bảo mật dữ liệu, hoặc cần chạy liên tục cho nhiều người.
Linh kiện nào quyết định tốc độ chạy AI
Với mô hình ngôn ngữ, tốc độ sinh chữ phụ thuộc chủ yếu vào việc toàn bộ mô hình có nằm gọn trong bộ nhớ của GPU hay không. Thứ tự ưu tiên khi chọn linh kiện thường là:
- GPU và VRAM: VRAM quyết định mô hình lớn cỡ nào chạy được. Băng thông bộ nhớ của GPU quyết định số token mỗi giây.
- RAM hệ thống: nạp mô hình, chạy phần mô hình tràn ra khỏi VRAM, chạy song song trình duyệt, Office, cơ sở dữ liệu vector.
- SSD NVMe: mỗi mô hình nặng từ vài GB đến vài chục GB, SSD nhanh giúp nạp mô hình nhanh hơn và lưu được nhiều bản.
- CPU: quan trọng khi chạy mô hình trên CPU hoặc xử lý tài liệu đầu vào. Với máy có GPU tốt, CPU tầm trung 6–8 nhân thường là đủ.
- Nguồn và tản nhiệt: GPU chạy tải cao nhiều giờ liền cần nguồn chất lượng và luồng gió tốt trong thùng máy.
Một lỗi phổ biến là dồn ngân sách vào CPU cao cấp rồi dùng GPU ít VRAM. Với AI cục bộ, cách phân bổ này cho kết quả kém hơn nhiều so với CPU tầm trung đi kèm GPU nhiều VRAM. Nếu phải cắt giảm, hãy cắt ở CPU, vỏ máy, đèn trang trí trước khi cắt ở VRAM.
Xác định nhu cầu trước khi chọn cấu hình
Trước khi xem linh kiện, hãy trả lời năm câu hỏi. Câu trả lời sẽ quyết định gần như toàn bộ cấu hình.
- Chạy loại mô hình nào? Chat và tóm tắt văn bản (LLM), chuyển giọng nói thành chữ, tạo ảnh, hay đọc tài liệu nội bộ bằng RAG.
- Kích thước mô hình? Mô hình 7B–8B đủ cho soạn thảo cơ bản; 14B cho câu trả lời tiếng Việt mạch lạc hơn; 32B trở lên cho phân tích phức tạp, viết mã.
- Bao nhiêu người dùng cùng lúc? Một người khác hẳn mười người cùng hỏi lúc 9 giờ sáng.
- Độ dài ngữ cảnh? Hỏi đáp ngắn cần ít bộ nhớ; đưa hợp đồng 40 trang vào một lần cần nhiều bộ nhớ hơn đáng kể cho KV cache.
- Máy đặt ở đâu, chạy bao lâu? Đặt cạnh bàn làm việc thì cần êm; chạy 24/7 trong phòng server thì cần UPS, tản nhiệt và quản trị từ xa.
Ví dụ thực tế
Một văn phòng kế toán 25 người muốn tóm tắt chứng từ và trả lời câu hỏi về quy trình nội bộ. Nhu cầu thật là mô hình 14B, ngữ cảnh trung bình, khoảng 5–8 người dùng xen kẽ. Cấu hình phù hợp là một máy trạm GPU 24 GB VRAM, không cần server nhiều GPU như suy nghĩ ban đầu của nhiều chủ doanh nghiệp.
Bảng cấu hình mẫu theo nhu cầu và mức ngân sách
Bảng dưới đây chia thành bốn mức, từ thử nghiệm đến phục vụ cả văn phòng. Đây là cấu hình định hướng; giá linh kiện biến động liên tục nên hãy xem bảng giá hiện hành trước khi chốt.
Nguyên tắc đọc bảng: cột “Mô hình phù hợp” giả định bản lượng tử hóa 4-bit (Q4) và ngữ cảnh vừa phải. Nếu bạn cần bản 8-bit hoặc ngữ cảnh dài, hãy lên một bậc VRAM. Với mức “Văn phòng dùng chung”, nên tính thêm UPS và một ổ NAS để sao lưu dữ liệu, cấu hình.
Nếu chưa chắc nhu cầu, hãy bắt đầu ở mức “Phổ thông” trên một máy có sẵn khe PCIe x16 và nguồn đủ khỏe, rồi nâng GPU sau. Cách này giảm rủi ro mua thừa khi đội ngũ chưa quen dùng AI cục bộ.
| Mức | GPU / VRAM | RAM | Lưu trữ | Mô hình phù hợp |
|---|---|---|---|---|
| Thử nghiệm | Không GPU rời hoặc 8 GB VRAM | 16–32 GB | SSD NVMe 512 GB | Mô hình 1B–4B, 7B chạy chậm |
| Phổ thông, 1 người | 12–16 GB VRAM | 32 GB | SSD NVMe 1 TB | 7B–14B Q4, Whisper, tạo ảnh cơ bản |
| Chuyên sâu, phòng kỹ thuật | 24 GB VRAM | 64 GB | SSD NVMe 2 TB | 14B–32B Q4, RAG tài liệu lớn |
| Văn phòng dùng chung | 2 GPU 24 GB hoặc GPU 48 GB trở lên | 128 GB, nên dùng ECC | 2 SSD NVMe + NAS sao lưu | 32B–70B Q4, nhiều người dùng |
Chọn GPU: VRAM quan trọng hơn tốc độ xung nhịp
GPU là linh kiện đắt nhất và quyết định nhất. Khi so sánh hai card, hãy xem theo thứ tự: dung lượng VRAM, băng thông bộ nhớ, hệ sinh thái phần mềm, rồi mới đến hiệu năng tính toán.
Ước lượng VRAM nhanh
Một cách nhẩm thô: mô hình lượng tử hóa 4-bit cần khoảng 0,6–0,7 GB cho mỗi tỷ tham số, cộng thêm 1–2 GB cho KV cache và bộ đệm khi ngữ cảnh ngắn. Như vậy mô hình 7B lượng tử hóa 4-bit thường cần khoảng 5–6 GB VRAM, mô hình 14B khoảng 9–11 GB. Con số thực tế phụ thuộc định dạng, phiên bản công cụ và độ dài ngữ cảnh.
NVIDIA hay AMD
- NVIDIA: hầu hết công cụ AI hỗ trợ CUDA trước tiên, tài liệu và hướng dẫn nhiều, ít lỗi tương thích. Lựa chọn an toàn cho doanh nghiệp không có chuyên gia.
- AMD: một số dòng có nhiều VRAM, Ollama và llama.cpp đã hỗ trợ ROCm hoặc Vulkan trên nhiều card, nhưng cần kiểm tra danh sách card được hỗ trợ trên trang chính thức trước khi mua.
Card chơi game hay card chuyên dụng
Card dòng game cho tỷ lệ VRAM trên chi phí tốt, phù hợp máy một người dùng. Card chuyên dụng cho máy trạm có VRAM lớn, tản nhiệt kiểu thổi ra sau phù hợp lắp nhiều card, hỗ trợ bộ nhớ ECC, phù hợp máy chạy 24/7. Card cũ đã qua đào coin cần kiểm tra kỹ quạt, keo tản nhiệt và nhiệt độ VRAM trước khi đưa vào sử dụng.
RAM, CPU và mainboard: đủ dùng, đừng lãng phí
RAM hệ thống nên lớn hơn hoặc bằng tổng VRAM, và tối thiểu 32 GB cho máy làm AI nghiêm túc. Lý do: khi nạp mô hình, dữ liệu thường đi qua RAM; khi mô hình lớn hơn VRAM, công cụ như llama.cpp sẽ đẩy một phần lớp mô hình sang RAM và CPU xử lý. Phần chạy trên CPU chậm hơn nhiều, nhưng vẫn giúp bạn chạy được mô hình mà nếu không thì không chạy nổi.
Chọn CPU
- Máy có GPU mạnh: CPU 6–8 nhân đời mới là đủ, ưu tiên hỗ trợ đủ làn PCIe cho GPU và SSD.
- Máy chạy mô hình chủ yếu bằng CPU: ưu tiên nhiều kênh bộ nhớ và hỗ trợ tập lệnh AVX2 hoặc AVX-512, vì tốc độ khi đó phụ thuộc băng thông RAM.
Chọn mainboard
- Khe PCIe x16 cho GPU chính; nếu định lắp hai GPU, kiểm tra khoảng cách khe và số làn PCIe thực tế khi cắm đồng thời.
- Ít nhất hai khe M.2 NVMe.
- Bốn khe RAM để mở rộng sau này; ưu tiên cắm đủ kênh (dual channel trở lên).
- Cổng mạng 2,5 GbE nếu máy phục vụ cả văn phòng và kết nối NAS.
Đừng trả thêm cho mainboard ép xung cao cấp nếu bạn không ép xung. Khoản đó nên chuyển sang VRAM hoặc RAM.
Ổ cứng, nguồn, tản nhiệt và UPS cho máy chạy liên tục
Nhiều người chỉ để ý GPU rồi lắp nguồn yếu, thùng máy bí. Kết quả là máy tự tắt khi GPU chạy hết tải, hoặc GPU giảm xung vì quá nóng.
Ổ cứng
Chọn SSD NVMe có DRAM cache, dung lượng 1 TB trở lên. Một thư viện vài mô hình ở nhiều mức lượng tử hóa có thể chiếm hàng trăm GB. Nên tách ổ hệ điều hành và ổ chứa mô hình, dữ liệu RAG để dễ sao lưu và cài lại.
Nguồn
Cộng công suất tối đa (TDP) của GPU và CPU, nhân với khoảng 1,5 để có dư cho đỉnh tải tức thời. Chọn nguồn có chứng nhận hiệu suất từ 80 Plus Gold trở lên, đủ đầu cấp nguồn PCIe đúng chuẩn của card.
Tản nhiệt
- Thùng máy có ít nhất ba quạt hút trước, một quạt xả sau.
- Đặt máy nơi thoáng, không sát tường, không trong tủ kín.
- Theo dõi nhiệt độ GPU bằng nvidia-smi hoặc phần mềm của hãng; nếu thường xuyên chạm ngưỡng giảm xung, cần cải thiện luồng gió.
UPS
Máy phục vụ cả văn phòng nên có UPS để tránh mất điện đột ngột làm hỏng dữ liệu, đồng thời cho phép tắt máy an toàn. Công suất UPS tính theo công suất thực tế của máy cộng màn hình, thiết bị mạng đi kèm.
Laptop, PC, máy trạm hay server: chọn dạng máy nào
Cùng một nhu cầu AI cục bộ, dạng máy phù hợp phụ thuộc vào người dùng, nơi đặt và thời gian vận hành.
- Laptop có GPU rời: tiện mang đi, nhưng VRAM trên laptop thường thấp hơn bản desktop cùng tên, tản nhiệt hạn chế, khó nâng cấp. Phù hợp người cần demo, làm việc di động với mô hình nhỏ.
- Máy Mac dùng bộ nhớ hợp nhất: RAM được chia sẻ cho GPU nên chạy được mô hình khá lớn, êm, tiết kiệm điện. Đổi lại không nâng cấp được, một số công cụ hỗ trợ kém hơn CUDA.
- PC desktop tự lắp: tỷ lệ hiệu năng trên chi phí tốt nhất, dễ nâng cấp GPU, phù hợp cá nhân và phòng kỹ thuật.
- Máy trạm (workstation): linh kiện chuyên dụng, RAM ECC, chạy ổn định nhiều giờ, có bảo hành tận nơi. Phù hợp phòng thiết kế, kỹ thuật.
- Server rack hoặc tower: nhiều GPU, quản trị từ xa, đặt trong phòng máy. Phù hợp khi nhiều người dùng chung qua Open WebUI hoặc vLLM.
Gợi ý nhanh
Một người dùng: PC desktop. Phòng 5–10 người: máy trạm một GPU 24 GB trở lên. Cả công ty và chạy 24/7: server, đặt sau UPS, có kế hoạch sao lưu. Nếu nhu cầu chưa rõ, có thể thuê GPU đám mây vài tuần để đo trước khi mua.
Quy trình 6 bước chốt cấu hình và kiểm tra sau khi lắp
Làm theo trình tự sau giúp tránh mua sai linh kiện đắt nhất.
- Liệt kê việc cần làm và chọn mô hình mục tiêu (ví dụ 14B cho chat tiếng Việt, Whisper cho ghi âm cuộc họp).
- Thử trước mô hình đó trên máy sẵn có hoặc GPU thuê theo giờ để biết chất lượng có đạt không.
- Tính VRAM theo kích thước mô hình, mức lượng tử hóa và độ dài ngữ cảnh, cộng dư 20–30%.
- Chọn GPU đáp ứng VRAM, rồi chọn RAM, SSD, nguồn, thùng máy xoay quanh GPU.
- Lắp đặt và cài phần mềm: driver GPU, Ollama hoặc LM Studio, giao diện chat như Open WebUI nếu dùng chung.
- Kiểm tra kết quả: chạy mô hình mục tiêu, đo token mỗi giây, theo dõi VRAM và nhiệt độ trong 30–60 phút tải liên tục.
Checklist kiểm tra
- Lệnh
ollama pscho thấy mô hình chạy 100% trên GPU, không tràn sang CPU. - Nhiệt độ GPU ổn định, không giảm xung.
- Tốc độ sinh chữ đủ nhanh để đọc thoải mái khi nhiều người hỏi cùng lúc.
- Máy khởi động lại vẫn tự chạy dịch vụ AI, có sao lưu cấu hình.
Lỗi thường gặp khi chọn máy tính chạy AI
Đây là những sai lầm hay gặp khi doanh nghiệp tự chọn cấu hình máy tính chạy AI cục bộ.
- Chọn GPU theo hiệu năng game: card mạnh nhưng ít VRAM sẽ không chạy nổi mô hình cần thiết, trong khi card yếu hơn nhưng nhiều VRAM lại chạy tốt.
- Quên KV cache: mô hình vừa khít VRAM với câu hỏi ngắn nhưng báo lỗi hết bộ nhớ khi dán tài liệu dài.
- RAM ít hơn VRAM: nạp mô hình chậm, máy giật khi mở thêm ứng dụng.
- Nguồn kém chất lượng: máy tự khởi động lại khi GPU tăng tải đột ngột.
- Mong đợi ngang mô hình thương mại lớn nhất: mô hình mở chạy cục bộ đã rất tốt cho nhiều việc văn phòng, nhưng với suy luận phức tạp vẫn có khoảng cách. Nên đánh giá trên dữ liệu thật của công ty.
- Không tính chi phí vận hành: điện năng, làm mát, thời gian người quản trị cập nhật mô hình, sao lưu.
- Bỏ qua bảo mật: mở cổng dịch vụ AI ra Internet không có xác thực, ai cũng truy cập được.
Phần lớn lỗi trên tránh được nếu bạn thử nghiệm mô hình mục tiêu trước khi mua, và nhờ người có kinh nghiệm rà lại danh sách linh kiện.
Hãy chốt mô hình và độ dài ngữ cảnh mục tiêu trước, rồi chọn GPU có VRAM dư khoảng 20–30% so với ước tính. Phần dư này giúp máy dùng được thêm 2–3 năm khi mô hình mới ra đời và nhu cầu tăng lên.
Câu hỏi thường gặp
Máy tính chạy AI cục bộ cần card đồ họa bao nhiêu GB?
Để chạy mô hình 7B–14B lượng tử hóa 4-bit mượt, GPU 12–16 GB VRAM là mức hợp lý. Mô hình 32B cần khoảng 24 GB, còn 70B cần từ 48 GB trở lên hoặc chia cho nhiều GPU.
Không có card đồ họa rời có chạy AI được không?
Được, Ollama và llama.cpp chạy được trên CPU với mô hình nhỏ 1B–4B. Tốc độ chậm hơn nhiều so với GPU, phù hợp thử nghiệm hơn là dùng hằng ngày.
Nên mua laptop hay PC để chạy AI cục bộ?
Nếu không cần di chuyển, PC desktop cho nhiều VRAM hơn, tản nhiệt tốt hơn và dễ nâng cấp. Laptop phù hợp người cần mang mô hình nhỏ đi demo hoặc làm việc ngoài văn phòng.
Một máy chạy AI có phục vụ được cả văn phòng 20 người không?
Được nếu cấu hình đủ VRAM và dùng công cụ hỗ trợ xử lý nhiều yêu cầu như Ollama, vLLM kèm Open WebUI. Thường không phải 20 người hỏi cùng lúc, nên một máy trạm GPU 24 GB trở lên có thể đáp ứng nhu cầu cơ bản.
Chạy AI cục bộ có tốn điện nhiều không?
Khi đang sinh câu trả lời, GPU tiêu thụ gần công suất tối đa; khi nhàn rỗi thì thấp hơn nhiều. Chi phí điện phụ thuộc số giờ chạy tải thực tế, nên đo bằng ổ cắm có đồng hồ công suất sau khi lắp.
Card AMD có chạy Ollama được không?
Nhiều card AMD đời mới đã được Ollama hỗ trợ qua ROCm. Hãy kiểm tra danh sách GPU được hỗ trợ trên trang tài liệu chính thức của Ollama trước khi mua.
Có nên mua card đồ họa cũ để chạy AI?
Có thể, nếu card nhiều VRAM và còn tốt. Cần kiểm tra nhiệt độ, quạt, chạy thử tải dài và ưu tiên nơi bán có bảo hành rõ ràng.