Máy tính chạy AI cục bộ nên có tối thiểu 32 GB RAM; 16 GB chỉ đủ thử mô hình nhỏ 1B–7B. Nguyên tắc dễ nhớ: RAM hệ thống nên lớn hơn hoặc bằng VRAM của GPU, cộng thêm 8–16 GB cho hệ điều hành và ứng dụng. Nếu chạy mô hình bằng CPU hoặc mô hình lớn tràn khỏi VRAM, RAM phải chứa được phần mô hình đó: mô hình 32B Q4 cần khoảng 20–22 GB, 70B Q4 khoảng 40–45 GB, nên cần 64–128 GB RAM.
Máy tính chạy AI cần bao nhiêu RAM: câu trả lời theo mức dùng
RAM cho AI là bộ nhớ hệ thống của máy tính, khác với VRAM trên card đồ họa. RAM giữ hệ điều hành, ứng dụng, dữ liệu đang xử lý và đóng vai trò trung gian khi nạp mô hình AI vào GPU. Khi máy không có GPU rời, hoặc mô hình quá lớn so với VRAM, RAM trở thành nơi chứa và chạy chính mô hình.
Có thể chia nhu cầu RAM thành bốn mức:
- 16 GB: thử nghiệm mô hình nhỏ 1B–4B, hoặc 7B Q4 khi đóng bớt ứng dụng. Không thoải mái cho làm việc hằng ngày.
- 32 GB: mức khởi điểm hợp lý cho máy có GPU 12–16 GB, chạy mô hình 7B–14B cùng trình duyệt, Office, Zalo.
- 64 GB: cho máy GPU 24 GB, chạy mô hình 32B, RAG tài liệu lớn, hoặc offload một phần mô hình sang CPU.
- 128 GB trở lên: cho server dùng chung, chạy mô hình 70B, nhiều dịch vụ cùng lúc như cơ sở dữ liệu vector, giao diện chat, công cụ xử lý tài liệu.
Vì sao RAM quan trọng khi đã có GPU
Nhiều người nghĩ có GPU mạnh thì RAM không quan trọng. Thực tế RAM vẫn tham gia ở ba thời điểm.
Khi nạp mô hình
Công cụ như Ollama, LM Studio đọc file mô hình từ SSD, đi qua RAM rồi mới chép sang VRAM. Hệ điều hành cũng giữ file trong bộ đệm để lần nạp sau nhanh hơn. Thiếu RAM khiến quá trình này chậm, máy dùng bộ nhớ ảo trên ổ cứng và giật.
Khi mô hình tràn khỏi VRAM
Nếu mô hình 32B Q4 cần khoảng 21 GB mà card chỉ có 16 GB, phần còn lại sẽ chạy trên CPU và nằm trong RAM. Lúc này RAM phải đủ chứa phần tràn cộng với mọi thứ khác đang chạy.
Khi chạy các thành phần phụ trợ
Hệ thống AI nội bộ hiếm khi chỉ có mô hình. Một máy phục vụ văn phòng thường chạy thêm giao diện chat, cơ sở dữ liệu vector cho RAG, mô hình embedding, công cụ đọc PDF và OCR. Mỗi thành phần chiếm vài GB RAM, cộng lại rất nhanh.
Vì vậy nguyên tắc an toàn là RAM lớn hơn hoặc bằng VRAM, cộng 8–16 GB cho hệ điều hành và ứng dụng.
Bảng chọn dung lượng RAM theo cấu hình và việc cần làm
Dùng bảng sau để đối chiếu nhanh. Các con số giả định mô hình lượng tử hóa 4-bit, ngữ cảnh vừa phải, hệ điều hành Windows 11 hoặc Linux có giao diện.
Cột “Ghi chú” nêu kịch bản thường gặp ở doanh nghiệp vừa và nhỏ. Nếu bạn vừa chạy AI vừa làm việc nặng khác trên cùng máy như dựng video, thiết kế 3D, máy ảo, hãy cộng thêm dung lượng RAM mà các phần mềm đó đang dùng.
Với máy không có GPU rời, cột “Mô hình chạy bằng CPU” là con số quan trọng nhất, vì toàn bộ mô hình nằm trong RAM. Tốc độ khi đó phụ thuộc băng thông RAM, nên cắm đủ kênh bộ nhớ quan trọng không kém dung lượng.
| VRAM của GPU | RAM gợi ý | Mô hình chạy bằng CPU | Ghi chú |
|---|---|---|---|
| Không có GPU rời | 16–32 GB | 1B–8B Q4 | Thử nghiệm, máy văn phòng |
| 8–12 GB | 32 GB | Phần tràn của 14B | Một người dùng, chat và tóm tắt |
| 16–24 GB | 64 GB | Phần tràn của 32B–70B | Phòng kỹ thuật, RAG tài liệu lớn |
| 48 GB trở lên hoặc nhiều GPU | 128 GB trở lên | Hiếm khi cần | Server dùng chung cả công ty |
Chạy AI hoàn toàn bằng CPU thì RAM cần thế nào
Máy văn phòng không có card rời vẫn chạy được mô hình nhỏ bằng llama.cpp hoặc Ollama. Khi đó RAM vừa chứa mô hình vừa quyết định tốc độ.
Dung lượng
Lấy kích thước file mô hình cộng thêm khoảng 2–4 GB cho ngữ cảnh và bộ đệm, sau đó cộng phần dành cho hệ điều hành và ứng dụng. Ví dụ mô hình 8B Q4 khoảng 5 GB, máy cần ít nhất 16 GB RAM để vừa chạy mô hình vừa mở trình duyệt.
Băng thông quan trọng hơn bạn nghĩ
Mỗi token sinh ra, CPU phải đọc gần như toàn bộ trọng số từ RAM. Vì vậy:
- Cắm RAM chạy dual channel (hai thanh) thay vì một thanh, tốc độ sinh chữ có thể tăng đáng kể.
- RAM DDR5 có băng thông cao hơn DDR4, có lợi cho chạy AI bằng CPU.
- Máy trạm, server có 4–8 kênh bộ nhớ chạy mô hình bằng CPU tốt hơn hẳn máy để bàn thông thường.
Kỳ vọng thực tế
Mô hình 7B–8B Q4 chạy bằng CPU trên máy để bàn đời mới thường đủ dùng cho tóm tắt ngắn, nhưng chậm khi sinh văn bản dài. Mô hình từ 14B trở lên chạy bằng CPU thường quá chậm cho trải nghiệm chat.
Chọn loại RAM: DDR4 hay DDR5, có cần ECC không
Ngoài dung lượng, loại RAM cũng ảnh hưởng đến độ ổn định và tốc độ của máy chạy AI.
- DDR4: phổ biến trên máy đời cũ, giá dễ chịu. Vẫn ổn nếu mô hình chạy chủ yếu trên GPU.
- DDR5: băng thông cao hơn, hữu ích khi chạy hoặc offload mô hình bằng CPU. Nên chọn cho máy lắp mới.
- RAM ECC: tự phát hiện và sửa lỗi bit bộ nhớ. Nên dùng cho server, máy trạm chạy 24/7, nơi lỗi bộ nhớ có thể làm hỏng dữ liệu hoặc gây treo dịch vụ. Cần mainboard và CPU hỗ trợ ECC.
Cấu hình thanh RAM
- Ưu tiên 2 thanh dung lượng lớn thay vì 4 thanh nhỏ trên máy để bàn, vì cắm 4 thanh DDR5 đôi khi phải chạy ở xung thấp hơn.
- Chừa khe trống để nâng cấp sau này nếu mainboard có 4 khe.
- Bật XMP hoặc EXPO trong BIOS để RAM chạy đúng tốc độ công bố, sau đó chạy kiểm tra ổn định.
Đối với máy chủ AI phục vụ nhiều người, độ ổn định quan trọng hơn vài phần trăm tốc độ. Không nên ép xung RAM trên máy chạy dịch vụ cho cả công ty.
Cách kiểm tra máy đã đủ RAM cho AI chưa
Sau khi cài mô hình, hãy kiểm tra thực tế thay vì chỉ dựa vào bảng ước tính.
Chuẩn bị
- Mở các ứng dụng bạn vẫn dùng hằng ngày: trình duyệt, Office, phần mềm kế toán, Zalo.
- Chuẩn bị một tài liệu dài điển hình để thử ngữ cảnh lớn.
Các bước kiểm tra
- Mở Task Manager trên Windows (tab Performance, mục Memory) hoặc lệnh
free -htrên Linux. - Ghi lại mức RAM đang dùng trước khi nạp mô hình.
- Nạp mô hình, đặt câu hỏi có dán tài liệu dài.
- Quan sát RAM đã dùng và dung lượng bộ nhớ ảo (Committed hoặc swap).
- Lặp lại vài lần trong ngày làm việc thật.
Kết quả
- RAM dùng dưới 80%, không có swap: đủ.
- RAM trên 90%, ổ cứng hoạt động liên tục: thiếu RAM, máy đang dùng bộ nhớ ảo.
- Tốc độ sinh chữ giảm mạnh khi mở thêm ứng dụng: cần nâng RAM hoặc giảm kích thước mô hình.
Lỗi thường gặp khi chọn RAM cho máy AI
Những lỗi dưới đây thường khiến máy chạy AI cục bộ hoạt động kém dù đã đầu tư GPU tốt.
- Chỉ cắm một thanh RAM: mất một nửa băng thông, ảnh hưởng rõ khi mô hình chạy bằng CPU.
- RAM nhỏ hơn VRAM: ví dụ GPU 24 GB đi với 16 GB RAM, máy dễ giật khi nạp mô hình lớn.
- Trộn thanh RAM khác hãng, khác xung: máy có thể chạy ở xung thấp nhất hoặc mất ổn định.
- Bỏ qua nhu cầu của RAG: cơ sở dữ liệu vector và mô hình embedding cũng cần RAM, đặc biệt khi kho tài liệu lớn.
- Mua quá nhiều RAM nhưng GPU yếu: 128 GB RAM giúp chạy được mô hình 70B bằng CPU, nhưng tốc độ có thể chỉ vài token mỗi giây, khó dùng cho chat hằng ngày.
Khi nào KHÔNG cần nâng RAM
Nếu mô hình đã chạy 100% trên GPU, RAM dùng dưới 70% và máy không giật, việc nâng RAM gần như không làm AI nhanh hơn. Khoản đầu tư nên dành cho GPU nhiều VRAM hơn hoặc SSD lưu trữ mô hình.
Với máy lắp mới để chạy AI, hãy chọn 2 thanh RAM dung lượng lớn chạy dual channel và chừa khe trống. Nâng RAM sau này dễ và ít rủi ro hơn nhiều so với thay mainboard.
Cần máy tính hoặc server chạy AI cho công ty? PCTech tư vấn cấu hình theo mô hình và số người dùng, lắp ráp, cài sẵn Ollama/Open WebUI, bảo hành tận nơi tại TP.HCM.
Nhập mô hình muốn chạy và số người dùng, nhận gợi ý GPU, RAM, SSD ngay. Dùng thử ngay
Câu hỏi thường gặp
16GB RAM có chạy được AI không?
Có thể chạy mô hình nhỏ 1B–7B ở bản lượng tử hóa 4-bit. Tuy vậy, khi mở thêm trình duyệt và Office, máy dễ thiếu RAM nên 32 GB là mức thoải mái hơn.
Chạy mô hình 70B cần bao nhiêu RAM?
Nếu chạy chủ yếu bằng CPU, bản Q4 của mô hình 70B cần khoảng 40–45 GB chỉ cho trọng số, nên máy cần 64 GB trở lên, tốt nhất là 128 GB. Tốc độ khi đó khá chậm so với chạy trên GPU.
RAM hay VRAM quan trọng hơn khi chạy AI?
Nếu có GPU, VRAM quan trọng hơn vì quyết định mô hình nào chạy nhanh được. RAM đóng vai trò hỗ trợ và trở thành chính khi máy không có GPU hoặc mô hình tràn khỏi VRAM.
Có nên dùng RAM ECC cho máy chạy AI?
Nên dùng cho server hoặc máy trạm chạy liên tục phục vụ nhiều người. Máy cá nhân dùng vài giờ mỗi ngày thì RAM thường vẫn đủ ổn định.
Laptop 32GB RAM không có card rời chạy AI được không?
Được với mô hình 7B–8B lượng tử hóa, phù hợp tóm tắt, soạn thảo ngắn. Tốc độ phụ thuộc CPU và băng thông RAM, thường chậm hơn máy có GPU rời.
Nâng RAM có làm AI chạy nhanh hơn không?
Chỉ nhanh hơn khi máy đang thiếu RAM hoặc mô hình chạy một phần trên CPU. Nếu mô hình đã nằm trọn trong VRAM, nâng RAM gần như không thay đổi tốc độ.
Bài viết liên quan
- Máy tính chạy AI cục bộ: chọn cấu hình theo nhu cầu và ngân sách
- Cần bao nhiêu VRAM để chạy LLM 7B, 14B, 32B, 70B?
- Bao nhiêu GB RAM là đủ? 8GB, 16GB hay 32GB
- RAM ECC là gì? Khác RAM thường ra sao
- Dual Channel là gì? Có cần cắm 2 thanh RAM không
- RAM DDR5 là gì? Có đáng nâng cấp từ DDR4 không
- Chạy AI bằng CPU hay GPU? Khi nào CPU là đủ
- Chạy mô hình AI nhỏ trên máy văn phòng cũ: được đến đâu