Thuê GPU đám mây hay mua server GPU phụ thuộc chủ yếu vào mức độ sử dụng: nếu GPU chạy đều nhiều giờ mỗi ngày, liên tục trong 2–3 năm, mua server thường có tổng chi phí sở hữu (TCO) thấp hơn; nếu chỉ dùng theo đợt, thử nghiệm, hoặc nhu cầu chưa ổn định, thuê theo giờ rẻ và linh hoạt hơn. Cách quyết định đúng là lập bảng TCO đầy đủ cho cả hai phương án, gồm phần cứng, điện, làm mát, nhân sự vận hành, lưu trữ, băng thông và giá trị còn lại, rồi tính điểm hòa vốn theo số giờ GPU dùng mỗi tháng.
Kết luận nhanh: thuê GPU đám mây hay mua server GPU
Trước khi đi vào con số, đây là quy tắc chọn nhanh:
- Chọn thuê GPU đám mây nếu: bạn đang thử nghiệm, nhu cầu thay đổi theo dự án, cần GPU rất mạnh trong thời gian ngắn (ví dụ tinh chỉnh mô hình vài ngày), không có chỗ đặt máy hoặc người vận hành.
- Chọn mua server GPU nếu: tải ổn định và đều đặn hằng ngày, dữ liệu không được rời khỏi công ty, đã có phòng máy, UPS và người vận hành, kế hoạch dùng ít nhất 2–3 năm.
- Chọn mô hình lai nếu: có một tải nền đều đặn (chat nội bộ, xử lý tài liệu) và các đợt cao điểm thỉnh thoảng (huấn luyện, xử lý hàng loạt).
Bài viết này tập trung vào cách tính chi phí. Phần so sánh tổng quan về bảo mật, hiệu năng và vận hành giữa GPU đám mây và server tại chỗ được trình bày ở bài riêng trong cùng chuyên mục.
Tổng chi phí sở hữu (TCO) gồm những khoản nào
TCO (Total Cost of Ownership) là tổng mọi chi phí trực tiếp và gián tiếp để sở hữu và vận hành một tài sản trong suốt vòng đời sử dụng. Sai lầm lớn nhất khi so sánh là chỉ đặt giá mua máy cạnh giá thuê theo giờ. Bảng dưới liệt kê các khoản cần đưa vào cho từng phương án.
Một số khoản thường bị bỏ quên:
- Thời gian của người vận hành: cài đặt, cập nhật, xử lý sự cố, dù là nhân sự nội bộ cũng có chi phí cơ hội.
- Chi phí lưu trữ khi thuê: ổ đĩa đám mây vẫn tính tiền khi máy đã tắt.
- Chi phí dữ liệu đi ra: nhiều nhà cung cấp tính phí khi tải dữ liệu từ đám mây về.
- Giá trị còn lại: GPU mua về sau 3 năm vẫn bán lại hoặc tái sử dụng được một phần.
| Hạng mục | Mua server GPU | Thuê GPU đám mây |
|---|---|---|
| Phần cứng | Chi một lần: GPU, máy chủ, ổ, nguồn | Không có, trả theo giờ hoặc theo tháng |
| Điện năng | Tiền điện GPU chạy tải và chờ | Đã gồm trong giá thuê |
| Làm mát, chỗ đặt | Điều hòa, phòng máy, tủ rack | Không có |
| UPS, mạng nội bộ | Cần đầu tư thêm nếu chưa có | Cần internet ổn định để truy cập |
| Lưu trữ | Ổ trong máy, NAS | Ổ đĩa đám mây tính phí theo dung lượng và thời gian |
| Băng thông | Gần như không phát sinh thêm | Phí dữ liệu đi ra tùy nhà cung cấp |
| Nhân sự vận hành | Cài đặt, bảo trì phần cứng và phần mềm | Chỉ phần mềm, nhưng phải quản lý tài khoản và chi phí |
| Giá trị còn lại | Bán lại hoặc tái sử dụng sau vòng đời | Không có |
Cách tính điểm hòa vốn theo số giờ sử dụng
Điểm hòa vốn là số giờ GPU dùng mỗi tháng mà tại đó chi phí thuê bằng chi phí sở hữu. Công thức đơn giản hóa:
Chi phí sở hữu mỗi tháng = (Giá mua − Giá trị còn lại) / Số tháng sử dụng + Điện + Làm mát + Vận hành + Bảo trì
Số giờ hòa vốn mỗi tháng = Chi phí sở hữu mỗi tháng / Giá thuê một giờ GPU tương đương
Các bước thực hiện
- Lấy báo giá cấu hình server cụ thể, chọn vòng đời 36 tháng.
- Ước tính giá trị còn lại, thận trọng thì để ở mức thấp.
- Tính điện năng: công suất trung bình nhân số giờ chạy nhân đơn giá điện kinh doanh hiện hành.
- Quy đổi thời gian vận hành ra chi phí theo giờ công.
- Lấy giá thuê theo giờ của GPU có VRAM và hiệu năng tương đương từ bảng giá hiện hành của 2–3 nhà cung cấp.
- Chia để ra số giờ hòa vốn, rồi so với số giờ bạn thực sự dùng.
Nếu số giờ dùng thực tế cao hơn nhiều so với điểm hòa vốn, mua có lợi. Nếu thấp hơn, thuê có lợi. Nếu sát nhau, các yếu tố phi tài chính như bảo mật dữ liệu và độ linh hoạt sẽ quyết định. Hãy dùng số giờ đã đo được trong giai đoạn thử nghiệm, không dùng con số kỳ vọng.
Các hình thức thuê GPU và mức linh hoạt
Thuê GPU không chỉ có một kiểu. Mỗi hình thức có mức cam kết và rủi ro khác nhau, ảnh hưởng trực tiếp đến phép tính TCO.
- Theo yêu cầu (on-demand): bật khi cần, tắt khi xong, trả theo giờ hoặc giây. Linh hoạt nhất, đơn giá cao nhất.
- Giá rẻ có thể bị thu hồi (spot, preemptible): rẻ hơn đáng kể nhưng máy có thể bị dừng bất cứ lúc nào. Hợp với tác vụ chạy lại được như xử lý hàng loạt.
- Cam kết dài hạn (reserved, savings plan): đơn giá thấp hơn đổi lấy cam kết 1–3 năm, gần giống mua nhưng không phải vận hành phần cứng.
- Inference không máy chủ hoặc API mô hình: không thuê GPU, trả theo token hoặc số yêu cầu. Thường là lựa chọn rẻ nhất khi tải thấp và không cần tự kiểm soát mô hình.
| Hình thức | Cam kết | Đơn giá tương đối | Phù hợp |
|---|---|---|---|
| On-demand | Không | Cao | Thử nghiệm, dự án ngắn |
| Spot / preemptible | Không, có thể bị dừng | Thấp | Xử lý hàng loạt chạy lại được |
| Reserved 1–3 năm | Có | Trung bình | Tải ổn định, không muốn giữ phần cứng |
| API mô hình | Không | Theo token | Tải thấp, không cần tự host |
| Mua server | Vốn ban đầu | Thấp nhất khi dùng nhiều | Tải đều, dữ liệu nhạy cảm |
Ví dụ tình huống ở doanh nghiệp Việt Nam
Công ty thiết kế nội thất 30 người
Công ty cần tạo phối cảnh bằng AI khoảng 2–3 giờ mỗi ngày làm việc, tập trung theo dự án, có tháng gần như không dùng. Nhu cầu không đều, không có phòng máy. Thuê GPU theo yêu cầu hoặc dùng máy trạm AI cho 1–2 designer chính là hợp lý; mua server riêng sẽ để GPU nhàn rỗi phần lớn thời gian.
Công ty logistics 60 người
Hệ thống tự động đọc chứng từ, phân loại email, trợ lý AI nội bộ chạy từ sáng đến tối, kéo dài nhiều năm. Dữ liệu khách hàng nhạy cảm. Tải đều và dài hạn, số giờ dùng vượt xa điểm hòa vốn, mua server đặt tại văn phòng hoặc thuê chỗ đặt máy là phương án có TCO tốt.
Startup phần mềm 10 người
Định kỳ vài tuần tinh chỉnh mô hình một lần, mỗi lần cần GPU rất lớn trong 1–2 ngày, thời gian còn lại chỉ chạy suy luận nhẹ. Mô hình lai phù hợp: một máy trạm GPU tầm trung cho phát triển hằng ngày, thuê GPU mạnh theo giờ cho các đợt huấn luyện.
Yếu tố không nằm trong bảng tính nhưng ảnh hưởng quyết định
Ngay cả khi con số nghiêng về một phía, vẫn có những yếu tố khó quy ra tiền:
- Vị trí dữ liệu: hợp đồng với khách hàng hoặc chính sách nội bộ có thể yêu cầu dữ liệu ở lại trong công ty hoặc trong lãnh thổ Việt Nam. Kiểm tra vùng đặt máy của nhà cung cấp đám mây và văn bản pháp lý hiện hành.
- Độ trễ: server tại chỗ phản hồi nhanh hơn trong mạng nội bộ; GPU đám mây ở nước ngoài thêm độ trễ đường truyền, thường không đáng kể với chat nhưng ảnh hưởng ứng dụng thời gian thực.
- Khả năng có GPU: GPU cao cấp trên đám mây có lúc hết hàng ở một số vùng, ảnh hưởng kế hoạch nếu phụ thuộc hoàn toàn.
- Tốc độ thay đổi công nghệ: GPU mua hôm nay có thể bị thế hệ mới vượt sau 2 năm. Thuê giúp luôn tiếp cận phần cứng mới.
- Năng lực vận hành: không có người hiểu phần cứng và Linux, server mua về dễ trở thành gánh nặng.
- Dòng tiền: mua là chi vốn một lần, thuê là chi phí định kỳ, ảnh hưởng khác nhau tới kế hoạch tài chính.
Checklist ra quyết định và lỗi thường gặp khi so sánh
Checklist trước khi quyết định
- Đã đo số giờ GPU thực tế ít nhất 2–4 tuần chưa?
- Đã lấy báo giá cấu hình tương đương ở cả hai phương án chưa?
- Đã tính điện, làm mát, UPS, người vận hành, lưu trữ, băng thông chưa?
- Đã xác định yêu cầu về vị trí dữ liệu chưa?
- Đã có kế hoạch nếu nhu cầu tăng gấp đôi hoặc giảm một nửa chưa?
- Đã cân nhắc API mô hình như phương án thứ ba chưa?
Lỗi thường gặp
- So sánh khập khiễng: so GPU thuê đời mới với server mua dùng card đời cũ hơn, hoặc ngược lại.
- Quên tắt máy thuê: máy on-demand chạy không tải cả cuối tuần làm hóa đơn tăng vọt. Đặt cảnh báo ngân sách và lịch tự tắt.
- Tính vòng đời quá dài: giả định dùng GPU 5–6 năm khiến TCO mua trông rẻ hơn thực tế.
- Bỏ qua thời gian rảnh: server mua về chỉ chạy giờ hành chính thì phần lớn thời gian nhàn rỗi, cần tính đúng mức sử dụng.
Đừng quyết định thuê hay mua dựa trên cảm giác. Hãy thuê GPU theo giờ trong 1 tháng để đo nhu cầu thật, ghi lại số giờ dùng và cấu hình cần thiết, rồi mới đưa con số đó vào bảng TCO.
Cần máy tính hoặc server chạy AI cho công ty? PCTech tư vấn cấu hình theo mô hình và số người dùng, lắp ráp, cài sẵn Ollama/Open WebUI, bảo hành tận nơi tại TP.HCM.
Nhập mô hình muốn chạy và số người dùng, nhận gợi ý GPU, RAM, SSD ngay. Dùng thử ngay
Câu hỏi thường gặp
Dùng GPU bao nhiêu giờ mỗi ngày thì nên mua server?
Không có ngưỡng cố định vì phụ thuộc giá mua, giá thuê và chi phí vận hành của bạn. Hãy tính điểm hòa vốn theo công thức TCO; nhìn chung, tải chạy đều nhiều giờ mỗi ngày trong nhiều năm nghiêng về phía mua.
Thuê GPU đám mây có an toàn cho dữ liệu công ty không?
Các nhà cung cấp lớn có cơ chế mã hóa và kiểm soát truy cập tốt, nhưng dữ liệu vẫn nằm trên hạ tầng bên thứ ba. Cần kiểm tra vùng lưu trữ, điều khoản xử lý dữ liệu và yêu cầu trong hợp đồng với khách hàng của bạn.
Có nên mua GPU cũ để giảm chi phí sở hữu?
Có thể, nếu nguồn gốc rõ ràng và còn bảo hành. Tuy nhiên GPU từng chạy khai thác hoặc tải nặng liên tục có rủi ro hỏng cao hơn, và đời cũ có thể thiếu VRAM hoặc tính năng cho mô hình mới.
Spot instance có dùng để chạy chatbot nội bộ được không?
Không nên. Spot có thể bị thu hồi bất cứ lúc nào, làm chatbot gián đoạn. Spot phù hợp với tác vụ hàng loạt có thể chạy lại như xử lý tài liệu, tạo embedding, huấn luyện có lưu điểm kiểm tra.
Dùng API mô hình có rẻ hơn thuê GPU không?
Khi lượng sử dụng thấp hoặc không đều, API thường rẻ hơn vì chỉ trả theo token. Khi khối lượng xử lý rất lớn và đều, tự chạy mô hình trên GPU thuê hoặc mua có thể kinh tế hơn.
Vòng đời hợp lý để tính TCO server GPU là bao lâu?
Phần lớn doanh nghiệp tính 3 năm cho GPU vì tốc độ thay đổi công nghệ nhanh. Thân máy, nguồn, lưu trữ có thể dùng lâu hơn và tái sử dụng khi thay GPU.
Bài viết liên quan
- GPU đám mây vs server tại chỗ cho AI doanh nghiệp: chọn hướng nào
- Server AI nội bộ cho doanh nghiệp nhỏ: khi nào cần, cấu hình ra sao
- Chi phí triển khai AI cho doanh nghiệp nhỏ gồm những khoản nào
- Máy chạy AI tốn bao nhiêu điện? Cách ước tính và giảm tiền điện
- API AI là gì? Cách doanh nghiệp gọi mô hình AI qua API và tính phí
- Máy trạm AI (AI workstation) cho phòng kỹ thuật, thiết kế: chọn và triển khai
- Fine-tuning là gì? Khi nào doanh nghiệp cần tinh chỉnh mô hình AI
- Đo hiệu quả AI: ROI cần theo dõi những gì