Server AI nội bộ là máy chủ đặt tại văn phòng hoặc trung tâm dữ liệu riêng của doanh nghiệp, chạy mô hình AI (thường là mô hình ngôn ngữ mã nguồn mở) để nhiều nhân viên cùng truy cập qua mạng nội bộ. Doanh nghiệp nhỏ cần server AI khi có dữ liệu nhạy cảm không muốn gửi ra ngoài, nhu cầu dùng AI đều đặn hằng ngày của nhiều người và có người phụ trách vận hành. Cấu hình phổ biến cho 10–30 người dùng là một máy có GPU 24–48 GB VRAM, 64–128 GB RAM, SSD NVMe, chạy Ollama hoặc vLLM kèm giao diện Open WebUI.
Server AI nội bộ là gì và hoạt động thế nào
Server AI nội bộ là một máy chủ chuyên chạy mô hình AI cho tổ chức. Nhân viên mở trình duyệt, vào một địa chỉ nội bộ, chat với AI giống như dùng ChatGPT, nhưng câu hỏi và tài liệu chỉ đi trong mạng công ty. Khác máy trạm AI dành cho một người, server phục vụ nhiều người cùng lúc và thường đặt ở phòng máy hoặc tủ rack.
Luồng hoạt động cơ bản:
- Người dùng gửi câu hỏi từ trình duyệt hoặc ứng dụng nội bộ.
- Giao diện web (ví dụ Open WebUI) xác thực người dùng, ghi lịch sử, chuyển yêu cầu tới máy chủ mô hình.
- Máy chủ mô hình (Ollama, vLLM, llama.cpp) chạy mô hình trên GPU để sinh câu trả lời.
- Nếu có kho tri thức, hệ thống RAG tìm đoạn tài liệu liên quan trong cơ sở dữ liệu vector và gửi kèm cho mô hình.
- Câu trả lời trả về người dùng theo kiểu chữ chạy dần.
Toàn bộ chuỗi này có thể nằm trên một máy duy nhất với doanh nghiệp nhỏ, hoặc tách thành nhiều máy khi quy mô lớn hơn.
Khi nào doanh nghiệp nhỏ thật sự cần server AI nội bộ
Server AI nội bộ là khoản đầu tư có chi phí vận hành, nên chỉ hợp lý khi có lý do rõ ràng. Các dấu hiệu nên cân nhắc:
- Dữ liệu nhạy cảm: hợp đồng, hồ sơ nhân sự, số liệu kế toán, bản vẽ, dữ liệu khách hàng mà chính sách công ty hoặc hợp đồng với đối tác không cho phép đưa lên dịch vụ bên ngoài.
- Dùng đều đặn, nhiều người: từ 10 người trở lên dùng AI hằng ngày cho tóm tắt, soạn thảo, tra cứu quy trình.
- Kho tài liệu nội bộ lớn: muốn AI trả lời dựa trên quy trình, sổ tay sản phẩm, văn bản nội bộ.
- Tích hợp hệ thống: cần AI xử lý tự động hóa đơn, email, phiếu yêu cầu mà không phụ thuộc hạn mức API.
- Có người vận hành: nhân sự IT nội bộ hoặc đối tác IT có thể cập nhật, giám sát, sao lưu.
Khi nào chưa nên
Công ty dưới 10 người, chủ yếu cần AI viết nội dung, không có dữ liệu nhạy cảm, hoặc cần chất lượng ngang các mô hình thương mại hàng đầu cho tác vụ suy luận phức tạp. Khi đó, gói doanh nghiệp của dịch vụ đám mây với cam kết không dùng dữ liệu để huấn luyện thường kinh tế và đơn giản hơn. Nhiều công ty chọn mô hình lai: server nội bộ cho dữ liệu nhạy cảm, dịch vụ đám mây cho việc còn lại.
Kiến trúc phần mềm: các thành phần của một server AI nội bộ
Phần mềm quyết định trải nghiệm người dùng nhiều hơn phần cứng. Một hệ thống đầy đủ gồm các lớp sau:
Lớp máy chủ mô hình
Ollama dễ cài, quản lý mô hình đơn giản, phù hợp vài chục người dùng không quá đồng thời. vLLM tối ưu cho nhiều yêu cầu cùng lúc nhờ cơ chế gom lô liên tục, phù hợp khi số người dùng đồng thời cao, nhưng cấu hình phức tạp hơn và thường dùng mô hình định dạng gốc hoặc lượng tử hóa riêng.
Lớp giao diện và phân quyền
Open WebUI hoặc AnythingLLM cung cấp giao diện chat, tài khoản người dùng, nhóm quyền, lịch sử hội thoại, tải tài liệu lên để hỏi đáp.
Lớp kho tri thức (RAG)
Gồm mô hình embedding, cơ sở dữ liệu vector và bộ đồng bộ tài liệu từ thư mục chia sẻ hoặc NAS. Lớp này giúp AI trả lời theo tài liệu công ty thay vì kiến thức chung.
Lớp hạ tầng
- Docker: đóng gói từng thành phần, dễ cập nhật và khôi phục.
- Reverse proxy có HTTPS: cung cấp địa chỉ nội bộ dễ nhớ, mã hóa kết nối.
- Xác thực tập trung: đăng nhập bằng tài khoản công ty nếu đã có Microsoft 365 hoặc Google Workspace.
- Giám sát: theo dõi nhiệt độ GPU, dung lượng ổ, thời gian phản hồi.
Ước lượng tải: bao nhiêu người dùng thì cần cấu hình nào
Sai lầm phổ biến là tính theo tổng số nhân viên. Thứ cần tính là số yêu cầu đồng thời vào giờ cao điểm. Trong văn phòng, thường chỉ một phần nhỏ người dùng gửi câu hỏi cùng một thời điểm; công ty 30 người có thể chỉ có 3–6 yêu cầu đồng thời lúc đông nhất. Tỷ lệ này thay đổi mạnh nếu có tự động hóa chạy hàng loạt, nên hãy đo thực tế trong giai đoạn thử nghiệm.
Các yếu tố ảnh hưởng:
- Kích thước mô hình: mô hình lớn trả lời tốt hơn nhưng chậm hơn và chiếm nhiều VRAM.
- Độ dài ngữ cảnh: hỏi đáp trên tài liệu dài làm bộ nhớ đệm KV phình to, mỗi phiên chiếm thêm VRAM.
- Phần mềm phục vụ: vLLM chịu tải đồng thời tốt hơn đáng kể so với chạy tuần tự.
Bảng sau là ước lượng có điều kiện cho mô hình lượng tử hóa 4–8 bit, ngữ cảnh vài nghìn đến khoảng 16 nghìn token. Kết quả thực tế phụ thuộc mô hình, phiên bản phần mềm và cách dùng.
| Quy mô | Yêu cầu đồng thời | Mô hình phù hợp | GPU / VRAM gợi ý | Phần mềm |
|---|---|---|---|---|
| 5–15 người | 1–3 | 7B–14B | 1 card 16–24 GB | Ollama + Open WebUI |
| 15–40 người | 3–8 | 14B–32B | 1 card 24–48 GB | Ollama hoặc vLLM + Open WebUI |
| 40–100 người | 8–20 | 32B, có thể kèm 7B cho tác vụ nhẹ | 2 card, tổng 48–96 GB | vLLM + Open WebUI + RAG |
| Trên 100 người hoặc tự động hóa lớn | 20+ | Nhiều mô hình chuyên biệt | Server nhiều GPU | Cần thiết kế riêng |
Cấu hình phần cứng server AI: từng thành phần cần gì
GPU
GPU là trung tâm. VRAM phải chứa được trọng số mô hình cộng bộ nhớ đệm cho các phiên đồng thời. Ví dụ, mô hình 32B lượng tử hóa 4-bit thường cần khoảng 18–20 GB cho trọng số, phần còn lại của card 48 GB dành cho ngữ cảnh và nhiều người dùng. Ưu tiên card có tản nhiệt phù hợp chạy liên tục trong thùng máy server.
CPU, RAM và mainboard
CPU không cần quá mạnh nếu mô hình nằm hoàn toàn trên GPU, nhưng nên có đủ lõi cho Docker, cơ sở dữ liệu vector, xử lý tài liệu. RAM nên từ 64 GB, với hai GPU nên 128 GB, ưu tiên ECC. Mainboard cần đủ khe PCIe x16 và khoảng cách giữa các khe cho hai card.
Lưu trữ
SSD NVMe 1–2 TB cho hệ điều hành, mô hình và cơ sở dữ liệu vector, cấu hình RAID 1 nếu có thể. Dữ liệu tài liệu gốc nên nằm trên NAS, server chỉ đọc và lập chỉ mục.
Nguồn, thùng máy và mạng
- Nguồn dư 30–40% công suất đỉnh, chứng nhận hiệu suất cao, cân nhắc nguồn dự phòng kép với server rack.
- Thùng máy dạng tower cho văn phòng không có tủ rack, dạng rack 2U–4U nếu có phòng máy.
- Cổng mạng 2,5–10 Gbps nếu đồng bộ dữ liệu lớn từ NAS; truy cập chat thông thường 1 Gbps là đủ.
Đặt server ở đâu: điện, nhiệt độ, tiếng ồn và UPS
Server AI chạy GPU tỏa nhiệt nhiều hơn server file thông thường. Một máy hai GPU có thể tiêu thụ từ vài trăm đến hơn một nghìn watt khi tải nặng, tùy dòng card. Chuẩn bị chỗ đặt máy là bước hay bị bỏ qua nhất.
- Nhiệt độ: phòng máy nên có điều hòa chạy cả ngày lẫn đêm. Đặt server trong phòng kho kín, không thông gió là nguyên nhân phổ biến khiến GPU giảm xung hoặc tự tắt.
- Tiếng ồn: server rack rất ồn, không đặt cạnh khu làm việc. Văn phòng nhỏ không có phòng máy có thể chọn thùng tower với quạt lớn, êm hơn.
- Nguồn điện: kiểm tra ổ cắm và đường dây đủ tải, không dùng ổ cắm kéo dài chung với thiết bị khác.
- UPS: chọn UPS online hoặc line-interactive đủ công suất để server tắt an toàn khi mất điện, kết nối phần mềm tự shutdown.
- Vật lý: khóa phòng hoặc tủ rack, vì server chứa dữ liệu và lịch sử hội thoại của cả công ty.
Với văn phòng TP.HCM hay mất điện cục bộ vào mùa mưa hoặc khi khu vực bảo trì lưới điện, UPS và cơ chế tự khởi động lại dịch vụ sau khi có điện là yêu cầu bắt buộc.
Bảo mật và phân quyền cho server AI nội bộ
Đặt AI trong công ty không tự động có nghĩa là an toàn. Server AI tập trung dữ liệu nhạy cảm của nhiều phòng ban, nên cần thiết kế bảo mật ngay từ đầu.
- Không mở server ra internet trực tiếp: người làm việc từ xa truy cập qua VPN.
- Tài khoản riêng cho từng người: tắt đăng ký tự do, dùng đăng nhập tập trung nếu có.
- Phân quyền kho tri thức: tài liệu nhân sự, kế toán chỉ phòng liên quan được hỏi. RAG không phân quyền là cách nhanh nhất để lộ bảng lương.
- Giới hạn lưu lịch sử: đặt thời gian lưu hội thoại phù hợp chính sách công ty, có cơ chế xóa theo yêu cầu.
- Cập nhật định kỳ: phần mềm AI mã nguồn mở cập nhật thường xuyên, có cả bản vá bảo mật.
- Nhật ký truy cập: ghi ai dùng, khi nào, để điều tra khi có sự cố.
Tham khảo danh mục rủi ro cho ứng dụng mô hình ngôn ngữ của OWASP để rà soát các điểm như prompt injection, rò rỉ dữ liệu qua câu trả lời, phân quyền plugin. Nếu xử lý dữ liệu cá nhân, đối chiếu với quy định bảo vệ dữ liệu cá nhân hiện hành của Việt Nam.
Vận hành hằng ngày: cập nhật, giám sát và sao lưu
Chi phí thật của server AI nằm ở vận hành, không chỉ ở lúc mua. Một lịch vận hành tối thiểu:
- Hằng ngày: kiểm tra dịch vụ còn chạy, dung lượng ổ, cảnh báo nhiệt độ GPU. Nên có cảnh báo tự động qua email hoặc Zalo.
- Hằng tuần: xem nhật ký lỗi, thời gian phản hồi trung bình, số người dùng hoạt động.
- Hằng tháng: cập nhật phần mềm trong khung giờ ít người dùng, thử trên bản sao trước nếu có thể; kiểm tra khôi phục sao lưu.
- Hằng quý: đánh giá mô hình mới có tốt hơn cho tiếng Việt và nghiệp vụ công ty không, vệ sinh bụi máy, rà soát phân quyền.
Cần sao lưu gì
Không cần sao lưu file mô hình thường xuyên vì có thể tải lại, nhưng phải sao lưu: cấu hình Docker, cơ sở dữ liệu người dùng và lịch sử, cơ sở dữ liệu vector, prompt hệ thống, danh sách phiên bản mô hình đang dùng. Mất những thứ này đồng nghĩa với dựng lại hệ thống từ đầu.
Đo hiệu quả
Theo dõi số người dùng hoạt động hằng tuần, các nhóm việc phổ biến, phản hồi của người dùng về chất lượng câu trả lời. Đây là cơ sở để quyết định nâng cấp hay điều chỉnh.
Lộ trình triển khai server AI nội bộ trong 90 ngày
Giai đoạn 1 (tuần 1–4): thử nghiệm có kiểm soát
- Chọn 5–10 người dùng thử ở 2–3 phòng ban có nhu cầu rõ.
- Dựng hệ thống trên máy trạm có sẵn hoặc máy thuê, chạy Ollama và Open WebUI.
- Thử 2–3 mô hình, ghi lại câu hỏi thật, đánh giá chất lượng tiếng Việt.
- Đo số yêu cầu đồng thời và độ dài ngữ cảnh thực tế.
Giai đoạn 2 (tuần 5–8): chốt cấu hình và mua sắm
- Dựa trên số liệu thử nghiệm, chọn mô hình và cấu hình GPU.
- Chuẩn bị chỗ đặt máy, UPS, mạng, tài khoản đăng nhập tập trung.
- Viết chính sách sử dụng AI nội bộ: dữ liệu nào được đưa vào, ai được hỏi gì.
Giai đoạn 3 (tuần 9–12): đưa vào sử dụng
- Lắp đặt, cài đặt bằng Docker, cấu hình HTTPS, sao lưu, giám sát.
- Nạp kho tri thức đầu tiên với tài liệu đã được làm sạch và phân quyền.
- Đào tạo người dùng theo nhóm, kèm mẫu prompt cho từng phòng ban.
- Mở rộng dần, thu thập phản hồi, điều chỉnh sau 30 ngày.
Đi theo lộ trình này giúp tránh mua phần cứng trước khi biết mình thật sự cần gì.
Lỗi thường gặp khi doanh nghiệp nhỏ tự dựng server AI
- Mua GPU trước, nghĩ nhu cầu sau: dẫn tới VRAM thiếu cho mô hình mong muốn hoặc dư thừa không dùng tới.
- Kỳ vọng ngang mô hình thương mại lớn nhất: mô hình mở chạy nội bộ rất tốt cho tóm tắt, soạn thảo, hỏi đáp tài liệu, nhưng có thể kém hơn ở suy luận nhiều bước phức tạp. Cần nói rõ với người dùng ngay từ đầu.
- Nạp mọi tài liệu vào RAG: tài liệu cũ, mâu thuẫn, trùng lặp khiến AI trả lời sai. Chất lượng kho tri thức quan trọng hơn số lượng.
- Không có người chịu trách nhiệm: server chạy tốt vài tháng rồi hỏng sau một lần cập nhật, không ai biết khôi phục.
- Bỏ qua giới hạn ngữ cảnh: người dùng dán tài liệu hàng trăm trang, mô hình cắt bớt mà không báo, câu trả lời thiếu ý.
- Mở cổng ra internet cho tiện: giao diện chat có lỗ hổng hoặc mật khẩu yếu trở thành cửa vào mạng nội bộ.
Hãy chạy thử nghiệm 2–4 tuần trên phần cứng sẵn có hoặc máy thuê trước khi mua server. Số liệu thật về số yêu cầu đồng thời và độ dài ngữ cảnh sẽ quyết định cấu hình chính xác hơn mọi ước tính trên giấy.
Câu hỏi thường gặp
Server AI nội bộ có chạy được ChatGPT không?
Không. ChatGPT là dịch vụ của OpenAI và không cài lên server riêng được. Server nội bộ chạy các mô hình mã nguồn mở hoặc mô hình có trọng số công khai, giao diện như Open WebUI cho trải nghiệm tương tự ChatGPT.
Công ty 20 người cần server AI cấu hình thế nào?
Thường một máy với GPU 24 GB VRAM, 64 GB RAM, SSD NVMe 1–2 TB là điểm khởi đầu hợp lý cho mô hình 14B–32B lượng tử hóa. Nên thử nghiệm để đo số yêu cầu đồng thời thực tế trước khi chốt.
Mô hình AI chạy nội bộ có trả lời tiếng Việt tốt không?
Nhiều mô hình mở thế hệ mới xử lý tiếng Việt khá tốt cho tóm tắt, soạn thảo, hỏi đáp. Chất lượng khác nhau giữa các mô hình, nên tự thử bằng câu hỏi thật của công ty trước khi chọn.
Server AI nội bộ có cần kết nối internet không?
Chỉ cần internet khi tải mô hình và cập nhật phần mềm. Khi vận hành, hệ thống có thể chạy hoàn toàn trong mạng nội bộ, đây là lợi thế lớn với dữ liệu nhạy cảm.
Nên chọn Ollama hay vLLM cho server công ty?
Ollama dễ cài và quản lý, phù hợp nhóm nhỏ, ít yêu cầu đồng thời. vLLM chịu tải nhiều người cùng lúc tốt hơn nhưng cấu hình phức tạp hơn, phù hợp khi số người dùng đồng thời cao.
Có thể dùng server AI nội bộ cho tự động hóa không?
Có. Hầu hết máy chủ mô hình cung cấp API tương thích chuẩn OpenAI, nên n8n, Make hoặc script nội bộ có thể gọi để phân loại email, trích xuất hóa đơn, tóm tắt phiếu yêu cầu.
Ai nên vận hành server AI nội bộ trong doanh nghiệp nhỏ?
Một nhân sự IT nội bộ hiểu Linux và Docker, hoặc một đối tác IT có hợp đồng hỗ trợ. Quan trọng là có người chịu trách nhiệm rõ ràng cho cập nhật, sao lưu và xử lý sự cố.