ChatGPT nội bộ tự host là hệ thống chat AI mà doanh nghiệp tự vận hành trên server của mình: mô hình ngôn ngữ mở chạy bằng Ollama hoặc vLLM, giao diện như Open WebUI, đăng nhập bằng tài khoản công ty và kho tài liệu nội bộ để AI trả lời theo quy trình riêng. Cách này phù hợp khi dữ liệu nhạy cảm, số người dùng đều đặn và có người quản trị IT. Đổi lại, chất lượng mô hình mở thường thấp hơn các mô hình thương mại hàng đầu, và doanh nghiệp tự chịu trách nhiệm phần cứng, bảo mật, sao lưu, cập nhật.
ChatGPT nội bộ tự host là gì
ChatGPT nội bộ là cách gọi quen miệng cho một hệ thống chat AI chỉ phục vụ nhân viên công ty, chạy trên hạ tầng do công ty kiểm soát. Nó không phải sản phẩm ChatGPT của OpenAI, mà là tổ hợp các phần mềm mở ghép lại để cho trải nghiệm tương tự: gõ câu hỏi, nhận câu trả lời, lưu lịch sử, hỏi trên tài liệu.
Khác biệt cốt lõi so với dùng dịch vụ đám mây:
- Quyền kiểm soát dữ liệu: câu hỏi và tài liệu nằm trên server công ty, không đi qua bên thứ ba.
- Quyền chọn mô hình: dùng mô hình mở phù hợp tiếng Việt, đổi mô hình khi có bản tốt hơn.
- Trách nhiệm vận hành: công ty tự lo máy hỏng, cập nhật bảo mật, sao lưu, hỗ trợ người dùng.
Không phải lựa chọn duy nhất
Nhiều doanh nghiệp chọn cách lai: dùng gói doanh nghiệp của dịch vụ đám mây cho việc chung, và ChatGPT nội bộ cho dữ liệu nhạy cảm như hồ sơ nhân sự, bảng lương, hợp đồng. Quyết định nên dựa trên loại dữ liệu và năng lực vận hành, không phải xu hướng.
Kiến trúc một hệ thống ChatGPT nội bộ gồm những lớp nào
Hình dung hệ thống như năm lớp chồng lên nhau, mỗi lớp có lựa chọn riêng. Hiểu rõ các lớp giúp bạn thay một phần mà không phải làm lại từ đầu.
Luồng một câu hỏi đi qua hệ thống:
- Nhân viên đăng nhập giao diện web bằng tài khoản công ty.
- Giao diện kiểm tra quyền, tìm đoạn tài liệu liên quan trong kho vector.
- Câu hỏi kèm đoạn tài liệu được gửi tới máy chủ suy luận.
- Mô hình trên GPU sinh câu trả lời, trả về giao diện.
- Hệ thống ghi log ai hỏi gì, lúc nào, để kiểm soát và cải thiện.
| Lớp | Vai trò | Lựa chọn phổ biến | Ghi chú |
|---|---|---|---|
| Phần cứng | Chạy mô hình, lưu dữ liệu | Máy trạm GPU, server rack, có UPS | VRAM quyết định cỡ mô hình |
| Máy chủ suy luận | Nạp mô hình, xử lý yêu cầu | Ollama, vLLM, llama.cpp server | vLLM mạnh khi nhiều người dùng đồng thời |
| Mô hình | Hiểu câu hỏi, sinh câu trả lời | Các dòng mô hình mở 7B–32B | Đọc giấy phép, thử tiếng Việt |
| Giao diện và tài khoản | Chat, phân quyền, lịch sử | Open WebUI, AnythingLLM, LibreChat | Nên đăng nhập qua tài khoản công ty |
| Tài liệu (RAG) | Đưa kiến thức nội bộ vào câu trả lời | Kho tài liệu tích hợp, cơ sở dữ liệu vector | Chất lượng phụ thuộc tài liệu đầu vào |
Khi nào doanh nghiệp nên tự dựng, khi nào không
Tự dựng ChatGPT nội bộ hợp lý khi hội đủ phần lớn các điều kiện dưới đây:
- Có dữ liệu không được phép hoặc không muốn gửi ra ngoài: hồ sơ bệnh án, dữ liệu khách hàng, bản vẽ kỹ thuật, hồ sơ thầu.
- Có từ khoảng 15–20 người dùng đều đặn hằng ngày, đủ để tận dụng phần cứng.
- Có người IT nội bộ hoặc đối tác bảo trì phụ trách máy chủ.
- Nhu cầu chủ yếu là soạn thảo, tóm tắt, hỏi đáp tài liệu, không đòi hỏi suy luận phức tạp nhất.
Trường hợp không nên
- Công ty 5–10 người, không có ai quản trị máy: máy chủ dễ thành “hộp đen” không ai dám đụng.
- Cần chất lượng cao nhất cho phân tích chiến lược, lập trình phức tạp: mô hình mở cỡ vừa khó theo kịp.
- Chỉ muốn thử AI cho biết: bắt đầu bằng dịch vụ đám mây có gói miễn phí/trả phí rẻ hơn về thời gian.
Một câu hỏi kiểm tra hữu ích: nếu server tắt một tuần, công việc có bị ảnh hưởng không? Nếu có, bạn cần đầu tư nghiêm túc vào vận hành, không chỉ cài đặt.
Chọn mô hình và phần cứng theo số người dùng
Số người dùng đồng thời quan trọng hơn tổng số nhân viên. Công ty 50 người thường chỉ có 3–8 người hỏi cùng lúc vào giờ cao điểm. Bảng dưới là ước lượng tham khảo cho mô hình lượng tử hóa 4-bit, ngữ cảnh vừa phải; con số thực tế thay đổi theo phiên bản phần mềm, độ dài tài liệu và mô hình cụ thể.
Nguyên tắc chọn
- Chọn mô hình trước, phần cứng sau: thử 2–3 mô hình với câu hỏi thật của công ty.
- Chừa VRAM cho ngữ cảnh dài khi hỏi trên tài liệu, vì bộ nhớ đệm tăng theo độ dài ngữ cảnh và số phiên song song.
- Khi số người đồng thời tăng, cân nhắc chuyển từ Ollama sang vLLM để phục vụ song song hiệu quả hơn.
| Quy mô | Cỡ mô hình gợi ý | GPU tham khảo | RAM hệ thống |
|---|---|---|---|
| Nhóm thử nghiệm 5–10 người | 7B–8B | Một GPU 12–16 GB VRAM | 32 GB |
| Công ty 20–50 người | 12B–14B | Một GPU 24 GB VRAM | 64 GB |
| 50–150 người, hỏi tài liệu nhiều | 27B–32B | Hai GPU 24 GB hoặc một GPU 48 GB | 128 GB |
| Nhiều phòng ban, nhiều mô hình | Kết hợp mô hình nhỏ và lớn | Server nhiều GPU, chạy vLLM | Từ 128 GB, tùy thiết kế |
Bảo mật cho ChatGPT nội bộ
Tự host không tự động an toàn. Dữ liệu tập trung một chỗ, nên một lỗ hổng có thể lộ nhiều hơn. Checklist tối thiểu:
- Chỉ truy cập trong mạng nội bộ hoặc qua VPN: không mở cổng giao diện chat, cổng Ollama hay vLLM ra Internet.
- Đăng nhập tập trung: kết nối với tài khoản công ty (Microsoft 365, Google Workspace) qua OIDC nếu giao diện hỗ trợ, để nhân viên nghỉ việc bị khóa ngay.
- Phân quyền tài liệu: kho nhân sự, kế toán tách riêng; không gom mọi tài liệu vào một kho chung.
- Mã hóa kết nối: dùng HTTPS bằng reverse proxy với chứng chỉ nội bộ.
- Cập nhật định kỳ: hệ điều hành, Docker, giao diện chat; đọc ghi chú phát hành về lỗi bảo mật.
- Ghi log và rà soát: lưu log truy cập, định kỳ xem tài khoản lạ, lượng truy vấn bất thường.
Chính sách dữ liệu đi kèm
Kỹ thuật phải đi cùng quy định: loại dữ liệu nào được đưa vào, ai được xem lịch sử chat, lưu bao lâu. Với dữ liệu cá nhân, hãy đối chiếu quy định bảo vệ dữ liệu cá nhân hiện hành của Việt Nam và hỏi ý kiến bộ phận pháp chế.
Lộ trình triển khai theo 4 giai đoạn
Chia nhỏ giúp giảm rủi ro và cho bạn số liệu thật trước khi đầu tư lớn.
- Giai đoạn 1 – Thử nghiệm (2–3 tuần): dùng một máy trạm có GPU sẵn có, cài Ollama và Open WebUI, 5 người thử. Mục tiêu: chọn mô hình phù hợp tiếng Việt, liệt kê 10 việc AI làm tốt.
- Giai đoạn 2 – Thí điểm phòng ban (1–2 tháng): chọn một phòng có tài liệu rõ ràng, ví dụ chăm sóc khách hàng. Xây kho tài liệu, bộ câu hỏi kiểm tra, đo thời gian tiết kiệm.
- Giai đoạn 3 – Hạ tầng chính thức: đầu tư server đặt trong tủ rack có UPS, mạng ổn định, sao lưu, đăng nhập tập trung, HTTPS.
- Giai đoạn 4 – Mở rộng và vận hành: thêm phòng ban, mẫu prompt cho từng nhóm, kết nối quy trình tự động khi cần.
Ví dụ ở quy mô 35 người
Một công ty tư vấn thiết kế nội thất bắt đầu với phòng dự án: AI tóm tắt biên bản họp khách, soạn email báo tiến độ, tra quy chuẩn vật liệu từ kho tài liệu. Sau thí điểm, phòng kế toán được thêm vào với kho riêng và quyền tách biệt, máy chủ được nâng cấp lên GPU 24 GB.
Chi phí vận hành cần tính trước
Không chỉ có tiền mua máy. Khi lập ngân sách, liệt kê đủ các khoản sau và xin báo giá hiện hành cho từng khoản:
- Phần cứng: server hoặc máy trạm GPU, ổ lưu trữ, UPS, tủ rack, switch.
- Điện năng: máy GPU chạy 24/7 tiêu thụ đáng kể, cần ước tính theo công suất thực tế và giờ dùng.
- Nhân sự quản trị: thời gian IT cập nhật, sao lưu, hỗ trợ người dùng, xử lý sự cố.
- Phần mềm: đa số là mã nguồn mở, nhưng có thể cần bản doanh nghiệp, chứng chỉ, VPN.
- Đào tạo: hướng dẫn nhân viên dùng đúng, viết prompt, hiểu giới hạn của AI.
- Nâng cấp: mô hình mới thường lớn hơn, nên dự phòng nâng cấp GPU sau 2–3 năm.
So sánh công bằng với dịch vụ đám mây
Đặt hai phương án cạnh nhau trong 3 năm: tổng chi phí sở hữu server so với số tài khoản dịch vụ đám mây nhân với bảng giá hiện hành. Đừng quên giá trị không quy ra tiền được như quyền kiểm soát dữ liệu, cũng như rủi ro không có người vận hành.
Sai lầm thường gặp khi tự dựng ChatGPT nội bộ
Những lỗi dưới đây khiến nhiều dự án dừng sau vài tháng:
- Kỳ vọng ngang dịch vụ thương mại hàng đầu: nhân viên so sánh và bỏ dùng. Hãy nói rõ hệ thống nội bộ mạnh ở đâu (dữ liệu riêng, tài liệu công ty) và yếu ở đâu.
- Đổ mọi tài liệu vào một kho: bản cũ, bản mới lẫn lộn khiến AI trả lời mâu thuẫn. Cần người chịu trách nhiệm từng kho.
- Không có bộ câu hỏi kiểm tra: đổi mô hình hay cập nhật phần mềm mà không biết chất lượng tốt lên hay xấu đi.
- Bỏ qua sao lưu: ổ hỏng là mất toàn bộ lịch sử, cấu hình, kho tài liệu đã chuẩn hóa.
- Một người nắm tất cả: người cài đặt nghỉ việc, không ai biết mật khẩu và cấu hình. Ghi lại tài liệu vận hành và bàn giao.
- Mở ra Internet để tiện: rủi ro lộ dữ liệu lớn hơn lợi ích. Dùng VPN.
Tránh được các lỗi này, ChatGPT nội bộ trở thành công cụ hằng ngày thay vì một dự án thử nghiệm bị bỏ quên.
Hãy coi ChatGPT nội bộ là một dịch vụ cần người chịu trách nhiệm, không phải phần mềm cài một lần. Chỉ định người phụ trách, lịch sao lưu và bộ câu hỏi kiểm tra ngay từ đầu sẽ quyết định hệ thống sống được bao lâu.
Cần máy tính hoặc server chạy AI cho công ty? PCTech tư vấn cấu hình theo mô hình và số người dùng, lắp ráp, cài sẵn Ollama/Open WebUI, bảo hành tận nơi tại TP.HCM.
Nhập mô hình muốn chạy và số người dùng, nhận gợi ý GPU, RAM, SSD ngay. Dùng thử ngay
Câu hỏi thường gặp
ChatGPT nội bộ có dùng được mô hình của OpenAI không?
Có thể dùng giao diện nội bộ kết nối API của OpenAI hoặc nhà cung cấp khác, nhưng khi đó câu hỏi vẫn gửi ra ngoài. Muốn dữ liệu không rời công ty, phải dùng mô hình mở chạy trên server của mình.
Tự dựng ChatGPT nội bộ mất bao lâu?
Bản thử nghiệm trên máy có sẵn GPU có thể dựng trong vài ngày. Hệ thống chính thức có đăng nhập tập trung, phân quyền, kho tài liệu và sao lưu thường cần vài tuần đến vài tháng tùy quy mô.
Mô hình mở có trả lời tiếng Việt tốt bằng ChatGPT không?
Mô hình mở cỡ vừa hiểu và viết tiếng Việt khá tốt cho soạn thảo, tóm tắt, hỏi đáp tài liệu, nhưng thường kém hơn mô hình thương mại hàng đầu ở suy luận phức tạp. Hãy thử với câu hỏi thực tế của công ty trước khi quyết định.
Có cần kết nối Internet để dùng ChatGPT nội bộ không?
Không, sau khi tải mô hình và phần mềm, hệ thống chạy hoàn toàn trong mạng nội bộ. Internet chỉ cần khi cập nhật phần mềm hoặc tải mô hình mới.
Nhân viên làm việc từ xa dùng ChatGPT nội bộ thế nào?
Cách an toàn là kết nối VPN của công ty rồi truy cập địa chỉ nội bộ như khi ngồi văn phòng. Không nên mở trực tiếp giao diện chat ra Internet.
Ai chịu trách nhiệm nếu AI nội bộ trả lời sai?
AI chỉ là công cụ hỗ trợ, người dùng vẫn chịu trách nhiệm kiểm tra trước khi gửi cho khách hay ra quyết định. Doanh nghiệp nên ghi rõ điều này trong quy định sử dụng.
Có thể bắt đầu nhỏ rồi nâng cấp không?
Được, và nên làm vậy. Kiến trúc nhiều lớp cho phép thay GPU, đổi mô hình hoặc chuyển từ Ollama sang vLLM mà vẫn giữ giao diện và kho tài liệu.
Bài viết liên quan
- Xây trợ lý AI nội bộ cho nhân viên: các bước và chi phí
- Server AI nội bộ cho doanh nghiệp nhỏ: khi nào cần, cấu hình ra sao
- Cài Open WebUI: giao diện chat AI nội bộ cho cả công ty
- Ollama vs vLLM: chọn công cụ chạy mô hình AI nội bộ
- GPU đám mây vs server tại chỗ cho AI doanh nghiệp: chọn hướng nào
- Bảo mật dữ liệu khi dùng ChatGPT, Claude trong công ty
- Hạ tầng IT tối thiểu để doanh nghiệp nhỏ triển khai AI an toàn, hiệu quả
- vLLM là gì? Chạy mô hình AI tốc độ cao trên server