Foundation model (mô hình nền tảng) là mô hình AI rất lớn được huấn luyện trên lượng dữ liệu khổng lồ và đa dạng, thường bằng phương pháp tự giám sát, để học năng lực tổng quát rồi có thể điều chỉnh cho nhiều nhiệm vụ khác nhau. Thuật ngữ do nhóm nghiên cứu Đại học Stanford phổ biến năm 2021. Ví dụ gồm các họ mô hình GPT, Claude, Gemini, Llama, Qwen, cũng như mô hình tạo ảnh và mô hình giọng nói lớn. Doanh nghiệp hiếm khi tự huấn luyện foundation model mà dùng qua API hoặc tải bản mở về, rồi tùy chỉnh bằng prompt, RAG hoặc fine-tuning.
Foundation model là gì, vì sao gọi là “nền tảng”
Foundation model là mô hình AI được huấn luyện trước (pre-trained) trên dữ liệu quy mô rất lớn, sau đó đóng vai trò nền móng cho vô số ứng dụng phía trên. Chữ “nền tảng” nhấn mạnh hai ý:
- Đa năng: một mô hình làm được nhiều việc, từ viết, dịch, tóm tắt đến phân loại, lập trình, mà không cần huấn luyện riêng cho từng việc.
- Phụ thuộc dây chuyền: hàng nghìn sản phẩm xây trên vài mô hình nền tảng, nên điểm mạnh và điểm yếu của mô hình nền lan sang mọi ứng dụng.
Hãy so sánh với xây nhà. Trước đây, mỗi bài toán AI như một căn nhà xây từ móng: muốn nhận diện hóa đơn thì huấn luyện mô hình hóa đơn, muốn phân loại email thì huấn luyện mô hình email. Foundation model giống như một khung nhà lớn có sẵn móng, cột, điện nước; doanh nghiệp chỉ cần ngăn phòng, sơn sửa theo nhu cầu.
Thuật ngữ được nhóm nghiên cứu tại Stanford (Center for Research on Foundation Models) đưa ra trong báo cáo năm 2021, nhằm mô tả sự chuyển dịch này và cả những rủi ro đi kèm.
Foundation model được tạo ra như thế nào
Quá trình tạo một foundation model thường gồm các giai đoạn:
- Thu thập dữ liệu: văn bản từ web, sách, mã nguồn, hình ảnh kèm chú thích, âm thanh; lọc trùng, lọc nội dung độc hại, chất lượng thấp.
- Tiền huấn luyện (pre-training): mô hình học theo cách tự giám sát, ví dụ đoán token tiếp theo trong văn bản. Không cần người dán nhãn từng mẫu, nhờ đó tận dụng được dữ liệu khổng lồ.
- Hậu huấn luyện (post-training): tinh chỉnh theo hướng dẫn, RLHF hoặc phương pháp tương tự để mô hình biết làm theo yêu cầu, trả lời hữu ích và an toàn hơn.
- Đánh giá và phát hành: kiểm tra trên benchmark, red teaming, công bố model card, phát hành qua API hoặc trọng số mở.
Giai đoạn tiền huấn luyện đòi hỏi hàng nghìn GPU chạy nhiều tuần đến nhiều tháng, chi phí rất lớn. Đây là lý do chỉ một số ít tổ chức có thể huấn luyện foundation model lớn từ đầu, còn phần đông doanh nghiệp đứng ở vai trò người dùng và tùy chỉnh.
Foundation model khác mô hình AI chuyên biệt thế nào
Không phải bài toán nào cũng cần foundation model. Mô hình chuyên biệt nhỏ, huấn luyện cho một nhiệm vụ, vẫn có chỗ đứng.
Thực tế nhiều hệ thống kết hợp cả hai: foundation model xử lý phần ngôn ngữ linh hoạt, mô hình chuyên biệt nhỏ làm việc lặp lại khối lượng lớn với chi phí thấp.
| Tiêu chí | Foundation model | Mô hình chuyên biệt |
|---|---|---|
| Phạm vi | Nhiều nhiệm vụ, nhiều lĩnh vực | Một nhiệm vụ cụ thể |
| Dữ liệu cần để bắt đầu | Gần như không, chỉ cần prompt | Cần bộ dữ liệu gắn nhãn riêng |
| Kích thước | Rất lớn, từ vài tỷ đến hàng trăm tỷ tham số trở lên | Nhỏ, chạy nhẹ |
| Chi phí mỗi lần chạy | Cao hơn | Thấp |
| Độ ổn định đầu ra | Linh hoạt nhưng khó đoán hơn | Ổn định trong phạm vi đã học |
| Ví dụ | Chatbot, trợ lý viết, phân tích tài liệu | Đọc biển số, phát hiện lỗi sản phẩm |
Các loại foundation model phổ biến hiện nay
Foundation model không chỉ là chatbot. Có thể chia theo dạng dữ liệu:
- Mô hình ngôn ngữ lớn (LLM): các họ GPT, Claude, Gemini, Llama, Qwen, Mistral. Xử lý văn bản và mã nguồn.
- Mô hình đa phương thức: nhận cả văn bản, ảnh, âm thanh, video. Nhiều LLM thế hệ mới đã đa phương thức.
- Mô hình tạo ảnh, video: dựa trên diffusion hoặc transformer, như các họ Stable Diffusion, FLUX và mô hình video thương mại.
- Mô hình giọng nói: nhận dạng tiếng nói như Whisper, chuyển văn bản thành giọng nói.
- Mô hình embedding: biến văn bản thành vector cho tìm kiếm ngữ nghĩa, nền tảng của RAG.
- Mô hình chuyên ngành lớn: sinh học, y khoa, thời tiết, mã nguồn.
Theo cách phân phối, có mô hình đóng (chỉ dùng qua API hoặc ứng dụng của nhà cung cấp) và mô hình trọng số mở (tải về chạy trên máy riêng theo giấy phép). Tên phiên bản thay đổi rất nhanh, hãy kiểm tra trang chính thức để biết mô hình hiện hành.
Doanh nghiệp dùng foundation model qua những con đường nào
Có bốn mức độ, từ dễ đến khó:
- Dùng ứng dụng có sẵn: ChatGPT, Claude, Gemini, Copilot. Không cần kỹ thuật, có gói miễn phí và trả phí, nên chọn gói doanh nghiệp có cam kết dữ liệu.
- Gọi qua API: tích hợp vào phần mềm nội bộ, n8n, Google Sheets, chatbot website. Trả theo token, cần người kỹ thuật cơ bản.
- Tùy chỉnh bằng prompt và RAG: viết prompt hệ thống, kết nối kho tài liệu nội bộ để mô hình trả lời dựa trên dữ liệu công ty mà không cần huấn luyện lại.
- Fine-tuning hoặc chạy mô hình mở tại chỗ: tinh chỉnh bằng LoRA trên dữ liệu riêng, hoặc chạy mô hình trọng số mở trên server nội bộ khi dữ liệu nhạy cảm.
Ví dụ: công ty logistics 40 người bắt đầu ở mức 1 cho nhân viên soạn email; sau ba tháng lên mức 3, xây trợ lý tra cứu quy trình hải quan nội bộ bằng RAG. Chỉ khi cần xử lý số lượng lớn chứng từ với định dạng riêng mới cân nhắc mức 4.
Lời khuyên chung: đi từ mức thấp, chỉ lên mức cao khi có bằng chứng mức hiện tại không đáp ứng.
Tiêu chí chọn foundation model cho doanh nghiệp
Đừng chọn theo bảng xếp hạng mạng xã hội. Hãy chấm theo các tiêu chí sau với chính dữ liệu của bạn:
- Chất lượng tiếng Việt: thử với văn bản thật trong ngành, chú ý thuật ngữ, chính tả, giọng văn.
- Đúng nhiệm vụ: viết nội dung, phân tích số liệu, lập trình hay đọc ảnh chứng từ; mỗi mô hình mạnh ở mảng khác.
- Chính sách dữ liệu: dữ liệu gửi qua API hay gói doanh nghiệp có bị dùng huấn luyện không, lưu trữ bao lâu, ở đâu.
- Chi phí theo khối lượng thật: đếm token mẫu, nhân theo dự kiến, đối chiếu bảng giá hiện hành.
- Độ trễ và giới hạn: tốc độ phản hồi, hạn mức yêu cầu mỗi phút.
- Hệ sinh thái: tích hợp với Google Workspace, Microsoft 365, công cụ tự động hóa đang dùng.
- Giấy phép nếu dùng mô hình trọng số mở: có cho phép dùng thương mại không, điều kiện gì.
Cách làm thực tế: chọn 2–3 ứng viên, chạy cùng một bộ 50 câu hỏi thật (một bộ evals nhỏ), chấm điểm, rồi quyết định.
Rủi ro và giới hạn của foundation model
Sức mạnh tổng quát đi kèm những điểm yếu doanh nghiệp cần biết:
- Bịa thông tin (hallucination): mô hình trả lời trôi chảy kể cả khi sai.
- Kiến thức có ngày cắt: không biết sự kiện sau thời điểm huấn luyện nếu không có công cụ tìm kiếm.
- Thiên lệch từ dữ liệu: dữ liệu web chứa định kiến, mô hình có thể lặp lại.
- Phụ thuộc nhà cung cấp: đổi giá, đổi phiên bản, ngừng mô hình cũ có thể ảnh hưởng hệ thống đang chạy.
- Rủi ro dữ liệu: nhân viên dán thông tin nhạy cảm vào công cụ không được phê duyệt.
- Câu hỏi bản quyền: tranh luận pháp lý về dữ liệu huấn luyện và nội dung tạo ra vẫn đang diễn ra ở nhiều nước.
Cách giảm rủi ro
- Dùng RAG để mô hình trả lời dựa trên tài liệu đã kiểm duyệt.
- Thiết kế để có thể đổi mô hình, tránh gắn chặt vào một nhà cung cấp.
- Có chính sách sử dụng AI nội bộ và người duyệt cho đầu ra quan trọng.
- Theo dõi chất lượng bằng evals định kỳ.
Khi nào doanh nghiệp không cần foundation model
Foundation model là công cụ mạnh nhưng không phải lời giải cho mọi việc:
- Tính toán chính xác, quy tắc cố định: tính lương, tính thuế theo công thức, đối chiếu số liệu. Excel, phần mềm kế toán hoặc script đơn giản chính xác và rẻ hơn.
- Tác vụ lặp lại cực lớn, định dạng cố định: đọc mã vạch, phân loại ảnh sản phẩm theo vài nhóm. Mô hình chuyên biệt nhỏ phù hợp hơn.
- Quy trình chưa rõ ràng: nếu chính công ty chưa thống nhất cách làm, AI chỉ tự động hóa sự lộn xộn.
- Dữ liệu không được phép rời hệ thống và chưa có hạ tầng chạy mô hình tại chỗ: cần giải quyết hạ tầng và chính sách trước.
Câu hỏi đúng không phải “có nên dùng foundation model không” mà là “bài toán này cần sự linh hoạt ngôn ngữ đến mức nào”. Bài toán càng cần hiểu ngữ cảnh, xử lý văn bản tự do, giao tiếp với người, foundation model càng phát huy giá trị.
Đừng gắn chặt hệ thống vào một mô hình duy nhất; hãy thiết kế để đổi được mô hình nền tảng bằng cấu hình và giữ một bộ câu hỏi kiểm thử, khi có phiên bản mới bạn chỉ cần chạy lại để quyết định có chuyển hay không.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
Foundation model và LLM có phải là một?
LLM là một loại foundation model, chuyên về ngôn ngữ. Foundation model rộng hơn, gồm cả mô hình tạo ảnh, giọng nói, đa phương thức và chuyên ngành.
Doanh nghiệp nhỏ có tự huấn luyện foundation model được không?
Gần như không thực tế vì cần dữ liệu và hạ tầng tính toán rất lớn. Doanh nghiệp nên dùng mô hình có sẵn và tùy chỉnh bằng prompt, RAG hoặc fine-tuning.
Foundation model đóng và mở khác nhau thế nào?
Mô hình đóng chỉ dùng qua dịch vụ của nhà cung cấp. Mô hình trọng số mở có thể tải về chạy trên máy riêng theo điều khoản giấy phép, phù hợp khi cần giữ dữ liệu tại chỗ.
Fine-tuning foundation model có cần thiết không?
Phần lớn trường hợp không. Prompt tốt và RAG giải quyết được đa số nhu cầu. Fine-tuning hợp lý khi cần định dạng, giọng văn rất riêng hoặc tác vụ lặp lại khối lượng lớn.
Vì sao gọi là “nền tảng”?
Vì một mô hình được huấn luyện trước làm nền móng cho rất nhiều ứng dụng khác nhau, thay vì mỗi ứng dụng cần một mô hình riêng từ đầu.
Chạy foundation model mở tại văn phòng cần máy thế nào?
Tùy kích thước mô hình. Ước lượng mô hình 7B–8B lượng tử hóa 4-bit thường cần khoảng 5–6 GB VRAM; mô hình lớn hơn cần GPU nhiều VRAM hoặc nhiều GPU, phụ thuộc độ dài ngữ cảnh và số người dùng.
Bài viết liên quan
- LLM là gì? Giải thích cho người không chuyên
- Mô hình AI (AI model) là gì? Phân loại các mô hình phổ biến
- Mô hình AI mã nguồn mở và mô hình đóng: khác nhau thế nào, chọn loại nào
- Open weights là gì? Khác mã nguồn mở thế nào
- Fine-tuning là gì? Khi nào doanh nghiệp cần tinh chỉnh mô hình AI
- Small Language Model (SLM) là gì? Mô hình AI nhỏ chạy được trên máy
- Evals là gì? Đánh giá chất lượng ứng dụng AI