Small Language Model (SLM) là mô hình ngôn ngữ có số tham số nhỏ hơn nhiều so với các mô hình hàng đầu, thường từ vài trăm triệu đến khoảng vài tỉ tham số. SLM chạy nhanh, rẻ, có thể chạy trên laptop, điện thoại hoặc máy chủ nội bộ mà không cần gửi dữ liệu ra ngoài. Chúng phù hợp với nhiệm vụ hẹp như phân loại, trích xuất, tóm tắt ngắn, nhưng kém mô hình lớn ở suy luận phức tạp và kiến thức rộng.
Vì sao mô hình nhỏ ngày càng đáng chú ý
Mô hình lớn mạnh nhưng tốn kém và phải chạy trên hạ tầng của nhà cung cấp. Nhờ kỹ thuật huấn luyện tốt hơn và “chưng cất” kiến thức từ mô hình lớn, các mô hình nhỏ thế hệ mới đạt chất lượng đủ dùng cho nhiều việc. Các họ mô hình như Gemma của Google, Phi của Microsoft, Llama cỡ nhỏ của Meta, Qwen cỡ nhỏ của Alibaba đều có phiên bản chạy được trên máy tính cá nhân.
So sánh SLM và mô hình lớn
Bảng giúp đánh giá khi nào mô hình nhỏ là đủ.
| Tiêu chí | Mô hình nhỏ (SLM) | Mô hình lớn |
|---|---|---|
| Nơi chạy | Laptop, điện thoại, máy chủ nội bộ | Chủ yếu máy chủ của nhà cung cấp |
| Tốc độ | Nhanh | Chậm hơn |
| Chi phí | Thấp, gần như chỉ chi phí phần cứng | Theo lượng dùng, cao hơn |
| Bảo mật dữ liệu | Giữ được trong nội bộ | Dữ liệu gửi ra ngoài |
| Kiến thức, suy luận | Hạn chế | Rộng và sâu hơn |
| Tiếng Việt | Tùy mô hình, cần thử kỹ | Thường tốt hơn |
Nhiệm vụ phù hợp với SLM
- Phân loại email, ticket, tin nhắn theo chủ đề.
- Trích xuất trường thông tin từ văn bản có cấu trúc tương đối rõ.
- Tóm tắt ngắn đoạn văn bản.
- Kiểm tra chính tả, chuẩn hóa định dạng.
- Trả lời câu hỏi dựa trên tài liệu được cung cấp sẵn (RAG) với câu hỏi đơn giản.
- Chạy tính năng AI ngay trên thiết bị khi không có mạng.
Cách bắt đầu thử SLM
- Cài công cụ chạy mô hình cục bộ như Ollama hoặc LM Studio trên máy có RAM từ 16GB trở lên.
- Tải một vài mô hình nhỏ phổ biến, ưu tiên mô hình công bố hỗ trợ tiếng Việt.
- Chạy cùng bộ 20 đến 30 nhiệm vụ thật của bạn, so với kết quả từ mô hình lớn.
- Nếu đạt yêu cầu ở một nhiệm vụ cụ thể, tính chi phí triển khai trên máy chủ nội bộ.
Kết hợp nhỏ và lớn
Mô hình phổ biến là định tuyến: SLM xử lý trước phần lớn yêu cầu đơn giản, những yêu cầu khó hoặc SLM không chắc chắn mới chuyển lên mô hình lớn. Cách này giảm chi phí đáng kể mà vẫn giữ chất lượng. Dữ liệu nhạy cảm có thể được SLM nội bộ ẩn danh trước khi gửi lên mô hình lớn bên ngoài.
Với SLM, cách viết prompt càng rõ ràng, có ví dụ mẫu và yêu cầu định dạng đầu ra chặt chẽ thì kết quả càng ổn định. Mô hình nhỏ ít “đoán ý” tốt như mô hình lớn.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
SLM có miễn phí không?
Nhiều mô hình nhỏ mở trọng số, tải về miễn phí, nhưng cần kiểm tra giấy phép khi dùng thương mại và tính chi phí phần cứng.
Laptop văn phòng có chạy được SLM không?
Mô hình rất nhỏ chạy được trên laptop RAM 16GB, tốc độ vừa phải. Có GPU hoặc chip Apple dòng M thì nhanh hơn rõ.
SLM có hiểu tiếng Việt không?
Có mô hình hiểu khá, có mô hình yếu. Cần thử với dữ liệu thật, đặc biệt văn bản không dấu và viết tắt.
Có thể tinh chỉnh SLM cho công ty không?
Có, và chi phí tinh chỉnh mô hình nhỏ thấp hơn nhiều so với mô hình lớn. Đây là cách phổ biến để đạt chất lượng cao cho nhiệm vụ hẹp.
Bài viết liên quan
- Chạy AI trên máy tính cá nhân (local AI): cần gì và có đáng không
- Ollama là gì? Chạy mô hình AI miễn phí trên máy của bạn
- Mô hình AI mã nguồn mở và mô hình đóng: khác nhau thế nào, chọn loại nào
- NPU và AI PC là gì? Có cần mua laptop AI không
- Fine-tuning là gì? Khi nào doanh nghiệp cần tinh chỉnh mô hình AI