GraphRAG là kỹ thuật RAG (truy xuất tăng cường cho sinh văn bản) có thêm đồ thị tri thức: hệ thống dùng AI trích xuất thực thể như người, sản phẩm, hợp đồng, khách hàng và quan hệ giữa chúng từ tài liệu, lưu thành đồ thị, rồi dùng đồ thị này khi tìm ngữ cảnh để trả lời. GraphRAG mạnh ở câu hỏi tổng hợp và nhiều bước, ví dụ 'những khách hàng nào liên quan đến các hợp đồng có điều khoản phạt chậm giao'. Đổi lại, chi phí xây dựng và cập nhật cao hơn RAG thường, nên chỉ đáng dùng khi dữ liệu có nhiều mối quan hệ chéo.
GraphRAG là gì và ra đời để giải quyết vấn đề gì
GraphRAG là cách tổ chức tri thức cho RAG dưới dạng đồ thị gồm các nút (thực thể) và cạnh (quan hệ), thay vì chỉ là các đoạn văn rời rạc được biến thành vector. Khái niệm này được biết đến rộng rãi sau khi Microsoft Research công bố phương pháp và mã nguồn GraphRAG, sau đó nhiều thư viện và cơ sở dữ liệu đồ thị cũng hỗ trợ cách làm tương tự.
Vấn đề GraphRAG hướng tới là điểm yếu của RAG dựa trên vector. RAG thường lấy vài đoạn văn có nghĩa gần câu hỏi nhất. Nó làm tốt câu hỏi kiểu ‘chính sách đổi trả trong bao nhiêu ngày’. Nhưng với câu hỏi như ‘tóm tắt các vấn đề chính khách hàng phàn nàn trong năm’ hay ‘nhà cung cấp nào xuất hiện trong cả hợp đồng thuê kho và biên bản sự cố’, câu trả lời nằm rải rác ở hàng chục tài liệu. Lấy 5 đoạn giống nhất không đủ để thấy bức tranh.
Ý tưởng cốt lõi
Đồ thị cho phép hệ thống đi theo quan hệ: từ khách hàng A sang hợp đồng, từ hợp đồng sang điều khoản, từ điều khoản sang sự cố liên quan. Nhờ vậy AI gom được ngữ cảnh có liên kết logic chứ không chỉ giống nhau về chữ.
GraphRAG hoạt động qua những bước nào
Một hệ thống GraphRAG thường có hai giai đoạn: lập chỉ mục và truy vấn.
Giai đoạn lập chỉ mục
- Chia tài liệu: cắt thành các đoạn vừa phải như RAG thông thường.
- Trích xuất thực thể và quan hệ: dùng mô hình ngôn ngữ đọc từng đoạn, rút ra ‘Công ty X – ký hợp đồng – Kho Bình Dương’, ‘Hợp đồng HD-12 – có điều khoản – phạt chậm giao’.
- Gộp và chuẩn hóa: hợp nhất các cách viết khác nhau của cùng một thực thể, ví dụ ‘Cty X’, ‘Công ty TNHH X’.
- Phát hiện cộng đồng: nhóm các thực thể liên quan chặt với nhau thành cụm, rồi tạo bản tóm tắt cho từng cụm.
Giai đoạn truy vấn
- Truy vấn cục bộ: câu hỏi về một thực thể cụ thể, hệ thống tìm nút đó và các nút lân cận.
- Truy vấn toàn cục: câu hỏi tổng quan, hệ thống dùng các bản tóm tắt cụm để tổng hợp.
Cuối cùng, ngữ cảnh lấy từ đồ thị được đưa vào mô hình để viết câu trả lời, giống bước sinh văn bản của RAG.
So sánh GraphRAG với RAG thông thường
Hai cách tiếp cận không thay thế hoàn toàn nhau. Nhiều hệ thống thực tế kết hợp cả hai: tìm vector cho câu hỏi đơn giản, đi theo đồ thị cho câu hỏi cần nối thông tin.
| Tiêu chí | RAG thông thường | GraphRAG |
|---|---|---|
| Câu hỏi tra cứu một ý | Tốt, nhanh | Tốt nhưng thừa công |
| Câu hỏi tổng hợp nhiều tài liệu | Hay bỏ sót | Mạnh hơn rõ rệt |
| Câu hỏi về quan hệ nhiều bước | Yếu | Mạnh |
| Chi phí lập chỉ mục | Thấp, chủ yếu tính embedding | Cao, cần mô hình đọc toàn bộ tài liệu |
| Cập nhật khi tài liệu đổi | Đơn giản | Phức tạp hơn, có thể phải tính lại cụm |
| Khả năng giải thích nguồn | Trỏ về đoạn văn | Trỏ về thực thể, quan hệ và đoạn văn |
Ví dụ GraphRAG trong doanh nghiệp Việt Nam
Hãy xem vài tình huống mà đồ thị tri thức tạo khác biệt rõ.
- Công ty phân phối thiết bị 40 người: có hàng trăm hợp đồng đại lý, phụ lục, biên bản bảo hành. Câu hỏi ‘đại lý nào ở miền Tây có hợp đồng sắp hết hạn và từng có khiếu nại bảo hành’ cần nối khu vực, hợp đồng, ngày hết hạn và sự cố.
- Văn phòng luật nhỏ: hồ sơ vụ việc nhắc nhiều bên liên quan, công ty con, người đại diện. Đồ thị giúp phát hiện cùng một người xuất hiện ở nhiều hồ sơ.
- Bộ phận IT nội bộ: tài liệu mô tả máy chủ, phần mềm, tài khoản, nhà cung cấp. Câu hỏi ‘nếu NAS phòng kế toán hỏng thì ảnh hưởng những ứng dụng nào’ là bài toán đi theo quan hệ phụ thuộc.
Ngược lại, kho câu hỏi thường gặp của cửa hàng bán lẻ, nội quy công ty, hướng dẫn sử dụng sản phẩm thường không cần GraphRAG. RAG thông thường với chunking tốt và reranker đã đủ.
Chi phí và độ phức tạp cần lường trước
GraphRAG hấp dẫn trên lý thuyết nhưng có chi phí thật cần tính trước khi chọn.
- Chi phí trích xuất: mô hình phải đọc toàn bộ kho tài liệu để rút thực thể và quan hệ. Với kho lớn, số token xử lý có thể gấp nhiều lần so với chỉ tạo embedding. Có thể dùng mô hình nhỏ hơn hoặc mô hình chạy cục bộ để giảm chi phí, đổi lại chất lượng trích xuất có thể giảm.
- Chất lượng đồ thị: nếu trích xuất sai, đồ thị chứa quan hệ sai và AI trả lời sai một cách rất tự tin. Cần lấy mẫu kiểm tra thủ công.
- Chuẩn hóa tên: tiếng Việt có nhiều cách viết tắt, có dấu và không dấu. Bước gộp thực thể đòi hỏi quy tắc riêng.
- Hạ tầng: có thể cần thêm cơ sở dữ liệu đồ thị như Neo4j hoặc lưu đồ thị dạng tệp, cộng với vector database sẵn có.
- Vận hành: tài liệu thay đổi hằng tuần thì cần quy trình cập nhật đồ thị tăng dần, không phải lập chỉ mục lại toàn bộ.
Vì vậy, GraphRAG nên là bước nâng cấp sau khi RAG cơ bản đã chạy ổn, không phải điểm xuất phát.
Lộ trình thử GraphRAG từng bước
Nếu bạn đã có chatbot tài liệu nội bộ và thấy nó yếu ở câu hỏi tổng hợp, có thể thử theo lộ trình sau:
- Thu thập câu hỏi thất bại: lọc từ log những câu RAG hiện tại trả lời thiếu hoặc sai, phân loại xem có phải câu hỏi cần nối nhiều tài liệu không.
- Chọn tập tài liệu nhỏ: khoảng vài chục đến vài trăm tài liệu của một phòng ban.
- Định nghĩa loại thực thể: ví dụ khách hàng, hợp đồng, sản phẩm, nhân sự phụ trách. Giới hạn loại thực thể giúp đồ thị gọn và chính xác hơn.
- Chạy trích xuất và kiểm tra mẫu: đọc 30–50 quan hệ ngẫu nhiên, đánh giá đúng sai.
- So sánh song song: cùng bộ câu hỏi, chấm điểm câu trả lời của RAG thường và GraphRAG.
- Quyết định: chỉ mở rộng nếu chênh lệch rõ ở nhóm câu hỏi quan trọng.
Dấu hiệu nên dừng
Nếu phần lớn câu hỏi thất bại thực ra do tài liệu thiếu, lỗi thời hoặc chia đoạn kém, hãy sửa dữ liệu trước. GraphRAG không bù được dữ liệu nguồn kém chất lượng.
Khi nào doanh nghiệp không cần GraphRAG
Phần lớn doanh nghiệp nhỏ và vừa chưa cần GraphRAG ở giai đoạn đầu. Bạn có thể bỏ qua nếu:
- Kho tài liệu dưới vài trăm trang, câu hỏi chủ yếu là tra cứu quy định, quy trình, thông số.
- Mỗi câu trả lời thường nằm gọn trong một hoặc hai tài liệu.
- Chưa có người theo dõi chất lượng dữ liệu và log câu hỏi.
- Ngân sách cho xử lý token bị giới hạn chặt.
- Dữ liệu quan hệ đã có sẵn trong phần mềm như CRM, ERP. Khi đó cho AI truy vấn trực tiếp qua function calling thường chính xác hơn việc trích xuất lại quan hệ từ văn bản.
Điểm cuối rất quan trọng: nếu thông tin ‘khách hàng nào ký hợp đồng nào’ đã nằm trong cơ sở dữ liệu có cấu trúc, đừng bắt AI suy ra lại từ file PDF. GraphRAG phù hợp nhất với tri thức đang nằm trong văn bản tự do và chưa từng được cấu trúc hóa.
Trước khi xây GraphRAG, hãy liệt kê 20 câu hỏi quan trọng mà chatbot hiện tại trả lời kém. Nếu hơn một nửa là câu hỏi cần nối nhiều tài liệu, GraphRAG đáng thử; nếu không, hãy cải thiện chunking và reranker trước.
Muốn đưa AI vào công việc của doanh nghiệp? PCTech tư vấn, đánh giá mức sẵn sàng AI và triển khai chatbot, AI agent, tự động hóa cho doanh nghiệp.
10 câu hỏi, 2 phút, nhận mức độ và việc nên làm tiếp theo. Dùng thử ngay
Câu hỏi thường gặp
GraphRAG có thay thế vector database không?
Thường là không. Nhiều triển khai vẫn dùng vector để tìm điểm bắt đầu, sau đó mới đi theo đồ thị để mở rộng ngữ cảnh.
GraphRAG có tốn kém hơn RAG thường không?
Có, chủ yếu ở bước lập chỉ mục vì mô hình phải đọc toàn bộ tài liệu để trích xuất thực thể và quan hệ. Chi phí truy vấn cũng có thể cao hơn với câu hỏi toàn cục.
Có cần Neo4j để làm GraphRAG không?
Không bắt buộc. Một số thư viện lưu đồ thị dạng tệp. Cơ sở dữ liệu đồ thị hữu ích khi đồ thị lớn hoặc cần truy vấn phức tạp, cập nhật thường xuyên.
GraphRAG có hoạt động tốt với tiếng Việt không?
Có thể dùng được nếu mô hình trích xuất hiểu tốt tiếng Việt. Cần chú ý bước chuẩn hóa tên viết tắt, có dấu, không dấu để tránh một thực thể bị tách thành nhiều nút.
GraphRAG có giảm hallucination không?
Nó giúp AI có ngữ cảnh đầy đủ hơn cho câu hỏi tổng hợp nên có thể giảm trả lời bịa. Nhưng nếu đồ thị trích xuất sai, AI vẫn trả lời sai, nên cần kiểm tra chất lượng đồ thị.
Doanh nghiệp nhỏ có tự làm GraphRAG được không?
Có thể thử bằng thư viện mã nguồn mở nếu có người biết lập trình Python. Với đội không có kỹ thuật, nên làm RAG cơ bản ổn định trước rồi mới tính đến GraphRAG.
Bài viết liên quan
- RAG là gì? Cho AI đọc tài liệu nội bộ
- Đồ thị tri thức (knowledge graph) là gì? Cách doanh nghiệp tổ chức dữ liệu cho AI
- Vector database là gì? Nền tảng cho AI đọc tài liệu nội bộ
- Chunking là gì? Cách chia tài liệu cho RAG trả lời chính xác
- Reranker là gì? Tăng độ chính xác tìm kiếm cho RAG
- Hybrid search là gì? Kết hợp tìm từ khóa và tìm ngữ nghĩa
- Xây kho tri thức (knowledge base) cho AI trả lời nội bộ
- AI hallucination là gì? Cách giảm sai sót khi dùng AI