RAG
RAG: Retrieval-Augmented Generation
Paper 08 (P8) • NeurIPS 2020 Facebook AI Research (FAIR) • UCL • NYU Foundational Landmark in RAG

Sinh Tăng Cường Truy Xuất Cho Các Tác Vụ NLP Thâm Dụng Tri Thức

"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" — Đặt nền móng học thuật kinh điển cho kiến trúc RAG: Kết hợp bộ nhớ tham số tiềm ẩn (BART Seq2Seq) và bộ nhớ phi tham số dày đặc (Wikipedia DPR MIPS) để giải quyết triệt để vấn đề ảo giác và trôi dạt sự thật.

Tác giả: Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich Küttler, Mike Lewis, Wen-tau Yih, Tim Rocktäschel, Sebastian Riedel, Douwe Kiela
Facebook AI Research; University College London; New York University
Open-Domain QA (NQ EM)
44.5% vs 36.6%
Vượt trội T5-11B (lớn gấp gần 30 lần)
Độ Xác Thực Sự Thật
Gấp 6 lần BART
42.7% vs 7.1% trong đánh giá của người
Quy Mô Bộ Nhớ Ngoài
21M Đoạn Văn
Toàn bộ Wikipedia, Dense MIPS qua FAISS
Cập Nhật Tri Thức
Hot-Swapping
Thay thế chỉ mục tức thì, zero retrain

Tóm Tắt Học Thuật (Academic Abstract)

Đối chiếu song ngữ: Bản dịch tiếng Việt chuyên môn hóa & Văn bản gốc tiếng Anh

NeurIPS 2020
Bản Dịch Học Thuật Tiếng Việt Bản dịch trực tiếp

Các mô hình ngôn ngữ tiền huấn luyện quy mô lớn đã chứng minh khả năng lưu trữ tri thức thực tế phong phú ngay bên trong các tham số trọng số của chúng, đồng thời đạt được các kết quả tiên tiến nhất (state-of-the-art) khi được tinh chỉnh trên các tác vụ xử lý ngôn ngữ tự nhiên (NLP) xuôi dòng. Tuy nhiên, khả năng truy cập và thao tác chính xác trên tri thức của chúng vẫn còn nhiều hạn chế, do đó trên các tác vụ thâm dụng tri thức (knowledge-intensive tasks), hiệu năng của chúng vẫn tụt lại phía sau các kiến trúc chuyên biệt cho từng nhiệm vụ.

Ngoài ra, việc cung cấp nguồn gốc xuất xứ (provenance) cho các quyết định dự đoán và việc cập nhật tri thức về thế giới vẫn là những bài toán nghiên cứu mở đầy thách thức. Chúng tôi khám phá một công thức tinh chỉnh đa dụng cho Sinh Tăng Cường Truy Xuất (Retrieval-Augmented Generation - RAG) — các mô hình kết hợp giữa bộ nhớ tham số (parametric memory) và bộ nhớ phi tham số (non-parametric memory) đã được tiền huấn luyện dành cho bài toán tạo sinh ngôn ngữ.

Chúng tôi so sánh hai công thức xây dựng: RAG-Sequence (điều kiện hóa trên cùng một tài liệu xuyên suốt toàn chuỗi) và RAG-Token (có thể sử dụng các tài liệu khác nhau cho từng token). Chúng tôi thiết lập kỷ lục mới trên ba tác vụ Open-Domain QA, vượt trội hơn cả các mô hình seq2seq khổng lồ như T5-11B lẫn các kiến trúc truy xuất-và-trích xuất chuyên biệt. Đối với các tác vụ tạo sinh, RAG tạo ra văn bản cụ thể hơn, đa dạng hơn và chuẩn xác về mặt sự thật hơn.

English Original Abstract arXiv:2005.11401

"Large pre-trained language models have been shown to store factual knowledge in their parameters, and achieve state-of-the-art results when fine-tuned on downstream NLP tasks. However, their ability to access and precisely manipulate knowledge is still limited, and in knowledge-intensive tasks, their performance lags behind task-specific architectures."

"Additionally, deciding the provenance of their decisions and updating their world knowledge remain open research problems. Pre-trained models with a differentiable access mechanism to explicit non-parametric memory have so far been only investigated for extractive downstream tasks. We explore a general-purpose fine-tuning recipe for retrieval-augmented generation (RAG) — models which combine pre-trained parametric and non-parametric memory for language generation."

Từ khóa: Retrieval-Augmented Generation Dense Passage Retrieval (DPR) Parametric Memory Non-Parametric Memory Open-Domain QA BART

1. Động Lực Nghiên Cứu: Giới Hạn Của Mô Hình Tham Số Thuần Túy

Tại sao việc nhồi nhét toàn bộ tri thức thế giới vào các trọng số tham số là một hướng tiếp cận bất khả thi

1 Ảo Giác Nặng Nề (Hallucination)

Các mô hình Seq2Seq thuần túy (như BART, T5, GPT) chỉ học phân phối xác suất từ ngữ. Đối với các sự thật chuyên sâu, thực thể đuôi dài (long-tail entities), chúng có xu hướng bịa đặt các chi tiết sai lệch một cách rất tự tin.

2 Bất Khả Thi Trong Cập Nhật Tri Thức

Tri thức được "đóng băng" (frozen) ngay sau khi huấn luyện. Khi thế giới thay đổi (lãnh đạo mới, giá cả mới, sự kiện mới), cách duy nhất để cập nhật là huấn luyện lại toàn bộ mô hình với chi phí tính toán khổng lồ.

3 Thiếu Nguồn Gốc Xuất Xứ (No Provenance)

Mô hình hoạt động như một "hộp đen" (black box). Con người không thể kiểm tra, xác thực hoặc truy vết xem câu trả lời được rút ra từ tài liệu, điều khoản hay bằng chứng nào, gây rủi ro pháp lý và an toàn nghiêm trọng.

Đặc Điểm So Sánh Mô Hình Tham Số Thuần (T5, GPT, BART) Mô Hình Trích Xuất (REALM, DPR Reader) RAG — Mô Hình Lai (Đề Xuất)
Bản Chất Bộ Nhớ Chỉ có bộ nhớ tham số tiềm ẩn (Trọng số nơ-ron) Bộ nhớ phi tham số ngoài (Không có bộ sinh văn bản) Lai ghép: Tham số (BART) + Phi tham số (DPR Index)
Dạng Câu Trả Lời Sinh Ra Văn bản tự do (Dễ bịa đặt, ảo giác) Chỉ trích xuất chuỗi con cứng nhắc (Span extraction) Tạo sinh văn bản tự do, chuẩn xác, tổng hợp đa nguồn
Cập Nhật Thông Tin Mới Phải tiền huấn luyện / fine-tune lại toàn bộ Chỉ cần thay đổi tài liệu Hoán đổi chỉ mục tức thời (Hot-swapping index, zero retraining)
Truy Vết Bằng Chứng Hoàn toàn không thể giải thích Chỉ ra vị trí đoạn văn trích xuất Minh bạch 100%: Cung cấp đoạn văn truy xuất kèm xác suất

2. Kiến Trúc Lai Ghép Bộ Nhớ (Hybrid Architecture)

Sự hợp nhất giữa Dense Passage Retriever (DPR), Chỉ mục FAISS MIPS và BART Generator

Sơ Đồ Luồng Dữ Liệu Đầu-Cuối Trong RAG (End-to-End Computational Flow)

Standard Pipeline
flowchart TD subgraph INPUT ["ĐẦU VÀO TRUY VẤN (Input Query)"] Q["Câu truy vấn của người dùng: x
'Định nghĩa tai giữa'"] end subgraph RETRIEVER ["BỘ TRUY XUẤT PHI THAM SỐ (Non-Parametric Retriever - DPR)"] BERT_Q["Bộ Mã Hóa Truy Vấn: BERT_q(x)
Sinh vector nhúng q(x) 768-d"] FAISS["Tìm Kiếm Tích Trong Lớn Nhất (MIPS via FAISS)
So khớp q(x) với 21M đoạn văn d(z)"] WIKI[("BỘ NHỚ PHI THAM SỐ (Wikipedia)
21 triệu đoạn 100-từ đã nhúng trước bởi BERT_d")] TOPK["Top-K Đoạn Văn Liên Quan Nhất: z_1, z_2, ..., z_k
Kèm phân phối tiên nghiệm p_η(z|x)"] end subgraph CONCAT ["GHÉP NỐI NGỮ CẢNH (Context Augmentation)"] PAIRS["Ghép cặp độc lập từng tài liệu với câu hỏi:
[z_1; x], [z_2; x], ..., [z_k; x]"] end subgraph GENERATOR ["BỘ TẠO SINH THAM SỐ (Parametric Generator - BART)"] BART["Mô Hình Seq2Seq BART-large (400M Tham số)
12 Tầng Encoder + 12 Tầng Decoder"] MARGIN["Cơ Chế Biên Duyên Hóa Xác Suất (Marginalization)
RAG-Sequence (Chuỗi) hoặc RAG-Token (Từng Token)"] end subgraph OUTPUT ["ĐẦU RA TẠO SINH (Verified Generation)"] RESP["Chuỗi văn bản mục tiêu: y
'Tai giữa là khoang nằm bên trong màng nhĩ, gồm 3 xương con...'"] end Q --> BERT_Q BERT_Q --> FAISS WIKI -.-> FAISS FAISS --> TOPK Q --> PAIRS TOPK --> PAIRS PAIRS --> BART BART --> MARGIN MARGIN --> RESP classDef highlight fill:#e0f2fe,stroke:#0284c7,stroke-width:2px,color:#0369a1; classDef memory fill:#fef3c7,stroke:#d97706,stroke-width:2px,color:#92400e; classDef gen fill:#dcfce7,stroke:#16a34a,stroke-width:2px,color:#166534; class RETRIEVER,BERT_Q,FAISS highlight; class WIKI memory; class GENERATOR,BART,MARGIN gen;
1. Bộ Nhớ Phi Tham Số (Non-Parametric Memory)
  • Kho ngữ liệu Wikipedia: Bản dump tháng 12/2018, được chia thành 21 triệu đoạn văn bản 100 từ không chồng lấn.
  • Kiến trúc Bi-Encoder DPR: Sử dụng $\text{BERT}_d$ để nhúng 21 triệu đoạn thành các vector 768 chiều.
  • Chỉ mục FAISS HNSW/IVF: Cho phép tìm kiếm láng giềng gần nhất (MIPS) trong thời gian cận tuyến tính (sub-linear time).
  • Tính năng vượt trội: Có thể hoán đổi, xóa, cập nhật tài liệu trong vài phút mà không cần huấn luyện lại mô hình.
2. Bộ Nhớ Tham Số (Parametric Memory)
  • Mô hình BART-large: 400 triệu tham số (12 tầng encoder + 12 tầng decoder) đã được tiền huấn luyện khử nhiễu tự hồi quy.
  • Lưu trữ tri thức ngôn ngữ: Nắm vững ngữ pháp tiếng Anh, phong cách diễn đạt, khả năng tóm tắt và xâu chuỗi lập luận tự nhiên.
  • Cơ chế điều kiện hóa: Nhận đầu vào là chuỗi ghép nối $[z; x]$ để tổng hợp thông tin khách quan từ $z$ thành câu trả lời $y$.
  • Hội tụ tối ưu: Tinh chỉnh liên hợp với retriever để học cách trích lọc đúng thông tin từ tài liệu được nạp vào.

3. Hai Mô Hình Biên Duyên Hóa: RAG-Sequence vs RAG-Token

Nền tảng toán học phân tích cách thức tích phân biến tiềm ẩn tài liệu $z$ để sinh văn bản

Công Thức 1 Single Latent Document

Mô Hình RAG-Sequence

Giả định rằng cùng một tài liệu $z$ được dùng để sinh ra toàn bộ chuỗi mục tiêu $y$. Tài liệu $z$ đóng vai trò là một biến tiềm ẩn đơn nhất được biên duyên hóa trên Top-$K$:

$$p_{\text{RAG-Sequence}}(y|x) \approx \sum_{z \in \text{top-}k(p(\cdot|x))} p_\eta(z|x) \prod_{i=1}^N p_\theta(y_i|x, z, y_{1:i-1})$$
  • Mỗi tài liệu $z$ sinh ra một giả thuyết trọn vẹn $y$ với xác suất riêng $p_\theta(y|x, z)$.
  • Xác suất cuối cùng là tổng có trọng số của các chuỗi theo phân phối retriever $p_\eta(z|x)$.
  • Ưu điểm: Câu trả lời có tính nhất quán cực cao, không bị pha trộn chắp vá thông tin giữa các tài liệu đối nghịch.
Phù hợp nhất cho: Trả lời câu hỏi ngắn, trích xuất dữ kiện sự thật đơn lẻ.
Công Thức 2 Token-level Mixture

Mô Hình RAG-Token

Cho phép mô hình chọn một tài liệu tiềm ẩn khác nhau tại mỗi vị trí token $y_i$. Điều này cho phép bộ tạo sinh tổng hợp kiến thức từ nhiều tài liệu khác nhau:

$$p_{\text{RAG-Token}}(y|x) \approx \prod_{i=1}^N \sum_{z \in \text{top-}k(p(\cdot|x))} p_\eta(z|x) \, p_\theta(y_i|x, z, y_{1:i-1})$$
  • Tại mỗi token thứ $i$, bộ tạo sinh tính phân phối trên tất cả các tài liệu trong Top-$K$.
  • Biên duyên hóa phân phối xác suất token ngay tại bước $i$ trước khi chuyển sang bước $i+1$.
  • Ưu điểm: Có khả năng tổng hợp đa tài liệu (multi-document synthesis) rất mạnh mẽ.
Phù hợp nhất cho: Tóm tắt văn bản, trả lời câu hỏi trừu tượng dài (NLG).

Công Thức Tính Phân Phối Xác Suất Truy Xuất (DPR Retriever)

Xác suất truy xuất một đoạn văn $z$ dựa trên câu hỏi $x$ được chuẩn hóa theo softmax dựa trên tích vô hướng giữa hai biểu diễn vector:

$$p_\eta(z|x) \propto \exp \left( d(z)^\top q(x) \right) = \frac{\exp \left( d(z)^\top q(x) \right)}{\sum_{z' \in \text{Corpus}} \exp \left( d(z')^\top q(x) \right)}$$ $$\text{với } d(z) = \text{BERT}_d(z), \quad q(x) = \text{BERT}_q(x)$$

Trong quá trình suy luận, việc tìm kiếm Top-$K$ đoạn văn bản có xác suất cao nhất trở thành bài toán Maximum Inner Product Search (MIPS) trên 21 triệu vector được tối ưu hóa bằng thư viện FAISS, trả về kết quả chỉ trong vài mili-giây.

4. Chiến Lược Huấn Luyện Liên Hợp & Kỹ Thuật Giải Mã

Tối ưu hóa đầu-cuối không cần nhãn giám sát đoạn văn và các giải pháp tìm kiếm chùm tối ưu

1 Huấn Luyện Liên Hợp (End-to-End Joint Training)

Hệ thống được huấn luyện hoàn toàn mà không cần bất kỳ dữ liệu giám sát nào về việc đoạn văn nào là đoạn văn đúng cần truy xuất. Mô hình học cách truy xuất thông qua tín hiệu phản hồi từ hàm mất mát Negative Marginal Log-Likelihood:

$$\mathcal{L}_{\text{RAG}} = \sum_j -\log p(y_j | x_j)$$

Chiến lược tiết kiệm tài nguyên: Đóng băng trọng số của bộ mã hóa tài liệu $\text{BERT}_d$ và chỉ mục 21 triệu vector; gradient chỉ lan truyền ngược vào bộ mã hóa truy vấn $\text{BERT}_q$ và bộ giải mã BART.

2 Kỹ Thuật Giải Mã (Decoding Strategies)

Tại thời điểm kiểm tra, việc tìm $\arg\max_y p(y|x)$ đòi hỏi các chiến lược chuyên biệt:

Giải mã RAG-Token: Sử dụng Beam Search tự hồi quy tiêu chuẩn với xác suất chuyển đổi $p'(y_i|x, y_{1:i-1}) = \sum_z p_\eta(z|x) p_\theta(y_i|x, z, y_{1:i-1})$.
Giải mã RAG-Sequence (Thorough vs Fast):
  • Thorough Decoding: Chạy beam search độc lập trên từng $z$, hợp các giả thuyết lại và tính lại xác suất biên duyên $p(y|x)$.
  • Fast Decoding: Giả định xác suất bằng 0 cho các chuỗi không được sinh ra trong chùm của $z_i$, giúp tăng tốc độ giải mã gấp nhiều lần.

5. Thiết Lập Thực Nghiệm (Experimental Setup)

Chi tiết 4 nhóm tác vụ thâm dụng tri thức, các bộ dữ liệu tiêu chuẩn, thước đo và siêu tham số

1 Hỏi Đáp Miền Mở (Open-Domain QA)
Thước đo: EM %

Đánh giá năng lực truy xuất và trích xuất dữ kiện sự thật chính xác từ câu hỏi không có ngữ cảnh đi kèm trên 4 bộ chuẩn danh tiếng:

  • Natural Questions (NQ): Các câu hỏi tìm kiếm người dùng thật từ Google Search.
  • TriviaQA (TQA): Tập hợp câu hỏi đố vui kiến thức bách khoa từ các chuyên gia.
  • WebQuestions (WQ): Tập câu truy vấn Freebase sinh ra qua Google Suggest API.
  • CuratedTREC (CT): Bộ dữ liệu lịch sử từ hội nghị TREC QA (1999–2002) với câu hỏi diễn đạt phức tạp.
2 Hỏi Đáp Trừu Tượng (Abstractive QA)
Rouge-L & BLEU-1

Sử dụng bộ chuẩn MS-MARCO NLG v2.1 gồm các câu hỏi từ Bing Search đòi hỏi câu trả lời hoàn chỉnh dạng văn bản tự do:

  • Thử thách khắc nghiệt: Không cung cấp văn bản vàng (gold passages) lúc kiểm tra; RAG phải tự dò tìm trong 21 triệu đoạn Wikipedia.
  • Mục tiêu: Đo lường khả năng tổng hợp thông tin, tính trôi chảy ngôn ngữ và độ chính xác của câu trả lời tự do.
3 Tạo Sinh Câu Hỏi Mở (Open Question Gen)
Q-BLEU-1 & Human Eval

Sử dụng tập dữ liệu SearchQA / Jeopardy để kiểm tra khả năng sáng tạo câu hỏi đố vui từ tên thực thể:

  • Đánh giá của con người (Human Assessment): Chấm điểm mù hai tiêu chí sống còn: Tính xác thực sự thật (Factuality) và Tính cụ thể ngữ cảnh (Specificity).
  • Mục tiêu: Khảo sát xem mô hình có bị lặp lại những câu thoại rỗng tuếch hay sinh ra các dữ kiện đặc trưng sâu sắc.
4 Xác Minh Sự Thật (Fact Verification)
Classification Acc %

Thử nghiệm trên bộ dữ liệu FEVER (Thorne et al., 2018) phân loại nhận định thành 3 lớp:

  • Phân loại nhãn: Supports (Xác thực/Đúng), Refutes (Bác bỏ/Sai), Not Enough Info (Thiếu chứng cứ).
  • Không giám sát bằng chứng: Mô hình RAG tự động truy xuất tài liệu chứng minh mà không cần gắn nhãn câu chứng cứ từ người.

Bảng Siêu Tham Số Huấn Luyện & Hạ Tầng Thử Nghiệm (Implementation Details)

Tham Số (Parameter) Giá Trị Cấu Hình Ý Nghĩa Kỹ Thuật
Chỉ Mục Bộ Nhớ Ngoài (Corpus) Wikipedia dump Dec 2018 21,015,324 đoạn văn bản 100 từ không chồng lấn
Công Cụ Tìm Kiếm Vector (MIPS) FAISS HNSW / Flat Index Tìm kiếm vector 768 chiều với tích trong cực đại cận tuyến tính
Số Tài Liệu Truy Xuất ($k$) Top-$k = 5$ hoặc $10$ (Training) / $50$ (Decoding) Cân bằng tối ưu giữa độ phủ thông tin và chi phí bộ nhớ GPU
Thuật Toán Tối Ưu & Learning Rate AdamW (BART: $3 \times 10^{-5}$, $\text{BERT}_q$: $10^{-5}$) LR của bộ truy vấn thấp hơn để tránh xáo trộn biểu diễn không gian nhúng

6. Kết Quả Thực Nghiệm & Đánh Giá Hiệu Năng Đột Phá

So sánh đối đầu trên 4 nhóm tác vụ thâm dụng tri thức: Open-Domain QA, MS-MARCO, Jeopardy và FEVER

Bảng 1: Điểm Khớp Chính Xác (Exact Match - EM %) trên Open-Domain QA

4 Benchmarks
Mô Hình (Model) Phân Loại Kiến Trúc Natural Questions (NQ) TriviaQA (TQA) WebQuestions (WQ) CuratedTREC (CT)
T5-11B (Raffel et al., 2020) Closed-book (Parametric only - 11 Tỷ Tham Số) 34.5 50.1 37.4 —
T5-11B + SSM Closed-book + Salient Span Masking 36.6 60.5 44.7 —
REALM (Guu et al., 2020) Open-book (Retrieve-and-Extract) 40.4 — 40.7 46.8
DPR (Karpukhin et al., 2020) Open-book (Bi-Encoder + Extractive Reader) 41.5 57.9 / 56.8 41.1 44.4
RAG-Token (Đề Xuất) Hybrid Generative (400M BART + DPR) 44.1 55.2 / 66.1 45.5 50.0
RAG-Sequence (Đề Xuất) Hybrid Generative (State-of-the-Art) 44.5 56.8 / 68.0 45.2 52.2

* Điểm nhấn: Mô hình RAG (chỉ 400M tham số BART) đánh bại áp đảo T5-11B (mô hình 11 tỷ tham số, lớn gấp gần 30 lần) trên mọi bài toán QA miền mở.

Bảng 2: Tác Vụ Tạo Sinh (MS-MARCO) & Xác Minh (FEVER)

Mô Hình Rouge-L (MS-MARCO) BLEU-1 (MS-MARCO) FEVER 3-way Acc
BART thuần túy 38.2 41.6 64.0%
RAG-Token 40.1 41.5 72.5%
RAG-Sequence 40.8 44.2 72.5%

Ví Dụ Định Tính So Sánh Khả Năng Diệt Ảo Giác

Câu hỏi: "Định nghĩa tai giữa (define middle ear)?"
BART thuần: "Tai giữa là phần tai nằm giữa tai giữa và mũi." (Ảo giác vô nghĩa)
RAG-Seq: "Tai giữa bao gồm hòm nhĩ và ba xương con." (Chính xác 100% y khoa)
Thực thể: "Sun" (Jeopardy Question Generation)
BART thuần: "Ngôi sao này là ngôi sao gần Trái Đất nhất trong Hệ Mặt Trời." (Câu lặp nông cạn)
RAG-Seq: "Thiên thể này chiếm 99,86% khối lượng của toàn bộ Hệ Mặt Trời." (Dữ kiện cực kỳ sắc sảo)

Nghiên Cứu Cắt Bỏ Thành Phần (Ablation Analysis)

1 Dense DPR vs BM25 Sparse

Sử dụng Dense Retrieval (DPR) mang lại bước nhảy vọt +12.7% trên Natural Questions (44.5% so với 31.8%) và +12.7% trên TriviaQA so với phương pháp tìm kiếm từ khóa truyền thống BM25.

2 Huấn Luyện Liên Hợp vs Cố Định Retriever

Việc cho phép gradient lan truyền ngược vào $\text{BERT}_q$ (Joint Training) giúp mô hình thích nghi câu truy vấn theo ngữ cảnh tạo sinh, gia tăng từ +3.0% đến +4.4% điểm số EM so với việc giữ nguyên retriever ban đầu.

7. Khả Năng Thay Thế Chỉ Mục Tri Thức Nóng (Hot-Swapping Memory)

Cập nhật tri thức thời gian thực không cần tái huấn luyện mô hình — Ưu thế sinh tử trong môi trường doanh nghiệp

Thử Nghiệm Kinh Điển Trong Bài Báo: Wikipedia 2016 vs Wikipedia 2018

Để chứng minh tính linh hoạt của bộ nhớ phi tham số, các tác giả thực hiện thí nghiệm hoán đổi chỉ mục Wikipedia mà giữ nguyên 100% trọng số của mô hình BART đã huấn luyện:

Chỉ Mục Cũ: Wikipedia 2016 Index Snapshot 2016
Câu hỏi: "Ai là thủ lĩnh của Đảng Lao Động Anh?"
→ RAG phản hồi: "Jeremy Corbyn" (Chính xác theo năm 2016)
Chỉ Mục Mới: Wikipedia 2018 Hot-Swapped Index
Câu hỏi: "Ai là thủ lĩnh của Đảng Lao Động Anh?"
→ RAG phản hồi: "Keir Starmer" (Tự động cập nhật ngay lập tức!)
Ý nghĩa then chốt đối với AI hiện đại: Đây là giải pháp triệt để cho vấn đề Temporal Drift (Trôi dạt tri thức theo thời gian) và Data Privacy / Unlearning (Xóa bỏ tài liệu mật ngay lập tức bằng cách xóa vector khỏi chỉ mục mà không sợ rò rỉ qua trọng số).
Ứng Dụng Khóa Luận Tốt Nghiệp

8. Kế Thừa & Chuyển Giao Công Nghệ Vào Hệ Thống SmartRestaurant

Thiết kế kiến trúc RAG hai tầng (Two-Tier RAG) cho Trợ lý AI Tư vấn Thực đơn & Đặt bàn (Aria)

Bảng Ánh Xạ Lý Thuyết Lewis et al. (2020) Sang Nghiệp Vụ SmartRestaurant

Thành Phần Trong RAG (2020) Thành Phần Tương Ứng Trong SmartRestaurant (Aria) Quy Trình Thực Thi Thực Tế Tại Nhà Hàng
Bộ Nhớ Phi Tham Số (Wikipedia 21M Đoạn) PostgreSQL (pgvector) + Pinecone Hybrid Index Lưu trữ toàn bộ công thức 50+ món ăn, thành phần chi tiết, 14 nhóm chất gây dị ứng, biểu phí dịch vụ và hồ sơ đặt bàn.
Bộ Truy Xuất (DPR Bi-Encoder) Hybrid Search (BGE-M3 Dense + BM25 Sparse) Nhận diện chuẩn xác cả tên món ăn cụ thể (từ khóa chính xác BM25) lẫn nhu cầu cảm xúc khách hàng: "Món nào thanh đạm cho người ốm" (ngữ nghĩa sâu Dense).
Bộ Tạo Sinh Tham Số (BART-large) Gemini 2.5 Flash / Llama-3-8B-Instruct Đóng vai trò nhân viên tư vấn lễ tân duyên dáng, nhận ngữ cảnh từ cơ sở tri thức để tạo sinh câu trả lời tự nhiên, lịch thiệp.
Hot-Swapping Memory Real-time Stock & Dynamic Menu Updates Khi bếp trưởng báo "Cá hồi đã hết", hệ thống chỉ cần cập nhật cờ dữ liệu trong vector database; Aria lập tức từ chối nhận món mà không cần huấn luyện lại.

Chiến Lược Chọn Lựa Giữa RAG-Sequence Và RAG-Token Trong Nghiệp Vụ Nhà Hàng

Đồ án áp dụng linh hoạt hai trường phái biên duyên hóa tùy theo mục đích hội thoại của khách:

Áp Dụng RAG-Sequence (An Toàn Dị Ứng)

Áp dụng cho các truy vấn nhạy cảm về an toàn thực phẩm (dị ứng tôm, gluten, đậu phộng). Toàn bộ câu trả lời bị ràng buộc chặt chẽ vào một tài liệu kiểm nghiệm duy nhất, đảm bảo tính nhất quán tuyệt đối và tránh nhầm lẫn giữa các nguyên liệu.

Áp Dụng RAG-Token (Gợi Ý Combo Đa Món)

Áp dụng khi khách yêu cầu gợi ý thực đơn trọn gói cho tiệc 6 người gồm món khai vị, món chính và tráng miệng. Mô hình có thể tổng hợp thông tin từ nhiều thẻ món ăn khác nhau trong cùng một câu trả lời mạch lạc.

9. Tài Liệu Tham Khảo & Trích Dẫn BibTeX

Các ấn phẩm khoa học nền tảng liên quan và mã trích dẫn tiêu chuẩn

[1] Lewis, P., Perez, E., Piktus, A., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. In Advances in Neural Information Processing Systems (NeurIPS 2020). arXiv:2005.11401.
[2] Karpukhin, V., Oguz, B., Min, S., et al. (2020). Dense Passage Retrieval for Open-Domain Question Answering. In EMNLP 2020.
[3] Lewis, M., Liu, Y., Goyal, N., et al. (2020). BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. In ACL 2020.
[4] Guu, K., Lee, K., Tung, Z., et al. (2020). REALM: Retrieval-Augmented Language Model Pre-training. arXiv:2002.08909.
Trích dẫn BibTeX chuẩn NeurIPS 2020 NeurIPS 2020
@inproceedings{lewis2020rag,
  author    = {Patrick Lewis and Ethan Perez and Aleksandra Piktus and Fabio Petroni and Vladimir Karpukhin and Naman Goyal and Heinrich K{\"u}ttler and Mike Lewis and Wen-tau Yih and Tim Rockt{\"a}schel and Sebastian Riedel and Douwe Kiela},
  title     = {Retrieval-Augmented Generation for Knowledge-Intensive {NLP} Tasks},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  volume    = {33},
  pages     = {9459--9474},
  year      = {2020},
  url       = {https://arxiv.org/abs/2005.11401}
}