Mmaiqai.com
🤖 CT-AI · Chương 3 · Mục 3.1.4

Không train từ đầu: Fine-tuning và RAG

🎯 Mục tiêu học (LO AI-3.1.4 · mức K2 – Hiểu): giải thích mô hình pretrained, fine-tuning và retrieval-augmented generation (RAG).

💡 Ý cốt lõi: train mô hình từ đầu rất tốn kém → tận dụng mô hình huấn luyện sẵn (pretrained) rồi fine-tune hoặc RAG để hợp việc mới.

Fine-tuning vs RAG

Fine-tuningRAG
Cách làmTrain thêm mô hình pretrained bằng dữ liệu của việc mới.Cấp nguồn dữ liệu riêng cho LLM, chuyển thành dạng tra cứu được; tìm tài liệu liên quan → ghép vào prompt → đưa cho LLM.
Đổi mô hình?Có — cập nhật trọng số (toàn bộ mạng, vài lớp gần đầu ra, hoặc lớp thêm).Không — mô hình pretrained giữ nguyên.
Điểm mạnhCần ít dữ liệu/công sức hơn train từ đầu; hiệu quả khi việc mới gần việc cũ.Bổ sung thông tin cập nhật → câu trả lời chính xác hơn, không phải train lại.

Một mô hình pretrained có thể dùng RAG, fine-tuning, hoặc cả hai.

Fine-tuning ăn thua ở "độ giống nhau"

Mức thành công của fine-tuning phụ thuộc độ giống giữa việc cũ và việc mới:

  • Khác biệt nhỏ → rất hiệu quả. Vd: chỉnh bộ phân loại giống mèo sang nhận giống chó → chạy tốt.
  • Khác biệt lớn → kém hiệu quả. Vd: chỉnh từ nhận ảnh sang nhận giọng nói vùng miền → khó.
  • Fine-tune một LLM cho phân tích giá trị biên (BVA) theo ISTQB → thay đổi nhỏ, dễ đạt nếu dữ liệu tốt.

📝 Bẫy hay gặp

Đề hay cho một phát biểu nghe hợp lý nhưng sai — nhớ mấy chỗ gài sau:

  • "RAG thay đổi trọng số của mô hình pretrained" → SAI: RAG không đổi mô hình — chỉ bổ sung dữ liệu vào prompt.
  • "Fine-tuning cần nhiều dữ liệu hơn train từ đầu" → SAI: ngược lại, cần ít hơn nhiều.
  • "Mô hình pretrained sạch nên khỏi test lại" → SAI: thiên lệch/lỗ hổng của mô hình gốc di truyền sang → phải test lại.

📌 Ghi nhớ

Fine-tuning = train thêm, đổi mô hình, hiệu quả khi việc mới gần việc cũ

RAG = cấp thêm tài liệu vào prompt, không đổi mô hình

Với tester: điểm then chốt — thiên lệch & lỗ hổng của mô hình gốc di truyền sang mô hình mới. Dù chỉ fine-tune/RAG, vẫn phải test để xác nhận hoạt động tin cậy và công bằng trên việc mới.

📖 Thuật ngữ Anh–Việt (mục này)

Đề thi dùng thuật ngữ tiếng Anh — nhớ đúng cụm bên trái. Bấm 🔊 để nghe từng từ, hoặc "Đọc tất cả" để nghe lần lượt Anh → (vài giây) → Việt.

Thuật ngữ (EN)Nghĩa & ghi nhớ nhanh
Pretrained modelMô hình huấn luyện sẵn
Fine-tuningTinh chỉnh — train thêm mô hình sẵn cho việc mới
Retrieval-Augmented Generation (RAG)Sinh có tăng cường truy hồi — cấp tài liệu vào prompt
LLMMô hình ngôn ngữ lớn
PromptCâu lệnh/đầu vào đưa cho LLM
Enhanced promptPrompt được bổ sung tài liệu liên quan
WeightsTrọng số — tham số mô hình học được
LayerLớp trong mạng nơ-ron
Bias (mô hình)Thiên lệch — xu hướng sai lệch bất công của mô hình
VulnerabilityLỗ hổng — điểm yếu có thể bị khai thác

🎯 Câu hỏi minh họa (phong cách đề CT-AI · K2)

Which statement about RAG is correct?

  • a) RAG retrains the whole model from scratch.
  • b) RAG provides task-specific data to the LLM via an enhanced prompt, without changing the pretrained model.
  • c) RAG permanently changes the model’s weights.
  • d) RAG can only be used instead of, never together with, fine-tuning.
Xem bản dịch tiếng Việt

Phát biểu nào về RAG là đúng?

a) RAG train lại toàn bộ mô hình từ đầu.

b) RAG cấp dữ liệu riêng cho LLM qua prompt bổ sung, không đổi mô hình pretrained.

c) RAG thay đổi vĩnh viễn trọng số của mô hình.

d) RAG chỉ dùng thay cho fine-tuning, không bao giờ dùng chung.

Xem đáp án & giải thích

Đáp án đúng: b — RAG bổ sung dữ liệu vào prompt, không đổi mô hình.

a c sai — RAG không train lại hay đổi trọng số.

d sai — có thể dùng RAG, fine-tuning, hoặc cả hai.

Đề để tiếng Anh cho sát đề thi thật; phần giải thích để tiếng Việt cho dễ hiểu. Câu hỏi do maiqai.com tự soạn theo phong cách đề.

📎 Nguồn: Chương 3 – Machine Learning, mục 3.1.4 "Pretrained Models, Fine-Tuning, and Retrieval-Augmented Generation", trang 30 — ISTQB® Certified Tester AI Testing Syllabus v2.0 (© International Software Testing Qualifications Board). Nội dung biên soạn/dịch ý lại bằng tiếng Việt, không sao chép nguyên văn.