Kiểm thử Generative AI: khi "đúng/sai" không còn rạch ròi
🎯 Mục tiêu học (LO AI-4.2.1 · mức K2 – Hiểu): giải thích cách kiểm thử một hệ Generative AI (GenAI).
💡 Ý cốt lõi: test GenAI phải đánh giá cả tính đúng đắn, mạch lạc lẫn sáng tạo của output — và phải đối phó với "input explosion problem" do đầu vào quá đa dạng.
Những điểm cần nắm
| Chủ đề | Nội dung |
|---|---|
| Đánh giá cái gì | Tính đúng đắn (correctness), mạch lạc (coherence) và sáng tạo (creativity) của output — kể cả độ độc đáo/mới mẻ (originality, novelty); đồng thời xác nhận yêu cầu chức năng lẫn phi chức năng. GenAI sinh nhiều dạng nội dung (văn bản, ảnh, video, âm thanh) nên chiến lược test phải điều chỉnh theo từng loại. |
| Black-box testing | Cách phổ biến nhất: đưa nhiều loại input (prompt, ảnh, dữ liệu một phần...) vào hệ và đánh giá kết quả — xem thêm Red Teaming (4.2.2). Chú ý độ rõ ràng, độ độc đáo, mức tuân thủ quy tắc riêng của lĩnh vực. Có thể làm thủ công hoặc tự động; hữu ích nhất cho ứng dụng người dùng cuối như chatbot, công cụ thiết kế — nơi sự hài lòng phụ thuộc vào việc nội dung sinh ra có hữu ích & hợp lý. |
| Input explosion problem | Thách thức lớn: input quá đa dạng, khó kiểm soát hết. Có system prompt (tùy chọn) và user prompt (có thể chứa lượng dữ liệu khổng lồ, đa dạng), truy cập qua API; nhiều tham số ảnh hưởng output như temperature, max tokens; context window (giữ lại phần trước của hội thoại) cũng ảnh hưởng kết quả sinh ra. |
| Cách chấm kết quả | Nhiều trường hợp cần đánh giá thủ công — pass/fail phụ thuộc tiêu chí định tính (qualitative) nêu trong yêu cầu. Cách khác: dùng một hệ GenAI thứ hai để tự động chấm (vd hệ nhận diện ảnh kiểm tra ảnh do GenAI sinh ra) — cần cẩn trọng vì hệ chấm cũng có thể lặp lại thiên lệch/lỗi tương tự. |
| Kiểm thử phi chức năng | Quan trọng không kém kiểm thử chức năng: đánh giá mức sử dụng tài nguyên lúc inference lẫn training để xác nhận vận hành hiệu quả, tiết kiệm chi phí — gồm CPU/GPU, bộ nhớ, băng thông mạng, thời gian phản hồi. |
| Benchmark suite | Bộ dữ liệu & tác vụ chuẩn hóa giúp so sánh nhất quán giữa các model — đo từ khả năng hiểu ngôn ngữ đến suy luận, lập trình... Đối chiếu với benchmark giúp phát hiện điểm cần cải thiện một cách hệ thống, có thể lặp lại. |
📝 Bẫy hay gặp
Đề hay cho một phát biểu nghe hợp lý nhưng sai — nhớ mấy chỗ gài sau:
- "Test GenAI chỉ cần kiểm tra output đúng/sai như phần mềm thường" → SAI: phải đánh giá thêm mạch lạc & sáng tạo, và tiêu chí thường mang tính định tính.
- "Input explosion chỉ do user prompt dài" → SAI: còn do system prompt, tham số (temperature, max tokens), context window và việc truy cập qua API.
- "Dùng GenAI khác để tự động chấm luôn khách quan, không cần cẩn trọng" → SAI: hệ chấm cũng có thể lặp lại thiên lệch/lỗi tương tự hệ được chấm.
- "Kiểm thử GenAI chỉ cần quan tâm chức năng, bỏ qua phi chức năng" → SAI: phi chức năng (tài nguyên, chi phí, thời gian phản hồi) quan trọng ngang chức năng.
📌 Ghi nhớ
Đánh giá: đúng đắn · mạch lạc · sáng tạo — cả chức năng lẫn phi chức năng
Input explosion: prompt + tham số + context window khiến input khó kiểm soát hết
Với tester: khi test chatbot hay công cụ sinh nội dung, đừng chỉ soi "output có hợp lý không" — thử đổi temperature, độ dài hội thoại (context window), và cả prompt hệ thống lẫn prompt người dùng để xem output biến động ra sao; đồng thời đối chiếu qua benchmark để có con số so sánh khách quan.
📖 Thuật ngữ Anh–Việt (mục này)
Đề thi dùng thuật ngữ tiếng Anh — nhớ đúng cụm bên trái. Bấm 🔊 để nghe từng từ, hoặc "Đọc tất cả" để nghe lần lượt Anh → (vài giây) → Việt.
| Thuật ngữ (EN) | Nghĩa & ghi nhớ nhanh |
|---|---|
| Generative AI (GenAI) | AI tạo sinh — sinh nội dung mới (văn bản, ảnh, video, âm thanh) |
| Large language model (LLM) | Mô hình ngôn ngữ lớn |
| Black-box testing | Kiểm thử hộp đen — chỉ dựa vào input/output, không biết cấu trúc bên trong |
| Input explosion problem | Vấn đề bùng nổ đầu vào — input quá đa dạng, khó kiểm soát hết |
| System prompt | Prompt hệ thống — chỉ dẫn nền do nhà phát triển đặt |
| User prompt | Prompt người dùng nhập |
| Temperature | Tham số điều chỉnh mức ngẫu nhiên/sáng tạo của output |
| Context window | Cửa sổ ngữ cảnh — phần hội thoại trước được mô hình "nhớ" |
| Benchmark suite | Bộ chuẩn đánh giá — dữ liệu & tác vụ chuẩn hóa để so sánh model |
| Non-functional testing | Kiểm thử phi chức năng (hiệu năng, tài nguyên, chi phí...) |
🎯 Câu hỏi minh họa (phong cách đề CT-AI · K2)
Which factor is a key contributor to the "input explosion problem" when testing a GenAI chatbot?
- a) The chatbot only accepts a single fixed input format.
- b) Parameters like temperature and the context window can change the output for the same prompt.
- c) GenAI systems never use system prompts.
- d) Benchmarks eliminate the need to consider prompt variability.
Xem bản dịch tiếng Việt
Yếu tố nào là nguyên nhân chính gây ra "input explosion problem" khi test một chatbot GenAI?
a) Chatbot chỉ nhận một định dạng input cố định.
b) Các tham số như temperature và context window có thể làm thay đổi output dù cùng một prompt.
c) Hệ GenAI không bao giờ dùng system prompt.
d) Benchmark loại bỏ hoàn toàn nhu cầu xét đến sự biến thiên của prompt.
Xem đáp án & giải thích
✅ Đáp án đúng: b — tham số & context window là hai trong các yếu tố khiến input/khả năng ảnh hưởng đến output trở nên rất đa dạng.
a sai — thực tế GenAI thường nhận nhiều dạng input đa dạng, không cố định.
c sai — hệ GenAI thường có cả system prompt lẫn user prompt.
d sai — benchmark giúp so sánh chuẩn hóa, không loại bỏ được vấn đề input đa dạng trong thực tế sử dụng.
Đề để tiếng Anh cho sát đề thi thật; phần giải thích để tiếng Việt cho dễ hiểu. Câu hỏi do maiqai.com tự soạn theo phong cách đề.
📎 Nguồn: Chương 4 – Kiểm thử hệ thống dựa trên AI, mục 4.2.1 "Testing Generative AI", trang 41–42 — ISTQB® Certified Tester AI Testing Syllabus v2.0 (© International Software Testing Qualifications Board). Nội dung biên soạn/dịch ý lại bằng tiếng Việt, không sao chép nguyên văn.