Mmaiqai.com
🧪 CT-AI · Chương 4 · Mục 4.2.1

Kiểm thử Generative AI: khi "đúng/sai" không còn rạch ròi

🎯 Mục tiêu học (LO AI-4.2.1 · mức K2 – Hiểu): giải thích cách kiểm thử một hệ Generative AI (GenAI).

💡 Ý cốt lõi: test GenAI phải đánh giá cả tính đúng đắn, mạch lạc lẫn sáng tạo của output — và phải đối phó với "input explosion problem" do đầu vào quá đa dạng.

Những điểm cần nắm

Chủ đềNội dung
Đánh giá cái gìTính đúng đắn (correctness), mạch lạc (coherence) và sáng tạo (creativity) của output — kể cả độ độc đáo/mới mẻ (originality, novelty); đồng thời xác nhận yêu cầu chức năng lẫn phi chức năng. GenAI sinh nhiều dạng nội dung (văn bản, ảnh, video, âm thanh) nên chiến lược test phải điều chỉnh theo từng loại.
Black-box testingCách phổ biến nhất: đưa nhiều loại input (prompt, ảnh, dữ liệu một phần...) vào hệ và đánh giá kết quả — xem thêm Red Teaming (4.2.2). Chú ý độ rõ ràng, độ độc đáo, mức tuân thủ quy tắc riêng của lĩnh vực. Có thể làm thủ công hoặc tự động; hữu ích nhất cho ứng dụng người dùng cuối như chatbot, công cụ thiết kế — nơi sự hài lòng phụ thuộc vào việc nội dung sinh ra có hữu ích & hợp lý.
Input explosion problemThách thức lớn: input quá đa dạng, khó kiểm soát hết. Có system prompt (tùy chọn) và user prompt (có thể chứa lượng dữ liệu khổng lồ, đa dạng), truy cập qua API; nhiều tham số ảnh hưởng output như temperature, max tokens; context window (giữ lại phần trước của hội thoại) cũng ảnh hưởng kết quả sinh ra.
Cách chấm kết quảNhiều trường hợp cần đánh giá thủ công — pass/fail phụ thuộc tiêu chí định tính (qualitative) nêu trong yêu cầu. Cách khác: dùng một hệ GenAI thứ hai để tự động chấm (vd hệ nhận diện ảnh kiểm tra ảnh do GenAI sinh ra) — cần cẩn trọng vì hệ chấm cũng có thể lặp lại thiên lệch/lỗi tương tự.
Kiểm thử phi chức năngQuan trọng không kém kiểm thử chức năng: đánh giá mức sử dụng tài nguyên lúc inference lẫn training để xác nhận vận hành hiệu quả, tiết kiệm chi phí — gồm CPU/GPU, bộ nhớ, băng thông mạng, thời gian phản hồi.
Benchmark suiteBộ dữ liệu & tác vụ chuẩn hóa giúp so sánh nhất quán giữa các model — đo từ khả năng hiểu ngôn ngữ đến suy luận, lập trình... Đối chiếu với benchmark giúp phát hiện điểm cần cải thiện một cách hệ thống, có thể lặp lại.

📝 Bẫy hay gặp

Đề hay cho một phát biểu nghe hợp lý nhưng sai — nhớ mấy chỗ gài sau:

  • "Test GenAI chỉ cần kiểm tra output đúng/sai như phần mềm thường" → SAI: phải đánh giá thêm mạch lạc & sáng tạo, và tiêu chí thường mang tính định tính.
  • "Input explosion chỉ do user prompt dài" → SAI: còn do system prompt, tham số (temperature, max tokens), context window và việc truy cập qua API.
  • "Dùng GenAI khác để tự động chấm luôn khách quan, không cần cẩn trọng" → SAI: hệ chấm cũng có thể lặp lại thiên lệch/lỗi tương tự hệ được chấm.
  • "Kiểm thử GenAI chỉ cần quan tâm chức năng, bỏ qua phi chức năng" → SAI: phi chức năng (tài nguyên, chi phí, thời gian phản hồi) quan trọng ngang chức năng.

📌 Ghi nhớ

Đánh giá: đúng đắn · mạch lạc · sáng tạo — cả chức năng lẫn phi chức năng

Input explosion: prompt + tham số + context window khiến input khó kiểm soát hết

Với tester: khi test chatbot hay công cụ sinh nội dung, đừng chỉ soi "output có hợp lý không" — thử đổi temperature, độ dài hội thoại (context window), và cả prompt hệ thống lẫn prompt người dùng để xem output biến động ra sao; đồng thời đối chiếu qua benchmark để có con số so sánh khách quan.

📖 Thuật ngữ Anh–Việt (mục này)

Đề thi dùng thuật ngữ tiếng Anh — nhớ đúng cụm bên trái. Bấm 🔊 để nghe từng từ, hoặc "Đọc tất cả" để nghe lần lượt Anh → (vài giây) → Việt.

Thuật ngữ (EN)Nghĩa & ghi nhớ nhanh
Generative AI (GenAI)AI tạo sinh — sinh nội dung mới (văn bản, ảnh, video, âm thanh)
Large language model (LLM)Mô hình ngôn ngữ lớn
Black-box testingKiểm thử hộp đen — chỉ dựa vào input/output, không biết cấu trúc bên trong
Input explosion problemVấn đề bùng nổ đầu vào — input quá đa dạng, khó kiểm soát hết
System promptPrompt hệ thống — chỉ dẫn nền do nhà phát triển đặt
User promptPrompt người dùng nhập
TemperatureTham số điều chỉnh mức ngẫu nhiên/sáng tạo của output
Context windowCửa sổ ngữ cảnh — phần hội thoại trước được mô hình "nhớ"
Benchmark suiteBộ chuẩn đánh giá — dữ liệu & tác vụ chuẩn hóa để so sánh model
Non-functional testingKiểm thử phi chức năng (hiệu năng, tài nguyên, chi phí...)

🎯 Câu hỏi minh họa (phong cách đề CT-AI · K2)

Which factor is a key contributor to the "input explosion problem" when testing a GenAI chatbot?

  • a) The chatbot only accepts a single fixed input format.
  • b) Parameters like temperature and the context window can change the output for the same prompt.
  • c) GenAI systems never use system prompts.
  • d) Benchmarks eliminate the need to consider prompt variability.
Xem bản dịch tiếng Việt

Yếu tố nào là nguyên nhân chính gây ra "input explosion problem" khi test một chatbot GenAI?

a) Chatbot chỉ nhận một định dạng input cố định.

b) Các tham số như temperature và context window có thể làm thay đổi output dù cùng một prompt.

c) Hệ GenAI không bao giờ dùng system prompt.

d) Benchmark loại bỏ hoàn toàn nhu cầu xét đến sự biến thiên của prompt.

Xem đáp án & giải thích

Đáp án đúng: b — tham số & context window là hai trong các yếu tố khiến input/khả năng ảnh hưởng đến output trở nên rất đa dạng.

a sai — thực tế GenAI thường nhận nhiều dạng input đa dạng, không cố định.

c sai — hệ GenAI thường có cả system prompt lẫn user prompt.

d sai — benchmark giúp so sánh chuẩn hóa, không loại bỏ được vấn đề input đa dạng trong thực tế sử dụng.

Đề để tiếng Anh cho sát đề thi thật; phần giải thích để tiếng Việt cho dễ hiểu. Câu hỏi do maiqai.com tự soạn theo phong cách đề.

📎 Nguồn: Chương 4 – Kiểm thử hệ thống dựa trên AI, mục 4.2.1 "Testing Generative AI", trang 41–42 — ISTQB® Certified Tester AI Testing Syllabus v2.0 (© International Software Testing Qualifications Board). Nội dung biên soạn/dịch ý lại bằng tiếng Việt, không sao chép nguyên văn.