Mmaiqai.com
🧠 CT-AI · Chương 1 · Mục 1.1.4

Generative AI: tạo nội dung mới và các tác động

🎯 Mục tiêu học (LO AI-1.1.4 · mức K2 – Hiểu): giải thích Generative AI là gì, công nghệ nền và các tác động đi kèm.

💡 Ý cốt lõi: GenAI là AI chuyên tạo ra nội dung mới (văn bản, ảnh, video, nhạc, dữ liệu phức tạp) trông giống dữ liệu nó đã học.

Học từ lượng dữ liệu khổng lồ → sinh đầu ra tương tự dữ liệu huấn luyện (nhiều mô hình cũng làm phân loại/dự đoán).

Ba công nghệ nền của GenAI

Đề hay hỏi "công nghệ nào làm việc gì" — nhớ đúng 3 cái này.

Công nghệCách hoạt độngGhi nhớ
GANs (mạng đối sinh)Hai mạng nơ-ron cạnh tranh nhau: một bên tạo dữ liệu giả, một bên phân biệt thật/giả.2 mạng đấu nhau → dữ liệu giả rất thật
Diffusion model (mô hình khuếch tán)Thêm nhiễu vào dữ liệu rồi học cách khử nhiễu dần để tạo nội dung chất lượng cao.Thêm nhiễu → khử nhiễu
TransformerDùng cơ chế self-attention để sinh văn bản mạch lạc, đúng ngữ cảnh; là nền của LLM, ngày càng dùng cho đa phương thức.Self-attention → nền của LLM

💡 Hiểu nhanh 3 công nghệ nền

GANs — 2 mạng đấu nhau

Tưởng tượng một thợ làm tiền giả (Generator) và một cảnh sát (Discriminator). Thợ càng làm tinh vi để qua mặt, cảnh sát càng soi kỹ để bắt bài — hai bên ép nhau giỏi dần lên, tới lúc "tiền giả" gần như không phân biệt được với thật. Đó là lý do GANs tạo được ảnh/deepfake rất sống động.

Diffusion — thêm nhiễu → khử nhiễu

Lúc học, mô hình xem ảnh thật bị rắc nhiễu dần tới khi thành mớ hạt như màn hình TV mất sóng, rồi tập gột nhiễu ngược lại. Lúc tạo ảnh mới, nó bắt đầu từ một màn nhiễu và khử nhiễu dần từng bước — như tấm ảnh đầy hạt từ từ hiện rõ nét. Chỉ 1 quy trình (không đấu 2 mạng như GANs), thường cho ảnh chất lượng cao.

Transformer — self-attention

Khi xử lý mỗi từ, mô hình nhìn tất cả các từ khác trong câu và cân xem từ nào liên quan nhất (kể cả từ ở xa). Ví dụ "con chuột cắn đứt dây" và "con chuột máy tính bị hỏng" — hiểu đúng nhờ nhìn từ xung quanh. Nhờ vậy Transformer bắt được quan hệ xa, sinh văn bản mạch lạc → nền của các LLM.

Thực tế dùng: foundation model → fine-tune

Đa số công cụ GenAI hôm nay dựng trên một foundation model (mô hình nền, huấn luyện sẵn trên dữ liệu khổng lồ) rồi fine-tune (tinh chỉnh) cho ứng dụng cụ thể — thay vì huấn luyện lại từ đầu.

Xu hướng tiến tới đa phương thức (multimodal): một mô hình xử lý và sinh được cả văn bản, ảnh lẫn âm thanh → linh hoạt hơn. Khung pháp lý như EU AI Act đang dần định hình để quản lý việc phát triển và sử dụng có trách nhiệm.

Mặt trái cần nhớ (3 nhóm lo ngại)

① Lạm dụng & xói mòn niềm tin

Vì GenAI tạo được nội dung giả mà rất thật, nó dễ bị lợi dụng: deepfake (video/giọng nói giả mặt sếp hay người thân để lừa chuyển tiền), tin giả và bình luận ảo sinh hàng loạt để thao túng dư luận, nội dung lừa đảo tinh vi. Hệ quả: người xem khó phân biệt thật–giả, mất niềm tin vào ảnh/video/tin trên mạng; kèm theo rủi ro về riêng tư, bảo mật và thao túng.

② Tác động tới việc làm

Ảnh hưởng rõ nhất tới lao động tri thức (white-collar): AI tự viết bài, dịch, thiết kế cơ bản, sinh code, cả soạn tài liệu pháp lý/y tế → một số công việc lặp lại bị thu hẹp, dấy lên tranh luận về mất việc. Đổi lại, nó tăng năng suất và sinh ra việc mới (viết prompt, kiểm duyệt & đánh giá đầu ra AI, tinh chỉnh mô hình) → buộc người lao động học lại kỹ năng mới.

③ Tính bền vững (môi trường)

Huấn luyện và vận hành mô hình lớn ngốn rất nhiều tài nguyên tính toán: trung tâm dữ liệu tốn lượng điện khổng lồ và cả nước để làm mát → tiêu thụ điện cao, dấu chân carbon lớn. Vì vậy có xu hướng đẩy mạnh mô hình gọn/hiệu quả hơn hạ tầng dùng năng lượng sạch hơn.

Đổi lại, GenAI cũng mở ra cơ hội đổi mới trong giải trí, marketing, giáo dục và nghiên cứu — không phủ nhận lợi ích, nhưng phải nhìn cả hai mặt.

📝 Bẫy hay gặp

Đề hay cho một phát biểu nghe hợp lý nhưng sai — nhớ mấy chỗ gài sau:

  • "GenAI chỉ sinh nội dung, không làm gì khác" → SAI: nhiều mô hình còn làm phân loại/dự đoán.
  • Đảo ngược cơ chế — "GANs thêm rồi khử nhiễu" hoặc "Diffusion dùng 2 mạng đấu nhau" → SAI: đúng phải là GANs = 2 mạng đấu, Diffusion = nhiễu.
  • "Self-attention (Transformer) là nền của GANs" → SAI: nó là nền của LLM.

📌 Ghi nhớ

GenAI = tạo nội dung mới giống dữ liệu đã học

3 nền: GANs · Diffusion · Transformer

3 lo ngại: niềm tin · việc làm · bền vững

Với tester: đầu ra GenAI mở, đa dạng, không có một đáp án đúng duy nhất → không thể so khớp chính xác như phần mềm thường. Phải kiểm theo tiêu chí (đúng ngữ cảnh, an toàn, không thiên lệch, không bịa) và dùng kỹ thuật riêng — kiểm thử GenAI red teaming (xem mục 4.2).

📖 Thuật ngữ Anh–Việt (mục này)

Đề thi dùng thuật ngữ tiếng Anh — nhớ đúng cụm bên trái. Bấm 🔊 để nghe từng từ, hoặc "Đọc tất cả" để nghe lần lượt Anh → (vài giây) → Việt.

Thuật ngữ (EN)Nghĩa & ghi nhớ nhanh
Generative AI (GenAI)AI tạo sinh — chuyên tạo nội dung mới
Generative adversarial networks (GANs)Mạng đối sinh — 2 mạng cạnh tranh tạo dữ liệu giả rất thật
Diffusion modelMô hình khuếch tán — thêm rồi khử nhiễu dần để tạo nội dung
TransformerKiến trúc self-attention — nền của LLM
Self-attentionCơ chế tự chú ý — bắt quan hệ giữa các phần trong chuỗi
Large language model (LLM)Mô hình ngôn ngữ lớn
Foundation modelMô hình nền — huấn luyện sẵn trên dữ liệu khổng lồ, dùng làm gốc
Fine-tuningTinh chỉnh — huấn luyện thêm mô hình nền cho việc cụ thể
MultimodalĐa phương thức — xử lý cả văn bản, ảnh, âm thanh
Synthetic dataDữ liệu tổng hợp — do máy tạo ra, không phải thu thập thật
DeepfakeẢnh/video giả mạo do AI tạo, trông như thật
MisinformationThông tin sai lệch, tin giả
Carbon footprintDấu chân carbon — lượng khí thải phát sinh
EU AI ActĐạo luật AI của EU — khung pháp lý theo mức rủi ro

🎯 Câu hỏi minh họa (phong cách đề CT-AI · K2)

Which generative technology creates content by gradually adding and then removing noise from data to produce high-quality outputs?

  • a) Generative adversarial networks (GANs).
  • b) Diffusion models.
  • c) Decision trees.
  • d) Reinforcement learning agents.
Xem bản dịch tiếng Việt

Công nghệ tạo sinh nào tạo nội dung bằng cách thêm nhiễu rồi khử nhiễu dần khỏi dữ liệu để cho ra đầu ra chất lượng cao?

a) Mạng đối sinh (GANs).

b) Mô hình khuếch tán (diffusion).

c) Cây quyết định.

d) Agent học tăng cường.

Xem đáp án & giải thích

Đáp án đúng: b — Diffusion model tạo nội dung bằng cách thêm rồi khử nhiễu dần.

a sai — GANs dùng hai mạng cạnh tranh nhau, không phải cơ chế nhiễu.

c sai — decision tree là thuật toán ML phân loại/dự đoán, không phải công nghệ tạo sinh.

d sai — reinforcement learning học hành vi qua thử–sai, không phải sinh nội dung theo kiểu này.

Đề để tiếng Anh cho sát đề thi thật; phần giải thích để tiếng Việt cho dễ hiểu. Câu hỏi do maiqai.com tự soạn theo phong cách đề.

📎 Nguồn: Chương 1 – Giới thiệu AI, mục 1.1.4 "Generative AI", trang 17 — ISTQB® Certified Tester AI Testing Syllabus v2.0 (© International Software Testing Qualifications Board). Nội dung biên soạn/dịch ý lại bằng tiếng Việt, không sao chép nguyên văn.