Chuẩn bị dữ liệu: khâu tốn công nhất của ML
🎯 Mục tiêu học (LO AI-3.2.1 · mức K2 – Hiểu): tóm tắt các hoạt động chuẩn bị dữ liệu cho ML.
💡 Ý cốt lõi: chuẩn bị dữ liệu là khâu quan trọng & tốn nguồn lực nhất trong quy trình ML — gồm 3 nhóm hoạt động + EDA song song.
Ba nhóm hoạt động chính
| Nhóm | Gồm gì |
|---|---|
| Data acquisition (thu thập) | Xác định loại dữ liệu cần (số, phân loại, ảnh, văn bản...); thu từ nhiều nguồn (CSDL, API, cảm biến thời gian thực); gắn nhãn cho supervised, kiểm độ chính xác & nhất quán. Dữ liệu thu được có thể ở nhiều dạng: số (numerical), phân loại (categorical), ảnh, dạng bảng (tabular), văn bản, chuỗi thời gian (time series), cảm biến, không gian địa lý (geospatial), video, và âm thanh. |
| Data preprocessing (tiền xử lý) | Làm sạch (bỏ lỗi/trùng/ngoại lai; điền khuyết bằng mean/median/mode; ẩn danh/bỏ thông tin cá nhân); biến đổi định dạng, scaling, chuẩn hóa; tăng cường dữ liệu (thêm mẫu, ví dụ đối kháng, dữ liệu tổng hợp); lấy mẫu con để giảm thời gian/chi phí. |
| Feature engineering (kỹ thuật đặc trưng) | Chọn đặc trưng liên quan (đóng góp cho hiệu năng); trích tập đặc trưng gọn, nhiều thông tin, không dư thừa → giảm thời gian/chi phí train. |
Song song, thường làm EDA (phân tích dữ liệu khám phá): phát hiện xu hướng, mẫu, bất thường; trực quan hóa bằng biểu đồ để hiểu dữ liệu.
Chuẩn bị dữ liệu là quá trình lặp, thường làm thủ công; có thể đảo thứ tự hoặc bỏ bớt bước tùy dự án. Quan trọng: dữ liệu vận hành phải khớp đặc điểm dữ liệu huấn luyện (phân phối, khoảng giá trị đặc trưng) để mô hình chạy đúng như kỳ vọng khi lên production.
📝 Bẫy hay gặp
Đề hay cho một phát biểu nghe hợp lý nhưng sai — nhớ mấy chỗ gài sau:
- "Chuẩn bị dữ liệu là khâu nhẹ, nhanh nhất" → SAI: đây là khâu tốn nguồn lực nhất, chiếm phần lớn công sức.
- "Dữ liệu vận hành khác dữ liệu huấn luyện cũng không sao" → SAI: lệch nhau thì hiệu năng & giả định an toàn mất giá trị.
- Nhầm khâu: điền giá trị khuyết (mean/median/mode) thuộc preprocessing, không phải feature engineering.
📌 Ghi nhớ
3 nhóm: thu thập · tiền xử lý · feature engineering (+ EDA song song)
Nguyên tắc vàng: dữ liệu vận hành phải khớp đặc điểm dữ liệu huấn luyện
Với tester: lỗi mô hình rất hay bắt nguồn từ dữ liệu — nhãn sai, thiên lệch, lệch phân phối train/production. Bản thân dữ liệu và các bước chuẩn bị tự động đều phải được test (Chương 5).
📖 Thuật ngữ Anh–Việt (mục này)
Đề thi dùng thuật ngữ tiếng Anh — nhớ đúng cụm bên trái. Bấm 🔊 để nghe từng từ, hoặc "Đọc tất cả" để nghe lần lượt Anh → (vài giây) → Việt.
| Thuật ngữ (EN) | Nghĩa & ghi nhớ nhanh |
|---|---|
| Data preparation | Chuẩn bị dữ liệu |
| Data acquisition | Thu thập dữ liệu |
| Data preprocessing | Tiền xử lý dữ liệu |
| Feature engineering | Kỹ thuật đặc trưng — chọn/trích đặc trưng |
| Feature | Đặc trưng — thuộc tính đầu vào cho mô hình |
| Data cleaning | Làm sạch dữ liệu |
| Outlier | Ngoại lai — điểm dữ liệu bất thường |
| Imputation | Điền khuyết — bù giá trị thiếu (mean/median/mode) |
| Normalization | Chuẩn hóa — đưa dữ liệu về cùng thang |
| Data augmentation | Tăng cường dữ liệu — thêm mẫu/biến thể |
| Adversarial example | Ví dụ đối kháng — đầu vào cố tình gây sai |
| Synthetic data | Dữ liệu tổng hợp — do máy tạo |
| Exploratory data analysis (EDA) | Phân tích dữ liệu khám phá |
| Data pipeline | Đường ống dữ liệu |
🎯 Câu hỏi minh họa (phong cách đề CT-AI · K2)
Imputing missing values using the mean or median belongs to which data preparation activity?
- a) Data acquisition.
- b) Data preprocessing (cleaning).
- c) Feature engineering.
- d) Model deployment.
Xem bản dịch tiếng Việt
Điền giá trị khuyết bằng mean hoặc median thuộc hoạt động chuẩn bị dữ liệu nào?
a) Thu thập dữ liệu.
b) Tiền xử lý (làm sạch).
c) Feature engineering.
d) Triển khai mô hình.
Xem đáp án & giải thích
✅ Đáp án đúng: b — Điền khuyết là bước làm sạch trong tiền xử lý.
a sai — acquisition là thu thập & gắn nhãn.
c sai — feature engineering là chọn/trích đặc trưng.
d sai — deployment là triển khai, không liên quan.
Đề để tiếng Anh cho sát đề thi thật; phần giải thích để tiếng Việt cho dễ hiểu. Câu hỏi do maiqai.com tự soạn theo phong cách đề.
📎 Nguồn: Chương 3 – Machine Learning, mục 3.2.1 "Activities in Data Preparation", trang 31–32 — ISTQB® Certified Tester AI Testing Syllabus v2.0 (© International Software Testing Qualifications Board). Nội dung biên soạn/dịch ý lại bằng tiếng Việt, không sao chép nguyên văn.