Key Concepts
- Trí tuệ nhân tạo (AI), Học máy (Machine Learning), Học sâu (Deep Learning)
- Thuật toán (Algorithm), Mô hình (Model)
- Dữ liệu (Data), Tập dữ liệu (Dataset)
- Xử lý dữ liệu (Data Wrangling), Tiền xử lý dữ liệu (Data Preprocessing), Tăng cường dữ liệu (Data Augmentation)
- Tập huấn luyện (Training Set), Tập xác thực (Validation Set), Tập kiểm thử (Test Set)
- Học có giám sát (Supervised Learning), Học không giám sát (Unsupervised Learning), Học tăng cường (Reinforcement Learning)
- Đặc trưng (Feature), Nhãn (Target)
- Chuẩn hóa đặc trưng (Feature Scaling)
- Giảm chiều dữ liệu (Dimensionality Reduction)
- Quá khớp (Overfitting), Chưa khớp (Underfitting)
- Hàm mất mát (Loss Function), Chỉ số đánh giá (Metric)
- Độ lệch (Bias), Phương sai (Variance)
- Chính quy hóa (Regularization)
1. AI, Machine Learning, và Deep Learning
- Trí tuệ nhân tạo (AI): Lĩnh vực phát triển hệ thống máy tính có khả năng thực hiện các công việc thông minh như con người (hiểu ngôn ngữ, nhận dạng hình ảnh, giải quyết vấn đề, ra quyết định).
- Học máy (Machine Learning): Lĩnh vực con của AI, tập trung vào việc giúp máy tính tự học hỏi từ dữ liệu mà không cần lập trình tường minh. Machine learning là mảng con nổi bật nhất của AI, nhưng không phải cứ AI là machine learning. Ví dụ: Rule-based system là AI nhưng không phải machine learning.
- Học sâu (Deep Learning): Lĩnh vực con của học máy, sử dụng các thuật toán lấy cảm hứng từ cấu trúc và chức năng của não người (mạng thần kinh nhân tạo - Artificial Neural Network).
2. Thuật Toán và Mô Hình
- Thuật toán (Algorithm): Quy trình/phương pháp áp dụng để huấn luyện và điều chỉnh tham số dựa trên dữ liệu. Ví dụ: Linear Regression, Decision Tree, Support Vector Machine, Random Forest.
- Mô hình (Model): Kết quả đầu ra sau khi áp dụng thuật toán lên dữ liệu huấn luyện. Là hình thái cuối cùng có khả năng đưa ra dự đoán/suy luận khi có dữ liệu mới. Ví dụ: Sau khi huấn luyện Linear Regression, ta được một bộ các trọng số cụ thể, đây chính là mô hình.
- Tóm lại: Thuật toán mô tả cách máy tính tự động tìm tham số/tính năng/cấu trúc. Mô hình là kết quả học, là các tham số/cấu trúc sau khi huấn luyện, có thể áp dụng để dự đoán trên dữ liệu mới.
3. Dữ Liệu và Tập Dữ Liệu
- Dữ liệu (Data): Thông tin/giá trị thu thập từ nhiều nguồn, có thể ở dạng thô hoặc đã qua xử lý. Là nền tảng cốt lõi của mọi hệ thống machine learning. Chất lượng và cách xử lý data quyết định trực tiếp đến hiệu năng của mô hình.
- Tập dữ liệu (Dataset): Tập hợp có cấu trúc bao gồm nhiều mẫu dữ liệu, được tổ chức và sắp xếp để sử dụng cho một mục đích nào đó (thường là huấn luyện và đánh giá mô hình).
- Các dạng dữ liệu phổ biến: Dạng bảng, hình ảnh, văn bản, âm thanh.
4. Xử Lý, Tiền Xử Lý và Tăng Cường Dữ Liệu
- Xử lý dữ liệu (Data Wrangling): Quá trình thu thập, làm sạch và xử lý dữ liệu từ nhiều nguồn khác nhau thành dạng có cấu trúc và dễ sử dụng hơn.
- Tiền xử lý dữ liệu (Data Preprocessing): Quá trình chuẩn bị và xử lý dữ liệu để có thể áp dụng các thuật toán học máy hoặc phân tích dữ liệu.
- Tăng cường dữ liệu (Data Augmentation): Quá trình tạo ra dữ liệu mới từ bộ dữ liệu gốc, làm cho bộ dữ liệu phong phú hơn, giúp mô hình có khả năng khái quát hóa tốt hơn.
5. Training Set, Validation Set, và Test Set
- Training Set (Tập Huấn Luyện): Dữ liệu được sử dụng trực tiếp để huấn luyện mô hình, thông qua việc điều chỉnh các tham số.
- Training (Huấn Luyện): Bước cốt lõi trong machine learning, dạy cho mô hình cách học từ dữ liệu thông qua thuật toán. Thuật toán sẽ điều chỉnh các tham số sao cho mô hình tối ưu hóa một tiêu chí nào đó (ví dụ: tối thiểu hóa sai số, tối đa hóa độ chính xác).
- Validation Set (Tập Xác Thực): Dữ liệu được tách riêng khỏi tập huấn luyện, dùng để theo dõi quá trình huấn luyện, xem mô hình có đang học đúng hướng hay không, và để điều chỉnh các siêu tham số (hyperparameter) của mô hình.
- Test Set (Tập Kiểm Thử): Dữ liệu tách biệt hoàn toàn, không được sử dụng trong quá trình huấn luyện hoặc tinh chỉnh mô hình. Dùng để đánh giá khách quan khả năng tổng quát hóa của mô hình thông qua độ chính xác/sai số khi dự đoán trên dữ liệu mới.
- Ví dụ: Training set giống như bài tập cô giáo giao hàng ngày. Validation set giống như bài kiểm tra cuối kỳ. Test set giống như bài thi tốt nghiệp trung học phổ thông.
- K-Fold Cross-Validation (Cross-Validation): Thay vì chia dữ liệu cố định thành training set và validation set, chia nhỏ dữ liệu theo nhiều cách khác nhau và xoay vòng để mọi phần dữ liệu đều lần lượt được sử dụng làm validation set.
6. Dữ Liệu Được Đánh Nhãn và Không Được Đánh Nhãn
- Dữ liệu không được đánh nhãn (Unlabeled Data): Dữ liệu chỉ có thông tin đầu vào mà không có thông tin mục tiêu đầu ra (nhãn). Ví dụ: Bộ sưu tập hình ảnh chó mèo mà không có nhãn "chó" hay "mèo".
- Dữ liệu được đánh nhãn (Labeled Data): Dữ liệu có cả thông tin đầu vào và thông tin mục tiêu đầu ra (nhãn). Ví dụ: Bộ sưu tập hình ảnh chó mèo đã được gán nhãn "chó" hoặc "mèo".
- Gán nhãn dữ liệu (Data Labeling/Annotation): Quá trình biến dữ liệu không được đánh nhãn thành dữ liệu được đánh nhãn.
7. Học Có Giám Sát, Học Không Giám Sát, và Học Tăng Cường
- Học có giám sát (Supervised Learning): Sử dụng dữ liệu có đánh nhãn để mô hình hóa mối quan hệ giữa dữ liệu đầu vào và nhãn của chúng. Là nhóm thuật toán phổ biến nhất, có ứng dụng rộng rãi nhất. Ví dụ: Dự đoán nhiệt độ, dự đoán người bị COVID.
- Classification (Phân Loại): Kết quả đầu ra (nhãn) là một giá trị rời rạc. Ví dụ: Phân loại email spam/không spam, phân loại người bị ung thư/không bị ung thư.
- Regression (Hồi Quy): Kết quả đầu ra (nhãn) là một giá trị liên tục. Ví dụ: Dự đoán giá nhà.
- Học không giám sát (Unsupervised Learning): Sử dụng dữ liệu không được đánh nhãn để mô hình hóa cấu trúc/thông tin ẩn trong dữ liệu.
- Clustering (Phân Cụm): Phân toàn bộ tập dữ liệu thành K cụm khác nhau sao cho các điểm dữ liệu trong cùng một cụm tương đồng nhau.
- Association (Kết Hợp): Phát hiện ra các mối quan hệ/quy tắc thường xuất hiện cùng nhau trong dữ liệu. Thường xuất hiện trong các hệ thống gợi ý (recommendation system).
- Học tăng cường (Reinforcement Learning): Học hỏi bằng cách tương tác với môi trường xung quanh và đưa ra quyết định dựa trên phản hồi mà chúng nhận được từ môi trường. Đối tượng huấn luyện là "tác nhân" (agent). Ví dụ: Đứa bé bò đến đốm lửa (tác nhân tương tác với môi trường).
8. Đặc Trưng và Nhãn
- Đặc trưng (Feature): (còn gọi là input variable, independent variable, attribute, predictor) Thông tin/đặc trưng/tính chất của đối tượng mà mô hình sẽ học và dựa vào đó để đưa ra dự đoán.
- Nhãn (Target): (còn gọi là output variable, dependent variable, label) Giá trị đầu ra/nhãn/mục tiêu mà chúng ta muốn mô hình dự đoán được.
- Ví dụ: Trong bộ dữ liệu về giá nhà, diện tích, số tầng, số phòng là feature, giá nhà là target.
9. Kỹ Thuật Đặc Trưng
- Feature Engineering: Quá trình tạo, chọn lọc và biến đổi đặc trưng từ dữ liệu gốc ban đầu để giúp mô hình học hiệu quả hơn.
- Tạo feature mới: Dựa vào các feature ban đầu để tạo ra feature mới.
- Loại bỏ feature: Loại bỏ các feature không ảnh hưởng đến target.
- Chọn lọc feature: Giữ lại các feature quan trọng nhất.
- Các loại Feature:
- Numeric Feature (Đặc trưng dạng số): (còn gọi là quantitative feature) Được biểu diễn bằng các con số và phản ánh các đại lượng có thể đo lường được. Ví dụ: Chiều cao, cân nặng, số phòng, diện tích.
- Categorical Feature (Đặc trưng phân loại): (còn gọi là qualitative feature) Thể hiện các giá trị rời rạc, không trực tiếp mang ý nghĩa tính toán. Ví dụ: Màu sắc, quốc gia, sản phẩm.
- Nominal Feature (Đặc trưng định danh): Các giá trị không thể sắp xếp theo thứ tự/thứ bậc. Ví dụ: Màu sắc.
- Ordinal Feature (Đặc trưng thứ bậc): Các giá trị có thể sắp xếp theo thứ tự/thứ bậc. Ví dụ: Kích thước quần áo (XS, S, M, L, XL).
- Feature Scaling (Chuẩn Hóa Đặc Trưng): Chuẩn hóa các numeric feature nằm trên các giải giá trị khác nhau về cùng một giải giá trị. Giúp mô hình đánh giá đúng tầm quan trọng của các feature và hội tụ nhanh hơn.
- Normalization (Min-Max Scaling): Chuẩn hóa các giá trị của feature trong khoảng nhất định (thường là 0 đến 1).
- Standardization (Z-Score Normalization): Đưa các giá trị của feature về dạng có kỳ vọng bằng 0 và độ lệch chuẩn bằng 1.
10. Giảm Chiều Dữ Liệu
- Dimensionality (Số Chiều): Số lượng feature được sử dụng để mô tả dữ liệu.
- Curse of Dimensionality (Lời Nguyền của Số Chiều): Khi bộ dữ liệu có quá nhiều feature, mô hình khó học hơn và cần rất nhiều dữ liệu để học hiệu quả.
- Dimensionality Reduction (Giảm Chiều Dữ Liệu): Quá trình cắt giảm bớt số lượng feature trong khi vẫn cố gắng giữ được nhiều thông tin quan trọng nhất có thể. Hạn chế ảnh hưởng của curse of dimensionality, giảm độ phức tạp của dữ liệu, tăng tốc độ huấn luyện, giảm chi phí tính toán, và giúp trực quan hóa dữ liệu.
- Feature Selection (Chọn Lọc Đặc Trưng): Giữ lại những đặc trưng quan trọng nhất và bỏ đi những đặc trưng ít quan trọng hơn hoặc gây nhiễu.
- Feature Extraction (Trích Xuất Đặc Trưng): Tạo ra các đặc trưng mới bằng cách kết hợp hoặc biến đổi các đặc trưng cũ.
11. Sample
- Sample: (còn gọi là item, record, data point, observation) Một hàng trong bộ dữ liệu, đại diện cho một đơn vị dữ liệu đầy đủ, một ví dụ cụ thể. Ví dụ: Trong bộ dữ liệu về giá nhà, mỗi sample là thông tin đầy đủ về một căn nhà. Dataset là tập hợp của nhiều sample.
12. Overfitting và Underfitting
- Model Complexity (Độ Phức Tạp của Mô Hình): Thường thì mô hình càng phức tạp thì sẽ có càng nhiều tham số và có khả năng học những tính chất phức tạp hơn từ dữ liệu.
- Overfitting (Quá Khớp): Mô hình học quá mức các đặc trưng của dữ liệu, bao gồm cả thông tin nhiễu và các chi tiết quá đặc thù, làm giảm khả năng tổng quát hóa. Dấu hiệu: Dự đoán tốt trên dữ liệu luyện, nhưng dự đoán tồi trên dữ liệu mới.
- Underfitting (Chưa Khớp): Mô hình quá đơn giản, không đủ khả năng để học hỏi những đặc trưng/tính chất từ dữ liệu.
13. Loss Function và Metric
- Loss Function (Hàm Mất Mát): Đo lường/đánh giá sự sai lệch giữa giá trị dự đoán của mô hình và giá trị thực tế trong quá trình huấn luyện. Mục tiêu là tối thiểu hóa giá trị mất mát (loss value).
- Metric (Chỉ Số Đánh Giá): Đo lường/đánh giá hiệu suất của mô hình trên validation set hoặc test set.
- Tóm lại: Loss function liên quan trực tiếp đến việc học và tối ưu hóa tham số của mô hình. Metric liên quan đến việc đánh giá chất lượng dự đoán cuối cùng của mô hình.
- Các Metric phổ biến:
- Classification: Accuracy, Precision, Recall, F1-score.
- Regression: Mean Absolute Error (MAE), Mean Squared Error (MSE), Root Mean Squared Error (RMSE), Coefficient of Determination (R-squared).
- Imbalance Data (Dữ Liệu Mất Cân Bằng): Bộ dữ liệu có sự chênh lệch lớn về số lượng sample dành cho các class.
- True Positive (TP): Mô hình dự đoán đúng là class positive.
- False Positive (FP): (Lỗi loại 1) Mô hình dự đoán là class positive nhưng thực tế là class negative.
- False Negative (FN): (Lỗi loại 2) Mô hình dự đoán là class negative nhưng thực tế là class positive.
- True Negative (TN): Mô hình dự đoán đúng là class negative.
- Precision: TP / (TP + FP). Đánh giá độ chính xác của mô hình đối với riêng các dự đoán về class positive.
- Recall: TP / (TP + FN). Đánh giá độ bao phủ của các dự đoán của mô hình đối với riêng class positive.
- F1-score: 2 * (Precision * Recall) / (Precision + Recall). Metric thể hiện sự cân bằng giữa precision và recall.
- Bias-Variance Tradeoff: Không thể đồng thời tối ưu cả precision và recall, hoặc tối thiểu hóa cả lỗi loại 1 và lỗi loại 2.
14. Bias và Variance
- Bias (Độ Lệch): Sự khác biệt giữa giá trị dự đoán của mô hình so với giá trị thực tế. Mô hình có bias cao thường quá đơn giản và bị underfitting.
- Variance (Phương Sai): Thể hiện sự thay đổi của mô hình với các dữ liệu đầu vào khác nhau. Mô hình có variance cao thường nhạy cảm với các nhiễu trong dữ liệu và bị overfitting.
- Bias-Variance Tradeoff: Bias và variance có mối quan hệ trái chiều với nhau. Mô hình càng đơn giản thì bias càng cao, variance càng thấp. Mô hình càng phức tạp thì bias càng thấp, variance càng cao.
15. Regularization
- Regularization (Chính Quy Hóa): Kỹ thuật ngăn chặn overfitting bằng cách thêm vào một đại lượng (penalty) vào trong loss function. Giúp giới hạn giá trị các tham số trong mô hình, từ đó buộc mô hình trở nên đơn giản hơn và tổng quát hóa tốt hơn với dữ liệu mới.
- Các kỹ thuật Regularization phổ biến: L1, L2, Elastic Net.
Conclusion
Video cung cấp một cái nhìn tổng quan và chi tiết về các khái niệm quan trọng nhất trong machine learning, từ các khái niệm cơ bản như AI, machine learning, deep learning, đến các khái niệm nâng cao hơn như feature engineering, dimensionality reduction, overfitting, underfitting, bias-variance tradeoff, và regularization. Video cũng cung cấp các ví dụ cụ thể và dễ hiểu để minh họa cho các khái niệm này, giúp người xem có thể nắm bắt được các kiến thức một cách dễ dàng.
AI summaries can miss context or contain errors. Check important details against the original video.





