[FIT-LAB Spring 2026] Tìm hiểu về Gradient, Mediapipe & YOLO (Buổi 9)

By Việt Nguyễn AI

Share:

Dưới đây là bản tóm tắt chi tiết nội dung video về kiến thức nền tảng của Deep Learning và ứng dụng thực tế trong Computer Vision.

Key Concepts

  • Neuron (Nơ-ron): Đơn vị cơ bản của mạng thần kinh, mô phỏng nơ-ron sinh học.
  • Weights (W) & Bias (b): Các tham số cần tối ưu hóa trong quá trình huấn luyện.
  • Activation Function (Hàm kích hoạt): Hàm phi tuyến (ReLU, Sigmoid, Tanh) giúp mô hình học các đặc trưng phức tạp.
  • Forward Propagation: Quá trình truyền dữ liệu từ đầu vào đến đầu ra.
  • Loss Function (Hàm mất mát): Đo lường sai số giữa dự đoán và thực tế.
  • Gradient Descent: Thuật toán tối ưu hóa dựa trên đạo hàm để cập nhật tham số.
  • Computer Vision (Thị giác máy tính): Các bài toán cơ bản gồm Classification, Object Detection, và Segmentation.

1. Cấu trúc và Nguyên lý hoạt động của Neuron

  • Cấu tạo: Một nơ-ron trong máy tính nhận tín hiệu đầu vào ($x_i$), nhân với trọng số ($w_i$), cộng với hệ số bias ($b$), sau đó đi qua hàm kích hoạt ($f$).
  • Công thức: $y = f(\sum w_i x_i + b)$. Đây là sự kết hợp giữa hàm tuyến tính (bên trong) và hàm phi tuyến (bên ngoài).
  • Sức mạnh: Nhờ tính chất phi tuyến, mạng nơ-ron có thể học được các quy luật phức tạp từ dữ liệu.

2. Các hàm kích hoạt (Activation Functions)

  • Sigmoid & Tanh: Phổ biến trong quá khứ, đầu ra bị giới hạn (0-1 hoặc -1 đến 1), nhưng dễ gặp vấn đề "Vanishing Gradient" (đạo hàm biến mất).
  • ReLU (Rectified Linear Unit): Hiện nay rất phổ biến, công thức $max(0, z)$. Giải quyết tốt vấn đề đạo hàm biến mất.
  • Leaky ReLU: Biến thể của ReLU, cho phép một lượng nhỏ tín hiệu đi qua khi đầu vào âm, tránh tình trạng "chết" nơ-ron.

3. Kiến trúc mạng nơ-ron (Neural Network)

  • Input Layer: Nơi tiếp nhận dữ liệu (cần làm phẳng dữ liệu dạng bảng, ảnh hoặc văn bản).
  • Hidden Layers: Các tầng ẩn thực hiện tổng hợp thông tin. Càng nhiều tầng, mô hình càng học được các đặc trưng phức tạp (từ đơn giản đến trừu tượng).
  • Output Layer: Nơi đưa ra kết quả dự đoán cuối cùng.
  • Nguyên tắc: Các nơ-ron trong cùng một tầng không tương tác với nhau; thông tin chỉ truyền từ tầng trước sang tầng sau.

4. Quá trình huấn luyện mô hình

  • Forward Propagation: Dữ liệu đi từ input qua các tầng để tạo ra dự đoán.
  • Loss Function: So sánh dự đoán với nhãn thực tế (Ground Truth). Mục tiêu là tối thiểu hóa hàm Loss.
  • Backward Propagation & Gradient Descent:
    • Sử dụng đạo hàm (Gradient) để xác định hướng thay đổi tham số nhằm giảm Loss.
    • Learning Rate: Hệ số kiểm soát độ dài bước nhảy khi cập nhật tham số. Nếu quá lớn, mô hình không hội tụ; nếu quá nhỏ, mô hình học rất chậm.
    • Thách thức: Hàm Loss thực tế rất gồ ghề, chứa nhiều cực tiểu cục bộ (Local Minima) và điểm yên ngựa (Saddle points), khiến việc tìm cực tiểu toàn cục (Global Minimum) là cực kỳ khó khăn.

5. Ứng dụng thực tế với Computer Vision

  • MediaPipe (Google): Framework mạnh mẽ cho các tác vụ thời gian thực như:
    • Hand Landmark Detection: Nhận diện 21 điểm trên bàn tay.
    • Gesture Recognition: Nhận diện cử chỉ (đóng/mở tay, Victory, I love you...).
    • Face Landmark Detection: Nhận diện 478 điểm trên khuôn mặt.
    • Pose Estimation: Nhận diện 33 điểm trên cơ thể người.
  • YOLO (You Only Look Once): Framework hàng đầu cho Object Detection.
    • Các bài toán cơ bản:
      1. Image Classification: Phân loại ảnh.
      2. Object Detection: Định vị đối tượng bằng khung hình (Bounding Box).
      3. Segmentation: Phân đoạn từng pixel thuộc về đối tượng (chính xác hơn Bounding Box).
    • Cấu trúc mô hình: Có nhiều phiên bản (Nano, Small, Medium, Large, Extra Large). Mô hình càng lớn càng chính xác nhưng tốn tài nguyên tính toán.

Kết luận

Việc tối ưu hóa mạng nơ-ron giống như một người leo núi bị bịt mắt, chỉ có thể dựa vào độ dốc (Gradient) để tìm đường xuống chân núi. Trong thực tế, thay vì tự xây dựng từ đầu, các kỹ sư thường sử dụng các framework như MediaPipe hoặc YOLO để triển khai nhanh chóng các giải pháp AI, tập trung vào việc tinh chỉnh tham số và lựa chọn mô hình phù hợp với bài toán cụ thể.

Chat with this Video

AI-Powered

Load the transcript when you're ready to chat so the initial page stays lighter.

Ready to summarize another video?

Summarize YouTube Video