Cẩm nang về LLMs dành cho những người không muốn tối cổ về AI | Minh Triết

SpiderumAbout 9 min readMay 30, 2025Watch original
THE SUMMARYAI-generated

Tóm tắt chi tiết video về Large Language Models (LLMs)

Key Concepts:

  • Large Language Models (LLMs): Mô hình ngôn ngữ lớn, bao gồm generative models (tạo văn bản, hình ảnh, âm thanh) và representation models (phân loại, thấu hiểu quan điểm, tìm kiếm thông tin). Trong video này, LLMs chủ yếu được hiểu là generative models.
  • Pretraining: Giai đoạn huấn luyện ban đầu, sử dụng lượng lớn dữ liệu text (hoặc đa phương tiện) để LLM học cách dự đoán từ tiếp theo.
  • Tokenization: Quá trình chia nhỏ câu thành các đơn vị (tokens) để LLM có thể xử lý.
  • Neural Network/Transformer: Kiến trúc mạng nơ-ron được sử dụng để xây dựng LLMs.
  • Supervised Fine-Tuning (SFT): Giai đoạn tinh chỉnh LLM bằng dữ liệu có nhãn (câu hỏi và câu trả lời mẫu) để cải thiện khả năng trả lời câu hỏi và tuân theo hướng dẫn.
  • Reinforcement Learning (RL): Phương pháp học máy sử dụng tín hiệu thưởng/phạt để huấn luyện LLM.
  • Reinforcement Learning from Human Feedback (RLHF): Sử dụng phản hồi của con người để huấn luyện reward model, sau đó dùng reward model để huấn luyện LLM thông qua reinforcement learning.
  • Reasoning Models: LLMs có khả năng lý luận, tạo ra các bước suy nghĩ trung gian trước khi đưa ra câu trả lời.
  • Chain of Thought Reasoning: Kỹ thuật mà LLM tạo ra chuỗi các tính toán logic để giải thích quá trình suy luận của mình.
  • Deliberate Practice: Phương pháp luyện tập có chủ đích, tập trung vào cải thiện điểm yếu thông qua lặp lại và phản hồi.

1. Giới thiệu về LLMs

  • LLMs đã trở nên phổ biến từ sau khi OpenAI giới thiệu ChatGPT vào tháng 11/2022.
  • ChatGPT đạt 100 triệu người dùng chỉ trong 2 tháng, nhanh hơn TikTok (9 tháng) và Facebook (4.5 năm).
  • Video này giải thích chi tiết về cơ chế hoạt động của LLMs, từ cơ chế hoạt động, các bước tạo ra một LLM, đến cách cập nhật thông tin mới nhất về LLMs.
  • LLMs không chỉ là những model tạo ra từ ngữ mà còn có thể là Representation Model.
  • LLMs như ChatGPT là thuật toán dự đoán từ tiếp theo dựa trên hàng trăm triệu tài liệu.
  • Khả năng kỳ diệu của LLMs đến từ việc dự đoán từ tiếp theo, giúp chúng học được nhiều tác vụ khác như dịch thuật, ngữ pháp, giải toán.
  • LLMs không tư duy như con người, mà chỉ dựa vào các thông số toán học đã được học để sao chép suy nghĩ của con người.
  • LLMs không có kiến thức giác quan và không hiểu ý nghĩa thực sự của câu nói.

2. Quá trình huấn luyện LLMs

2.1. Pretraining (Chuẩn bị dữ liệu huấn luyện)

  • Cần một lượng lớn dữ liệu (text, hình ảnh, âm thanh) để LLMs học.
  • Dữ liệu này có thể được ví như một internet thu nhỏ.
  • Ví dụ: Fineweb (Hugging Face) chứa 15.000 tỷ token, nặng khoảng 44 TB, lấy từ Common Crawl.
  • Quá trình lọc dữ liệu rất quan trọng để loại bỏ dữ liệu kém chất lượng, spam, nội dung lặp lại.
  • Chất lượng dữ liệu pretraining rất quan trọng vì LLMs sẽ bắt chước những gì chúng xem được.

2.2. Tokenization

  • LLMs chia nhỏ câu thành các token (từ, cụm từ, ký tự).
  • Ví dụ: "Tôi là Chiết" -> "Tôi", "là", "Chiết".
  • Các token được chuyển hóa thành các vector (dãy số) thông qua quá trình embedding.
  • LLMs học những token nào thường đi với nhau để đưa ra kết quả hợp lý nhất.

2.3. Neural Network Training

  • Neural Network (Transformer) là cấu trúc đứng sau hầu hết các LLMs.
  • Neural Network có lớp đầu vào, lớp ẩn và lớp đầu ra.
  • Dữ liệu đã được token hóa được chuyển vào Neural Network để LLM bắt đầu học.
  • Đây là quá trình self-supervised: LLM che đi token trong câu và tự dự đoán token tiếp theo.
  • LLM kiểm tra đáp án và cập nhật trọng số (weights) để đưa ra dự đoán chính xác hơn trong tương lai.

2.4. Tạo ra Base Models (Mô hình gốc)

  • Sau quá trình huấn luyện Neural Network, một mô hình có khả năng dự đoán từ tiếp theo với độ chính xác cao được tạo ra.
  • Base models chưa có khả năng nghe theo hướng dẫn từ người dùng.
  • Một số base models đã được phát hành, ví dụ như họ nhà Lama của Meta.
  • Andre Kapaty cho rằng base models rất mạnh và sáng tạo hơn Instruct Models vì chưa bị giới hạn bởi bất kỳ tinh chỉnh nào.
  • Có thể tận dụng Base Model bằng cách sử dụng FHO prompting (đưa ra ví dụ về kết quả mong muốn).

3. Supervised Fine-Tuning (SFT)

  • Tinh chỉnh base model để nó có thể vận dụng kiến thức vào một tác vụ cụ thể (ví dụ: trả lời câu hỏi).
  • Tạo ra một label data gồm câu hỏi và câu trả lời mẫu được viết bởi các chuyên gia.
  • LLM học được xu hướng trả lời câu hỏi của các chuyên gia và bắt chước.
  • LLM không tự suy nghĩ, mà mô phỏng câu trả lời đến từ các chuyên gia và kiến thức từ pretraining.
  • OpenAI thuê khoảng 40 người viết 13.000 prompts cho quá trình SFT.
  • OpenAI đảm bảo các câu lệnh và câu trả lời đạt được ba tiêu chí: hữu ích, vô hại và thành thật.
  • Do đa số người viết câu trả lời mẫu sử dụng tiếng Anh, nên nhiều câu trả lời mà mô hình bắt chước cũng sẽ bằng tiếng Anh.

4. Reinforcement Learning (RL)

  • Sử dụng reinforcement learning để tăng khả năng lý luận và tạo ra kết quả đầu ra chất lượng.
  • Reinforcement learning là phương pháp học máy trong đó mô hình học từ tín hiệu thưởng/phạt của môi trường.
  • Ví dụ: AlphaGo học cách chơi cờ vây bằng cách tự chơi với chính mình và rút ra bài học từ lỗi sai.
  • Ứng dụng RL trong LLMs gặp nhiều trở ngại vì khó xác định tín hiệu thưởng/phạt.

4.1. Reinforcement Learning from Human Feedback (RLHF)

  • Sử dụng phản hồi của con người để huấn luyện LLM.
  • Phát triển một reward model (RM) mô phỏng cách đánh giá của con người.
  • Huấn luyện RM bằng cách cho người được thuê xếp hạng các câu trả lời từ LLM.
  • Sau khi có RM, huấn luyện LLM học cách tối ưu hóa điểm số của RM.
  • Sử dụng phương pháp Proximal Policy Optimization (PPO) để đảm bảo LLM học một cách ổn định và không quá khác biệt so với phiên bản sau SFT.

5. Reasoning Models (Mô hình lý luận)

  • Reasoning models có khả năng lý luận cao, tạo ra các bước suy nghĩ trung gian trước khi đưa ra câu trả lời.
  • Kỹ thuật ORL (không được giải thích chi tiết trong video) là kỹ thuật chính làm gia tăng chất lượng của reasoning models.
  • Reasoning trong bối cảnh LLMs ám chỉ khả năng tạo ra những bước suy nghĩ trung gian trước khi đưa ra câu trả lời cuối cùng.
  • Chain of Thought Reasoning: LLM tự tạo ra chuỗi những tính toán logic để giải thích tại sao nó lại đưa ra kết quả cuối cùng.
  • Reasoning models có thể thực hiện các yêu cầu có độ phức tạp cao, viết code tốt và chính xác hơn.
  • Ví dụ: DeepSeek Coder V2 có khả năng tương đương với nhiều models của các công ty lớn khác nhưng với mức giá rẻ hơn.
  • Benchmark (bộ câu hỏi) được sử dụng để kiểm tra khả năng của các model.

5.1. Khi nào nên dùng Reasoning Models

  • Không nên dùng reasoning models cho tất cả tác vụ hàng ngày (tổng kết tài liệu, dịch văn bản, hỏi kiến thức).
  • Nên dùng reasoning models cho các tác vụ phức tạp, đòi hỏi tư duy logic (khoa học tự nhiên, lập trình phức tạp).
  • Đưa cho reasoning models càng nhiều bối cảnh càng tốt để có câu trả lời chất lượng hơn.

6. Mượn học máy để bàn việc học của con người

  • So sánh quá trình huấn luyện LLM với việc học của con người:
    • Pretraining: Đọc sách giáo khoa để xây dựng kiến thức nền.
    • SFT: Xem bài tập có đáp án để có ý niệm về cách vận dụng kiến thức.
    • Reinforcement Learning: Luyện tập bài tập để biến kiến thức thành của mình.

6.1. Tầm quan trọng của bài giải mẫu

  • Direct instruction (đưa ra hướng dẫn chi tiết trước khi tự giải quyết vấn đề) mang lại hiệu quả cao hơn.
  • Giải bài tập khi chưa biết gì chỉ là đoán mò, không góp phần tăng thêm kiến thức.
  • Đừng ngần ngại xem qua bài giải mẫu trước khi tự giải bài tập.

6.2. Deliberate Practice (Tập luyện có chủ đích)

  • Tập luyện được cá nhân hóa bởi huấn luyện viên hoặc giáo viên (hoặc tự huấn luyện).
  • Liên tục lặp lại và cải tiến quá trình luyện tập.
  • Mỗi lần lặp lại cần biết được điểm mạnh, điểm yếu để cải thiện.
  • So sánh kết quả của bản thân với những ví dụ mà ta muốn hướng đến.

6.3. Làm thế nào để đưa ra quyết định tốt hơn

  • Hạn chế quyết định ngay khi vừa nảy ra ý tưởng hoặc gặp vấn đề.
  • Dành thời gian suy nghĩ trước khi đưa ra quyết định quan trọng.
  • Rèn luyện từ trong tư duy của chính mình.

7. Làm thế nào để không tối cổ về LLMs

  • ELM Arena: Xem leaderboard để biết những models nào đang được cộng đồng đánh giá cao.
  • The Batch Newsletter (Andrew Ng): Đọc thông tin về những cập nhật mới về AI.
  • Lex Fridman Podcast: Tìm hiểu sâu về bộ óc của những người đang dẫn đầu trong công cuộc phát triển trí tuệ nhân tạo.

8. Kết luận

  • LLMs có những khả năng thần kỳ nhưng kết quả không phải lúc nào cũng chính xác.
  • Cần dùng LLMs một cách thận trọng và kiểm tra thêm nguồn thứ ba để chắc chắn kết quả.
  • Hiểu LLMs giúp bạn dùng công cụ này một cách thông thái hơn.

AI summaries can miss context or contain errors. Check important details against the original video.

MAKE IT YOURS

Read. Remember. Reuse.

Free tools

Go a little deeper.

Have a question about this video? Load its transcript to open the video chat.