Buổi học đầu tiên về trí tuệ nhân tạo đã tập trung vào việc xây dựng một khung tư duy đúng: AI là lĩnh vực rộng, học máy là một cách tiếp cận quan trọng và học sâu là một nhánh của học máy. Từ ví dụ nhận diện mèo và chó, người học đã từng bước suy luận ra cách mô hình học từ dữ liệu, đánh giá sai số và điều chỉnh tham số.
Từ AI đến học máy và học sâu
AI có thể được xem là lĩnh vực rộng nghiên cứu việc xây dựng các hệ thống có khả năng thực hiện những nhiệm vụ đòi hỏi năng lực như nhận dạng mẫu, dự đoán, suy luận hoặc ra quyết định. Học máy là một phương pháp quan trọng trong AI, trong đó mô hình tìm ra quy luật hoặc mối quan hệ từ dữ liệu thay vì con người phải viết toàn bộ quy tắc một cách thủ công.
Học sâu là một nhánh của học máy, sử dụng mạng nơ-ron nhiều tầng. Vì vậy, một hệ thống dùng mạng nơ-ron nhiều tầng để nhận diện mèo và chó vừa là học sâu, vừa là học máy và thuộc lĩnh vực AI.
Ba cách nhìn về việc học
Học máy có thể được phân loại theo cách hệ thống nhận tín hiệu để học. Trong học có giám sát, dữ liệu đi kèm nhãn đúng để mô hình đối chiếu với dự đoán. Trong học không giám sát, dữ liệu không có nhãn và hệ thống tìm cấu trúc hoặc nhóm có ý nghĩa trong dữ liệu. Học tăng cường sử dụng tín hiệu phần thưởng từ môi trường để cải thiện hành động.
Điểm quan trọng là cách phân loại này khác với việc phân biệt học máy truyền thống và học sâu. Một hệ thống học sâu vẫn có thể học có giám sát hoặc không giám sát.
Mạng nơ-ron nhiều tầng
Mạng nơ-ron nhiều tầng thực hiện nhiều phép biến đổi liên tiếp trên dữ liệu. Trong bài toán hình ảnh, các tầng đầu có thể học những mẫu đơn giản, rồi các tầng tiếp theo kết hợp chúng thành những biểu diễn phức tạp hơn. Người thiết kế kiến trúc không nhất thiết phải chỉ rõ tầng nào tìm tai, mắt hay khuôn mặt; các tham số của mạng được điều chỉnh trong quá trình huấn luyện.
Vì vậy, cách hình dung “từ đơn giản đến phức tạp” là hữu ích, nhưng cần nhớ rằng bên trong đó là các phép biến đổi toán học chứ không phải các tầng có ý thức hay tự suy nghĩ.
Mô hình biết mình sai như thế nào?
Trong học có giám sát, mô hình đưa ra một dự đoán rồi đối chiếu dự đoán đó với nhãn đúng. Ví dụ, nếu ảnh là mèo nhưng mô hình dự đoán chó với xác suất cao, sự khác biệt giữa dự đoán và mục tiêu tạo ra tín hiệu sai số. Hàm mất mát lượng hóa mức độ sai lệch này.
Mục tiêu của huấn luyện là điều chỉnh mô hình để giảm hàm mất mát, chứ không nhất thiết khiến mọi dự đoán đều hoàn hảo.
Tham số và quá trình tối ưu
Một mạng có thể chứa rất nhiều tham số. Khi mô hình dự đoán chưa tốt, thuật toán cần xác định nên thay đổi các tham số theo hướng nào. Gradient cung cấp thông tin về cách hàm mất mát thay đổi khi tham số thay đổi; gradient descent sử dụng thông tin đó để cập nhật tham số theo hướng giúp giảm mất mát.
Quá trình này được lặp lại qua nhiều bước huấn luyện. Dự đoán, tính mất mát, tính gradient và cập nhật tham số tạo thành một vòng lặp tối ưu hóa. Lan truyền ngược là cơ chế quan trọng để tính toán tín hiệu gradient cho các tham số trong mạng.
Điểm dừng của buổi học
Đến cuối buổi, người học đã hình thành được chuỗi tư duy: dữ liệu đi vào mô hình, mô hình tạo dự đoán, dự đoán được đối chiếu với mục tiêu, hàm mất mát đo sai lệch, gradient cung cấp hướng điều chỉnh và quá trình tối ưu cập nhật tham số. Đây là nền tảng để bước sang cách lan truyền ngược hoạt động cụ thể ở buổi tiếp theo.
Kết luận
Điểm quan trọng nhất không phải ghi nhớ thật nhiều thuật ngữ mà là hiểu quan hệ giữa chúng. AI là phạm vi rộng; học máy là một phương pháp xây dựng năng lực AI; học sâu là một nhánh của học máy. Trong quá trình huấn luyện, mô hình không “suy nghĩ” theo nghĩa con người mà điều chỉnh các tham số bằng các quy trình toán học để giảm sai số theo mục tiêu.