Trong quá trình huấn luyện AI, một mô hình có thể đạt độ chính xác rất cao trên dữ liệu đã học nhưng lại dự đoán kém khi gặp dữ liệu mới. Đây là Overfitting – hiện tượng quá khớp khiến mô hình khó khái quát hóa. Vậy Overfitting là gì và làm sao để giảm tình trạng này? Hãy cùng Nhân Hòa tìm hiểu ngay!
Overfitting là gì? Ví dụ về hiện tượng quá khớp
Overfitting (quá khớp) là hiện tượng mô hình AI, Học máy (Machine Learning) học quá sát dữ liệu huấn luyện, dẫn đến việc ghi nhớ luôn cả những đặc điểm ngẫu nhiên hoặc chi tiết nhiễu trong tập dữ liệu thay vì tìm ra quy luật tổng quát. Vì vậy, mô hình cho kết quả rất tốt trên dữ liệu đã được training nhưng hoạt động kém với dữ liệu mới.
Ví dụ thực tế dễ hiểu - học sinh học tủ:
- Một học sinh làm 5 đề thi thử và chỉ học thuộc lòng đáp án của 5 đề đó mà không hiểu bản chất công thức.
- Khi vào phòng thi thật, chỉ cần giáo viên đổi số liệu hoặc ra câu hỏi khác một chút, học sinh đó sẽ làm sai dù điểm thi thử đạt 10/10.
Dấu hiệu nhận biết mô hình bị Overfitting
Có thể nhận biết hiện tượng quá khớp bằng cách so sánh kết quả của mô hình trên dữ liệu đã dùng để huấn luyện với dữ liệu mới dùng để kiểm tra. Một số dấu hiệu đáng chú ý gồm:
Kết quả trên dữ liệu huấn luyện cao hơn nhiều so với dữ liệu kiểm tra
Đây là dấu hiệu dễ nhận biết nhất. Mô hình đạt độ chính xác rất cao trên dữ liệu đã học nhưng khi gặp dữ liệu mới, kết quả giảm đáng kể. Ví dụ, mô hình đạt 98% độ chính xác trên dữ liệu huấn luyện nhưng chỉ đạt 72% trên dữ liệu kiểm tra. Chênh lệch lớn cho thấy mô hình đang ghi nhớ quá nhiều đặc điểm của dữ liệu cũ thay vì học được quy luật có thể áp dụng cho dữ liệu mới.
Kết quả thay đổi nhiều khi chia dữ liệu để kiểm tra
Khi chia dữ liệu thành nhiều phần và lần lượt dùng từng phần để kiểm tra, một mô hình hoạt động ổn định thường cho kết quả tương đối đồng đều. Ngược lại, nếu kết quả giữa các lần kiểm tra chênh lệch lớn, mô hình có thể đang phụ thuộc quá nhiều vào một số dữ liệu cụ thể.
Ví dụ, kết quả lần lượt là 91%, 89%, 90%, 62% và 88%. Mức 62% thấp bất thường so với các lần còn lại là dấu hiệu cần kiểm tra lại dữ liệu và mô hình. Tuy nhiên, dấu hiệu này không đủ để kết luận Overfitting mà cần kết hợp với các dấu hiệu khác.
Learning curve cho thấy khoảng cách lớn
Có thể sử dụng đồ thị Learning Curve để theo dõi hiệu suất của mô hình khi lượng dữ liệu huấn luyện tăng dần. Nếu đường biểu diễn dữ liệu huấn luyện và kiềm tra duy trì khoảng cách lớn, đặc biệt khi:
- Điểm huấn luyện rất cao;
- Điểm kiểm tra thực tế thấp hơn đáng kể;
- Khi bổ sung thêm dữ liệu, khoảng cách giữa hai kết quả dần thu hẹp.
Lưu ý: Learning Curve chỉ là một trong những cách nhận biết Overfitting, không nên dùng riêng dấu hiệu này để kết luận mô hình bị quá khớp.
>>> Xem thêm: Thuật ngữ AI là gì? Top 35 khái niệm trí tuệ nhân tạo phổ biến
Nguyên nhân khiến mô hình Overfitting là gì?
Hiện tượng quá khớp thường xuất phát từ một hoặc nhiều nguyên nhân sau:
- Dữ liệu huấn luyện quá ít: Khi lượng dữ liệu không đủ, mô hình khó học được quy luật tổng quát và dễ ghi nhớ những đặc điểm riêng của từng mẫu.
- Dữ liệu chứa nhiều nhiễu: Các thông tin không liên quan hoặc sai lệch trong training data có thể khiến mô hình học nhầm những pattern không có giá trị dự đoán.
- Mô hình quá phức tạp: Model có quá nhiều tham số hoặc cấu trúc phức tạp có khả năng học rất chi tiết training data, từ đó dễ học cả nhiễu.
- Huấn luyện quá lâu: Trong một số bài toán, nếu tiếp tục training sau khi mô hình đã đạt mức phù hợp, model có thể bắt đầu học những đặc điểm riêng của training data.
- Dữ liệu training không đại diện: Nếu dữ liệu huấn luyện khác biệt đáng kể so với dữ liệu thực tế mà mô hình sẽ xử lý, khả năng khái quát hóa cũng bị ảnh hưởng.
Phân biệt hiện tượng Overfitting và Underfitting?
Để phân biệt rõ hai hiện tượng này, có thể đặt Overfitting và Underfitting cạnh nhau theo cách mô hình học dữ liệu, kết quả đạt được và nguyên nhân dẫn đến sai lệch:
>>> Xem thêm: Diffusion Models là gì? Cách mô hình khuếch tán hoạt động
Cách giảm Overfitting trong Machine Learning
Giảm Overfitting không chỉ có một cách duy nhất. Tùy nguyên nhân, có thể kết hợp bổ sung dữ liệu, đơn giản hóa mô hình và kiểm soát quá trình huấn luyện để mô hình học được quy luật chung thay vì ghi nhớ dữ liệu huấn luyện.
Tăng và đa dạng hóa dữ liệu
Khi dữ liệu huấn luyện quá ít hoặc không đa dạng, mô hình dễ học quá sát những đặc điểm riêng của tập dữ liệu. Bổ sung thêm dữ liệu giúp mô hình có nhiều ví dụ hơn để nhận diện quy luật chung.
- Thu thập thêm dữ liệu thực tế.
- Đảm bảo dữ liệu có nhiều trường hợp và đặc điểm khác nhau.
- Với dữ liệu hình ảnh, có thể thay đổi nhẹ góc, kích thước hoặc độ sáng để tạo thêm mẫu phù hợp.
Đây thường là lựa chọn nên ưu tiên khi nguyên nhân chính là thiếu dữ liệu.
Giảm độ phức tạp của mô hình
Mô hình càng phức tạp càng có khả năng học cả những chi tiết không cần thiết trong dữ liệu huấn luyện. Vì vậy, có thể giảm mức độ phức tạp để mô hình tập trung vào những đặc điểm quan trọng. Ví dụ:
- Giảm số lượng lớp hoặc số nút trong mạng nơ-ron.
- Giới hạn độ sâu của cây quyết định.
- Loại bỏ những đặc điểm đầu vào không cần thiết.
Mục tiêu không phải làm mô hình càng đơn giản càng tốt, mà là đạt mức độ phức tạp vừa đủ để học được quy luật của dữ liệu.
Sử dụng Regularization
Regularization là cách thêm một cơ chế kiểm soát để hạn chế mô hình học quá sát dữ liệu huấn luyện. Một số phương pháp phổ biến gồm:
- L1 và L2: hạn chế mô hình phụ thuộc quá nhiều vào một số đặc điểm nhất định.
- Dropout: thường dùng trong mạng nơ-ron, tạm thời bỏ qua một phần các nút trong quá trình huấn luyện để mô hình không phụ thuộc quá mức vào một nhóm đặc điểm.
Regularization đặc biệt hữu ích khi mô hình có nhiều tham số và dễ học cả những đặc điểm không quan trọng.
Dừng huấn luyện đúng thời điểm (Early Stopping)
Trong quá trình huấn luyện, kết quả trên dữ liệu huấn luyện có thể tiếp tục cải thiện nhưng kết quả trên dữ liệu mới lại bắt đầu giảm. Nếu tiếp tục huấn luyện, Overfitting có thể trở nên nghiêm trọng hơn.
Early Stopping giúp dừng quá trình huấn luyện tại thời điểm mô hình vẫn đạt kết quả tốt trên dữ liệu mới, thay vì tiếp tục học quá sâu từ dữ liệu huấn luyện.
Kiểm tra mô hình bằng dữ liệu chưa từng được sử dụng để huấn luyện
Không nên chỉ dựa vào kết quả trên dữ liệu huấn luyện để đánh giá mô hình. Cần dành một phần dữ liệu riêng để kiểm tra khả năng xử lý dữ liệu mới. Cách này giúp phát hiện sớm tình trạng Overfitting.
Kết hợp nhiều mô hình khi phù hợp
Một số phương pháp như Random Forest kết hợp kết quả từ nhiều cây quyết định thay vì phụ thuộc vào một cây duy nhất. Cách tiếp cận này có thể giúp giảm việc mô hình quá phụ thuộc vào những đặc điểm riêng của một tập dữ liệu. Tuy nhiên, đây là giải pháp phụ thuộc vào loại bài toán và mô hình đang sử dụng, không phải lúc nào cũng cần thiết.
>>> Xem thêm: AI Automation là gì? Giải mã công nghệ tự động hóa bằng AI
Câu hỏi thường gặp về Overfitting là gì?
Overfitting có làm tăng chi phí vận hành mô hình AI không?
Một mô hình quá khớp có thể cho kết quả kém ổn định trên dữ liệu thực tế, khiến doanh nghiệp phải kiểm tra, điều chỉnh hoặc huấn luyện lại mô hình nhiều lần. Tuy nhiên, mức độ ảnh hưởng phụ thuộc vào từng bài toán và cách triển khai.
Hiện tượng quá khớp có thể xảy ra trong Deep Learning không?
Có. Các mô hình Deep Learning thường có số lượng tham số rất lớn nên vẫn có thể bị Overfitting, đặc biệt khi dữ liệu huấn luyện không đủ lớn hoặc không đa dạng.
Có thể vừa bị Overfitting vừa Underfitting không?
Thông thường, một mô hình tại cùng một thời điểm không thể gặp hiện tượng vừa quá khớp vừa thiếu khớp. Tuy nhiên, trong quá trình huấn luyện, mô hình có thể bắt đầu ở trạng thái Underfitting rồi dần chuyển sang Overfitting nếu tiếp tục huấn luyện quá lâu.
Lời kết
Overfitting xảy ra khi mô hình học quá sát dữ liệu huấn luyện, khiến khả năng xử lý dữ liệu mới bị hạn chế. Việc nhận biết sớm qua chênh lệch kết quả giữa dữ liệu huấn luyện và dữ liệu kiểm tra giúp xác định vấn đề kịp thời. Tùy nguyên nhân, có thể giảm Overfitting bằng cách bổ sung dữ liệu, đơn giản hóa mô hình, sử dụng Regularization hoặc dừng huấn luyện đúng thời điểm.


