Download app

Quét mã QR để tải về Nhân Hòa APP

QR code
preload-home

Overfitting là gì? Nguyên nhân, dấu hiệu và cách khắc phục

09/10/2026, 02:34 pm
Hoàng Trần Anh Thư
18

Trong quá trình huấn luyện AI, một mô hình có thể đạt độ chính xác rất cao trên dữ liệu đã học nhưng lại dự đoán kém khi gặp dữ liệu mới. Đây là Overfitting – hiện tượng quá khớp khiến mô hình khó khái quát hóa. Vậy Overfitting là gì và làm sao để giảm tình trạng này? Hãy cùng Nhân Hòa tìm hiểu ngay!

overfitting

Overfitting là gì? Ví dụ về hiện tượng quá khớp

Overfitting (quá khớp) là hiện tượng mô hình AI, Học máy (Machine Learning) học quá sát dữ liệu huấn luyện, dẫn đến việc ghi nhớ luôn cả những đặc điểm ngẫu nhiên hoặc chi tiết nhiễu trong tập dữ liệu thay vì tìm ra quy luật tổng quát. Vì vậy, mô hình cho kết quả rất tốt trên dữ liệu đã được training nhưng hoạt động kém với dữ liệu mới.

Ví dụ thực tế dễ hiểu - học sinh học tủ:

  • Một học sinh làm 5 đề thi thử và chỉ học thuộc lòng đáp án của 5 đề đó mà không hiểu bản chất công thức.
  • Khi vào phòng thi thật, chỉ cần giáo viên đổi số liệu hoặc ra câu hỏi khác một chút, học sinh đó sẽ làm sai dù điểm thi thử đạt 10/10.

Dấu hiệu nhận biết mô hình bị Overfitting

Có thể nhận biết hiện tượng quá khớp bằng cách so sánh kết quả của mô hình trên dữ liệu đã dùng để huấn luyện với dữ liệu mới dùng để kiểm tra. Một số dấu hiệu đáng chú ý gồm:

Kết quả trên dữ liệu huấn luyện cao hơn nhiều so với dữ liệu kiểm tra

Đây là dấu hiệu dễ nhận biết nhất. Mô hình đạt độ chính xác rất cao trên dữ liệu đã học nhưng khi gặp dữ liệu mới, kết quả giảm đáng kể. Ví dụ, mô hình đạt 98% độ chính xác trên dữ liệu huấn luyện nhưng chỉ đạt 72% trên dữ liệu kiểm tra. Chênh lệch lớn cho thấy mô hình đang ghi nhớ quá nhiều đặc điểm của dữ liệu cũ thay vì học được quy luật có thể áp dụng cho dữ liệu mới.

hiện tượng quá khớp

Kết quả thay đổi nhiều khi chia dữ liệu để kiểm tra

Khi chia dữ liệu thành nhiều phần và lần lượt dùng từng phần để kiểm tra, một mô hình hoạt động ổn định thường cho kết quả tương đối đồng đều. Ngược lại, nếu kết quả giữa các lần kiểm tra chênh lệch lớn, mô hình có thể đang phụ thuộc quá nhiều vào một số dữ liệu cụ thể.

Ví dụ, kết quả lần lượt là 91%, 89%, 90%, 62% và 88%. Mức 62% thấp bất thường so với các lần còn lại là dấu hiệu cần kiểm tra lại dữ liệu và mô hình. Tuy nhiên, dấu hiệu này không đủ để kết luận Overfitting mà cần kết hợp với các dấu hiệu khác.

Learning curve cho thấy khoảng cách lớn 

Có thể sử dụng đồ thị Learning Curve để theo dõi hiệu suất của mô hình khi lượng dữ liệu huấn luyện tăng dần. Nếu đường biểu diễn dữ liệu huấn luyện và kiềm tra duy trì khoảng cách lớn, đặc biệt khi:

  • Điểm huấn luyện rất cao; 
  • Điểm kiểm tra thực tế thấp hơn đáng kể; 
  • Khi bổ sung thêm dữ liệu, khoảng cách giữa hai kết quả dần thu hẹp.

Lưu ý: Learning Curve chỉ là một trong những cách nhận biết Overfitting, không nên dùng riêng dấu hiệu này để kết luận mô hình bị quá khớp.

>>> Xem thêm: Thuật ngữ AI là gì? Top 35 khái niệm trí tuệ nhân tạo phổ biến

hiện tượng overfitting là gì

Nguyên nhân khiến mô hình Overfitting là gì?

Hiện tượng quá khớp thường xuất phát từ một hoặc nhiều nguyên nhân sau:

  • Dữ liệu huấn luyện quá ít: Khi lượng dữ liệu không đủ, mô hình khó học được quy luật tổng quát và dễ ghi nhớ những đặc điểm riêng của từng mẫu.
  • Dữ liệu chứa nhiều nhiễu: Các thông tin không liên quan hoặc sai lệch trong training data có thể khiến mô hình học nhầm những pattern không có giá trị dự đoán.
  • Mô hình quá phức tạp: Model có quá nhiều tham số hoặc cấu trúc phức tạp có khả năng học rất chi tiết training data, từ đó dễ học cả nhiễu.
  • Huấn luyện quá lâu: Trong một số bài toán, nếu tiếp tục training sau khi mô hình đã đạt mức phù hợp, model có thể bắt đầu học những đặc điểm riêng của training data.
  • Dữ liệu training không đại diện: Nếu dữ liệu huấn luyện khác biệt đáng kể so với dữ liệu thực tế mà mô hình sẽ xử lý, khả năng khái quát hóa cũng bị ảnh hưởng.

Phân biệt hiện tượng Overfitting và Underfitting?

Để phân biệt rõ hai hiện tượng này, có thể đặt Overfitting và Underfitting cạnh nhau theo cách mô hình học dữ liệu, kết quả đạt được và nguyên nhân dẫn đến sai lệch:

Tiêu chí 

Overfitting (Quá khớp) 

Underfitting (Thiếu khớp) 

Bản chất 

Mô hình học quá sát dữ liệu huấn luyện, kể cả những đặc điểm riêng hoặc nhiễu không có ý nghĩa lâu dài. 

Mô hình chưa học đủ các quy luật quan trọng trong dữ liệu. 

Mức độ học dữ liệu 

Học quá chi tiết, dễ ghi nhớ dữ liệu thay vì nhận ra quy luật chung. 

Học chưa đủ, bỏ sót nhiều đặc điểm quan trọng của dữ liệu. 

Dấu hiệu dễ nhận biết 

Kết quả trên dữ liệu huấn luyện rất tốt nhưng giảm mạnh khi kiểm tra trên dữ liệu mới. 

Kết quả trên cả dữ liệu huấn luyện và dữ liệu mới đều chưa tốt. 

Khả năng áp dụng cho dữ liệu mới 

Kém: mô hình khó đưa ra dự đoán chính xác khi gặp dữ liệu khác với dữ liệu đã học. 

Kém: mô hình chưa đủ khả năng nhận diện đúng các đặc điểm của dữ liệu mới. 

Nguyên nhân thường gặp 

Mô hình quá phức tạp, dữ liệu huấn luyện quá ít hoặc thiếu đa dạng, huấn luyện quá lâu. 

Mô hình quá đơn giản, dữ liệu hoặc đặc điểm đầu vào chưa đủ, quá trình huấn luyện chưa phù hợp. 

Ví dụ 

Mô hình nhận diện chó và mèo ghi nhớ cả bối cảnh, ánh sáng hoặc những chi tiết riêng của ảnh huấn luyện nên dự đoán kém với ảnh mới. 

Mô hình chỉ dựa vào một vài đặc điểm đơn giản như kích thước hoặc màu sắc nên khó phân biệt chính xác chó và mèo. 

Hướng khắc phục 

Bổ sung và đa dạng hóa dữ liệu, giảm độ phức tạp của mô hình, dùng Regularization hoặc dừng huấn luyện sớm. 

Tăng mức độ phức tạp phù hợp, bổ sung đặc điểm cần thiết và cải thiện quá trình huấn luyện. 

>>> Xem thêm: Diffusion Models là gì? Cách mô hình khuếch tán hoạt động

Cách giảm Overfitting trong Machine Learning

Giảm Overfitting không chỉ có một cách duy nhất. Tùy nguyên nhân, có thể kết hợp bổ sung dữ liệu, đơn giản hóa mô hình và kiểm soát quá trình huấn luyện để mô hình học được quy luật chung thay vì ghi nhớ dữ liệu huấn luyện.

Tăng và đa dạng hóa dữ liệu

Khi dữ liệu huấn luyện quá ít hoặc không đa dạng, mô hình dễ học quá sát những đặc điểm riêng của tập dữ liệu. Bổ sung thêm dữ liệu giúp mô hình có nhiều ví dụ hơn để nhận diện quy luật chung.

  • Thu thập thêm dữ liệu thực tế.
  • Đảm bảo dữ liệu có nhiều trường hợp và đặc điểm khác nhau. 
  • Với dữ liệu hình ảnh, có thể thay đổi nhẹ góc, kích thước hoặc độ sáng để tạo thêm mẫu phù hợp. 

Đây thường là lựa chọn nên ưu tiên khi nguyên nhân chính là thiếu dữ liệu.

Giảm độ phức tạp của mô hình

Mô hình càng phức tạp càng có khả năng học cả những chi tiết không cần thiết trong dữ liệu huấn luyện. Vì vậy, có thể giảm mức độ phức tạp để mô hình tập trung vào những đặc điểm quan trọng. Ví dụ:

  • Giảm số lượng lớp hoặc số nút trong mạng nơ-ron. 
  • Giới hạn độ sâu của cây quyết định. 
  • Loại bỏ những đặc điểm đầu vào không cần thiết. 

Mục tiêu không phải làm mô hình càng đơn giản càng tốt, mà là đạt mức độ phức tạp vừa đủ để học được quy luật của dữ liệu.

hiện tượng overfitting

Sử dụng Regularization

Regularization là cách thêm một cơ chế kiểm soát để hạn chế mô hình học quá sát dữ liệu huấn luyện. Một số phương pháp phổ biến gồm:

  • L1 và L2: hạn chế mô hình phụ thuộc quá nhiều vào một số đặc điểm nhất định. 
  • Dropout: thường dùng trong mạng nơ-ron, tạm thời bỏ qua một phần các nút trong quá trình huấn luyện để mô hình không phụ thuộc quá mức vào một nhóm đặc điểm. 

Regularization đặc biệt hữu ích khi mô hình có nhiều tham số và dễ học cả những đặc điểm không quan trọng.

Dừng huấn luyện đúng thời điểm (Early Stopping)

Trong quá trình huấn luyện, kết quả trên dữ liệu huấn luyện có thể tiếp tục cải thiện nhưng kết quả trên dữ liệu mới lại bắt đầu giảm. Nếu tiếp tục huấn luyện, Overfitting có thể trở nên nghiêm trọng hơn.

Early Stopping giúp dừng quá trình huấn luyện tại thời điểm mô hình vẫn đạt kết quả tốt trên dữ liệu mới, thay vì tiếp tục học quá sâu từ dữ liệu huấn luyện.

Kiểm tra mô hình bằng dữ liệu chưa từng được sử dụng để huấn luyện

Không nên chỉ dựa vào kết quả trên dữ liệu huấn luyện để đánh giá mô hình. Cần dành một phần dữ liệu riêng để kiểm tra khả năng xử lý dữ liệu mới. Cách này giúp phát hiện sớm tình trạng Overfitting.

Kết hợp nhiều mô hình khi phù hợp

Một số phương pháp như Random Forest kết hợp kết quả từ nhiều cây quyết định thay vì phụ thuộc vào một cây duy nhất. Cách tiếp cận này có thể giúp giảm việc mô hình quá phụ thuộc vào những đặc điểm riêng của một tập dữ liệu. Tuy nhiên, đây là giải pháp phụ thuộc vào loại bài toán và mô hình đang sử dụng, không phải lúc nào cũng cần thiết.

>>> Xem thêm: AI Automation là gì? Giải mã công nghệ tự động hóa bằng AI

overfitting và underfitting

Câu hỏi thường gặp về Overfitting là gì?

Overfitting có làm tăng chi phí vận hành mô hình AI không?

Một mô hình quá khớp có thể cho kết quả kém ổn định trên dữ liệu thực tế, khiến doanh nghiệp phải kiểm tra, điều chỉnh hoặc huấn luyện lại mô hình nhiều lần. Tuy nhiên, mức độ ảnh hưởng phụ thuộc vào từng bài toán và cách triển khai.

Hiện tượng quá khớp có thể xảy ra trong Deep Learning không?

Có. Các mô hình Deep Learning thường có số lượng tham số rất lớn nên vẫn có thể bị Overfitting, đặc biệt khi dữ liệu huấn luyện không đủ lớn hoặc không đa dạng.

Có thể vừa bị Overfitting vừa Underfitting không?

Thông thường, một mô hình tại cùng một thời điểm không thể gặp hiện tượng vừa quá khớp vừa thiếu khớp. Tuy nhiên, trong quá trình huấn luyện, mô hình có thể bắt đầu ở trạng thái Underfitting rồi dần chuyển sang Overfitting nếu tiếp tục huấn luyện quá lâu.

Lời kết

Overfitting xảy ra khi mô hình học quá sát dữ liệu huấn luyện, khiến khả năng xử lý dữ liệu mới bị hạn chế. Việc nhận biết sớm qua chênh lệch kết quả giữa dữ liệu huấn luyện và dữ liệu kiểm tra giúp xác định vấn đề kịp thời. Tùy nguyên nhân, có thể giảm Overfitting bằng cách bổ sung dữ liệu, đơn giản hóa mô hình, sử dụng Regularization hoặc dừng huấn luyện đúng thời điểm.

Bài viết liên quan
09/10/2026
AI Coding Agent đang đưa trí tuệ nhân tạo tiến xa hơn trong lập trình, từ viết code đến tự động thực hiện tác vụ. Cline...
07/10/2026
Sự phát triển của AI Coding Agent đang mở ra cách tiếp cận mới trong phát triển phần mềm. Cursor AI cho phép lập trình viên...
06/10/2026
Lập trình đang thay đổi khi AI không chỉ viết mã mà còn có thể trực tiếp tham gia vào quy trình phát triển phần mềm. OpenAI...
Kết nối với Nhân Hoà
Công Ty TNHH Phần Mềm Nhân Hòa

Map Tầng 4, Tòa 97–99 Láng Hạ, Phường Đống Đa, Thành phố Hà Nội

Phone Điện thoại: 1900 6680 - (024) 7308 6680

Mail Mail: sales@nhanhoa.com

Hotline Phản ánh chất lượng dịch vụ: 091 140 8966

Công Ty TNHH Phần Mềm Nhân Hòa

Map 927/1 Cách Mạng Tháng 8, Phường Tân Sơn Nhất, Thành phố Hồ Chí Minh

Phone Điện thoại: 1900 6680 - (028) 7308 6680

Mail Mail: hcmsales@nhanhoa.com

Hotline Phản ánh chất lượng dịch vụ: 091 140 8966

Công Ty TNHH Phần Mềm Nhân Hòa

Map Tầng 2 Tòa nhà Sài Gòn Sky, ngõ 26 Nguyễn Thái Học, phường Thành Vinh, Nghệ An

Phone Điện thoại: 1900 6680 - (024) 7308 6680 - nhánh 6

Mail Mail: contact@nhanhoa.com

Hotline Phản ánh chất lượng dịch vụ: 091 140 8966

Kết nối với Nhân Hoà
Gọi lại cho tôi
×
Thông báo

Đăng nhập thành công!

ưu đãi Nhân Hòa Ưu đãi