Limio— Learn your way
🏆 Đấu trường
Đăng nhậpĐăng ký

Thiết kế và phát triển: @Limio team - Khoa Khoa học và Công nghệ Giáo dục, Đại học Bách Khoa Hà Nội

← Fundamental of Machine Learning

Bạn đang xem thử công khai

Đăng nhập để lưu tiến độ, làm bài tập, thảo luận và nhận phản hồi.

Đăng nhập
Module 1: Data Preparation and Model Foundations

Nền tảng học có giám sát và đánh đổi Bias-Variance

In / Lưu PDF

Nền tảng học có giám sát và đánh đổi Bias-Variance

Học có giám sát

Ta đưa cho mô hình các cặp (đầu vào, đáp án đúng) và để nó tự tìm quy luật ánh xạ. "Có giám sát" nghĩa là mỗi mẫu huấn luyện đều có nhãn đúng đi kèm.

Loại bài toánĐầu raVí dụ
Hồi quy (regression)Số liên tụcGiá nhà, nhiệt độ ngày mai
Phân loại (classification)Nhãn rời rạcSpam / không spam, có bệnh / không

Bias và Variance

Bias cao (underfitting) — mô hình quá đơn giản để nắm được quy luật. Dùng đường thẳng để khớp một quan hệ cong: sai cả trên tập train lẫn test.

Variance cao (overfitting) — mô hình quá phức tạp, học thuộc cả nhiễu trong tập train. Gần như hoàn hảo trên train, tệ trên test.

Dấu hiệuSai số trainSai số testChẩn đoán
CaoCaoCaoUnderfitting (bias cao)
Lệch lớnRất thấpCaoOverfitting (variance cao)
TốtThấpThấp, gần trainVừa phải

Đánh đổi

Tăng độ phức tạp của mô hình thì bias giảm nhưng variance tăng. Mục tiêu không phải là triệt tiêu cái nào, mà tìm điểm cân bằng cho tổng sai số trên dữ liệu mới nhỏ nhất.

Cách nhận biết và xử lý

Nếu đang overfitting: thêm dữ liệu, giảm số đặc trưng, giảm độ phức tạp (ví dụ giới hạn max_depth của cây), hoặc thêm regularization.

Nếu đang underfitting: thêm đặc trưng, dùng mô hình mạnh hơn, huấn luyện lâu hơn.

Lỗi thường gặp nhất

Thấy accuracy trên tập train cao rồi kết luận mô hình tốt. Con số đó gần như luôn đẹp, kể cả khi mô hình chỉ học thuộc lòng. Luôn so sánh train với test: khoảng cách giữa hai con số mới là thứ nói lên vấn đề.