Bạn đang xem thử công khai
Đăng nhập để lưu tiến độ, làm bài tập, thảo luận và nhận phản hồi.
Bài giảng đầy đủ cho Module 3 (khoảng 22 phút), có 4 điểm dừng.
| Phút | Nội dung |
|---|---|
| 00:00 | Bài toán phân loại nhị phân — so sánh nhãn dự đoán với nhãn thật |
| 02:30 | Dữ liệu mất cân bằng — vì sao accuracy đánh lừa |
| 05:00 | Ma trận nhầm lẫn — TP, FP, FN, TN, lỗi loại I và loại II |
| 10:00 | Precision, Recall và F1 score |
| 13:00 | Chuyển sang hồi quy — Mean Absolute Error |
| 19:00 | Hệ số xác định R² |
Một tập dữ liệu gian lận thẻ có 99% giao dịch bình thường. Mô hình luôn đoán “bình thường” đạt accuracy 99% — nghe rất giỏi, nhưng bắt được 0 vụ gian lận, tức là hoàn toàn vô dụng.
Đó là lý do phải nhìn precision và recall thay vì chỉ nhìn accuracy.
| Dự đoán + | Dự đoán − | |
|---|---|---|
| Thực tế + | TP — True Positive | FN — False Negative (lỗi loại II) |
| Thực tế − | FP — False Positive (lỗi loại I) | TN — True Negative |
F1 = 2 × P × R / (P + R) — trung bình điều hoà, nên nếu một trong hai chỉ số thấp thì F1 bị kéo xuống mạnh. Đây là lý do dùng F1 thay vì trung bình cộng.