Bạn đang xem thử công khai
Đăng nhập để lưu tiến độ, làm bài tập, thảo luận và nhận phản hồi.
Bài giảng đầy đủ cho Module 2 (khoảng 36 phút), có 5 điểm dừng để kiểm tra hiểu bài.
| Phút | Nội dung |
|---|---|
| 00:00 | Linear Regression — khớp đường thẳng, dự đoán lương theo kinh nghiệm |
| 04:00 | Logistic Regression — hàm sigmoid, ngưỡng 0.5, phân lớp Junior/Senior |
| 07:30 | Cây quyết định — root node, decision node, leaf node |
| 11:00 | Ví dụ duyệt vay ngân hàng — chọn thuộc tính chia nhánh bằng Gini |
| 21:00 | Bootstrapping — lấy mẫu có hoàn lại, nền tảng của Random Forest |
| 24:00 | SVM — lề cực đại và support vectors |
| 34:00 | Kernel trick — nâng chiều để tách tuyến tính |
Logistic Regression là bài toán phân loại, dù tên có chữ “regression”. Nó cho ra một xác suất trong khoảng (0, 1), rồi so với ngưỡng (thường 0.5) để quyết định nhãn.
Gini càng thấp càng tốt. Gini = 0 nghĩa là nhánh hoàn toàn thuần khiết — mọi mẫu cùng một nhãn, không cần chia tiếp. Thuật toán chọn thuộc tính nào cho Gini có trọng số nhỏ nhất.
Gini = 1 − Σ (pᵢ)²
Trong ví dụ duyệt vay, chia theo age cho Gini = (5/14)(0.48) + (4/14)(0) + (5/14)(0.48) = 0.343.