Limio— Learn your way
🏆 Đấu trường
Đăng nhậpĐăng ký

Thiết kế và phát triển: @Limio team - Khoa Khoa học và Công nghệ Giáo dục, Đại học Bách Khoa Hà Nội

← Fundamental of Machine Learning

Bạn đang xem thử công khai

Đăng nhập để lưu tiến độ, làm bài tập, thảo luận và nhận phản hồi.

Đăng nhập
Module 2: Core Machine Learning Algorithms

Chọn thuật toán: giả định và tình huống áp dụng

In / Lưu PDF

Chọn thuật toán: giả định và tình huống áp dụng

Biết ba thuật toán ít hữu ích hơn biết bài toán nào cần thuật toán nào.

Bảng so sánh

Hồi quy tuyến tínhCây quyết địnhRandom ForestSVM
Giải thích đượcRất tốtRất tốtKémKém
Quan hệ phi tuyếnKhôngCóCóCó (kernel)
Cần chuẩn hoáNênKhôngKhôngBắt buộc
Nhạy với ngoại laiCaoThấpThấpTrung bình
Dữ liệu nhỏTốtDễ overfitTốtTốt
Dữ liệu rất lớnTốtTốtChậm dầnChậm

Ba câu hỏi trước khi chọn

1. Có bắt buộc giải thích được quyết định không?

Ngân hàng từ chối hồ sơ vay, bệnh viện gợi ý chẩn đoán, quyết định tuyển dụng — những nơi này thường bị luật hoặc quy định buộc phải giải thích. Khi đó cây quyết định hoặc hồi quy tuyến tính thắng, kể cả khi độ chính xác thấp hơn vài phần trăm.

2. Quan hệ trong dữ liệu tuyến tính hay không?

Vẽ biểu đồ phân tán trước. Nếu thấy rõ đường cong, đừng bắt đầu bằng mô hình tuyến tính.

3. Dữ liệu lớn cỡ nào?

SVM chậm rõ rệt khi số mẫu lên tới hàng trăm nghìn. Với dữ liệu rất lớn, hồi quy tuyến tính hoặc mô hình cây thường thực tế hơn.

Nguyên tắc làm việc

Luôn bắt đầu bằng một baseline đơn giản — hồi quy tuyến tính hoặc logistic. Nó cho bạn con số để so sánh. Nếu mô hình phức tạp không vượt được baseline một cách đáng kể, hãy chọn cái đơn giản: dễ triển khai, dễ bảo trì, dễ giải thích.

Lỗi thường gặp nhất

Bắt đầu bằng mô hình mạnh nhất. Không có baseline, bạn không biết mô hình phức tạp kia có thực sự đóng góp gì hay chỉ đang tốn tài nguyên.