Tóm tắt Reading 26: Machine Learning and Prediction

Môn FRM1 — FRM Part I · Reading 26/62

Mã hóa và regularization

  • Biến không có thứ tự: one-hot encoding (1 cho nhóm của quan sát, 0 cho nhóm khác). Biến có thứ bậc: gán 0, 1, 2, … theo thứ tự.
  • Regularization thêm penalty vào loss để thu nhỏ hệ số, giảm overfitting. Ridge (L2): L = RSS + λΣβ2, thu nhỏ về gần 0, giải tích. LASSO (L1): L = RSS + λΣ|β|, đưa hệ số kém quan trọng về đúng 0 (chọn feature), phương pháp số. Elastic net cộng cả hai penalty. λ là hyperparameter.

Logistic regression

  • Đầu ra nhị phân: Pj = 1 ÷ [1 + e−(α + Σβx)], nằm trong (0, 1); ước lượng bằng maximum likelihood (log-likelihood), không dùng OLS.
  • Phân loại: ŷ = 1 nếu P ≥ Z. Z = 0.5 khi chi phí sai lầm cân xứng; hạ Z (ví dụ 0.1) khi bỏ sót vỡ nợ rất tốn kém.
  • Đầu ra liên tục: MSFE = (1 ÷ ntest)Σ(y − ŷ)2; hoặc mean absolute forecast error.

Decision tree và ensemble

  • Root node, decision node, terminal node; CART là white-box. Entropy = −Σp log2p; Gini = 1 − Σp2. Information gain = thước đo node cha − bình quân gia quyền node con; chọn feature có gain lớn nhất. Pre-pruning và post-pruning chống overfitting.
  • Ensemble: wisdom of crowds, chống overfitting. Bagging (có hoàn lại, out-of-bag), pasting (không hoàn lại), random forest (tập con feature khoảng √m, giảm tương quan giữa cây), boosting (gradient boosting trên phần dư; AdaBoost tăng trọng số quan sát bị phân loại sai).

KNN, SVM, neural network

  • KNN: lazy learner; K lớn → bias cao, variance thấp; K ≈ √n. SVM: con đường rộng nhất; support vectors nằm trên mép, separation boundary ở giữa; hyperplane có số chiều bằng số feature − 1.
  • Neural network: output = bias + Σwjxj, activation function tạo phi tuyến; gradient descent với learning rate; dừng khi kết quả validation bắt đầu xấu đi dù training vẫn cải thiện.

Đánh giá phân loại

  • Accuracy = (TP + TN) ÷ tổng; precision = TP ÷ (TP + FP); recall = TP ÷ (TP + FN); error rate = (FP + FN) ÷ tổng = 1 − accuracy.
  • ROC: TPR theo FPR; AUC = 1 hoàn hảo, 0.5 ngẫu nhiên, < 0.5 tệ hơn ngẫu nhiên. So sánh mô hình khi các chỉ số mâu thuẫn: nhìn confusion matrix và chi phí sai lầm.

Bản đầy đủ gồm:

Bài giảng chi tiết, flashcard lặp lại ngắt quãng, ngân hàng câu hỏi luyện thi, lộ trình theo ngày thi. Dùng trọn 1 năm.