Mô hình và điều kiện áp dụng
- Y = α + β × X + ε: β là độ nhạy của Y theo X, α là giá trị của Y khi X = 0, ε là phần không được X giải thích.
- Ba điều kiện: quan hệ tuyến tính, sai số cộng vào (phương sai sai số không phụ thuộc dữ liệu), mọi X quan sát được.
- Chỉ cần tuyến tính theo tham số: ln(X), X2, 1 ÷ X dùng được; Y = α + βXp + ε thì không.
Ước lượng OLS và diễn giải
- OLS cực tiểu hóa Σε̂i2. β̂ = cov(X, Y) ÷ var(X); α̂ = Ȳ − β̂X̄; đường hồi quy đi qua (X̄, Ȳ).
- β̂: thay đổi của Y khi X tăng một đơn vị; α̂: Y dự báo khi X = 0. Trong hồi quy bội, hệ số là partial slope (giữ nguyên biến khác).
- Dummy variable nhận 0 hoặc 1, lượng hóa yếu tố định tính.
- Hồi quy một biến: R2 = rX,Y2; |r| = √R2, dấu của r theo dấu của β̂. β̂ = 0 ⇒ R2 = 0.
Giả định và tính chất
- Giả định: E(ε | X) = 0; (X, Y) iid; var(X) > 0; homoskedasticity; khó có outlier lớn.
- Vi phạm E(ε | X) = 0: survivorship/sample selection bias, simultaneity bias, omitted variables, attenuation bias (X đo sai → hệ số bị kéo về 0).
- α̂, β̂ unbiased, consistent, xấp xỉ chuẩn khi mẫu lớn. Var(β̂) ≈ σε2 ÷ (n × σX2): tăng theo phương sai sai số, giảm theo phương sai X và cỡ mẫu.
Kiểm định và khoảng tin cậy
- Ba bước: phát biểu giả thuyết → tính test statistic → so với giá trị tới hạn.
- t = (β̂ − β0) ÷ SE(β̂), n − 2 bậc tự do; bác bỏ H0 khi |t| > tc.
- Khoảng tin cậy: β̂ ± tc × SE(β̂); β0 nằm ngoài khoảng ⇔ bác bỏ H0.
- p-value là mức ý nghĩa nhỏ nhất để bác bỏ H0; p-value in sẵn chỉ dành cho H0: β = 0.