Phân phối rời rạc
- Bernoulli: hai kết quả 1/0; E(X) = p, Var(X) = p(1 − p), lớn nhất khi p = 0.5.
- Binomial: số thành công trong n phép thử độc lập; P(X = x) = [n! ÷ ((n − x)! × x!)] × px(1 − p)n − x; E(X) = np, Var(X) = np(1 − p).
- Poisson: số sự kiện mỗi đơn vị; P(X = x) = λxe−λ ÷ x!; trung bình = phương sai = λ. Nhớ đổi λ theo đơn vị câu hỏi; n lớn, p nhỏ thì binomial ≈ Poisson với λ = np.
Uniform, normal, lognormal
- Uniform trên [a, b]: P(x1 ≤ X ≤ x2) = (x2 − x1) ÷ (b − a); E(X) = (a + b) ÷ 2; Var(X) = (b − a)2 ÷ 12; CDF tuyến tính.
- Normal: mô tả đầy đủ bởi μ và σ2; skewness 0, kurtosis 3; mean = median = mode; tổ hợp tuyến tính các biến chuẩn độc lập vẫn chuẩn; đuôi kéo dài vô hạn.
- Khoảng tin cậy: 90% → ± 1.65σ; 95% → ± 1.96σ; 99% → ± 2.58σ. Khoảng 68% trong ± 1σ.
- z = (x − μ) ÷ σ; z-table cho F(z) = P(Z < z); F(−z) = 1 − F(z); xác suất bên phải = 1 − F(z).
- Lognormal: Y = eX với X chuẩn; lệch phải, chặn dưới tại 0; hợp cho giá và price relative, không hợp cho lợi suất có thể âm.
Phân phối dùng trong kiểm định
- Student's t: đối xứng, đuôi dày hơn chuẩn, một tham số df = n − 1; dùng khi mẫu nhỏ, phương sai tổng thể chưa biết, tổng thể xấp xỉ chuẩn. Df tăng → gần N(0, 1), khoảng tin cậy hẹp dần nhưng luôn rộng hơn khoảng dùng z.
- Chi-squared: lệch phải, chặn tại 0, df càng lớn càng gần chuẩn; χ2n − 1 = (n − 1)s2 ÷ σ02 cho kiểm định phương sai.
- F: tỷ số hai phương sai mẫu s12 ÷ s22; lệch phải, chặn tại 0, hai bậc tự do n1 − 1 và n2 − 1; t2n − 1 ~ F1, n − 1.
Exponential, beta, mixture
- Exponential: f(x) = (1 ÷ β)e−x/β; λ = 1 ÷ β là hazard rate; mean 1 ÷ λ, variance 1 ÷ λ2; số sự kiện tới t theo Poisson(t ÷ β).
- Beta: xác suất nằm trong [0, 1]; hai shape parameter α, β; dùng cho default probability và recovery rate.
- Mixture: PDF là bình quân gia quyền các PDF thành phần; thành phần parametric, trọng số nonparametric. Khác mean → đổi skewness (có thể nhiều đỉnh); khác variance → tăng kurtosis, tạo fat tails.