Mean, variance và moment mẫu
- Sample mean μ̂ = (Σ Xi) ÷ n; tổng độ lệch Σ (Xi − μ̂) luôn bằng 0.
- Variance chia n: σ̂2 = (1 ÷ n) Σ (Xi − μ̂)2 là bản chệch; bản không chệch s2 = [1 ÷ (n − 1)] Σ (Xi − μ̂)2. Mặc định dùng n − 1.
- Population mean μ (chia N) là duy nhất nhưng không quan sát được; μ̂ (chia n) chỉ là ước lượng. Moment mẫu thu được bằng cách thay E[·] bằng trung bình chia n.
- Var(μ̂) = σ2 ÷ n; standard error = σ ÷ √n.
Estimator và các tính chất
- Estimator là công thức; estimate (point estimate) là con số tính từ một mẫu.
- Bias(θ̂) = E[θ̂] − θ. Sample mean không chệch; E[σ̂2] = [(n − 1) ÷ n] σ2, bias = −σ2 ÷ n.
- Sample mean là BLUE với dữ liệu iid: phương sai nhỏ nhất trong các estimator tuyến tính không chệch (trọng số 1 ÷ n).
- Consistent: khi n tăng, bias và phương sai của estimator tiến về 0. LLN cần mean hữu hạn; CLT cần mean và variance hữu hạn, không cần tổng thể chuẩn: μ̂ ≈ N(μ, σ2 ÷ n) khi n ≥ 30.
Hình dạng phân phối
- Skewness = μ3 ÷ σ3. Lệch phải: mode < median < mean; lệch trái: mean < median < mode.
- Kurtosis = μ4 ÷ σ4; chuẩn bằng 3; excess kurtosis = kurtosis − 3. Leptokurtic (> 3) có fat tails; platykurtic (< 3) đuôi mỏng.
- Skewness âm hơn và kurtosis cao hơn hàm ý rủi ro đuôi lớn hơn.
- Median: x(n+1)/2 khi n lẻ; 0.5 × (xn/2 + xn/2+1) khi n chẵn. Quantile α tại vị trí α × n; IQR = Q75 − Q25; median và IQR vững trước outlier.
Hai biến
- Stack hai sample mean thành vector: với dữ liệu iid, vector có phân phối chuẩn tiệm cận.
- Cov(X, Y) = E(XY) − E(X)E(Y); sample covariance chia n − 1; Corr = Cov ÷ (σXσY) ∈ [−1, 1].
- Moment bậc p có p − 1 thước đo chéo: 2 coskewness, 3 cokurtosis. Bivariate normal: coskewness = 0; k(X,X,Y,Y) = 1 + 2ρ2 (nhỏ nhất 1 tại ρ = 0); k(X,X,X,Y) = 3ρ (tuyến tính từ −3 tới +3).