Từ điển học thuật Khoa học tự nhiên

Độ chệch (Bias) là gì? Công thức tính, phân rã MSE và sự đánh đổi Bias-Variance

Tiếng Anhstatistical bias

Tên gọi khácđộ lệch thống kêđộ chệch của ước lượngsai số hệ thống

Độ chệch (bias) trong thống kê và học máy là sự sai khác có tính hệ thống giữa kỳ vọng toán học của một ước lượng thống kê và giá trị thực sự của tham số tổng thể cần ước lượng.

666 lượt xem Cập nhật 2/9/2026

Độ chệch (statistical bias), hay độ lệch kỳ vọng, là đại lượng đo lường sự sai khác có tính hệ thống giữa giá trị kỳ vọng toán học của một ước lượng thống kê và giá trị thực sự của tham số tổng thể mà nó hướng đến. Trong lý thuyết xác suất thống kê, khoa học dữ liệu và học máy, độ chệch phản ánh mức độ thiếu chuẩn xác cơ bản của mô hình, đóng vai trò nền tảng trong bài toán đánh đổi độ chệch - phương sai (Bias-Variance Tradeoff) và thiết kế các thuật toán dự báo tối ưu.

Định nghĩa toán học của độ chệch

Giả sử heta heta là một tham số thực của tổng thể cần ước lượng, và heta^\hat{ heta} là một ước lượng thống kê (estimator) được tính toán từ một mẫu ngẫu nhiên độc lập X1,X2,,XnX_1, X_2, \dots, X_n. Độ chệch của heta^\hat{ heta}, ký hiệu là Bias(heta^)\operatorname{Bias}(\hat{ heta}), được xác định chính xác theo công thức (Lehmann & Casella, 1998):

Bias(heta^)=E[heta^]heta\operatorname{Bias}(\hat{ heta}) = \mathbb{E}[\hat{ heta}] - heta

Dựa trên giá trị của Bias(heta^)\operatorname{Bias}(\hat{ heta}), ta phân loại ước lượng như sau:

  • Ước lượng không chệch (Unbiased Estimator): Nếu Bias(heta^)=0\operatorname{Bias}(\hat{ heta}) = 0, tức là E[heta^]=heta\mathbb{E}[\hat{ heta}] = heta với mọi giá trị của heta heta. Ví dụ kinh điển: Trung bình mẫu ar{X} = rac{1}{n}\sum_{i=1}^n X_i là ước lượng không chệch của trung bình tổng thể μ\mu.
  • Ước lượng chệch (Biased Estimator): Nếu Bias(heta^)e0\operatorname{Bias}(\hat{ heta}) e 0. Nếu Bias(heta^)>0\operatorname{Bias}(\hat{ heta}) > 0, ước lượng có xu hướng đánh giá quá cao (overestimate); ngược lại nếu Bias(heta^)<0\operatorname{Bias}(\hat{ heta}) < 0, ước lượng có xu hướng đánh giá thấp hơn giá trị thực (underestimate).
  • Ước lượng không chệch tiệm cận (Asymptotically Unbiased): Nếu độ chệch tiến dần về 0 khi kích thước mẫu tiến tới vô cùng: limnoBias(heta^)=0\lim_{n o \infty} \operatorname{Bias}(\hat{ heta}) = 0.

Sai số toàn phương trung bình (MSE) và sự phân rã độ chệch - phương sai

Để đánh giá chất lượng tổng thể của một ước lượng, các nhà thống kê sử dụng sai số toàn phương trung bình (Mean Squared Error - MSE). Một trong những định lý nền tảng của suy luận thống kê chỉ ra rằng MSE có thể phân rã chính xác thành bình phương độ chệch cộng với phương sai của ước lượng (Hastie et al., 2009):

\operatorname{MSE}(\hat{ heta}) = \mathbb{E}\left[(\hat{ heta} - heta)^2 ight] = \left(\operatorname{Bias}(\hat{ heta}) ight)^2 + \operatorname{Var}(\hat{ heta})

Chứng minh toán học của sự phân rã:

egin{aligned} \operatorname{MSE}(\hat{ heta}) &= \mathbb{E}\left[\left((\hat{ heta} - \mathbb{E}[\hat{ heta}]) + (\mathbb{E}[\hat{ heta}] - heta) ight)^2 ight] \ &= \mathbb{E}\left[(\hat{ heta} - \mathbb{E}[\hat{ heta}])^2 ight] + 2(\mathbb{E}[\hat{ heta}] - heta)\mathbb{E}[\hat{ heta} - \mathbb{E}[\hat{ heta}]] + (\mathbb{E}[\hat{ heta}] - heta)^2 \ &= \operatorname{Var}(\hat{ heta}) + 0 + \left(\operatorname{Bias}(\hat{ heta}) ight)^2 \end{aligned}

Sự đánh đổi Độ chệch - Phương sai trong Học máy (Bias-Variance Dilemma)

Trong các bài toán học có giám sát (hồi quy và phân loại), sai số dự báo tổng thể trên tập kiểm tra luôn bao gồm ba thành phần: độ chệch của mô hình, phương sai của mô hình và sai số ngẫu nhiên không thể khử (irreducible error σϵ2\sigma_\epsilon^2) (Geman et al., 1992):

\operatorname{Error}(x) = \operatorname{Bias}\left(\hat{f}(x) ight)^2 + \operatorname{Var}\left(\hat{f}(x) ight) + \sigma_\epsilon^2
Trạng thái mô hình Đặc trưng độ chệch (Bias) Đặc trưng phương sai (Variance) Biểu hiện thực tế Giải pháp kỹ thuật
Mô hình quá đơn giản (Underfitting) Độ chệch cao (extHighBias ext{High Bias}) Phương sai thấp (extLowVariance ext{Low Variance}) Mô hình áp đặt các giả định quá khắt khe, không học được quy luật phức tạp của dữ liệu, sai số cao trên cả tập huấn luyện và tập kiểm tra. Tăng độ phức tạp của mô hình, bổ sung thêm đặc trưng phi tuyến (polynomial features), sử dụng mạng nơ-ron sâu hoặc thuật toán Boosting.
Mô hình quá phức tạp (Overfitting) Độ chệch thấp (extLowBias ext{Low Bias}) Phương sai cao (extHighVariance ext{High Variance}) Mô hình học thuộc lòng cả nhiễu ngẫu nhiên của tập huấn luyện, hoạt động hoàn hảo trên train nhưng sai số nhảy vọt trên tập dữ liệu mới. Thu thập thêm dữ liệu, áp dụng điều chuẩn hóa (Regularization: L1 Lasso, L2 Ridge), giảm bớt đặc trưng hoặc dùng kỹ thuật Bagging / Random Forest.
Mô hình tối ưu (Optimal Balance) Độ chệch vừa phải Phương sai vừa phải Tổng sai số kiểm tra đạt giá trị cực tiểu toàn cục. Sử dụng phương pháp kiểm định chéo (k-fold cross-validation) để dò tìm siêu tham số tối ưu.

Ứng dụng chấp nhận độ chệch để giảm phương sai: Hồi quy Ridge

Một nguyên lý quan trọng trong thống kê hiện đại là: đôi khi cố tình chấp nhận một lượng độ chệch nhỏ lại giúp giảm mạnh phương sai, dẫn tới tổng sai số MSE\operatorname{MSE} nhỏ hơn hẳn ước lượng không chệch OLS (Ordinary Least Squares). Kỹ thuật hồi quy Ridge (L2 regularization) bổ sung một số hạng phạt vào hàm mất mát:

\hat{eta}_{ ext{ridge}} = \left(X^T X + \lambda I ight)^{-1} X^T y

Khi tham số điều chuẩn λ>0\lambda > 0, ước lượng \hat{eta}_{ ext{ridge}} bị chệch về phía 0 nhưng có ma trận hiệp phương sai nhỏ hơn đáng kể so với \hat{eta}_{ ext{OLS}}, đặc biệt trong các bài toán dữ liệu đa cộng tuyến cao (multicollinearity) hoặc khi số chiều đặc trưng vượt quá số lượng mẫu quan sát (p>np > n).

Câu hỏi thường gặp

Ước lượng không chệch (Unbiased Estimator) có luôn tốt hơn ước lượng chệch không?

Không nhất thiết. Mặc dù ước lượng không chệch có kỳ vọng bằng đúng tham số thực, nó có thể có phương sai rất lớn dẫn đến sai số tổng thể MSE cao. Trong nhiều tình huống thực tế, một ước lượng có độ chệch nhỏ nhưng phương sai thấp hơn nhiều (như hồi quy Ridge hoặc bộ lọc Kalman) sẽ cho kết quả dự báo chính xác và ổn định hơn.

Sự đánh đổi Độ chệch - Phương sai (Bias-Variance Tradeoff) giải thích hiện tượng Overfitting như thế nào?

Khi mô hình học máy được gia tăng độ phức tạp quá mức để giảm độ chệch xuống gần bằng 0, mô hình sẽ trở nên cực kỳ nhạy cảm với các biến động ngẫu nhiên của tập dữ liệu huấn luyện, làm phương sai (Variance) tăng vọt. Kết quả là mô hình bị Overfitting: dự báo rất tốt trên tập train nhưng sai lệch nặng nề trên dữ liệu kiểm tra mới.

Làm thế nào để kiểm soát và giảm độ chệch trong mô hình phân tích dữ liệu?

Để giảm độ chệch cao (Underfitting), các kỹ sư có thể tăng bậc của mô hình (thêm các tương tác phi tuyến), bổ sung thêm các biến giải thích đặc trưng mới, giảm mức độ phạt điều chuẩn (regularization parameter lambda), hoặc chuyển sang các thuật toán có năng lực biểu diễn cao hơn như mạng nơ-ron sâu hay Gradient Boosting.

Các nghiên cứu khoa học về “độ chệch bias”

Công bố nổi bật trên thế giới và tại Việt Nam, kèm tóm tắt theo hướng chủ đề.

Trích dẫn nhiều nhất

  • Áp dụng Sigma đánh giá hiệu năng xét nghiệm Sinh hóa tại phòng xét nghiệm LAM Viện Pasteur Thành phố Hồ Chí Minh

    Nguyễn Đức Trúc và cộng sự2024Tạp chí Y học Dự phòng0 trích dẫn

    AI tóm tắt

    Nghiên cứu quản lý chất lượng phòng xét nghiệm y khoa ứng dụng thang đo Six Sigma kết hợp xác định sai số tổng cho phép và độ chệch bias thực tế trên 22 chỉ số sinh hóa máu tại Viện Pasteur Thành phố Hồ Chí Minh. Các xét nghiệm glucose và cholesterol đạt chỉ số hiệu năng Sigma trên 4,5 phản ánh mức độ chính xác cao và độ chệch bias tối thiểu trong quy trình đo lường tự động.

  • Hiệu chỉnh độ chệch thống kê của các mô phỏng mô hình khí hậu khu vực cho dự phóng biến đổi khí hậu ở tiểu lưu vực Jemma, thượng lưu lưu vực sông Nile Xanh của Ethiopia

    Dịch bởi AIStatistical bias correction of regional climate model simulations for climate change projection in the Jemma sub-basin, upper Blue Nile Basin of Ethiopia

    Gebrekidan Worku và cộng sự2019

    AI tóm tắt

    Khảo sát mô hình khí hậu thủy văn đánh giá các phương pháp hiệu chỉnh độ chệch bias bias correction trong mô phỏng khí hậu khu vực lưu vực sông Jemma thuộc lưu vực sông Nile Xanh của Ethiopia. Kỹ thuật ánh xạ phân vị phi tuyến giúp loại trừ sai số chệch có hệ thống của lượng mưa và nhiệt độ từ mô hình RCM so với số liệu quan trắc trạm. Dữ liệu cung cấp kịch bản dòng chảy chính xác hơn.

  • Một quy trình thống kê để đánh giá độ chệch trong các phương pháp phân tích sử dụng xác suất có điều kiện

    Dịch bởi AIA statistical procedure for the assessment of bias in analytical methods using conditional probabilities

    Robert B. Frenkel và cộng sự2017

    AI tóm tắt

    Nghiên cứu hóa học phân tích đề xuất quy trình thống kê mới dựa trên luật xác suất có điều kiện conditional probabilities để đồng thời đánh giá độ chệch bias và độ không chụm trong các phương pháp xét nghiệm hóa sinh lâm sàng. Mô hình xây dựng hàm mật độ xác suất kết hợp giúp lượng hóa mức độ tin cậy của kết quả phân tích nồng độ chất tan. Tác giả chỉ ra tính ưu việt của phương pháp.

  • Độ chệch thống kê trong các ước lượng hợp lý cực đại của các tham số câu hỏi

    Dịch bởi AIStatistical bias in maximum likelihood estimators of item parameters

    Frederic M. Lord1983Psychometrika

    AI tóm tắt

    Khảo sát thống kê lý thuyết trắc nghiệm đo lường dẫn xuất các công thức tiệm cận cho độ chệch bias trong ước lượng hợp lý cực đại maximum likelihood của các tham số câu hỏi trong mô hình đáp ứng câu hỏi logistic. Kết quả phân tích số học chỉ ra độ lớn của độ chệch bias tỷ lệ nghịch với số lượng người tham gia kiểm tra và có thể hiệu chỉnh bằng chuỗi khai triển Taylor.

Nổi bật tại Việt Nam

  • XÂY DỰNG CƠ SỞ LIÊN THÔNG XÉT NGHIỆM TSH, FT3, FT4 THÔNG QUA CHƯƠNG TRÌNH NGOẠI KIỂM MIỄN DỊCH RIQAS

    Phạm Thị Thanh An và cộng sự2022Tạp chí Y học Việt Nam

    AI tóm tắt

    Khảo sát đảm bảo chất lượng xét nghiệm y học sử dụng kết quả ngoại kiểm miễn dịch RIQAS phân tích độ chệch bias và hệ số biến thiên CV của ba xét nghiệm hormone tuyến giáp TSH, FT3 và FT4. Đánh giá sai số cho thấy độ chệch bias trung bình của các xét nghiệm dao động trong khoảng từ -4,2% đến 3,8%, đáp ứng tiêu chuẩn liên thông kết quả xét nghiệm giữa các phòng thí nghiệm lâm sàng.

Tài liệu tham khảo

  1. Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction. Springer Science & Business Media. DOI: 10.1007/978-0-387-84858-7
  2. Lehmann, E. L., & Casella, G. (1998). Theory of Point Estimation. Springer. DOI: 10.1007/b98854
  3. Geman, S., Bienenstock, E., & Doursat, R. (1992). Neural networks and the bias/variance dilemma. Neural Computation, 4(1), 1-58. DOI: 10.1162/neco.1992.4.1.1