Từ điển học thuật Khoa học tự nhiên

Linear regression là gì? Các công bố khoa học về Linear regression

Tiếng Anhlinear regression

Tên gọi kháchồi quy tuyến tínhmô hình hồi quy tuyến tínhOLS regression

Hồi quy tuyến tính (linear regression) là phương pháp mô hình hóa thống kê nhằm thiết lập mối quan hệ định lượng giữa một biến phụ thuộc (biến phản hồi) với một hoặc nhiều biến độc lập (biến dự báo) dưới dạng hàm tuyến tính.

416 lượt xem Cập nhật 12/9/2026

Hồi quy tuyến tính (linear regression) là phương pháp mô hình hóa thống kê nền tảng nhằm thiết lập và ước lượng mối quan hệ toán học định lượng giữa một biến phụ thuộc (biến phản hồi $Y$) với một hoặc nhiều biến độc lập (biến dự báo $X$) dưới dạng phương trình tuyến tính của các tham số. Đây là công cụ phân tích then chốt trong kinh tế lượng, học máy và khoa học dữ liệu.

Mô hình toán học của hồi quy tuyến tính

Trong trường hợp tổng quát của mô hình hồi quy tuyến tính bội (Multiple Linear Regression), mối quan hệ giữa biến phụ thuộc $Y$ và $k$ biến độc lập $X_1, X_2, \dots, X_k$ được biểu diễn qua phương trình:

$$Y_i = \beta_0 + \beta_1 X_{i1} + \beta_2 X_{i2} + \dots + \beta_k X_{ik} + \varepsilon_i$$

Trong đó:

  • $\beta_0$ là hệ số chặn (intercept).
  • $\beta_1, \dots, \beta_k$ là các hệ số hồi quy riêng phần (partial regression coefficients), biểu thị mức thay đổi kỳ vọng của $Y$ khi một biến $X_j$ tăng một đơn vị và các biến khác giữ nguyên.
  • $\varepsilon_i$ là sai số ngẫu nhiên (residual error) phản ánh các yếu tố chưa quan sát được hoặc nhiễu ngẫu nhiên.

Phương pháp bình phương tối thiểu thông thường (OLS)

Theo chuyên khảo của Finch (2025) và Keith (2020), phương pháp ước lượng phổ biến nhất là Bình phương tối thiểu thông thường (Ordinary Least Squares - OLS). OLS tìm kiếm tập hợp hệ số $\hat{\beta}$ nhằm giảm thiểu tổng bình phương của các phần dư (Sum of Squared Residuals - SSR):

$$SSR = \sum_{i=1}^n e_i^2 = \sum_{i=1}^n (Y_i - \hat{Y}_i)^2$$

Nghiệm ma trận giải tích của ước lượng OLS được xác định bởi công thức kinh điển: $\hat{\beta} = (X^T X)^{-1} X^T Y$.

Các giả định kinh điển của định lý Gauss - Markov

Định lý Gauss - Markov khẳng định rằng nếu mô hình thỏa mãn 5 giả định cơ bản, ước lượng OLS sẽ là ước lượng tuyến tính không chệch tốt nhất (Best Linear Unbiased Estimator - BLUE):

Giả định Nội dung toán học Hậu quả khi vi phạm Phương pháp kiểm định
Tính tuyến tính Kỳ vọng có điều kiện $E(Y|X)$ là hàm tuyến tính của các tham số Ước lượng bị chệch và không nhất quán Kiểm định Ramsey RESET, biểu đồ phân dư
Ngoại sinh chặt chẽ $E(\varepsilon_i | X) = 0$ (sai số không tương quan với biến độc lập) Nội sinh (Endogeneity), hệ số ước lượng bị chệch nghiêm trọng Kiểm định Hausman, sử dụng biến công cụ (IV)
Phương sai sai số đồng nhất $Var(\varepsilon_i | X) = \sigma^2$ (Homoscedasticity) Phương sai ước lượng không hiệu quả, kiểm định t và F mất giá trị Kiểm định White, Breusch-Pagan
Không tự tương quan $Cov(\varepsilon_i, \varepsilon_j | X) = 0$ với mọi $i \neq j$ Sai số chuẩn của hệ số bị ước tính thấp, tăng nguy cơ sai lầm loại I Kiểm định Durbin-Watson, Breusch-Godfrey
Không đa cộng tuyến hoàn hảo Ma trận $X$ có hạng đầy đủ ($rank(X) = k + 1$) Không tính được nghịch đảo ma trận $(X^T X)^{-1}$, phương sai hệ số tăng vọt Hệ số phóng đại phương sai (VIF)

Đánh giá chất lượng mô hình và suy diễn thống kê

Theo Kozek và Jersky (2013), việc đánh giá sự phù hợp của mô hình hồi quy dựa trên hệ số xác định ($R^2$) và $R^2$ hiệu chỉnh (Adjusted $R^2$), phản ánh tỷ lệ phương sai của biến phụ thuộc được giải thích bởi tập hợp biến độc lập. Kiểm định $t$ của Student được sử dụng để kiểm định ý nghĩa thống kê của từng hệ số hồi quy riêng lẻ, trong khi kiểm định $F$ của Fisher đánh giá ý nghĩa thống kê của toàn bộ mô hình hồi quy.

Câu hỏi thường gặp

Hệ số xác định R-squared (R2) phản ánh điều gì?

R-squared đo lường tỷ lệ phần trăm phương sai của biến phụ thuộc được giải thích bởi các biến độc lập trong mô hình hồi quy tuyến tính, nhận giá trị từ 0 đến 1.

Đa cộng tuyến (Multicollinearity) là gì và làm sao phát hiện?

Đa cộng tuyến xảy ra khi hai hoặc nhiều biến độc lập có tương quan tuyến tính mạnh với nhau, làm tăng sai số chuẩn của các hệ số hồi quy; thường được phát hiện qua hệ số phóng đại phương sai (VIF > 5 hoặc 10).

Định lý Gauss - Markov có ý nghĩa gì trong kinh tế lượng?

Định lý chứng minh rằng khi thỏa mãn các giả định hồi quy cổ điển, phương pháp ước lượng OLS sẽ cho ra các ước lượng có phương sai nhỏ nhất trong tất cả các ước lượng tuyến tính không chệch (BLUE).

Các nghiên cứu khoa học về “linear regression”

Công bố nổi bật trên thế giới và tại Việt Nam, kèm tóm tắt theo hướng chủ đề.

Trích dẫn nhiều nhất

  • Các Tính Chất Giới Hạn của Một MLE Tối Ưu Hóa Bán Tham Số Đã Sửa trong Hồi Quy Tuyến Tính với Dữ Liệu Bị Censorship Phải

    Dịch bởi AIAsymptotic Properties of a Modified Semi-Parametric MLE in Linear Regression with Right-Censored Data

    Yu, Qi Qing và cộng sự2002

    AI tóm tắt

    Nghiên cứu lý thuyết thống kê đề xuất phương pháp hợp lý cực đại bán tham số cho mô hình linear regression dưới điều kiện dữ liệu sống sót bị cắt phải. Các tác giả thiết lập tính nhất quán và phân phối tiệm cận chuẩn của ước lượng, cung cấp công cụ phân tích hồi quy mạnh mẽ cho các thử nghiệm lâm sàng và phân tích độ tin cậy.

  • Đa cộng tuyến và cách phòng tránh trong phân tích hồi quy

    Dịch bởi AIMulticollinearity and Avoidance in Regression Analysis

    Shigeru Yoshioka1986Behaviormetrika

    AI tóm tắt

    Phân tích kinh tế lượng so sánh các ước lượng hồi quy Ridge với phương pháp bình phương bé nhất trong mô hình linear regression khi xuất hiện hiện tượng đa cộng tuyến nghiêm trọng. Mô phỏng Monte Carlo chỉ ra rằng việc áp dụng tham số co ngót giúp giảm đáng kể sai số toàn phương trung bình, tăng cường độ tin cậy của hệ số ước lượng.

Tài liệu tham khảo

  1. Finch, W. H. (2025). Ordinary Least Squares Linear Regression. In Statistical Analysis for Applied Research, CRC Press / Routledge, 1, 145-178. DOI: 10.1201/9781003379324-9
  2. Keith, T. Z. (2020). Linear Regression. In Multiple Regression and Beyond, Apress, 1, 45-82. DOI: 10.1007/978-1-4842-6583-3_3
  3. Kozek, A. S., & Jersky, B. (2013). Does sequential augmenting of simple linear heteroscedastic regression reduce variance?. Statistics, 47(5), 998-1011. DOI: 10.1080/02331888.2013.800063