Từ điển học thuật Khoa học tự nhiên

Mối tương quan là gì? Phân loại, hệ số và ý nghĩa thống kê

Tiếng Anhcorrelation

Tên gọi kháchệ số tương quantương quan thống kêstatistical correlation

Mối tương quan là quan hệ thống kê định lượng mức độ và chiều hướng đồng biến thiên giữa các biến số, đo lường bằng hệ số Pearson, Spearman hoặc Kendall mà không nhất thiết chỉ ra quan hệ nhân quả.

349 lượt xem Cập nhật 25/8/2026

Mối tương quan (correlation hay tương quan thống kê) là một khái niệm toán thống kê nền tảng biểu thị mức độ kết hợp, phụ thuộc hoặc đồng biến thiên có quy luật giữa hai hoặc nhiều biến số ngẫu nhiên. Trong phân tích dữ liệu thực nghiệm, mối tương quan giúp lượng hóa cả cường độ (độ mạnh yếu) lẫn chiều hướng (đồng biến dương hoặc nghịch biến âm) của mối liên hệ giữa các hiện tượng quan sát mà không nhất thiết đòi hỏi thiết lập quan hệ nhân quả tất định.

Mục từ này trình bày toàn diện về cơ sở toán học của các hệ số tương quan tham số và phi tham số (Pearson, Spearman, Kendall), quy trình kiểm định ý nghĩa thống kê, tương quan từng phần, hiện tượng đa cộng tuyến, cạm bẫy tương quan giả mạo và nghịch lý Simpson trong nghiên cứu khoa học.

Phân loại các hệ số tương quan chính trong thống kê

Tùy thuộc vào bản chất của thang đo dữ liệu (thang đo khoảng, tỷ lệ, thứ bậc hay danh nghĩa) và phân phối xác suất của các biến, nhà nghiên cứu lựa chọn các hệ số đo lường tương quan thích hợp:

1. Hệ số tương quan tích sai phân Pearson (Pearson r)

Được Karl Pearson (1896) chuẩn hóa dựa trên các ý tưởng ban đầu của Francis Galton, hệ số tương quan Pearson (rr) là thước đo tham số tiêu chuẩn để đánh giá mối quan hệ tuyến tính giữa hai biến số liên tục có phân phối chuẩn hai chiều (bivariate normal distribution):

r=i=1n(xixˉ)(yiyˉ)i=1n(xixˉ)2i=1n(yiyˉ)2r = \frac{ \sum_{i=1}^n (x_i - \bar{x})(y_i - \bar{y}) }{ \sqrt{ \sum_{i=1}^n (x_i - \bar{x})^2 } \sqrt{ \sum_{i=1}^n (y_i - \bar{y})^2 } }

Hệ số rr nhận giá trị trong đoạn từ -1 đến 1:

  • r=1r = 1: Tương quan tuyến tính dương hoàn hảo (khi xx tăng thì yy tăng theo tỷ lệ đường thẳng tuyệt đối).
  • r=1r = -1: Tương quan tuyến tính âm hoàn hảo (khi xx tăng thì yy giảm theo tỷ lệ đường thẳng tuyệt đối).
  • r=0r = 0: Không có mối liên hệ tuyến tính (tuy nhiên vẫn có thể tồn tại mối liên hệ phi tuyến phức tạp).

2. Hệ số tương quan hạng Spearman (Spearman rho)

Do Charles Spearman (1904) đề xuất, hệ số tương quan hạng Spearman (rsr_s hay ρ\rho) là một thước đo phi tham số đánh giá mức độ tương quan đơn điệu (monotonic relationship) giữa hai biến số. Phương pháp này chuyển đổi các giá trị thô thành thứ hạng (ranks) trước khi tính toán:

rs=16di2n(n21)r_s = 1 - \frac{ 6 \sum d_i^2 }{ n(n^2 - 1) }

Trong đó did_i là hiệu số thứ hạng giữa hai biến của quan sát thứ iinn là tổng số cặp quan sát. Spearman rho không yêu cầu giả định phân phối chuẩn và không bị ảnh hưởng bởi các biến đổi đơn điệu phi tuyến hay các giá trị ngoại lai cực đoan.

3. Hệ số tương quan hạng Kendall (Kendall tau)

Được Maurice Kendall (1938) phát triển, hệ số Kendall (τ\tau) là thước đo phi tham số dựa trên việc so sánh số cặp quan sát thuận (concordant pairs, CC) và số cặp quan sát nghịch (discordant pairs, DD):

τ=CD12n(n1)\tau = \frac{ C - D }{ \frac{1}{2} n(n - 1) }

Kendall tau có ưu thế vượt trội khi xử lý các tập dữ liệu mẫu nhỏ hoặc khi dữ liệu xuất hiện nhiều cặp có thứ hạng bằng nhau (tied ranks), đồng thời cung cấp ước lượng không chệch với phân phối mẫu hội tụ chuẩn nhanh hơn Spearman rho.

Bảng so sánh tổng hợp các hệ số tương quan

Hệ số tương quanThang đo dữ liệu phù hợpGiả định phân phốiDạng quan hệ đo lườngĐộ nhạy với ngoại lai
Pearson rBiến liên tục (khoảng / tỷ lệ)Phân phối chuẩn hai chiềuQuan hệ tuyến tính (Linear)Rất nhạy cảm với ngoại lai
Spearman rhoBiến thứ bậc hoặc liên tục phi chuẩnPhi tham số (không đòi hỏi phân phối chuẩn)Quan hệ đơn điệu (Monotonic)Kháng ngoại lai mạnh mẽ
Kendall tauBiến thứ bậc hoặc mẫu dữ liệu nhỏPhi tham sốĐồng thuận thứ bậc cặp đôiRất vững chắc với mẫu nhỏ
Tương quan điểm nhị phân (Point-Biserial)Một biến liên tục, một biến nhị phân thực sựChuẩn cho biến liên tụcQuan hệ khác biệt nhóm tuyến tínhNhạy cảm với ngoại lai

Kiểm định ý nghĩa thống kê và hệ số xác định

Trong suy diễn thống kê, một hệ số tương quan mẫu rr cần được kiểm định để xác định xem mối liên hệ có thực sự tồn tại trong tổng thể hay chỉ do ngẫu nhiên lấy mẫu. Giả thuyết không (H0:ρ=0H_0: \rho = 0) được kiểm định bằng phân phối Student t với n2n - 2 bậc tự do:

t=rn21r2t = r \sqrt{ \frac{ n - 2 }{ 1 - r^2 } }

Khi giá trị pp-value nhỏ hơn mức ý nghĩa đã chọn, giả thuyết không bị bác bỏ, khẳng định mối tương quan có ý nghĩa thống kê.

Bên cạnh đó, bình phương của hệ số tương quan Pearson (R2=r2R^2 = r^2), được gọi là hệ số xác định (coefficient of determination), biểu thị tỷ lệ phần trăm phương sai của biến phụ thuộc được giải thích bởi mô hình tuyến tính của biến độc lập.

Ý nghĩa kích thước hiệu ứng và quy ước diễn giải độ mạnh

Bên cạnh giá trị pp-value (chỉ cho biết mối tương quan có khác 0 một cách ngẫu nhiên hay không), độ lớn của hệ số tương quan (kích thước hiệu ứng - effect size) phản ánh mức độ chặt chẽ trong thực tế:

  • Tương quan yếu: Giá trị tuyệt đối của hệ số ở mức thấp, giải thích một tỷ lệ nhỏ phương sai chung giữa hai biến số.
  • Tương quan trung bình: Giá trị tuyệt đối ở mức vừa phải, thể hiện mối liên kết có ý nghĩa thực tiễn đáng kể.
  • Tương quan mạnh: Giá trị tuyệt đối ở mức cao tiệm cận 1 hoặc -1, giải thích phần lớn phương sai và thể hiện mối liên hệ chặt chẽ rõ rệt trong thực nghiệm.

Tầm quan trọng của trực quan hóa và Bộ tứ Anscombe

Một sai lầm phổ biến trong thực hành thống kê là chỉ dựa vào giá trị số của hệ số tương quan mà bỏ qua việc trực quan hóa dữ liệu bằng biểu đồ phân tán (scatter plot). Hiện tượng này được minh họa kinh điển qua "Bộ tứ Anscombe" (Anscombe's Quartet) — gồm bốn tập dữ liệu có cùng số lượng mẫu, cùng giá trị trung bình, cùng phương sai và cùng hệ số tương quan Pearson tính toán tương đương nhau, nhưng cấu trúc phân bố thực tế lại hoàn toàn khác biệt:

  • Tập 1 thể hiện mối quan hệ tuyến tính đồng nhất chuẩn mực.
  • Tập 2 biểu diễn một hàm parabol phi tuyến hoàn hảo (trong đó hệ số tuyến tính Pearson thất bại trong việc nắm bắt bản chất quy luật).
  • Tập 3 là một quan hệ tuyến tính hoàn hảo nhưng bị lệch hệ số do sự hiện diện của một điểm ngoại lai duy nhất.
  • Tập 4 hoàn toàn không có tương quan ngoại trừ một điểm đòn bẩy ngoại lai cực đoan làm sai lệch toàn bộ kết quả tính toán.

Do đó, trực quan hóa đồ thị là bước bắt buộc trước khi đưa ra bất kỳ kết luận tương quan nào.

Phân tích tương quan từng phần và đa cộng tuyến

Trong các hệ thống thực tế có nhiều biến số tác động đồng thời, mối tương quan đơn biến giữa hai biến số có thể bị sai lệch do tác động can thiệp của một biến số thứ ba:

  • Tương quan từng phần (Partial correlation): Đo lường mức độ liên hệ tuyến tính thuần túy giữa hai biến số sau khi đã kiểm soát và loại trừ hoàn toàn ảnh hưởng tuyến tính của một hoặc nhiều biến kiểm soát khác.
  • Đa cộng tuyến (Multicollinearity): Xuất hiện trong mô hình hồi quy đa biến khi các biến độc lập có mối tương quan mạnh với nhau, dẫn đến hiện tượng ước lượng hệ số hồi quy bị mất ổn định, sai số chuẩn tăng vọt và làm méo mó kết luận thống kê. Hiện tượng này thường được phát hiện qua hệ số phóng đại phương sai (VIF).

Nguyên tắc phân biệt tương quan và nhân quả

Một trong những nguyên lý căn bản nhất của phương pháp luận nghiên cứu khoa học là "mối tương quan không đồng nghĩa với quan hệ nhân quả" (correlation does not imply causation). Theo phân tích lịch sử của Aldrich (1995), sự nhầm lẫn giữa tương quan thực sự và tương quan giả mạo (spurious correlation) đã được các nhà thống kê học cảnh báo từ sớm:

  • Yếu tố gây nhiễu tiềm ẩn (Confounding variables): Hai biến số XXYY có thể thể hiện mối tương quan rất cao chỉ vì cả hai đều cùng chịu sự chi phối của một biến nguyên nhân chung ZZ (ví dụ: lượng kem bán ra và số vụ đuối nước đều tăng vào mùa hè do nhiệt độ thời tiết tăng).
  • Nghịch lý Simpson (Simpson's paradox): Một hiện tượng thống kê kỳ lạ khi mối tương quan giữa hai biến số thể hiện chiều hướng đồng biến trong từng phân nhóm nhỏ nhưng lại bị đảo ngược hoàn toàn thành nghịch biến khi tổng hợp toàn bộ dữ liệu mẫu, do sự phân bổ không đồng đều của biến phân tầng.
  • Tiêu chuẩn suy luận nhân quả: Để chứng minh mối quan hệ nhân quả thực sự, nghiên cứu khoa học cần dựa trên các thiết kế thử nghiệm ngẫu nhiên có đối chứng (RCT), phân tích chuỗi thời gian kiểm định tính nhân quả Granger, hoặc thỏa mãn các tiêu chuẩn dịch tễ học Bradford Hill (tính nhất quán, trình tự thời gian, độ mạnh của mối liên hiệp và cơ chế sinh học hợp lý).

Câu hỏi thường gặp

Khi nào nên sử dụng hệ số tương quan Pearson và khi nào nên dùng Spearman rho?

Hệ số Pearson (1896) được áp dụng khi hai biến số là dữ liệu liên tục, có quan hệ tuyến tính và tuân theo phân phối chuẩn hai chiều; trong khi Spearman rho (1904) là thước đo phi tham số ưu tiên khi dữ liệu ở thang đo thứ bậc, phân phối lệch hoặc có quan hệ đơn điệu phi tuyến.

Hệ số tương quan Kendall tau có ưu thế gì nổi bật so với Spearman rho?

Theo Kendall (1938), hệ số Kendall tau dựa trên việc đếm số cặp quan sát thuận và nghịch, cho ước lượng không chệch và có phân phối mẫu hội tụ chuẩn nhanh hơn, đặc biệt phù hợp cho các tập dữ liệu có kích thước mẫu nhỏ hoặc có nhiều giá trị bằng hạng.

Tại sao tương quan thống kê không đồng nghĩa với mối quan hệ nhân quả?

Theo Aldrich (1995), hai biến số có thể tương quan mạnh do ảnh hưởng của biến gây nhiễu tiềm ẩn chung (tương quan giả mạo) hoặc ngẫu nhiên; để chứng minh nhân quả đòi hỏi thiết kế thử nghiệm đối chứng ngẫu nhiên và kiểm soát các yếu tố nhiễu.

Hệ số xác định R bình phương trong tương quan tuyến tính có ý nghĩa gì?

Hệ số xác định là bình phương của hệ số tương quan Pearson (R2 = r2), biểu thị tỷ lệ phần trăm phương sai của biến phụ thuộc được giải thích trực tiếp bởi biến độc lập trong mô hình hồi quy tuyến tính đơn biến.

Tài liệu tham khảo

  1. Pearson, K. (1896). VII. Mathematical contributions to the theory of evolution.—III. Regression, heredity, and panmixia. Philosophical Transactions of the Royal Society of London. Series A, 187, 253-318. DOI: 10.1098/rsta.1896.0007
  2. Spearman, C. (1904). The Proof and Measurement of Association between Two Things. The American Journal of Psychology, 15(1), 72-101. DOI: 10.2307/1412159
  3. Kendall, M. G. (1938). A NEW MEASURE OF RANK CORRELATION. Biometrika, 30(1-2), 81-93. DOI: 10.1093/biomet/30.1-2.81
  4. Aldrich, J. (1995). Correlations Genuine and Spurious in Pearson and Yule. Statistical Science, 10(4), 364-376. DOI: 10.1214/ss/1177009870