Nghiên cứu khảo sát là phương pháp nghiên cứu định lượng thu thập dữ liệu bằng cách đặt cùng một bộ câu hỏi chuẩn hoá cho một mẫu được chọn từ tổng thể mục tiêu, rồi dùng thống kê để suy rộng kết quả về tổng thể đó. Điểm phân biệt của phương pháp không nằm ở việc "hỏi", mà ở hai điều kiện đi kèm: công cụ đo được chuẩn hoá cho mọi người trả lời, và mẫu được chọn theo quy tắc cho phép tính sai số suy rộng. Mục từ này trình bày cấu phần của một cuộc khảo sát, cách phân loại, kỹ thuật chọn mẫu, khung sai số tổng hợp, chuẩn báo cáo tỷ lệ phản hồi, cùng thực tiễn tại Việt Nam.
Khái niệm và ranh giới
Trong tiếng Anh, phương pháp này được gọi là survey research; sản phẩm cụ thể của nó là một cuộc khảo sát (survey). Ranh giới của phương pháp thường bị hiểu nhầm, nên cần tách bạch với ba khái niệm lân cận.
Thứ nhất, khảo sát khác điều tra toàn bộ (census). Điều tra toàn bộ tiếp cận mọi đơn vị của tổng thể nên không có sai số chọn mẫu; khảo sát chỉ tiếp cận một phần và luôn kèm sai số chọn mẫu định lượng được. Tổng điều tra dân số và nhà ở năm 2019 của Việt Nam là ví dụ chứa cả hai: phần toàn bộ đếm gần 26,9 triệu hộ, còn phần điều tra mẫu 9% số hộ thu thập các chỉ tiêu chi tiết hơn.
Thứ hai, khảo sát khác thực nghiệm (experiment). Nhà nghiên cứu khảo sát quan sát biến số như chúng vốn có, không phân bổ ngẫu nhiên điều kiện can thiệp. Vì vậy khảo sát cắt ngang chỉ chứng minh được liên hệ thống kê, không đủ để kết luận nhân quả — trừ khi thiết kế được bổ sung bằng đo lặp theo thời gian hoặc bằng thí nghiệm nhúng trong bảng hỏi (survey experiment).
Thứ ba, khảo sát khác phỏng vấn sâu và thảo luận nhóm. Hai phương pháp định tính này ưu tiên chiều sâu và tính linh hoạt của cuộc hỏi; khảo sát ưu tiên tính so sánh được giữa các đơn vị, nên phải hy sinh sự linh hoạt để giữ câu hỏi giống hệt nhau.
Cấu phần của một cuộc khảo sát
Một thiết kế khảo sát đầy đủ gồm sáu cấu phần, mỗi cấu phần là một nguồn sai số riêng.
- Tổng thể mục tiêu (target population): tập hợp các đơn vị mà kết luận hướng tới, phải định nghĩa rõ theo đơn vị, không gian và thời gian — ví dụ "người từ 18 tuổi trở lên thường trú tại Việt Nam ngày 1/4/2019".
- Khung mẫu (sampling frame): danh sách hoặc cơ chế thực tế dùng để tiếp cận tổng thể — danh bạ thuê bao, danh sách địa bàn điều tra, danh sách sinh viên. Khoảng lệch giữa khung mẫu và tổng thể mục tiêu là sai số bao phủ.
- Thiết kế mẫu: quy tắc rút đơn vị từ khung mẫu và xác suất chọn tương ứng.
- Công cụ đo: bảng hỏi, thang đo, hướng dẫn điều tra viên.
- Phương thức thu thập: trực tiếp, điện thoại, thư, trực tuyến, hoặc kết hợp nhiều phương thức.
- Quy trình ước lượng: gán trọng số, hiệu chỉnh không phản hồi, tính ước lượng điểm và khoảng tin cậy.
Bỏ qua cấu phần nào cũng làm hỏng khả năng suy rộng. Một bảng hỏi thiết kế tốt nhưng chạy trên khung mẫu lệch vẫn cho kết quả lệch, và không có kỹ thuật thống kê nào ở bước sau cứu được.
Phân loại
Khảo sát được phân loại theo hai trục độc lập: chiều thời gian và phương thức tiếp xúc.
Theo chiều thời gian
| Loại | Cách đo | Trả lời được câu hỏi | Hạn chế chính |
|---|---|---|---|
| Cắt ngang (cross-sectional) | Đo một lần tại một thời điểm | Hiện trạng, tỷ lệ, liên hệ giữa các biến | Không xác lập được trình tự thời gian nên khó suy nhân quả |
| Lặp lại (repeated cross-sectional) | Đo nhiều đợt trên các mẫu độc lập | Xu hướng ở cấp tổng thể | Không theo dõi được thay đổi ở cấp cá nhân |
| Theo dõi dọc (panel/longitudinal) | Đo nhiều đợt trên cùng những người trả lời | Thay đổi ở cấp cá nhân, trình tự thời gian | Hao hụt mẫu qua các đợt; hiệu ứng do được hỏi lặp lại |
Theo phương thức thu thập
| Phương thức | Ưu điểm | Nhược điểm | Rủi ro sai số nổi bật |
|---|---|---|---|
| Phỏng vấn trực tiếp tại hộ | Bảng hỏi dài, câu hỏi phức tạp, quan sát bổ sung | Chi phí và thời gian cao nhất | Hiệu ứng điều tra viên với câu hỏi nhạy cảm |
| Điện thoại | Triển khai nhanh, kiểm soát tập trung | Bảng hỏi phải ngắn, không dùng được câu hỏi có hình | Bao phủ lệch khi khung mẫu là danh bạ cố định |
| Thư giấy | Riêng tư, phù hợp câu hỏi nhạy cảm | Chu kỳ dài, không kiểm soát được ai điền | Tỷ lệ phản hồi thấp |
| Trực tuyến | Chi phí biên gần bằng không, dữ liệu vào thẳng cơ sở dữ liệu | Phụ thuộc khả năng tiếp cận Internet | Tự chọn tham gia; người trả lời trùng lặp hoặc tự động |
| Kết hợp nhiều phương thức | Bù được bao phủ cho nhau, nâng tỷ lệ phản hồi | Vận hành phức tạp | Hiệu ứng phương thức làm câu trả lời khác nhau giữa các kênh |
Cách chia phổ biến trên nhiều tài liệu phổ thông — "khảo sát mô tả, khảo sát phân tích, khảo sát so sánh, nghiên cứu trường hợp" — trộn lẫn hai thứ khác nhau là mục đích phân tích và thiết kế nghiên cứu. Nghiên cứu trường hợp không phải một loại khảo sát, mà là một thiết kế riêng thường dùng dữ liệu định tính.
Chọn mẫu
Chọn mẫu quyết định việc kết quả có suy rộng được hay không. Ranh giới quan trọng nhất là giữa mẫu xác suất và mẫu phi xác suất: chỉ mẫu xác suất — nơi mọi đơn vị có xác suất được chọn đã biết và khác không — mới cho phép tính sai số chuẩn theo lý thuyết chọn mẫu.
| Kỹ thuật | Nhóm | Nguyên tắc | Dùng khi |
|---|---|---|---|
| Ngẫu nhiên đơn giản | Xác suất | Mọi đơn vị có xác suất chọn bằng nhau | Khung mẫu đầy đủ, tổng thể nhỏ và tập trung |
| Hệ thống | Xác suất | Chọn theo bước nhảy cố định từ điểm xuất phát ngẫu nhiên | Danh sách dài, không có chu kỳ ẩn |
| Phân tầng | Xác suất | Chia tổng thể thành tầng thuần nhất rồi chọn trong từng tầng | Cần đảm bảo đại diện cho từng nhóm nhỏ |
| Chùm nhiều giai đoạn | Xác suất | Chọn địa bàn trước, chọn hộ hoặc người trong địa bàn sau | Tổng thể trải rộng địa lý, không có danh sách cá nhân |
| Thuận tiện | Phi xác suất | Lấy ai dễ tiếp cận | Thử nghiệm bảng hỏi, khám phá sơ bộ |
| Hạn ngạch | Phi xác suất | Lấp đầy chỉ tiêu theo nhóm nhân khẩu | Nghiên cứu thị trường, thời hạn gấp |
| Quả cầu tuyết | Phi xác suất | Người trả lời giới thiệu người tiếp theo | Tổng thể ẩn, khó tiếp cận |
Khảo sát quy mô lớn hiếm khi dùng ngẫu nhiên đơn giản. Thiết kế thực tế thường là phân tầng kết hợp chùm nhiều giai đoạn: Tổng điều tra dân số và nhà ở năm 2019 chọn mẫu phân tầng hai giai đoạn để bảo đảm tính đại diện của chỉ tiêu tới cấp huyện. Thiết kế phức hợp làm sai số chuẩn lớn hơn so với ngẫu nhiên đơn giản cùng cỡ mẫu; tỷ số giữa hai phương sai gọi là hiệu ứng thiết kế và phải được tính đến khi phân tích.
Cỡ mẫu và biên sai số
Với ước lượng một tỷ lệ trong tổng thể lớn, sai số chuẩn của tỷ lệ mẫu bằng căn bậc hai của tích tỷ lệ nhân phần bù, chia cho cỡ mẫu. Biên sai số ở mức tin cậy 95% xấp xỉ 1,96 lần sai số chuẩn đó. Hệ quả thực tiễn quan trọng: biên sai số giảm theo căn bậc hai của cỡ mẫu, nên muốn thu hẹp một nửa phải tăng cỡ mẫu gấp bốn lần.
| Cỡ mẫu | Biên sai số 95% khi tỷ lệ gần 50% |
|---|---|
| 100 | khoảng ±9,8 điểm phần trăm |
| 400 | khoảng ±4,9 điểm phần trăm |
| 1.000 | khoảng ±3,1 điểm phần trăm |
| 2.400 | khoảng ±2,0 điểm phần trăm |
Bảng trên chỉ tính sai số chọn mẫu và chỉ đúng với mẫu xác suất. Con số này không phản ánh sai số do không phản hồi, do đo lường hay do bao phủ — vốn thường lớn hơn và không hiện lên trong bất kỳ công thức nào.
Thiết kế bảng hỏi
Câu hỏi khảo sát là một công cụ đo. Người trả lời phải hiểu câu hỏi, nhớ lại thông tin, hình thành phán đoán, rồi ánh xạ phán đoán đó vào các phương án cho sẵn; sai lệch có thể xuất hiện ở bất kỳ bước nào.
Dạng câu hỏi
- Câu hỏi đóng: phương án cho sẵn, dễ mã hoá và so sánh, nhưng bó hẹp câu trả lời vào khung của người thiết kế.
- Câu hỏi mở: giữ được cách diễn đạt của người trả lời, chi phí mã hoá cao.
- Thang Likert: đo mức độ đồng ý trên dãy bậc đối xứng, thường 5 hoặc 7 bậc. Số bậc chẵn buộc người trả lời chọn về một phía, số bậc lẻ cho phép giữ trung lập.
- Thang phân biệt ngữ nghĩa: định vị giữa hai tính từ trái nghĩa.
- Câu hỏi xếp hạng: buộc so sánh trực tiếp, nhưng gánh nặng nhận thức tăng nhanh khi danh mục dài.
Lỗi thiết kế thường gặp
- Câu hỏi kép: hỏi hai điều trong một câu ("Anh/chị có hài lòng với giá và chất lượng dịch vụ không?") khiến câu trả lời không diễn giải được.
- Câu hỏi dẫn dắt: cài sẵn phán đoán vào cách diễn đạt.
- Giả định không kiểm tra: hỏi tần suất một hành vi mà chưa hỏi người đó có thực hiện hành vi ấy không.
- Thiên lệch đồng ý: xu hướng chọn "đồng ý" bất kể nội dung; giảm bớt bằng cách trộn câu phát biểu đảo chiều.
- Trả lời cho qua: khi bảng hỏi quá dài hoặc động lực thấp, người trả lời chọn phương án đầu tiên chấp nhận được thay vì cân nhắc đầy đủ.
- Thiên lệch mong muốn xã hội: khai báo lệch về phía chuẩn mực xã hội ở các chủ đề như thu nhập, rượu bia, hành vi bầu cử.
Trước khi triển khai chính thức, bảng hỏi cần được thử nghiệm. Hai kỹ thuật phổ biến là phỏng vấn nhận thức — yêu cầu vài người trả lời nói to suy nghĩ khi đọc từng câu — và khảo sát thử trên quy mô nhỏ để kiểm tra thời lượng, tỷ lệ bỏ giữa chừng và phân bố câu trả lời.
Độ tin cậy và hiệu lực
Một thang đo tốt cần cả hai thuộc tính. Độ tin cậy là mức nhất quán của phép đo khi lặp lại; với thang nhiều mục thường báo cáo hệ số nhất quán nội tại Cronbach alpha, và ngưỡng 0,7 hay được dùng làm mốc chấp nhận trong nghiên cứu ứng dụng. Hiệu lực là mức mà thang đo thực sự đo đúng khái niệm cần đo, gồm hiệu lực nội dung, hiệu lực cấu trúc và hiệu lực tiêu chí. Một thang đo có thể rất tin cậy mà vẫn không có hiệu lực: nó đo ổn định một thứ khác với thứ ta muốn đo.
Khung sai số tổng hợp
Chất lượng khảo sát được đánh giá theo khung sai số tổng hợp (total survey error), chia sai lệch thành hai nhánh: sai số đại diện và sai số đo lường.
| Nhánh | Nguồn sai số | Xuất hiện khi | Cách giảm |
|---|---|---|---|
| Đại diện | Sai số bao phủ | Khung mẫu bỏ sót hoặc thừa so với tổng thể mục tiêu | Cập nhật khung mẫu; kết hợp nhiều khung |
| Sai số chọn mẫu | Chỉ quan sát một phần tổng thể | Tăng cỡ mẫu; phân tầng hợp lý | |
| Sai số không phản hồi | Người được chọn không tham gia và khác biệt có hệ thống với người tham gia | Nhiều lần liên hệ lại; gán trọng số hiệu chỉnh | |
| Đo lường | Sai số do công cụ và người trả lời | Câu hỏi khó hiểu, nhớ lại sai, khai báo lệch | Thử nghiệm nhận thức; chọn phương thức riêng tư cho câu nhạy cảm |
| Sai số xử lý | Nhập liệu, mã hoá, gán trọng số sai | Kiểm tra logic tự động; nhập liệu kép |
Giá trị của khung này nằm ở chỗ nó buộc người nghiên cứu phân bổ nguồn lực theo nguồn sai số lớn nhất. Tăng cỡ mẫu chỉ tác động lên một ô trong bảng, trong khi khoản chi đó có thể hữu ích hơn nếu dành cho việc thử nghiệm bảng hỏi hoặc liên hệ lại người chưa trả lời.
Tỷ lệ phản hồi và sai lệch do không phản hồi
Tỷ lệ phản hồi là tỷ số giữa số phỏng vấn hoàn thành và số đơn vị đủ điều kiện trong mẫu. Do có nhiều cách xử lý trường hợp trả lời dở dang hoặc chưa rõ điều kiện, Hiệp hội Nghiên cứu Dư luận Công chúng Hoa Kỳ (AAPOR) chuẩn hoá sáu công thức từ RR1 đến RR6 trong tài liệu Standard Definitions, ấn bản thứ mười năm 2023. RR1 là mức thấp nhất, chỉ tính phỏng vấn hoàn thành; RR2 tính thêm phỏng vấn dở dang; RR3 và RR4 ước lượng phần trường hợp chưa rõ điều kiện thực sự đủ điều kiện. Vì các công thức cho ra con số khác nhau trên cùng một bộ dữ liệu, báo cáo phải nêu rõ đang dùng công thức nào.
Một hiểu lầm phổ biến là coi tỷ lệ phản hồi cao đồng nghĩa với ước lượng chính xác. Phân tích của Groves (2006) trên nhiều khảo sát hộ gia đình cho thấy quan hệ giữa tỷ lệ không phản hồi và độ lệch của ước lượng yếu và không nhất quán: sai lệch phụ thuộc vào mức tương quan giữa xu hướng tham gia và biến cần đo, chứ không phụ thuộc riêng vào tỷ lệ. Một khảo sát đạt 70% phản hồi vẫn có thể lệch nặng nếu nhóm không trả lời khác biệt có hệ thống ở đúng biến quan tâm.
Phân tích và báo cáo kết quả
Dữ liệu khảo sát hiếm khi phân tích được ở dạng thô. Ba bước xử lý gần như bắt buộc với mẫu phức hợp:
- Trọng số thiết kế: nghịch đảo xác suất được chọn, bù cho việc các nhóm được chọn với xác suất khác nhau.
- Hiệu chỉnh không phản hồi: điều chỉnh trọng số theo nhóm có tỷ lệ tham gia khác nhau.
- Hiệu chuẩn theo tổng thể: kéo phân bố mẫu về khớp với các phân bố đã biết từ nguồn ngoài, thường là số liệu dân số chính thức.
Ước lượng phương sai phải phản ánh thiết kế mẫu. Dùng công thức của mẫu ngẫu nhiên đơn giản cho dữ liệu chọn chùm nhiều giai đoạn sẽ cho khoảng tin cậy hẹp hơn thực tế và mức ý nghĩa quá lạc quan. Các gói phần mềm thống kê phổ biến đều có mô-đun riêng cho dữ liệu khảo sát phức hợp: lệnh svyset và họ lệnh svy trong Stata, gói survey trong R, mô-đun Complex Samples trong SPSS.
Báo cáo minh bạch cần nêu tối thiểu: định nghĩa tổng thể mục tiêu, khung mẫu, thiết kế mẫu và cỡ mẫu, thời gian thực địa, phương thức thu thập, công thức tỷ lệ phản hồi kèm giá trị, cách gán trọng số, và nguyên văn các câu hỏi được trích dẫn kết quả.
Ứng dụng tại Việt Nam
Hệ thống thống kê nhà nước là nơi phương pháp khảo sát được áp dụng ở quy mô lớn nhất. Tổng điều tra dân số và nhà ở năm 2019 ghi nhận 96.208.984 người tại thời điểm 0 giờ ngày 1/4/2019, đồng thời chạy một cuộc điều tra mẫu 9% số hộ — khoảng 8,2 triệu người trong hơn 2,3 triệu hộ — để thu thập các chỉ tiêu chi tiết về sinh, chết, di cư, lao động và điều kiện sống. Đây cũng là kỳ tổng điều tra đầu tiên chuyển sang thu thập bằng phiếu điện tử trên thiết bị di động ở gần như toàn bộ địa bàn, thay cho phiếu giấy.
Bên cạnh tổng điều tra, Cục Thống kê duy trì các cuộc khảo sát định kỳ như Khảo sát mức sống dân cư, nguồn số liệu chính thức cho tỷ lệ nghèo đa chiều và bất bình đẳng thu nhập, và Điều tra lao động việc làm hằng quý, nguồn tính tỷ lệ thất nghiệp và thiếu việc làm. Ở khu vực nghiên cứu chính sách, Chỉ số Hiệu quả quản trị và hành chính công cấp tỉnh (PAPI) khảo sát hằng năm người dân trên toàn bộ 63 tỉnh, thành phố về trải nghiệm thực tế với dịch vụ công.
Ở quy mô nhỏ hơn, khảo sát trực tuyến qua biểu mẫu miễn phí đã trở thành mặc định cho luận văn và nghiên cứu thị trường tại Việt Nam. Rủi ro phương pháp lớn nhất của thực hành này không nằm ở công cụ mà ở khung mẫu: một liên kết phát tán qua mạng xã hội tạo ra mẫu tự chọn, trong đó xác suất được chọn không xác định được. Kết quả loại này mô tả được nhóm đã trả lời nhưng không suy rộng hợp lệ ra "người tiêu dùng Việt Nam", dù cỡ mẫu có lớn đến đâu — và biên sai số in kèm trong báo cáo, nếu có, không mang ý nghĩa thống kê nào.
Hạn chế và vấn đề còn mở
Tỷ lệ phản hồi của khảo sát điện thoại và khảo sát hộ gia đình giảm liên tục ở nhiều quốc gia trong ba thập niên qua, kéo theo chi phí trên mỗi phỏng vấn hoàn thành tăng lên. Ngành nghiên cứu phản ứng theo hai hướng đối lập: xây dựng panel trực tuyến dựa trên nền tảng chọn mẫu xác suất — mời tham gia bằng thư hoặc trực tiếp rồi duy trì lâu dài — hoặc chấp nhận mẫu phi xác suất giá rẻ rồi hiệu chỉnh mạnh bằng mô hình thống kê. Hướng thứ hai chưa có nền tảng lý thuyết tương đương để tính sai số, và độ chính xác của nó phụ thuộc vào giả định về mô hình hiệu chỉnh.
Một vấn đề mới của khảo sát trực tuyến là chất lượng người trả lời: trả lời cẩu thả để nhận thù lao, một người tạo nhiều tài khoản, và gần đây là câu trả lời sinh bởi công cụ tự động cho các câu hỏi mở. Các biện pháp đối phó hiện nay — câu hỏi kiểm tra sự chú ý, phân tích thời gian trả lời, đối chiếu dấu vết kỹ thuật — đều mang tính phát hiện sau, chưa giải quyết được nguyên nhân.
Cuối cùng, ranh giới giữa khảo sát và dữ liệu hành chính đang mờ đi. Nhiều cơ quan thống kê chuyển sang mô hình kết hợp: lấy dữ liệu đăng ký, giao dịch, viễn thông làm nền, rồi dùng khảo sát quy mô nhỏ để hiệu chỉnh và bổ sung các biến mà dữ liệu hành chính không có, đặc biệt là thái độ và nhận thức — nhóm biến mà đến nay chỉ có cách hỏi trực tiếp mới đo được.