Từ điển học thuật Khoa học tự nhiên

Nghiên cứu liên kết toàn bộ bộ gen (GWAS) là gì?

Tiếng Anhgenome-wide association study

Tên gọi khácGWASnghiên cứu liên kết toàn bộ hệ gennghiên cứu liên kết toàn hệ gen

Nghiên cứu liên kết toàn bộ bộ gen là phương pháp nghiên cứu di truyền học dịch tễ học khảo sát các biến thể di truyền trên toàn bộ hệ gen nhằm xác định mối liên kết có ý nghĩa thống kê với bệnh lý hoặc tính trạng kiểu hình.

Cập nhật 6/10/2026

Nghiên cứu liên kết toàn bộ bộ gen là phương pháp nghiên cứu di truyền học dịch tễ học nhằm khảo sát các biến thể di truyền trên toàn bộ hệ gen ở nhiều cá thể khác nhau để xác định những mối liên kết có ý nghĩa thống kê với một bệnh lý hoặc tính trạng kiểu hình cụ thể. Phương pháp này tiếp cận theo hướng không định kiến trước về gen đích, cho phép phát hiện các vùng gen mới liên quan đến các tính trạng phức tạp. Bài viết này trình bày cơ sở sinh học, mô hình phân tích thống kê, quy trình thực nghiệm, các ứng dụng y sinh học và những giới hạn phương pháp luận của nghiên cứu liên kết toàn bộ bộ gen.

Bản chất khoa học và nguyên lý sinh học

Hệ gen người chứa hàng triệu điểm đa hình di truyền, trong đó phổ biến nhất là đa hình đơn nucleotide (single nucleotide polymorphism, SNP). Phần lớn các tính trạng phức tạp ở người như chiều cao, huyết áp, hoặc các bệnh mạn tính không lây nhiễm như đái tháo đường và bệnh tim mạch, không tuân theo quy luật di truyền đơn gen Mendel đơn giản mà chịu sự chi phối đa gen từ hàng trăm đến hàng nghìn biến thể rải rác trên hệ gen.

Nguyên lý cốt lõi của nghiên cứu liên kết toàn bộ bộ gen dựa trên hiện tượng mất cân bằng liên kết (linkage disequilibrium, LD). Mất cân bằng liên kết phản ánh xu hướng các allele tại những vị trí gần nhau trên cùng một nhiễm sắc thể cùng được di truyền sang thế hệ sau với tần suất cao hơn mức kỳ vọng ngẫu nhiên. Nhờ hiện tượng này, một nghiên cứu không cần phải giải trình tự hoặc kiểm tra từng nucleotide đơn lẻ trên hệ gen; thay vào đó, việc khảo sát một tập hợp biến thể đại diện (tag SNP) có thể gián tiếp ghi nhận tín hiệu của các biến thể nhân quả lân cận nằm trong cùng một khối liên kết haplotype.

Trước khi phương pháp này ra đời, di truyền học chủ yếu dựa vào phân tích liên kết phả hệ trong các gia đình có nhiều người mắc bệnh hoặc các nghiên cứu gen ứng viên dựa trên giả thuyết sinh học định trước. Tuy nhiên, nghiên cứu gen ứng viên thường gặp nhược điểm lớn là tỷ lệ dương tính giả cao và khả năng lặp lại thấp. Nghiên cứu liên kết toàn bộ bộ gen đã khắc phục nhược điểm này bằng cách khảo sát toàn diện và khách quan trên phạm vi toàn hệ gen mà không cần giả thuyết tiên nghiệm về chức năng của từng locus.

Quy trình thực hiện nghiên cứu liên kết toàn bộ bộ gen

Một nghiên cứu liên kết toàn thể gen tiêu chuẩn trải qua các giai đoạn chặt chẽ từ thu thập mẫu, kiểm soát chất lượng dữ liệu, phân tích liên kết thống kê cho đến kiểm chứng thực nghiệm.

1. Thiết kế nghiên cứu và thu thập mẫu

Có hai mô hình thiết kế mẫu phổ biến:

  • Mô hình bệnh - chứng (case-control study): So sánh tần số xuất hiện của các allele giữa nhóm cá thể mắc bệnh và nhóm cá thể đối chứng khỏe mạnh có đặc điểm nhân khẩu học tương đồng.
  • Mô hình đoàn hệ hoặc tính trạng liên tục (cohort study): Đánh giá mối tương quan giữa liều lượng allele với các chỉ số đo lường liên tục như huyết áp, nồng độ glucose huyết tương, hoặc chỉ số khối cơ thể.

2. Xác định kiểu gen và kiểm soát chất lượng dữ liệu

Dữ liệu kiểu gen ban đầu được tạo ra từ các chip vi mảng lai ghép nucleotide hoặc công nghệ giải trình tự hệ gen thế hệ mới. Để loại bỏ các sai số kỹ thuật, quy trình kiểm soát chất lượng (quality control, QC) lọc bỏ các biến thể và mẫu không đạt chuẩn theo các tiêu chí:

  • Tỷ lệ đọc thành công (call rate) của mẫu và của từng biến thể thấp.
  • Sai lệch so với trạng thái cân bằng di truyền Hardy-Weinberg trong nhóm đối chứng.
  • Tần số allele phụ (minor allele frequency, MAF) quá thấp, thường loại bỏ các biến thể cực hiếm để đảm bảo độ tin cậy thống kê.
  • Quan hệ huyết thống không mong muốn hoặc mẫu trùng lặp giữa các cá thể tham gia nghiên cứu.

3. Suy diễn kiểu gen

Sau khi lọc dữ liệu kiểu gen thực nghiệm, các nhà nghiên cứu thường áp dụng kỹ thuật suy diễn kiểu gen (genotype imputation) dựa trên các bảng tham chiếu hệ gen quy mô lớn. Kỹ thuật này sử dụng cấu trúc mất cân bằng liên kết của quần thể để ước tính kiểu gen của hàng triệu biến thể chưa được đo trực tiếp trên chip vi mảng, giúp đồng nhất hóa dữ liệu và gia tăng mật độ khảo sát.

Mô hình phân tích thống kê và kiểm soát sai số

Phân tích liên kết thống kê trong nghiên cứu toàn hệ gen thường kiểm định từng biến thể một cách độc lập với kiểu hình quan tâm.

Mô hình hồi quy đơn biến

Đối với tính trạng liên tục, mô hình hồi quy tuyến tính được sử dụng để ước tính mối liên hệ giữa kiểu gen và kiểu hình:

y=μ+βx+ϵy = \mu + \beta x + \epsilon

Trong công thức trên, yy là giá trị kiểu hình được đo lường, μ\mu là hệ số chặn đại diện cho giá trị trung bình quần thể, xx là số lượng allele hiệu ứng (thường nhận giá trị bằng không, một, hoặc hai theo mô hình cộng gộp), β\beta là hệ số góc biểu thị kích thước hiệu ứng di truyền, và ϵ\epsilon là sai số ngẫu nhiên của mô hình.

Đối với kiểu hình nhị phân trong mô hình bệnh - chứng, mô hình hồi quy logistic được áp dụng để tính toán tỷ số chênh (odds ratio) phản ánh mức độ tăng nguy cơ mắc bệnh liên quan đến từng bản sao của allele rủi ro.

Ngưỡng ý nghĩa thống kê toàn hệ gen

Do một nghiên cứu thực hiện kiểm định đồng thời trên hàng triệu vị trí biến thể, nguy cơ phát sinh dương tính giả do bài toán kiểm định đa giả thuyết (multiple testing problem) là rất lớn. Nếu áp dụng ngưỡng giá trị p truyền thống bằng mức sai sót loại I là 0,05, hàng nghìn tín hiệu ngẫu nhiên sẽ bị ngộ nhận là có ý nghĩa thực sự.

Theo Uffelmann và cộng sự (2021), ngưỡng ý nghĩa thống kê toàn hệ gen tiêu chuẩn được cộng đồng khoa học quốc tế chấp thuận rộng rãi là:

p<5×10−8p < 5 \times 10^{-8}

Ngưỡng này xuất phát từ phép hiệu chỉnh Bonferroni nghiêm ngặt đối với 1.000.000 kiểm định biến thể độc lập trong hệ gen người gốc Âu với mức sai sót loại I bằng 0,05. Mọi biến thể có giá trị p lớn hơn ngưỡng này đều không được coi là đạt mức ý nghĩa thống kê toàn hệ gen, trừ khi có bằng chứng tái lặp độc lập.

Kiểm soát hiện tượng phân tầng quần thể

Hiện tượng phân tầng quần thể (population stratification) xảy ra khi mẫu nghiên cứu chứa các phân nhóm có nguồn gốc tổ tiên khác nhau và tần số allele cũng như tỷ lệ mắc bệnh ngẫu nhiên khác biệt giữa các nhóm. Nếu không kiểm soát, sự khác biệt nền này sẽ dẫn đến những liên kết giả mạo không phản ánh bản chất sinh học. Các nghiên cứu hiện đại sử dụng phân tích thành phần chính (principal component analysis, PCA) hoặc mô hình hỗn hợp tuyến tính (linear mixed models, LMM) để đưa các trục nguồn gốc di truyền vào mô hình như các biến đồng biến kiểm soát.

Trực quan hóa kết quả: Biểu đồ Manhattan và biểu đồ Q-Q

Theo Uffelmann và cs. (2021), kết quả của nghiên cứu liên kết toàn bộ bộ gen thường được đánh giá trực quan qua hai biểu đồ đặc trưng:

  • Biểu đồ Manhattan: Trục hoành biểu diễn vị trí các biến thể sắp xếp dọc theo các nhiễm sắc thể từ đầu đến cuối hệ gen; trục tung biểu diễn giá trị đối số âm logarit cơ số mười của giá trị p, cụ thể là −log⁡10(p)-\log_{10}(p). Các đỉnh cao vượt qua đường ngưỡng p<5×10−8p < 5 \times 10^{-8} nổi bật như các tòa nhà chọc trời, đánh dấu các vùng gen liên kết mạnh với kiểu hình.
  • Biểu đồ lượng tử - lượng tử (quantile-quantile plot, Q-Q plot): So sánh phân bố quan sát được của các giá trị p với phân bố kỳ vọng dưới giả thuyết vô hiệu, cho phép phát hiện sớm hiện tượng lạm phát giá trị p do phân tầng quần thể hoặc sai sót kỹ thuật.

Lịch sử hình thành và những cột mốc phát triển

Nghiên cứu liên kết toàn bộ bộ gen bắt đầu bùng nổ khi công nghệ vi mảng nucleotide và dữ liệu dự án Bản đồ Haplotype Quốc tế (HapMap Project) cung cấp đầy đủ danh mục biến thể phổ biến.

Một cột mốc lịch sử mang tính bước ngoặt được xác lập vào năm 2007 bởi liên minh Wellcome Trust Case Control Consortium (2007). Nghiên cứu quy mô lớn này đã khảo sát 14.000 ca bệnh thuộc 7 bệnh lý phổ biến (khoảng 2.000 ca cho mỗi bệnh) cùng 3.000 đối chứng chia sẻ. Công trình đã xác định thành công 24 tín hiệu liên kết độc lập ở ngưỡng p < 5 x 10^-7 cho các bệnh tự miễn, đái tháo đường và bệnh mạch vành, chứng minh tính khả thi và sức mạnh vượt trội của phương pháp này.

Đánh giá chặng đường 10 năm phát triển từ năm 2005 đến năm 2017, Visscher và cộng sự (2017) ghi nhận phương pháp đã xác định khoảng 10.000 locus liên kết mạnh với các tính trạng phức tạp ở ngưỡng p < 5 x 10^-8. Một phát hiện quan trọng được Visscher và cs. (2017) chỉ ra là phần lớn các biến thể có ý nghĩa thống kê không nằm trong các đoạn exon mã hóa protein mà phân bố ở các vùng không mã hóa, đóng vai trò điều hòa biểu hiện gen.

Nhằm lưu trữ và chuẩn hóa khối lượng dữ liệu khổng lồ từ các công bố trên toàn cầu, cơ sở dữ liệu GWAS Catalog được thành lập và vận hành bởi Viện Nghiên cứu Hệ gen Người Quốc gia Hoa Kỳ (NHGRI) cùng Viện Tin sinh học Châu Âu (EMBL-EBI). Theo tổng quan của Tam và cộng sự (2019), cơ sở dữ liệu GWAS Catalog đã ghi nhận hơn 50.000 liên kết giữa các biến thể di truyền và tính trạng phức tạp hoặc bệnh lý.

So sánh với các phương pháp nghiên cứu di truyền khác

Để hiểu rõ vị trí của nghiên cứu liên kết toàn bộ bộ gen trong di truyền học hiện đại, bảng dưới đây so sánh các phương pháp tiếp cận chính:

Phương pháp Phạm vi khảo sát Giả thuyết định trước Đối tượng biến thể chủ yếu Cường độ hiệu ứng phát hiện
Nghiên cứu gen ứng viên Vài gen chọn lọc Bắt buộc có giả thuyết sinh học Biến thể phổ biến trong gen đích Thường trung bình đến lớn
Phân tích liên kết phả hệ Toàn bộ hệ gen trong gia đình Không cần giả thuyết về gen Biến thể hiếm có hiệu ứng lớn Hiệu ứng rất mạnh (kiểu Mendel)
Nghiên cứu liên kết toàn bộ bộ gen (GWAS) Toàn bộ hệ gen quần thể Không cần giả thuyết tiên nghiệm Biến thể phổ biến và bán phổ biến Hiệu ứng nhỏ đến trung bình
Giải trình tự toàn bộ vùng mã hóa (WES) Khoảng một phần trăm hệ gen (vùng exon) Không định kiến trong vùng mã hóa Biến thể hiếm và đột biến mới Hiệu ứng trung bình đến rất lớn

Ứng dụng thực tiễn trong y sinh học và bối cảnh Việt Nam

Nghiên cứu liên kết toàn bộ bộ gen đã chuyển giao nhiều thành tựu quan trọng vào thực tiễn lâm sàng và nghiên cứu y dược học:

  • Phát triển thuốc mới: Việc định vị các đích phân tử có bằng chứng di truyền vững chắc từ nghiên cứu liên kết toàn hệ gen giúp nâng cao khả năng thành công của các ứng viên thuốc khi bước vào các pha thử nghiệm lâm sàng.
  • Điểm nguy cơ đa gen (polygenic risk score, PRS): Theo Uffelmann và cs. (2021), điểm nguy cơ đa gen tổng hợp kích thước hiệu ứng từ hàng nghìn đến hàng triệu biến thể di truyền trên toàn hệ gen để lượng hóa nguy cơ mắc bệnh cho từng cá thể, hỗ trợ phân tầng nguy cơ và can thiệp lối sống sớm.
  • Dược lý di truyền: Phát hiện các biến thể ảnh hưởng đến chuyển hóa thuốc hoặc dự báo các phản ứng có hại nghiêm trọng của thuốc trên các nhóm bệnh nhân cụ thể.

Dữ liệu hệ gen tại Việt Nam

Trong một thời gian dài, phần lớn dữ liệu di truyền học quốc tế tập trung vào các quần thể phương Tây, tạo nên rào cản lớn khi chuyển giao các mô hình điểm nguy cơ đa gen sang người Việt Nam. Để giải quyết khoảng trống này, các nhà khoa học trong nước đã nỗ lực giải mã cấu trúc di truyền của quần thể bản địa.

Một đóng góp quan trọng là công trình của Tran và cộng sự (2026) về dự án 1000 Hệ gen người Việt (VN1K) công bố trên tạp chí Nature Communications. Nhóm nghiên cứu đã phân tích dữ liệu giải trình tự hệ gen từ 1.011 cá thể người Việt không cùng huyết thống tại 53 tỉnh thành trên cả nước để xây dựng Hệ gen tham chiếu người Việt VPR. Nghiên cứu của Tran và cs. (2026) đã phát hiện hơn 42 triệu biến thể di truyền trong quần thể người Việt, trong đó xác định được khoảng 8,5 triệu biến thể di truyền mới chưa từng được ghi nhận trong các cơ sở dữ liệu quốc tế. Bộ dữ liệu chuẩn này cung cấp hệ quy chiếu chất lượng cao cho việc thiết kế các chip vi mảng chuyên biệt và nâng cao độ chính xác khi suy diễn kiểu gen trong các nghiên cứu liên kết toàn hệ gen tại Việt Nam.

Hạn chế và những vấn đề còn mở

Mặc dù đạt được nhiều thành tựu lớn, phương pháp nghiên cứu liên kết toàn bộ bộ gen vẫn đối mặt với những giới hạn cố hữu về mặt lý thuyết và thực hành:

Hiện tượng di truyền thiếu hụt

Theo tổng quan của Tam và cộng sự (2019), hiện tượng di truyền thiếu hụt (missing heritability) phản ánh sự chênh lệch giữa độ di truyền ước tính từ nghiên cứu gia đình và phương sai giải thích được bởi các biến thể đơn nucleotide phổ biến. Mặc dù các nghiên cứu đã phát hiện hàng nghìn biến thể liên quan, tổng phương sai kiểu hình mà các biến thể phổ biến giải thích thường thấp hơn đáng kể so với ước tính độ di truyền thu được từ các nghiên cứu phả hệ cặp song sinh. Các nguyên nhân được đề xuất bao gồm sự đóng góp của các biến thể hiếm có hiệu ứng lớn chưa được bao phủ bởi chip vi mảng, tương tác giữa gen với gen, và tương tác phức tạp giữa gen với môi trường sống.

Thiên lệch quần thể nghiên cứu

Theo phân tích của Tam và cs. (2019), gần 80% cá thể tham gia các nghiên cứu GWAS trên toàn cầu thuộc nhóm người gốc Âu dù nhóm này chỉ chiếm khoảng 16% dân số thế giới vào năm 2019. Sự mất cân bằng chủng tộc nghiêm trọng này khiến các mô hình điểm nguy cơ đa gen được xây dựng từ quần thể châu Âu thường suy giảm mạnh độ chính xác khi áp dụng cho người châu Á hoặc châu Phi, làm dấy lên lo ngại về bất bình đẳng trong y học chính xác.

Khoảng cách từ tín hiệu thống kê đến cơ chế sinh học

Theo Tam và cs. (2019), hơn 90% các biến thể di truyền phát hiện qua GWAS nằm ở các vùng không mã hóa protein của hệ gen. Một tín hiệu đạt ý nghĩa thống kê chỉ chỉ ra một vùng nhiễm sắc thể có liên quan chứ không khẳng định biến thể được đo trực tiếp là biến thể gây bệnh. Do hiện tượng mất cân bằng liên kết bao phủ nhiều biến thể lân cận, việc xác định chính xác nucleotide gây biến đổi chức năng đòi hỏi các phương pháp lập bản đồ tinh tế (fine-mapping) cùng các thí nghiệm chức năng tế bào phức tạp trong phòng thí nghiệm.

Câu hỏi thường gặp

Mục đích chính của nghiên cứu liên kết toàn bộ bộ gen là gì?

Phương pháp này giúp quét toàn bộ hệ gen ở quy mô quần thể để định vị các biến thể di truyền liên quan đến bệnh lý hoặc tính trạng phức tạp mà không cần giả thuyết sinh học định trước về gen đích.

Tại sao ngưỡng ý nghĩa thống kê trong GWAS lại là p < 5 x 10^-8?

Ngưỡng này xuất phát từ phép hiệu chỉnh Bonferroni nghiêm ngặt đối với khoảng 1.000.000 khối mất cân bằng liên kết độc lập trong hệ gen người nhằm loại bỏ triệt để các tín hiệu dương tính giả do kiểm định đa giả thuyết.

Biến thể phát hiện qua GWAS có phải là nguyên nhân gây bệnh không?

Không nhất thiết, vì hiện tượng mất cân bằng liên kết khiến các biến thể lân cận di truyền cùng nhau. Để xác định biến thể nhân quả thực sự, các nhà nghiên cứu phải tiến hành phân tích lập bản đồ tinh tế và các thí nghiệm sinh học chức năng tiếp theo.

Dự án VN1K có ý nghĩa gì đối với nghiên cứu GWAS tại Việt Nam?

Dự án đã giải trình tự hệ gen của 1.011 người Việt và phát hiện hơn 42 triệu biến thể, cung cấp hệ gen tham chiếu chuẩn xác giúp nâng cao hiệu quả suy diễn kiểu gen và khắc phục tình trạng thiên lệch dữ liệu quần thể châu Âu.

Tài liệu tham khảo

  1. Uffelmann, E. et al. (2021). Genome-wide association studies. Nature Reviews Methods Primers, 1, 59. DOI: 10.1038/s43586-021-00056-9
  2. Tam, V. et al. (2019). Benefits and limitations of genome-wide association studies. Nature Reviews Genetics, 20(8), 467–484. DOI: 10.1038/s41576-019-0127-1
  3. Visscher, P. M. et al. (2017). 10 Years of GWAS Discovery: Biology, Function, and Translation. The American Journal of Human Genetics, 101(1), 5–22. DOI: 10.1016/j.ajhg.2017.06.005
  4. The Wellcome Trust Case Control Consortium (2007). Genome-wide association study of 14,000 cases of seven common diseases and 3,000 shared controls. Nature, 447(7145), 661–678. DOI: 10.1038/nature05911
  5. Tran, T. T. H. et al. (2026). VN1K is a pangenome-informed multi-omics and phenomics resource for the Vietnamese population. Nature Communications, 17, 75375. DOI: 10.1038/s41467-026-75375-0