Từ điển học thuật Khoa học tự nhiên

Tần số haplotype (haplotype frequency) là gì?

Tiếng AnhHaplotype frequency

Tần số haplotype là tỷ lệ xuất hiện của một tổ hợp alen cụ thể nằm trên cùng một nhiễm sắc thể hoặc cùng một phân tử DNA đơn bội trong vốn gen của một quần thể xác định.

Cập nhật 5/10/2026

Tần số haplotype là tỷ lệ xuất hiện của một tổ hợp alen cụ thể nằm trên cùng một nhiễm sắc thể hoặc cùng một phân tử DNA đơn bội trong vốn gen của một quần thể xác định. Khái niệm này phản ánh mức độ liên kết di truyền và cấu trúc đa hình phân tử giữa nhiều vị trí biến dị liền kề thay vì chỉ xét riêng lẻ từng alen độc lập. Bài viết phân tích cơ sở lý thuyết, các mô hình toán học ước tính tần số haplotype, nguyên lý mất cân bằng liên kết, ứng dụng trong nghiên cứu liên kết toàn bộ bộ gen, y học ghép mô tạng và đặc điểm tần số haplotype ở quần thể người Việt Nam.

Bản chất di truyền và cơ sở lý thuyết

Trong di truyền học phân tử và di truyền học quần thể, khái niệm haplotype (viết tắt từ cụm từ haploid genotype) chỉ tập hợp các alen tại nhiều locus di truyền khác nhau cùng nằm trên một phân tử DNA đơn bội và có xu hướng được truyền đạt nguyên vẹn qua các thế hệ giảm phân. Khi khảo sát một cá thể lưỡng bội, thông tin thu được từ các kỹ thuật giải trình tự thông thường thường chỉ cho biết kiểu gen tại từng locus mà không chỉ ra rõ alen nào nằm cùng trên một nhiễm sắc thể đơn bội nếu cá thể đó mang kiểu gen dị hợp tử ở từ hai locus trở lên. Sự sắp xếp cụ thể của các alen trên từng nhiễm sắc thể tương đồng được gọi là pha di truyền (gametic phase). Tần số haplotype biểu thị xác suất chọn ngẫu nhiên một nhiễm sắc thể mang đúng tổ hợp alen đó từ toàn bộ vốn gen của quần thể.

Mối quan hệ giữa tần số haplotype và tần số alen thành phần phụ thuộc trực tiếp vào hiện tượng liên kết di truyền và tần số tái tổ hợp giữa các locus. Xét trường hợp đơn giản nhất gồm hai locus bi-alen liền kề, locus thứ nhất có hai alen là A và a với tần số lần lượt là pAp_A và pap_a, locus thứ hai có hai alen là B và b với tần số lần lượt là pBp_B và pbp_b. Bốn tổ hợp haplotype có thể xuất hiện trong quần thể gồm AB, Ab, aB và ab, với tần số thực tế lần lượt ký hiệu là pABp_{AB}, pAbp_{Ab}, paBp_{aB} và pabp_{ab}.

Nếu hai locus phân ly độc lập hoặc trải qua quá trình tái tổ hợp ngẫu nhiên qua vô số thế hệ mà không chịu tác động của bất kỳ yếu tố chọn lọc nào, quần thể sẽ đạt trạng thái cân bằng liên kết (linkage equilibrium). Khi đó, xác suất xuất hiện đồng thời hai alen trên cùng một nhiễm sắc thể bằng tích xác suất của từng alen riêng rẽ:

pAB=pApBp_{AB} = p_A p_B

Trong công thức trên, pABp_{AB} là tần số haplotype kỳ vọng khi ở trạng thái cân bằng liên kết, pAp_A là tần số của alen A tại locus thứ nhất, và pBp_B là tần số của alen B tại locus thứ hai. Tuy nhiên, trong thực tế sinh học, các locus nằm gần nhau trên cùng một nhiễm sắc thể hiếm khi phân ly độc lập hoàn toàn. Sự sai khác giữa tần số haplotype quan sát được trong thực tế và tần số kỳ vọng ngẫu nhiên được định lượng bằng hệ số mất cân bằng liên kết (linkage disequilibrium, ký hiệu là D), như mô tả chi tiết trong tổng quan của Slatkin (năm 2008):

D=pAB−pApBD = p_{AB} - p_A p_B

Trong phương trình này, giá trị D biểu thị mức độ kết hợp không ngẫu nhiên giữa alen A và alen B. Khi D=0D = 0, hai locus ở trạng thái cân bằng liên kết. Khi D>0D > 0, hai alen A và B xuất hiện cùng nhau trên cùng một haplotype với tần số cao hơn kỳ vọng ngẫu nhiên. Ngược lại, khi D<0D < 0, tổ hợp alen này xuất hiện ít hơn kỳ vọng ngẫu nhiên. Vì độ lớn của D phụ thuộc vào tần số của các alen thành phần, các nhà nghiên cứu thường sử dụng hai chỉ số chuẩn hóa là hệ số chuẩn hóa của Lewontin (ký hiệu là D′D') và hệ số tương quan bình phương (ký hiệu là r2r^2):

D′=DDmax⁡D' = \frac{D}{D_{\max}}

Trong biểu thức trên, đại lượng Dmax⁡D_{\max} là giá trị cực đại lý thuyết mà D có thể đạt được với các tần số alen đã cho, được xác định bằng min⁡(pApb,papB)\min(p_A p_b, p_a p_B) khi D>0D > 0, hoặc min⁡(pApB,papb)\min(p_A p_B, p_a p_b) khi D<0D < 0. Chỉ số thứ hai là hệ số tương quan bình phương:

r2=D2pA(1−pA)pB(1−pB)r^2 = \frac{D^2}{p_A (1 - p_A) p_B (1 - p_B)}

Trong công thức tính r2r^2, tử số là bình phương của hệ số mất cân bằng liên kết D, còn mẫu số là tích của phương sai tần số alen tại hai locus tương ứng. Chỉ số r2r^2 nhận giá trị từ 0 đến 1, đóng vai trò là thước đo năng lực dự đoán kiểu gen của một biến dị dựa trên biến dị khác trong các phân tích di truyền liên kết.

Phương pháp ước tính tần số haplotype khi chưa rõ pha di truyền

Trong thực nghiệm lâm sàng và di truyền học người, việc tách riêng từng phân tử DNA đơn bội để giải trình tự trực tiếp đòi hỏi chi phí kỹ thuật rất cao. Hầu hết các bộ dữ liệu quy mô lớn thu được từ vi mảng đa hình đơn nucleotide hoặc giải trình tự thế hệ mới đều cung cấp kiểu gen lưỡng bội không xác định pha (unphased diploid genotypes). Do đó, các thuật toán thống kê đóng vai trò quyết định trong việc suy luận pha và ước tính tần số haplotype của quần thể.

Thuật toán kỳ vọng cực đại

Thuật toán kỳ vọng cực đại (Expectation-Maximization, viết tắt là EM) do Excoffier và Slatkin công bố năm 1995 là một trong những giải pháp thống kê nền tảng để tìm ước lượng hợp lý cực đại cho tần số haplotype từ dữ liệu kiểu gen chưa rõ pha. Thuật toán hoạt động dưới giả định quần thể nghiên cứu tuân theo định luật cân bằng Hardy-Weinberg. Giả sử quần thể có k dạng haplotype tiềm năng với các tần số chưa biết là p1,p2,…,pkp_1, p_2, \dots, p_k. Với một cá thể mang kiểu gen lưỡng bội quan sát được G, xác suất xuất hiện kiểu gen G là tổng xác suất của tất cả các cặp haplotype tương thích tạo nên G:

P(G)=∑(hi,hj)∈G21−δijpipjP(G) = \sum_{(h_i, h_j) \in G} 2^{1 - \delta_{ij}} p_i p_j

Trong công thức xác suất trên, (hi,hj)(h_i, h_j) là cặp haplotype tương thích với kiểu gen G, pip_i và pjp_j lần lượt là tần số của haplotype hih_i và hjh_j, còn δij\delta_{ij} là ký hiệu Kronecker delta, nhận giá trị bằng 1 khi i=ji = j (cá thể đồng hợp tử) và bằng 0 khi i≠ji \neq j (cá thể dị hợp tử). Quá trình ước tính của thuật toán EM lặp qua hai bước chính:

  • Bước tính kỳ vọng (Expectation step): Sử dụng vector tần số haplotype ước tính hiện tại ở bước lặp thứ t để tính xác suất có điều kiện của từng cặp haplotype tương thích đối với từng cá thể, từ đó tính số lượng kỳ vọng của từng haplotype hkh_k trong toàn bộ mẫu nghiên cứu.
  • Bước tối đa hóa (Maximization step): Cập nhật vector tần số haplotype mới cho bước lặp thứ t+1 bằng cách chuẩn hóa tổng số lượng kỳ vọng của haplotype đó chia cho tổng số nhiễm sắc thể trong mẫu (bằng 2N đối với cỡ mẫu gồm N cá thể lưỡng bội):
pk(t+1)=12N∑m=1NE[nk,m∣Gm,p(t)]p_k^{(t+1)} = \frac{1}{2N} \sum_{m=1}^N E[n_{k,m} \mid G_m, p^{(t)}]

Trong phương trình cập nhật trên, N là tổng số cá thể lưỡng bội trong mẫu khảo sát, GmG_m là kiểu gen quan sát được của cá thể thứ m, và E[nk,m∣Gm,p(t)]E[n_{k,m} \mid G_m, p^{(t)}] là số lượng kỳ vọng của haplotype hkh_k hiện diện trong cá thể thứ m dựa trên vector tần số p(t)p^{(t)} ở bước lặp trước. Quá trình lặp dừng lại khi mức chênh lệch hàm hợp lý giữa hai bước lặp liên tiếp nhỏ hơn một ngưỡng hội tụ định trước.

Phương pháp suy luận Bayes và mô hình quy tụ

Mặc dù thuật toán EM đạt hiệu quả tính toán cao đối với số lượng locus nhỏ, phương pháp này gặp hạn chế khi số lượng locus tăng lên do không gian các haplotype tiềm năng bùng nổ theo cấp số nhân và thuật toán không khai thác được mối quan hệ phả hệ di truyền giữa các haplotype. Năm 2001, Stephens, Smith và Donnelly đã đề xuất phương pháp thống kê Bayes kết hợp với lý thuyết quy tụ (coalescent theory) và chuỗi Markov Monte Carlo (MCMC), được hiện thực hóa trong phần mềm PHASE.

Phương pháp của Stephens và cộng sự đặt ra giả định rằng các haplotype mới trong quần thể phát sinh từ các haplotype tổ tiên thông qua quá trình tích lũy đột biến dần dần theo cấu trúc cây phả hệ. Khi suy luận pha cho một cá thể dị hợp tử, thuật toán ưu tiên lựa chọn các tổ hợp haplotype có độ tương đồng cao với những haplotype đã được quan sát chắc chắn ở các cá thể khác trong mẫu. Nhờ áp dụng tiên nghiệm sinh học về tính quy tụ phả hệ, phương pháp Bayes giảm đáng kể tỷ lệ gán nhầm pha và cung cấp ước lượng tần số haplotype chính xác hơn đối với các vùng gen dài chứa nhiều điểm đa hình.

Tiêu chí so sánh Thuật toán Kỳ vọng Cực đại (EM) Phương pháp suy luận Bayes (PHASE)
Cơ sở lý thuyết Ước lượng hợp lý cực đại cổ điển Thống kê Bayes kết hợp lý thuyết quy tụ phả hệ
Giả định quần thể Cân bằng Hardy-Weinberg nghiêm ngặt Mô hình đột biến và phả hệ quần thể
Tốc độ tính toán Rất nhanh với số lượng locus ít Chậm hơn do sử dụng chuỗi lặp MCMC
Độ chính xác ở vùng gen dài Dễ rơi vào điểm cực trị cục bộ khi nhiều locus Vượt trội, hạn chế tối đa việc tạo ra haplotype ảo
Xử lý alen hiếm Dễ ước tính lệch nếu cỡ mẫu không đủ lớn Được điều chỉnh tốt nhờ phân bố tiên nghiệm

Các yếu tố tiến hóa chi phối tần số haplotype

Tần số của một haplotype trong quần thể không phải là một hằng số cố định mà biến đổi liên tục dưới tác động của các động lực tiến hóa cơ bản. Hiểu rõ các yếu tố này giúp giải thích tại sao một số haplotype lại duy trì tần số rất cao trong khi nhiều tổ hợp khác biến mất hoàn toàn.

  • Tái tổ hợp di truyền: Tái tổ hợp qua quá trình bắt chéo trong giảm phân là cơ chế chính phá vỡ các haplotype sẵn có và tạo ra các tổ hợp alen mới. Tần số tái tổ hợp tỷ lệ thuận với khoảng cách vật lý giữa hai locus trên phân tử DNA, ngoại trừ các điểm nóng tái tổ hợp (recombination hotspots) nơi tần số trao đổi chéo cao hơn mức trung bình hàng chục lần. Các vùng gen nằm ngoài điểm nóng tái tổ hợp có xu hướng duy trì cấu trúc haplotype nguyên vẹn qua hàng ngàn thế hệ.
  • Chọn lọc tự nhiên: Khi một alen có lợi xuất hiện trên một haplotype và nhanh chóng tăng tần số dưới tác động của chọn lọc dương tính, toàn bộ các alen liên kết chặt chẽ xung quanh nó cũng tăng tần số theo cơ chế kéo theo di truyền (genetic hitchhiking). Ngược lại, chọn lọc cân bằng (balancing selection), điển hình như tại phức hệ tương hợp mô chính (MHC/HLA), giúp duy trì đồng thời nhiều dòng haplotype phân kỳ với tần số trung bình cao nhằm bảo tồn tính đa dạng miễn dịch chống lại các mầm bệnh biến đổi liên tục.
  • Phiêu bạt di truyền và hiệu ứng thắt cổ chai: Trong các quần thể có kích thước hiệu dụng nhỏ, sự biến động ngẫu nhiên của tần số alen có thể dẫn đến việc mất mát hoặc cố định nhanh chóng của các haplotype. Hiệu ứng người sáng lập (founder effect) xảy ra khi một nhóm nhỏ cá thể tách ra lập quần thể mới, làm cho tần số của một số haplotype cụ thể tăng vọt so với quần thể gốc.
  • Dòng gen và giao phối dị phối: Sự di cư và trao đổi vật chất di truyền giữa các quần thể mang lại những haplotype đặc trưng từ quần thể này sang quần thể khác, làm thay đổi cấu trúc di truyền vốn có và tạo điều kiện hình thành các tổ hợp liên kết mới.

Ý nghĩa ứng dụng trong y sinh học và nhân chủng học

Nghiên cứu tần số haplotype cung cấp công cụ mạnh mẽ vượt trội so với phân tích đơn alen trong nhiều lĩnh vực khoa học thực tiễn.

Nghiên cứu liên kết toàn bộ bộ gen (GWAS)

Năm 2005, Dự án Bản đồ Haplotype quốc tế (The International HapMap Consortium) đã công bố bản đồ haplotype toàn diện trên bộ gen người. Nghiên cứu này chứng minh rằng bộ gen người được tổ chức thành các khối haplotype (haplotype blocks) có mức độ mất cân bằng liên kết nội tại rất cao, ngăn cách nhau bởi các điểm nóng tái tổ hợp hẹp. Thay vì phải giải trình tự hoặc xác định kiểu gen của toàn bộ hàng chục triệu biến dị đơn nucleotide, các nhà nghiên cứu chỉ cần xác định kiểu gen của một số lượng nhỏ các biến dị đại diện (tag SNPs) để suy luận ra toàn bộ cấu trúc haplotype của một khối gen. Chiến lược này giúp tối ưu hóa chi phí và nâng cao sức mạnh thống kê trong việc định vị các biến dị gây bệnh phức tạp.

Ghép tạng và ghép tế bào gốc tạo máu

Ứng dụng lâm sàng quan trọng nhất của tần số haplotype nằm trong lĩnh vực ghép tế bào gốc tạo máu và ghép tạng. Hệ thống kháng nguyên bạch cầu người (HLA) nằm trên cánh ngắn của nhiễm sắc thể số 6 là khu vực đa hình nhất trong bộ gen người. Do các gen HLA liên kết chặt chẽ với nhau, chúng được di truyền từ bố mẹ sang con theo từng khối haplotype hoàn chỉnh. Việc nắm vững bảng phân bố tần số haplotype HLA của từng nhóm dân tộc là điều kiện tiên quyết để tính toán xác suất tìm được người hiến tặng phù hợp ngẫu nhiên không cùng huyết thống, xây dựng quy mô tối ưu cho các ngân hàng tế bào gốc và thiết lập thuật toán tìm kiếm người hiến.

Di truyền học hình sự và phân tích phả hệ

Trong khoa học pháp y, các đoạn lặp ngắn liên tiếp trên nhiễm sắc thể Y (Y-STR) và DNA ty thể (mtDNA) không trải qua quá trình tái tổ hợp tương đồng trong giảm phân. Toàn bộ các locus trên nhiễm sắc thể Y được truyền nguyên vẹn theo dòng bố dưới dạng một haplotype đơn nhất, trong khi DNA ty thể được truyền theo dòng mẹ. Tần số haplotype Y-STR và mtDNA trong cơ sở dữ liệu quốc gia cho phép các giám định viên đánh giá trọng số chứng cứ pháp y khi xác định mối quan hệ huyết thống nam giới hoặc truy nguyên nguồn gốc nghi phạm từ dấu vết sinh học tại hiện trường.

Đặc điểm tần số haplotype trong quần thể người Việt

Nhận thức được vai trò cốt lõi của cấu trúc haplotype trong y học chính xác, nhóm tác giả do Que, Khanh, Khanh, Van Son, Van Anh, Anh, Tung, Thang (năm 2022) thuộc Viện Huyết học - Truyền máu Trung ương và Đại học Quốc gia Hà Nội đã thực hiện công trình nghiên cứu toàn diện về tần số alen và tần số haplotype HLA trên mẫu máu cuống rốn của người Kinh tại Việt Nam. Nghiên cứu này được tiến hành theo chấp thuận của Hội đồng Đạo đức trong nghiên cứu y sinh học Đại học Y Hà Nội (số 78/HDDDDHYHN ngày 30 tháng 5 năm 2017) và được tài trợ bởi Bộ Khoa học và Công nghệ Việt Nam qua nhiệm vụ quốc gia mã số ĐTĐL.CN-63/19.

Nghiên cứu đã thu thập mẫu từ 3 776 sản phụ khỏe mạnh trong giai đoạn từ tháng 5 năm 2014 đến tháng 12 năm 2019. Sau khi loại bỏ 26 mẫu có kết quả định nhóm ở độ phân giải 4 chữ số chưa rõ ràng (chiếm tỷ lệ 0,68%), tổng cộng 3 750 đơn vị máu cuống rốn đạt tiêu chuẩn đã được phân tích bằng kỹ thuật PCR-SSO trên hệ thống Luminex kết nối cơ sở dữ liệu IMGT/HLA. Đây là bộ dữ liệu quy mô lớn nhất về tần số HLA đơn bội ở người Kinh từng được công bố trên tạp chí quốc tế.

Kết quả định nhóm kiểu gen cho thấy mức độ đa hình vượt trội tại 4 locus khảo sát, trong đó phát hiện 40 alen khác nhau tại locus HLA-A, 93 alen tại locus HLA-B, 47 alen tại locus HLA-C và 62 alen tại locus HLA-DRB1. Locus HLA-B ghi nhận mức độ đa hình cao nhất với số lượng alen gần gấp đôi các locus còn lại. Các alen có tần số xuất hiện cao nhất tại từng locus gồm có:

  • Locus HLA-A: Alen phổ biến nhất là A*11:01 chiếm 25%, tiếp theo là A*24:02 chiếm 12,3% và A*02:01 chiếm 11,2%.
  • Locus HLA-B: Alen phổ biến nhất là B*15:02 chiếm 15,1%, tiếp theo là B*46:01 chiếm 10,7% và B*58:01 chiếm 7,65%.
  • Locus HLA-C: Alen phổ biến nhất là C*08:01 chiếm 17,2%, tiếp theo là C*07:02 chiếm 16,2% và C*01:02 chiếm 15,2%.
  • Locus HLA-DRB1: Alen phổ biến nhất là DRB1*12:02 chiếm tới 31,0%, tiếp theo là DRB1*09:01 chiếm 10,47% và DRB1*15:02 chiếm 7,54%.

Khi phân tích liên kết giữa hai locus liền kề bằng thuật toán kỳ vọng cực đại, nghiên cứu đã xác định các tổ hợp haplotype hai locus chiếm ưu thế tuyệt đối trong quần thể người Kinh:

Cặp locus HLA Haplotype hai locus phổ biến nhất Tần số quan sát (%)
HLA-A - HLA-B A*11:01 - B*15:02 7,63
HLA-A - HLA-C A*11:01 - C*08:01 7,98
HLA-B - HLA-C B*15:02 - C*08:01 14,0
HLA-A - HLA-DRB1 A*11:01 - DRB1*12:02 10,56
HLA-B - HLA-DRB1 B*15:02 - DRB1*12:02 10,47
HLA-C - HLA-DRB1 C*08:01 - DRB1*12:02 11,38

Đặc biệt, khi mở rộng phân tích lên 4 locus hoàn chỉnh gồm HLA-A, HLA-B, HLA-C và HLA-DRB1, nhóm nghiên cứu đã ghi nhận nhiều tổ hợp haplotype phân kỳ khác nhau. Trong đó, haplotype bốn locus phổ biến nhất ở người Kinh là A*11:01 - B*15:02 - C*08:01 - DRB1*12:02 với tần số đạt 5,45%. Sự kết hợp của bốn alen này phản ánh mức độ mất cân bằng liên kết rất mạnh giữa các locus trên nhiễm sắc thể số 6 trong lịch sử tiến hóa của người Việt.

Dữ liệu thực nghiệm này có ý nghĩa sống còn đối với công tác điều trị ghép tế bào gốc tại Việt Nam. Khác với người phương Tây nơi các alen như A*01:01, A*02:01, B*07:02 và B*08:01 chiếm ưu thế, người Kinh mang cơ cấu alen và haplotype đặc trưng với sự hiện diện áp đảo của A*11:01, B*15:02 và DRB1*12:02. Do đó, cơ hội tìm kiếm mẫu tế bào gốc phù hợp HLA cho bệnh nhân Việt Nam phụ thuộc hoàn toàn vào các ngân hàng máu cuống rốn và danh sách người hiến tặng trong nước hoặc các quần thể gốc Đông Á lân cận.

Hạn chế phương pháp luận và các thách thức nghiên cứu

Mặc dù việc phân tích tần số haplotype đã đạt được nhiều bước tiến quan trọng, các phương pháp hiện tại vẫn đối mặt với một số rào cản kỹ thuật và hạn chế cố hữu:

  • Sai số do gán nhầm pha: Khi kích thước mẫu nhỏ hoặc đối với các haplotype hiếm có tần số rất thấp, sai số ước lượng của thuật toán thống kê có xu hướng tăng cao. Việc gán pha dựa trên mô hình xác suất có thể tạo ra các haplotype nhân tạo không có thực trong tự nhiên nếu quần thể có mức độ đa dạng cao hoặc chịu tác động của cấu trúc phân tầng.
  • Vi phạm giả định cân bằng Hardy-Weinberg: Nhiều thuật toán ước tính tần số haplotype (như thuật toán EM) phụ thuộc chặt chẽ vào giả định quần thể ở trạng thái cân bằng ngẫu nhiên. Nếu quần thể xảy ra hiện tượng giao phối cận huyết, chọn lọc tự nhiên mạnh hoặc cấu trúc phân tầng quần thể (population stratification), tần số kiểu gen quan sát được sẽ chệch khỏi kỳ vọng, dẫn đến ước tính sai lệch về tần số haplotype.
  • Độ phân giải alen trong kỹ thuật phòng thí nghiệm: Việc sử dụng các kỹ thuật định nhóm có độ phân giải trung bình (như PCR-SSO) có thể bỏ sót các biến dị tinh vi ở mức nucleotide so với giải trình tự thế hệ mới chuỗi dài (long-read sequencing). Sự nhập nhằng alen (allele ambiguity) buộc các nhà nghiên cứu phải gộp nhóm hoặc loại bỏ mẫu, làm giảm độ chính xác của bảng tần số haplotype chi tiết.
  • Thách thức tính toán trên dữ liệu toàn bộ gen: Khi số lượng điểm đa hình đơn nucleotide tăng lên hàng triệu biến dị trong các dự án giải trình tự toàn bộ bộ gen, việc tái dựng haplotype hoàn chỉnh đòi hỏi năng lực tính toán cực lớn. Các mô hình hiện đại phải sử dụng phương pháp trượt cửa sổ (sliding windows) hoặc các cấu trúc đồ thị tham chiếu, làm phát sinh sự đánh đổi giữa tốc độ xử lý và độ chính xác ở ranh giới giữa các khối liên kết.

Câu hỏi thường gặp

Tần số haplotype khác gì so với tần số alen?

Tần số alen chỉ đo lường tỷ lệ của một biến dị đơn lẻ tại một locus cụ thể, trong khi tần số haplotype đo lường tỷ lệ xuất hiện đồng thời của một tổ hợp gồm nhiều alen liên kết trên cùng một nhiễm sắc thể.

Tại sao tần số haplotype thực tế thường sai khác so với tích tần số alen?

Do các locus nằm gần nhau trên cùng một nhiễm sắc thể có hiện tượng mất cân bằng liên kết, khiến các alen có xu hướng di truyền cùng nhau thay vì phân ly độc lập ngẫu nhiên theo định luật xác suất.

Thuật toán kỳ vọng cực đại (EM) ước tính tần số haplotype như thế nào khi chưa rõ pha di truyền?

Thuật toán EM lặp lại bước tính kỳ vọng xác suất xuất hiện các cặp haplotype tương thích với kiểu gen quan sát và bước tối đa hóa để cập nhật tần số haplotype cho đến khi hàm hợp lý đạt trạng thái hội tụ.

Haplotype HLA nào có tần số cao nhất trong quần thể người Kinh tại Việt Nam?

Theo nghiên cứu năm 2022 của Que và cộng sự trên 3 750 đơn vị máu cuống rốn, haplotype bốn locus phổ biến nhất ở người Kinh là A*11:01 - B*15:02 - C*08:01 - DRB1*12:02 với tần số 5,45%.

Tài liệu tham khảo

  1. Excoffier, Slatkin (1995). Maximum-likelihood estimation of molecular haplotype frequencies in a diploid population. Molecular Biology and Evolution. doi:10.1093/oxfordjournals.molbev.a040269 DOI: 10.1093/oxfordjournals.molbev.a040269
  2. Stephens, Smith, Donnelly (2001). A New Statistical Method for Haplotype Reconstruction from Population Data. The American Journal of Human Genetics. doi:10.1086/319501 DOI: 10.1086/319501
  3. Slatkin (2008). Linkage disequilibrium — understanding the evolutionary past and mapping the medical future. Nature Reviews Genetics. doi:10.1038/nrg2361 DOI: 10.1038/nrg2361
  4. The International HapMap Consortium (2005). A haplotype map of the human genome. Nature. doi:10.1038/nature04226 DOI: 10.1038/nature04226
  5. Que, Khanh, Khanh, Van Son, Van Anh, Anh, Tung, Thang (2022). Allele and Haplotype Frequencies of HLA-A, -B, -C, and -DRB1 Genes in 3,750 Cord Blood Units From a Kinh Vietnamese Population. Frontiers in Immunology. doi:10.3389/fimmu.2022.875283 DOI: 10.3389/fimmu.2022.875283