Từ điển học thuật Khoa học tự nhiên

Bộ gen là gì? Cấu trúc hệ gen người, chức năng và công nghệ giải trình tự

Tiếng Anhgenome

Tên gọi kháchệ gengenomicshệ gen họcbộ gen sinh vật

Bộ gen là toàn bộ tập hợp vật chất di truyền (ADN hoặc ARN ở một số virus) của một sinh vật, bao gồm cả các gen mã hóa protein và các trình tự không mã hóa, chứa đựng toàn bộ thông tin hướng dẫn cấu trúc và vận hành sự sống.

361 lượt xem Cập nhật 1/9/2026

Giới thiệu về bộ gen

Bộ gen (genome) là toàn bộ vật liệu di truyền của một sinh vật, bao gồm tất cả các đoạn DNA (hoặc RNA ở một số virus) chứa thông tin mã hóa và điều hòa biểu hiện gene. Bộ gen chính là "bản đồ" di truyền xác định đặc tính, chức năng và khả năng sinh học của sinh vật từ cấp độ phân tử đến mô và cơ quan.

Kích thước bộ gen rất đa dạng, dao động từ vài kilobase (kb) ở virus đơn giản đến hàng gigabase (Gb) ở các loài thực vật và động vật đa bào. Ví dụ, bộ gen virus SARS-CoV-2 dài khoảng 30 kb, trong khi bộ gen người có dung lượng khoảng 3,2 Gb (3.200 Mb), tương đương hơn 3 tỷ cặp bazơ.

  • Bộ gen nhân chuẩn (nuclear genome): nằm trong nhân tế bào của sinh vật nhân chuẩn (eukaryote).
  • Genome ty thể (mitochondrial genome): nằm trong ti thể, có vai trò sản xuất năng lượng.
  • Genome lục lạp (chloroplast genome): chỉ có ở thực vật và tảo, đảm nhiệm quang hợp.

Sự phân bố và tổ chức của các thành phần này ảnh hưởng trực tiếp đến quá trình biểu hiện gene, đột biến và tiến hóa của sinh vật. Thông tin về bộ gen hiện được lưu trữ và truy cập rộng rãi trên các cơ sở dữ liệu như NCBI Genome Browser: https://www.ncbi.nlm.nih.gov/genome/.

Định nghĩa và thành phần

Bộ gen bao gồm các thành phần chính: các gene mã hóa protein, các RNA chức năng (tRNA, rRNA, miRNA…), vùng liên gen (intergenic region), intron và exon trong gene eukaryote. Mỗi gene chứa trình tự điều hòa (promoter, enhancer), vùng mã hóa và trình tự kết thúc (terminator).

Cấu trúc cơ bản của DNA trong bộ gen được mô tả dưới dạng chuỗi xoắn đôi (double helix) với các cặp bazơ A–T và G–C liên kết qua cầu hydro. Trình tự bazơ quyết định mã di truyền, trong đó mỗi nhóm ba bazơ (codon) tương ứng với một amino acid khi phiên mã và dịch mã.

Công thức tính độ dài tổng cộng của bộ gen (L) bằng tổng độ dài của các đoạn DNA quy định:

L=∑i=1nli L = \sum_{i=1}^{n} l_i

Trong đó, n là số đoạn trình tự, l_i là độ dài (số cặp bazơ) của đoạn thứ i. Công thức này giúp ước tính nhanh kích thước bộ gen khi tổ hợp nhiều đoạn nhỏ từ quá trình giải trình tự.

Thành phần tái tổ hợp (repetitive elements) chiếm phần lớn genome của nhiều loài eukaryote, bao gồm các trình tự lặp ngắn (SINE), lặp dài (LINE), các transposon và microsatellite. Chúng đóng vai trò quan trọng trong tiến hóa và biến dị di truyền.

Lịch sử nghiên cứu và giải mã genome

Dự án Human Genome Project (HGP), khởi xướng năm 1990 tại Mỹ và hoàn thành bản phân tích đầu tiên vào năm 2003, là bước ngoặt quan trọng trong sinh học phân tử. HGP đã xác định gần như toàn bộ trình tự 3,2 tỷ cặp bazơ của bộ gen người với độ chính xác cao.

Sau HGP, công nghệ giải trình tự DNA phát triển vượt bậc: từ phương pháp Sanger truyền thống đến công nghệ Next-Generation Sequencing (NGS) rút ngắn thời gian giải mã và giảm chi phí. Hiện nay, các nền tảng NGS cho phép giải trình tự hàng trăm mẫu đồng thời chỉ trong vài ngày.

  • 1990–2003: Human Genome Project – bản thô đầu tiên của bộ gen người.
  • 2005–2015: Dự án 1000 Genomes xác định biến dị di truyền của hơn 2.500 cá thể trên toàn cầu.
  • 2007–nay: ENCODE Project phân tích chức năng các thành phần không mã hóa trong bộ gen người.

Các dự án này được hỗ trợ bởi cơ sở dữ liệu trực tuyến như Ensembl Genome Browser (EMBL-EBI): https://www.ensembl.org/ và UCSC Genome Browser: https://genome.ucsc.edu/, nơi nghiên cứu và trao đổi dữ liệu di truyền toàn cầu.

Cấu trúc và tổ chức genome

Genome eukaryote thường tổ chức dưới dạng nhiều nhiễm sắc thể tuyến tính nằm trong nhân tế bào, mỗi nhiễm sắc thể bao gồm DNA quấn quanh protein histone thành nucleosome, tiếp tục nén gập lại để tạo thành chromatine. Trong khi đó, genome prokaryote thường là chuỗi DNA vòng, ít protein liên kết hơn và không có nhiễm sắc thể thực sự.

Các vùng chức năng trên nhiễm sắc thể eukaryote gồm:

  • Chromosome (nhiễm sắc thể): mỗi tập hợp chứa một bản sao hoàn chỉnh của genome nhân chuẩn.
  • Centromere: vị trí gắn thoi phân bào, đảm bảo phân chia lượng DNA chính xác.
  • Telomere: vùng đệm ở đầu mút nhiễm sắc thể, bảo vệ trình tự gene khỏi mất mát khi nhân đôi.
Đặc điểmEukaryoteProkaryote
Hình dạng DNATuyến tính nhiều nhiễm sắc thểVòng đơn nhiễm sắc thể
Protein liên kếtHistone, nucleosomeÍt hoặc không có histone
Tái tổ hợpCao, qua meiosisThấp, qua conjugation
Kích thước genomeThường lớn (từ Mb đến Gb)Nhỏ (thường vài Mb)

Hiểu rõ cấu trúc và tổ chức genome là cơ sở để giải thích cơ chế biểu hiện gene, điều hòa di truyền và quá trình tiến hóa. Nghiên cứu sâu hơn còn tập trung vào vai trò của chromatin remodeling và epigenetic modifications trong điều khiển truy cập DNA.

Công nghệ giải trình tự và phân tích genome

Phương pháp Sanger (chain termination) là nền tảng của giải trình tự DNA thế hệ đầu, sử dụng didNTP đánh dấu huỳnh quang để xác định trình tự nucleotide. Dù độ chính xác cao (>99,99%), Sanger chỉ giải trình tự được đoạn ~800–1000 bp mỗi lần và tốn nhiều thời gian, chi phí khi áp dụng cho genome lớn.

Next-Generation Sequencing (NGS) bao gồm các nền tảng Illumina, Ion Torrent, cho phép giải trình tự hàng triệu đoạn ngắn (reads) đồng thời. Độ sâu đọc (coverage) cao và chi phí giảm mạnh giúp NGS trở thành tiêu chuẩn trong nghiên cứu population genomics và metagenomics.

Third-Generation Sequencing (TGS) như Pacific Biosciences SMRT và Oxford Nanopore cung cấp long reads (>10 kb), cải thiện khả năng lắp ráp genome phức tạp và phát hiện biến dị cấu trúc (structural variants). Tuy nhiên, độ chính xác mỗi read thấp hơn NGS, thường được hiệu chỉnh bằng dữ liệu short-read.

Tiêu chíSangerNGS (Illumina)TGS (Nanopore)
Độ dài read~800 bp100–300 bp>10 kb
ThroughputThấpRất caoCao
Độ chính xácRất caoCaoTrung bình
Chi phí/genomeCaoThấpTrung bình

Phần mềm lắp ráp genome bao gồm SPAdes, Velvet cho short-read, Canu, Flye cho long-read. Annotation genome sử dụng AUGUSTUS, MAKER để gán chức năng gene dựa trên mô hình gene của loài tham chiếu.

Genomics chức năng và hệ biểu sinh (epigenomics)

Genomics chức năng (functional genomics) tập trung vào việc xác định chức năng của gene và vùng không mã hóa thông qua các kỹ thuật transcriptomics (RNA-Seq), proteomics và metabolomics. RNA-Seq sử dụng NGS để đo biểu hiện gene toàn cục, cung cấp dữ liệu về isoform, đột biến RNA editing, và tương tác RNA–protein.

Epigenomics nghiên cứu các chỉnh sửa sau dịch mã và thay đổi trên DNA mà không làm biến đổi trình tự bazơ, như methyl hóa DNA và biến đổi histone. Các kỹ thuật phổ biến:

  • Bisulfite sequencing: phát hiện vị trí methyl hóa cytosine.
  • ChIP-Seq (Chromatin Immunoprecipitation sequencing): xác định vị trí gắn histone modifications (H3K4me3, H3K27ac...).
  • ATAC-Seq (Assay for Transposase-Accessible Chromatin): đánh giá vùng chromatin mở để dự đoán enhancer và promoter hoạt động.

Kết hợp dữ liệu genomics chức năng và epigenomics cho phép xây dựng bản đồ điều hòa gene, hiểu cơ chế phát triển, bệnh lý và phản ứng sinh học với môi trường. Nguồn tham khảo chi tiết: EMBL-EBI Epigenomics Portal, https://www.ebi.ac.uk/epigenomics/.

So sánh genomics và di truyền so sánh

Comparative genomics so sánh trình tự genome giữa các loài nhằm xác định gene bảo tồn và vùng điều hòa chức năng. Phương pháp thường dùng là alignment toàn bộ genome (whole-genome alignment) và so sánh gene families để xây dựng cây phát sinh chủng loại (phylogenetic tree).

Công cụ chính:

  • BLAST: tìm kiếm sự tương đồng cục bộ giữa trình tự gene hoặc protein.
  • MUMmer: alignment nhanh genome-to-genome.
  • MAUVE: phát hiện rearrangements và structural variants.

So sánh di truyền so sánh giúp hiểu tiến hóa phân tử, tìm yếu tố di truyền liên quan đến thích nghi môi trường, bệnh truyền nhiễm và phát triển các thuốc kháng sinh mới.

Ứng dụng trong y sinh và nông nghiệp

Trong y sinh, giải trình tự genome cá nhân hỗ trợ chẩn đoán bệnh di truyền hiếm, xác định đột biến ung thư (tumor profiling) và phát triển y học cá thể hóa (precision medicine). Ví dụ, panel gene NGS cho ung thư vú/phổi giúp lựa chọn liệu pháp mục tiêu.

Công nghệ CRISPR/Cas9 cho phép chỉnh sửa genome chính xác, mở ra triển vọng điều trị bệnh di truyền (như beta-thalassemia) và tạo giống động vật-mô hình nghiên cứu.

Trong nông nghiệp, marker-assisted selection sử dụng các chỉ thị di truyền (SNP, SSR) để chọn giống cây trồng, vật nuôi có năng suất cao, kháng bệnh. Genome editing ứng dụng CRISPR giúp cải thiện chất lượng dinh dưỡng và kháng chịu điều kiện khắc nghiệt.

Vấn đề đạo đức, pháp lý và xã hội

Dữ liệu genome cá nhân là thông tin nhạy cảm, liên quan trực tiếp đến quyền riêng tư và nguy cơ phân biệt đối xử. Quy định HIPAA (Mỹ) và GDPR (EU) yêu cầu bảo vệ dữ liệu y tế, đồng ý rõ ràng (informed consent) trước khi thu thập và chia sẻ.

An ninh sinh học (biosecurity) lo ngại việc lạm dụng thông tin di truyền để phát triển vũ khí sinh học hoặc tạo tác nhân gây bệnh mới. Các tổ chức như WHO và Hiệp ước cấm vũ khí sinh học (BTWC) đề xuất khung pháp lý kiểm soát nghiên cứu và chia sẻ dữ liệu.

Vấn đề tiếp cận công bằng (equitable access) và chia sẻ dữ liệu genome toàn cầu đặt ra thách thức trong hợp tác đa phương giữa các quốc gia giàu và nghèo. Sáng kiến như Global Alliance for Genomics and Health (GA4GH) xây dựng tiêu chuẩn chia sẻ dữ liệu an toàn và hiệu quả.

Câu hỏi thường gặp

Bộ gen (Genome) của con người chứa khoảng bao nhiêu cặp base và bao nhiêu gen mã hóa protein?

Bộ gen người đơn bội (haploid) chứa khoảng 3.05 đến 3.2 tỷ cặp base (bp) ADN, được phân bố trên 23 nhiễm sắc thể và chứa khoảng 19.900 đến 21.000 gen mã hóa protein (chỉ chiếm khoảng 1.5% tổng bộ gen).

Dự án T2T (Telomere-to-Telomere Consortium, 2022) đạt được bước đột phá gì trong giải trình tự bộ gen người?

Dự án T2T đã hoàn thành bản giải trình tự bộ gen người 100% không còn khoảng trống đầu tiên (bản dựng T2T-CHM13), giải mã thêm ~200 triệu cặp base tại các vùng dị nhiễm sắc, tâm động (centromere) và đầu mút (telomere).

Sự khác biệt giữa ADN nhân và ADN ty thể trong bộ gen sinh vật nhân thực là gì?

ADN nhân là chuỗi thẳng liên kết với protein histone tạo chất nhiễm sắc, còn ADN ty thể (mtDNA) là phân tử vòng kép nhỏ (khoảng 16.569 bp ở người), di truyền theo dòng mẹ và tự sao chép độc lập.

Các nghiên cứu khoa học về “bộ gen”

Công bố nổi bật trên thế giới và tại Việt Nam, kèm tóm tắt theo hướng chủ đề.

Mới nhất

  • Bacillus phage phi18-2 is a novel temperate virus with an unintegrated genome present in the cytoplasm of lysogenic cells as a linear phage-plasmid

    Yutong Li và cộng sự2024Archives of Virology

    AI tóm tắt

    Thực khuẩn thể ôn hòa phi18-2 lây nhiễm Bacillus subtilis được phân lập nhằm làm rõ đặc tính phân tử và tạp nhiễm lên men. Thông qua kính hiển vi điện tử và phân tích di truyền, nghiên cứu xác định virion sở hữu bộ gen DNA sợi đôi dài 64.467 bp với đoạn lặp lại 309 bp ở hai đầu. Nhóm tác giả phát hiện trạng thái phage-plasmid ngoài nhiễm sắc thể của bộ gen trong tế bào chất tiềm tan, làm sáng tỏ chu trình tiềm tan đặc biệt của virus.

  • An evolutionary view of the Fusarium core genome

    Daniel A. Gomez-Chavarria và cộng sự2024

    AI tóm tắt

    Nấm gây bệnh thực vật thuộc chi Fusarium được khảo sát tiến hóa thông qua phân tích so sánh bộ gen lõi đa chủng. Áp dụng hướng tiếp cận hệ gen học phát sinh loài toàn diện, tác giả ghi nhận hàm lượng GC của bộ gen có xu hướng giảm dần ở các dòng phân nhánh hiện đại. Kết quả làm sáng tỏ các sự kiện nhân đôi bộ gen trong quá trình biệt hóa loài, hỗ trợ định danh và bảo vệ thực vật trước các loài nấm gây hại.

  • Three complete chloroplast genomes from two north American Rhus species and phylogenomics of Anacardiaceae

    Lan Huang và cộng sự2024BMC Genomic Data

    AI tóm tắt

    Đối tượng nghiên cứu là hệ thống ba trình tự lục lạp của hai loài thực vật Bắc Mỹ Rhus glabra và Rhus typhina. Bằng phương pháp giải trình tự gen hoàn chỉnh, nhóm tác giả xác lập cấu trúc bốn phần kinh điển của bộ gen lạp thể với chiều dài khoảng 159 kb gồm 88 gen mã hóa protein và 37 gen tRNA. Phân tích phát sinh loài ủng hộ tính đơn ngành của các chi họ Đào lộn hột và cung cấp dữ liệu di truyền giá trị về bộ gen cho phân loại thực vật.

Trích dẫn nhiều nhất

  • Giải trình tự và phân tích ban đầu hệ gen người

    Dịch bởi AIInitial sequencing and analysis of the human genome

    Sı́lvia Beà và cộng sự2001Nature23.070 trích dẫn

    AI tóm tắt

    Bản thảo trình tự giải mã của Dự án Bộ gen Người (International Human Genome Sequencing Consortium) xác lập cột mốc lịch sử trong sinh học phân tử. Thông qua phương pháp giải trình tự phân đoạn dựa trên clone, công trình cung cấp khoảng 94% vùng nguyên nhiễm sắc của bộ gen người với độ bao phủ xấp xỉ 90%. Nhóm nghiên cứu ước tính số lượng gen mã hóa protein vào khoảng 30.000 đến 40.000 gen, cung cấp cơ sở dữ liệu nền tảng về bộ gen cho y sinh học hiện đại.

  • Đặc tính phân tử toàn bộ hệ gen của virus cúm gia cầm H9N2 phân lập từ các trang trại gia cầm Ai Cập

    Dịch bởi AIMolecular characterization of the whole genome of H9N2 avian influenza virus isolated from Egyptian poultry farms

    Nahed Bedair và cộng sự2024Archives of Virology0 trích dẫn

    AI tóm tắt

    Virus cúm gia cầm H9N2 phân lập từ các trang trại gà tại Ai Cập được giải mã toàn diện nhằm theo dõi nguy cơ lây truyền sang người. Bằng kỹ thuật giải trình tự thế hệ mới trên toàn bộ 8 phân đoạn gen, nghiên cứu xác định chủng virus thuộc dòng phụ G1 Á-Âu và mang các đột biến tái tổ hợp kháng nguyên. Kết quả phát hiện các đột biến độc lực then chốt trên bộ gen virus, cảnh báo nguy cơ tiến hóa thành chủng gây bệnh nghiêm trọng ở gia cầm và người.

  • TỐI ƯU QUY TRÌNH PHÂN LẬP HỆ GEN VIRUS BK TỪ MẪU MÁU, NƯỚC TIỂU CỦA BỆNH NHÂN SAU GHÉP THẬN

    Đinh Thị Thu Hằng và cộng sự2025Tạp chí Khoa học và Công nghệ nhiệt đới

    AI tóm tắt

    Quy trình khuếch đại toàn bộ hệ gen virus BK từ mẫu máu và nước tiểu bệnh nhân ghép thận được tối ưu hóa. Bằng kỹ thuật long-PCR với cặp mồi đặc hiệu, nhóm tác giả khuếch đại thành công đoạn DNA hoàn chỉnh dài 5,1 kb trên 41 trong 50 mẫu lâm sàng. Nghiên cứu xác lập quy trình phân lập hệ gen đạt độ nhạy cao, tạo tiền đề giải trình tự bộ gen virus nhằm giám sát nguy cơ tổn thương thận ghép.

  • Giải trình tự và lắp ráp bộ gen của Seiridium unicorne, chủng phân lập CBS 538.82, tác nhân gây bệnh loét vỏ cây bách

    Dịch bởi AISequence and assembly of the genome of Seiridium unicorne, isolate CBS 538.82, causal agent of cypress canker disease

    Edoardo Scali và cộng sự2024Journal of Plant Pathology

    AI tóm tắt

    Dữ liệu bản thảo giải trình tự chủng nấm gây bệnh bách Seiridium unicorne CBS 538.82 được công bố nhằm phục vụ nghiên cứu tiến hóa. Nhóm tác giả lắp ráp hệ gen sơ thảo gồm 581 contig với chỉ số N50 đạt 390.618 cặp base và dự đoán 13.576 gen mã hóa protein. Phân tích so sánh xác định 3.155 protein hiệu ứng tiềm năng chiếm tỷ lệ 23,24% trong bộ gen, phản ánh phổ ký chủ rộng của loài nấm này.

  • Complete genome characterization of cacao leafroll virus, a newly described cacao-infecting polerovirus

    Raphael O. Adegbola và cộng sự2024Archives of Virology

    AI tóm tắt

    Virus cuốn lá ca cao mới phát hiện trên cây Theobroma cacao được phân tích toàn diện nhằm giải mã cấu trúc di truyền. Bằng kỹ thuật giải trình tự thông lượng cao từ 4 mẫu RNA cây bệnh, nghiên cứu xác định kích thước hoàn chỉnh của bộ gen dao động từ 5.976 đến 5.997 nucleotide chứa bảy khung đọc mở. Phân tích phát sinh loài xếp mầm bệnh vào chi Polerovirus và làm sáng tỏ nguồn gốc tiến hóa của bộ gen virus gây hại trên cây trồng.

Tài liệu tham khảo

  1. International Human Genome Sequencing Consortium. (2004). Finishing the euchromatic sequence of the human genome. Nature, 431(7011), 931-945. DOI: 10.1038/nature03001
  2. International Human Genome Sequencing Consortium, Lander, E. S., Linton, L. M., Birren, B., Nusbaum, C., Zody, M. C., Baldwin, J., ... & Morgan, M. J. (2001). Initial sequencing and analysis of the human genome. Nature, 409(6822), 860-921. DOI: 10.1038/35057062
  3. Nurk, S., Koren, S., Rhie, A., Rautiainen, M., Bzikadze, A. V., Mikheenko, A., ... & Phillippy, A. M. (2022). The complete sequence of a human genome. Science, 376(6588), 44-53. DOI: 10.1126/science.abj6987