Từ điển học thuật Khoa học tự nhiên

Phân tích trình tự là gì? Các nghiên cứu khoa học liên quan

Tiếng AnhSequence Analysis

Tên gọi khácphân tích chuỗi sinh họcgiải mã trình tự

quá trình tính toán và thực nghiệm nhằm xác định, căn chỉnh và giải mã các chuỗi nucleotit trong axit nucleic hoặc chuỗi axit amin trong protein để phân tích cấu trúc, chức năng sinh học và quan hệ tiến hóa.

211 lượt xem Cập nhật 19/9/2026

Phân tích trình tự (Sequence Analysis) là lĩnh vực nghiên cứu liên ngành giao thoa giữa sinh học phân tử, di truyền học và tin sinh học máy tính. Trọng tâm của phân tích trình tự là việc xác định, giải mã, so sánh và mô hình hóa trật tự sắp xếp tuyến tính của các đơn vị monome cấu thành nên các đại phân tử sinh học, bao gồm các nucleotit trong chuỗi xoắn kép axit đêôxiribônuclêic (DNA), phân tử axit ribônuclêic (RNA) và chuỗi các axit amin trong chuỗi polypeptide của protein. Đây là phương tiện nền tảng cho phép giới khoa học giải mã bản thiết kế sự sống, tìm hiểu chức năng sinh học của tế bào và tái hiện cây phả hệ tiến hóa của sinh giới.

Cơ sở lý thuyết và các cấp độ phân tích đại phân tử sinh học

Mọi hoạt động sống của sinh vật đều được vận hành dựa trên dòng thông tin di truyền theo học thuyết trung tâm của sinh học phân tử: thông tin mã hóa trong trình tự DNA được phiên mã thành RNA thông tin và sau đó được dịch mã thành chuỗi polypeptit tạo nên protein có hoạt tính xúc tác hoặc cấu trúc. Do đó, phân tích trình tự được tiến hành ở nhiều cấp độ cấu trúc và chức năng khác nhau:

Ở cấp độ DNA, việc phân tích chuỗi nucleotit giúp xác định ranh giới giữa các vùng gen mã hóa (exon) và các đoạn không mã hóa (intron), định vị các trình tự khởi động phiên mã (promoter), các yếu tố tăng cường (enhancer) và các vị trí gắn kết đặc hiệu của các yếu tố phiên mã. Đồng thời, kỹ thuật này cho phép phát hiện các biến dị di truyền như đột biến điểm đơn nucleotit (SNP), đột biến thêm bớt đoạn gây lệch khung đọc và biến đổi số lượng bản sao gen trong hệ gen quần thể.

Ở cấp độ RNA, phân tích trình tự bản phiên mã (transcriptome) cung cấp bức tranh động về mức độ biểu hiện gen trong từng loại mô, cơ quan hoặc giai đoạn phát triển cá thể. Kỹ thuật này giúp phát hiện các hiện tượng nối ghép RNA thay thế (alternative splicing) tinh vi, qua đó một gen duy nhất có thể tạo ra nhiều dạng đồng phân protein với chức năng sinh học khác nhau.

Ở cấp độ protein, phân tích chuỗi axit amin giúp dự đoán cấu trúc bậc hai, cấu trúc không gian bậc ba và nhận diện các miền chức năng (protein domain) chịu trách nhiệm liên kết phối tử hoặc xúc tác phản ứng hóa sinh. Việc so sánh trình tự protein giữa các loài sinh vật khác nhau cung cấp bằng chứng thuyết phục về các gốc axit amin bất biến, đóng vai trò sống còn đối với sự sống sót của tế bào qua hàng triệu năm tiến hóa.

Đột phá giải trình tự DNA của Sanger: Khởi đầu kỷ nguyên hệ gen

Trước thập niên bảy mươi của thế kỷ hai mươi, việc xác định trình tự một đoạn DNA ngắn là thách thức thực nghiệm vô cùng gian nan. Bước ngoặt lịch sử diễn ra vào năm 1977 khi Frederick Sanger và các cộng sự tại Cambridge công bố phương pháp giải trình tự DNA mang tính cách mạng trên tập san Proceedings of the National Academy of Sciences.

Phương pháp công bố năm 1977 sử dụng các chất ức chế kết thúc chuỗi dideoxynucleotide triphosphat (ddNTP). Khác với dNTP thông thường, phân tử ddNTP thiếu nhóm ba phẩy hydroxyl cần thiết cho sự hình thành liên kết phosphodiester tiếp theo. Khi enzyme DNA polymerase gặp phải ddNTP trong phản ứng sao chép in vitro, chuỗi đang tổng hợp sẽ bị dừng lại một cách chính xác tại vị trí base tương ứng. Bằng cách điện di các đoạn DNA có độ dài chênh lệch nhau đúng một nucleotit trên gel polyacrylamide, người nghiên cứu có thể đọc trực tiếp trật tự các base nitơ của chuỗi DNA mục tiêu. Sáng kiến kiệt xuất năm 1977 đã đặt nền móng vững chắc cho dự án giải mã hệ gen người và đưa Frederick Sanger trở thành một trong số ít nhà khoa học vinh dự nhận hai giải Nobel Hóa học.

Thuật toán tìm kiếm gióng hàng cục bộ BLAST: Cột mốc tin sinh học máy tính

Khi công nghệ giải trình tự thực nghiệm bùng nổ, khối lượng dữ liệu DNA và protein tích lũy trong các cơ sở dữ liệu quốc tế như GenBank tăng trưởng theo hàm số mũ. Việc tìm kiếm một chuỗi truy vấn trong hàng triệu trình tự tham chiếu bằng các thuật toán quy hoạch động chính xác tuyệt đối (như Smith - Waterman) đòi hỏi thời gian tính toán quá lớn trên máy tính.

Để giải quyết bài toán nghẽn cổ chai này, năm 1990, Stephen Altschul cùng các đồng nghiệp tại Trung tâm Thông tin Công nghệ Sinh học Quốc gia Hoa Kỳ (NCBI) đã công bố thuật toán BLAST (Basic Local Alignment Search Tool) trên tạp chí Journal of Molecular Biology. Nghiên cứu năm 1990 đã đề xuất một phương pháp heuristic tài tình: thay vì quét toàn bộ độ dài chuỗi, thuật toán tìm kiếm các từ khóa ngắn (k-mer) xuất hiện đồng thời trên cả hai chuỗi và sở hữu điểm tương đồng vượt qua một ngưỡng đánh giá xác định.

Từ các hạt giống từ khóa này, BLAST nhanh chóng mở rộng việc căn chỉnh cục bộ sang hai phía mà không cho phép khoảng trống, cho đến khi điểm số căn chỉnh suy giảm. Thuật toán năm 1990 tích hợp lý thuyết phân phối giá trị cực trị của Karlin và Altschul để gán giá trị kỳ vọng (E-value) có ý nghĩa thống kê nghiêm ngặt cho mỗi kết quả tìm kiếm. Đột phá năm 1990 đã biến BLAST thành công cụ tin sinh học được trích dẫn nhiều bậc nhất lịch sử, cho phép các nhà sinh học trên toàn thế giới quét cơ sở dữ liệu gen khổng lồ chỉ trong vài giây.

Gióng hàng đa trình tự và sự ra đời của phần mềm CLUSTAL W

Nếu như việc gióng hàng từng cặp trình tự giúp tìm kiếm sự tương đồng ban đầu, thì việc gióng hàng đồng thời nhiều trình tự (Multiple Sequence Alignment - MSA) là chìa khóa then chốt để giải mã cây tiến hóa và cấu trúc protein. Năm 1994, Julie Thompson, Desmond Higgins và Toby Gibson đã tạo nên một bước tiến quan trọng khi công bố chương trình CLUSTAL W trên tập san Nucleic Acids Research.

Trước nghiên cứu năm 1994, phương pháp gióng hàng tiến triển cổ điển thường mắc phải lỗi cục bộ do các sai số tích lũy ở giai đoạn đầu không thể sửa đổi ở các bước sau, đặc biệt đối với các chuỗi protein có độ phân kỳ cao. Nhóm tác giả năm 1994 đã giới thiệu ba cải tiến thuật toán sâu sắc: gán trọng số riêng cho từng chuỗi dựa trên khoảng cách tiến hóa để giảm thiểu ảnh hưởng của các chuỗi gần như trùng lặp, biến thiên ma trận thay thế axit amin theo từng mức độ phân kỳ chuỗi, và áp dụng hình phạt khoảng trống đặc hiệu theo vị trí dựa trên cấu trúc bậc hai dự đoán và vùng ưa nước.

Chương trình CLUSTAL W công bố năm 1994 được phân phối hoàn toàn tự do cho cộng đồng học thuật toàn cầu, nhanh chóng trở thành tiêu chuẩn vàng trong việc tái lập lịch sử tiến hóa phân tử, xây dựng cây phát sinh loài và xác định các họ protein chức năng.

Ứng dụng hiện đại trong y học chính xác và công nghệ sinh học

Ngày nay, phân tích trình tự đã trở thành công cụ không thể thiếu trong nhiều lĩnh vực đời sống:

Trong y học lâm sàng và điều trị ung thư, phân tích giải trình tự toàn bộ hệ gen (WGS) hoặc hệ gen biểu hiện (WES) giúp các bác sĩ phát hiện các biến thể soma đặc hiệu của khối u, lựa chọn phác đồ điều trị miễn dịch hoặc thuốc nhắm trúng đích theo phương châm y học cá thể hóa.

Trong giám sát dịch tễ học truyền nhiễm, phân tích trình tự RNA của các loại virus gây bệnh đường hô hấp giúp truy vết đường lây truyền, phát hiện sớm các biến chủng né tránh miễn dịch và hỗ trợ thiết kế vắc-xin công nghệ mRNA thế hệ mới với độ đặc hiệu cao.

Trong nông nghiệp và sinh thái môi trường, phân tích hệ gen vi sinh vật môi trường (metagenomics) cho phép khám phá hàng triệu loài vi khuẩn chưa từng nuôi cấy được trong phòng thí nghiệm, khai thác các enzyme xúc tác sinh học mới và nâng cao năng suất các giống cây trồng chống chịu biến đổi khí hậu.

Câu hỏi thường gặp

Thuật toán BLAST hoạt động theo nguyên lý nào để so khớp nhanh dữ liệu sinh học?

BLAST sử dụng phương pháp tìm kiếm heuristic dựa trên các từ khóa ngắn (k-mer). Thay vì so sánh toàn bộ chuỗi bằng quy hoạch động chậm, BLAST tìm kiếm các đoạn khớp từ ngắn có điểm số cao vượt ngưỡng cho trước, sau đó mở rộng sang hai bên cho đến khi điểm số căn chỉnh suy giảm, giúp tăng tốc độ tìm kiếm cơ sở dữ liệu lên hàng nghìn lần.

Gióng hàng đa trình tự (Multiple Sequence Alignment) có vai trò gì trong sinh học tiến hóa?

Gióng hàng đa trình tự cho phép xếp chồng đồng thời ba hoặc nhiều chuỗi tương đồng để nhận diện các vị trí axit amin hoặc nucleotit được bảo tồn nguyên vẹn qua tiến hóa. Các vùng bảo tồn này thường là trung tâm hoạt động xúc tác của enzyme hoặc liên kết cấu trúc quan trọng, đồng thời cung cấp dữ liệu nền tảng để xây dựng cây phát sinh loài.

Sự khác biệt căn bản giữa giải trình tự Sanger và giải trình tự thế hệ mới (NGS) là gì?

Giải trình tự Sanger sử dụng phương pháp kết thúc chuỗi dideoxy để đọc từng đoạn DNA đơn lẻ với độ chính xác rất cao và độ dài đọc lớn, phù hợp cho kiểm chứng gen đơn. Trong khi đó, NGS sử dụng kỹ thuật giải trình tự song song khối lượng cực lớn hàng triệu đến hàng tỷ phân tử cùng lúc, giúp đọc toàn bộ hệ gen với tốc độ nhanh và chi phí thấp hơn rất nhiều.

Tài liệu tham khảo

  1. Sanger, F., Nicklen, S., Coulson, A. R. (1977). DNA sequencing with chain-terminating inhibitors. Proceedings of the National Academy of Sciences. DOI: 10.1073/pnas.74.12.5463
  2. Altschul, S. F., Gish, W., Miller, W., Myers, E. W., Lipman, D. J. (1990). Basic local alignment search tool. Journal of Molecular Biology. DOI: 10.1016/s0022-2836(05)80360-2
  3. Thompson, J. D., Higgins, D. G., Gibson, T. J. (1994). CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice. Nucleic Acids Research. DOI: 10.1093/nar/22.22.4673