Giải trình tự thế hệ mới (tiếng Anh: Next-Generation Sequencing, viết tắt: NGS), còn được gọi là phương pháp giải trình tự song song khối lượng lớn, là tập hợp các công nghệ sinh học phân tử hiện đại cho phép xác định đồng thời trình tự nucleotide của hàng triệu đến hàng tỷ phân đoạn acid nucleic trong một phản ứng duy nhất với tốc độ vượt trội và chi phí tối ưu. Khác biệt căn bản với phương pháp giải trình tự kết thúc chuỗi cổ điển do Frederick Sanger phát minh vốn chỉ xử lý đơn lẻ từng đoạn DNA ngắn trong mỗi mao quản, công nghệ giải trình tự thế hệ mới dựa trên nguyên lý phân mảnh hệ gene, gắn adapter chuyên biệt và thực hiện quá trình khuếch đại đơn dòng cùng giải mã quang học hoặc điện hóa song song trên bề mặt phẳng. Sự ra đời và hoàn thiện liên tục của công nghệ này đã làm thay đổi căn bản quy mô nghiên cứu sinh học phân tử và y học hệ gene, hạ thấp chi phí giải mã toàn bộ hệ gene người theo cấp số nhân, đồng thời đặt nền tảng kỹ thuật vững chắc cho sự phát triển của y học chính xác, chẩn đoán đột biến ung thư, sàng lọc trước sinh không xâm lấn và nghiên cứu hệ sinh thái vi sinh vật chuyên sâu.
Sự chuyển dịch mô thức từ phương pháp Sanger sang giải trình tự song song
Kể từ khi ra đời vào giai đoạn nửa sau thế kỷ hai mươi, phương pháp Sanger sử dụng các dideoxynucleotide triphosphat đánh dấu huỳnh quang hoặc phóng xạ để gây ngừng ngẫu nhiên quá trình kéo dài chuỗi DNA đã thống trị sinh học phân tử suốt nhiều thập kỷ và là công cụ chủ lực hoàn thành Dự án Hệ gene Người. Tuy nhiên, do giới hạn vật lý của quá trình điện di mao quản và chỉ đọc được một chuỗi duy nhất trong một phản ứng, phương pháp Sanger đòi hỏi thời gian kéo dài nhiều năm cùng ngân sách khổng lồ khi áp dụng cho các hệ gene kích thước lớn.
Công nghệ giải trình tự thế hệ mới khắc phục triệt để rào cản này bằng cách thay đổi hoàn toàn chiến lược kỹ thuật. Thay vì đọc tuần tự từng phân đoạn DNA dài, toàn bộ mẫu acid nucleic được cắt nhỏ thành một thư viện gồm vô số phân đoạn ngắn. Các phân đoạn này được cố định vật lý trên một bề mặt rắn hoặc vi hạt từ tính, sau đó hàng triệu phản ứng sinh hóa giải trình tự diễn ra đồng thời trong cùng một không gian phản ứng thu nhỏ. Nhờ sự tích hợp giữa hóa học phân tử, quang học độ phân giải cao và thuật toán tin sinh học mạnh mẽ, năng suất tạo dữ liệu đã tăng lên hàng triệu lần trong khi lượng hóa chất tiêu thụ trên mỗi cặp base giảm mạnh.
Quy trình kỹ thuật và nguyên lý sinh học phân tử của NGS
Quy trình thực nghiệm chuẩn của giải trình tự thế hệ mới bao gồm bốn giai đoạn liên tiếp có mối liên hệ mật thiết với nhau:
Chuẩn bị thư viện giải trình tự
Mục tiêu của giai đoạn chuẩn bị thư viện là chuyển đổi mẫu acid nucleic ban đầu thành một quần thể các phân đoạn DNA mạch kép có kích thước đồng đều và sẵn sàng cho quá trình cố định:
- Phân mảnh acid nucleic: Phân tử DNA bộ gene hoặc cDNA (tổng hợp từ RNA qua phiên mã ngược) được phân cắt ngẫu nhiên thành các đoạn ngắn có chiều dài xác định thông qua phương pháp siêu âm cơ học hoặc cắt enzyme phân mảnh.
- Sửa chữa đầu mút và gắn đuôi: Các đầu mút so le của phân đoạn DNA được sửa chữa bằng enzyme polymerase và exonuclease để tạo thành đầu bằng, sau đó gắn thêm một phân tử adenine nhô ra ở đầu ba phẩy (A-tailing) để tạo liên kết bắt cặp bổ sung với phân tử thymine trên adapter.
- Gắn adapter nhân tạo: Các đoạn adapter oligonucleotide tổng hợp được gắn vào hai đầu của mỗi phân đoạn DNA nhờ enzyme ligase. Cấu trúc của adapter tích hợp ba vùng chức năng thiết yếu: vùng liên kết đặc hiệu với bề mặt bản dòng chảy, vùng mồi giải trình tự và vùng mã vạch nhận diện (chỉ số index/barcode) cho phép gộp chung nhiều mẫu bệnh phẩm khác nhau vào chạy trong cùng một lượt giải trình tự mà không bị nhầm lẫn dữ liệu.
Cố định và khuếch đại cụm đơn dòng
Để tín hiệu huỳnh quang phát ra trong quá trình giải mã đủ mạnh cho hệ thống quang học của máy giải trình tự ghi nhận, mỗi phân đoạn DNA đơn lẻ trong thư viện cần được nhân bản thành một cụm gồm hàng nghìn bản sao giống hệt nhau:
Trong các hệ thống giải trình tự đọc ngắn phổ biến, các phân đoạn DNA thư viện mạch đơn được bơm vào một phiến kính vi lưu chuyên dụng gọi là bản dòng chảy (flow cell), trên bề mặt có phủ sẵn một thảm gồm hàng tỷ oligonucleotide bắt cặp đặc hiệu với adapter. Sau khi phân tử DNA đơn bắt cặp với oligonucleotide bề mặt, enzyme polymerase tổng hợp chuỗi bổ sung cố định vào đáy bản dòng chảy. Tiếp theo, chuỗi DNA này uốn cong tạo thành hình cầu nối để bắt cặp với một oligonucleotide lân cận, khởi phát chu trình khuếch đại cầu (bridge amplification). Quá trình này được lặp lại qua nhiều chu kỳ liên tiếp, hình thành nên các cụm vi mô (clusters) khu trú cục bộ, mỗi cụm chứa hàng nghìn sợi DNA đơn dòng mang trình tự giống hệt nhau.
Giải trình tự bằng phản ứng tổng hợp
Sau khi hoàn tất tạo cụm, quá trình giải mã nucleotide được thực hiện theo nguyên lý giải trình tự bằng phản ứng tổng hợp (sequencing-by-synthesis):
Mồi giải trình tự được lai ghép vào vùng adapter của các sợi đơn trong cụm. Dung dịch phản ứng chứa enzyme DNA polymerase cùng bốn loại deoxynucleotide triphosphat (dNTP) được đưa vào bản dòng chảy. Điểm đặc biệt của công nghệ này là mỗi loại nucleotide trong số bốn base (A, T, C, G) được gắn một phân tử huỳnh quang có bước sóng phát xạ khác biệt và một nhóm chặn hóa học thuận nghịch ở vị trí ba phẩy carbon của vòng đường.
Trong mỗi chu kỳ tổng hợp, enzyme DNA polymerase chỉ gắn duy nhất một nucleotide bổ sung vào chuỗi đang kéo dài do sự hiện diện của nhóm chặn hóa học ngăn cản việc bổ sung liên tiếp. Hệ thống laser kích thích các phân tử huỳnh quang và camera cảm biến quang học ghi lại hình ảnh phát xạ của toàn bộ bề mặt bản dòng chảy để xác định loại base vừa được đưa vào tại từng cụm. Ngay sau đó, một hóa chất chuyên dụng được bơm vào để cắt bỏ đồng thời nhóm chặn ba phẩy và phân tử phát huỳnh quang, khôi phục nhóm ba phẩy hydroxyl tự do để chuẩn bị cho chu kỳ gắn nucleotide kế tiếp. Quá trình tuần hoàn này được lặp lại hàng trăm lần tương ứng với số lượng cặp base cần đọc.
Bảng tóm tắt so sánh các thế hệ công nghệ giải trình tự DNA chủ đạo:
| Thế hệ công nghệ | Nguyên lý nhận diện chính | Đặc điểm độ dài đọc | Ưu thế và ứng dụng đặc thù |
|---|---|---|---|
| Thế hệ thứ nhất (Sanger) | Điện di mao quản kết thúc chuỗi bằng ddNTP huỳnh quang | Đoạn dài trung bình, giải mã đơn phân đoạn mỗi ống | Độ chính xác rất cao, tiêu chuẩn vàng kiểm chứng đột biến |
| Thế hệ mới (NGS đọc ngắn) | Tổng hợp song song trên bản dòng chảy bằng nucleotide kết thúc thuận nghịch | Đoạn ngắn, hàng trăm triệu đến hàng tỷ phân đoạn song song | Năng suất khổng lồ, chi phí thấp, tối ưu cho WGS, WES và RNA-Seq |
| Thế hệ thứ ba (Đọc dài) | Phân tử đơn thời gian thực (khe nano hoặc giếng quang học) | Đoạn siêu dài, giải mã trực tiếp phân tử đơn lẻ | Vượt qua vùng lặp lại phức tạp, phát hiện biến dị cấu trúc lớn |
Quy trình phân tích dữ liệu tin sinh học
Dữ liệu thô thu được từ máy giải trình tự là những tệp hình ảnh quang học dung lượng khổng lồ. Để chuyển hóa các tín hiệu vật lý này thành thông tin sinh học có ý nghĩa, toàn bộ dữ liệu phải trải qua một quy trình phân tích tin sinh học đa tầng được chuẩn hóa nghiêm ngặt:
- Nhận diện nucleotide và gán điểm chất lượng: Thuật toán chuyển đổi cường độ tín hiệu huỳnh quang thành ký tự nucleotide tương ứng (A, T, C, G) kèm theo điểm chất lượng Phred (Q-score) phản ánh xác suất sai sót của từng vị trí base. Các chuỗi đọc cùng điểm chất lượng được xuất ra dưới định dạng tệp chuẩn FASTQ.
- Kiểm soát chất lượng và xử lý sơ bộ: Các thuật toán tin sinh học tiến hành lọc bỏ các chuỗi đọc có chất lượng kém, cắt bỏ chuỗi adapter nhân tạo và các nucleotide sai lệch ở hai đầu phân đoạn.
- Căn chỉnh trình tự vào hệ gene tham chiếu: Hàng trăm triệu chuỗi đọc ngắn được căn chỉnh vào đúng vị trí tương đồng trên hệ gene tham chiếu của sinh vật mục tiêu nhờ các thuật toán căn chỉnh Burrows-Wheeler (BWA), tạo ra các tệp dữ liệu căn chỉnh định dạng SAM hoặc BAM.
- Xác định biến thể di truyền: Các bộ công cụ phân tích di truyền chuyên dụng (tiêu biểu như GATK) áp dụng các mô hình thống kê để xử lý sai số kỹ thuật, hiệu chuẩn điểm chất lượng base và gọi biến thể di truyền độ tin cậy cao, phát hiện các dạng sai khác gồm đa hình đơn nucleotide (SNV), đột biến chèn hoặc mất đoạn nhỏ (Indels), biến đổi số lượng bản sao gen (CNV) và các biến dị cấu trúc, lưu trữ kết quả ở định dạng tệp VCF.
- Chú giải chức năng biến thể: Các biến thể phát hiện được tiếp tục đối chiếu với các cơ sở dữ liệu hệ gene học quần thể và dữ liệu bệnh học lâm sàng quốc tế để dự đoán tác động sinh học lên cấu trúc protein và đánh giá khả năng gây bệnh.
Hạn chế kỹ thuật và thách thức trong giải trình tự thế hệ mới
Mặc dù mang lại bước tiến vượt trội về hiệu năng và năng suất, công nghệ giải trình tự thế hệ mới đọc ngắn vẫn đối mặt với những ranh giới kỹ thuật và thách thức nội tại:
- Hạn chế của độ dài đọc ngắn: Các phân đoạn đọc ngắn gây cản trở lớn đối với việc lắp ráp hệ gene mới hoàn toàn khi chưa có bộ gene tham chiếu. Đặc biệt, công nghệ này gặp khó khăn nghiêm trọng khi giải mã các vùng lặp lại cao trong bộ gene (như vùng lặp lại nối tiếp, vi vệ tinh), các vùng gen giả có độ tương đồng cao với gen hoạt động, bài toán xác định biến dị cấu trúc quy mô lớn (đảo đoạn, chuyển đoạn nhiễm sắc thể) và việc phân pha xác định liên kết alen trên cùng một nhiễm sắc thể.
- Định kiến khuếch đại: Quá trình khuếch đại PCR trong khâu chuẩn bị thư viện và tạo cụm thường biểu hiện độ lệch bao phủ rõ rệt tại các vùng có hàm lượng GC quá cao hoặc quá thấp, dẫn đến tình trạng suy giảm độ sâu đọc cục bộ hoặc bỏ sót thông tin di truyền tại các vùng giàu GC quan trọng như vùng khởi động promoter.
- Profile sai số đặc thù của nền tảng: Phương pháp giải trình tự bằng phản ứng tổng hợp có xu hướng tích lũy sai số thay thế base ở các chu kỳ cuối của chuỗi đọc, trong khi các nền tảng dựa trên phát hiện điện thế ion hoặc pyrosequencing lại có tần suất sai số chèn/mất đoạn cao tại các đoạn đơn nucleotide lặp lại liên tiếp (homopolymers).
- Gánh nặng tính toán và giải đoán lâm sàng: Dung lượng dữ liệu khổng lồ đặt ra yêu cầu rất lớn về hạ tầng lưu trữ đám mây và hệ thống máy chủ tính toán hiệu năng cao. Trong bối cảnh lâm sàng, việc phát hiện hàng nghìn biến thể di truyền mới dẫn đến thách thức phức tạp trong việc phân loại các biến thể chưa rõ ý nghĩa (Variants of Uncertain Significance), đòi hỏi các nghiên cứu chức năng chuyên sâu để tránh nhầm lẫn trong chỉ định can thiệp y khoa.
Ứng dụng trong nghiên cứu sinh học và thực hành y học
Công nghệ giải trình tự thế hệ mới đã mở ra những chân trời ứng dụng sâu rộng trong hầu hết các lĩnh vực nghiên cứu sinh học và thực hành lâm sàng:
Trong nghiên cứu hệ gene người và bệnh di truyền, giải trình tự toàn bộ hệ gene (Whole Genome Sequencing - WGS) và giải trình tự toàn bộ vùng mã hóa protein (Whole Exome Sequencing - WES) cho phép tìm kiếm căn nguyên di truyền của các hội chứng bệnh hiếm, các bệnh rối loạn chuyển hóa bẩm sinh mà các phương pháp chẩn đoán truyền thống không thể phát hiện.
Trong lĩnh vực ung bướu học chính xác, giải trình tự thế hệ mới giúp lập bản đồ toàn diện các đột biến sinh dưỡng bên trong mô khối u, từ đó định hướng lựa chọn các liệu pháp nhắm trúng đích phân tử và liệu pháp miễn dịch phù hợp cho từng cá thể người bệnh. Hơn thế nữa, kỹ thuật sinh thiết lỏng kết hợp với NGS cho phép phát hiện các phân đoạn DNA khối u tự do tuần hoàn trong máu ngoại vi (ctDNA), giúp theo dõi đáp ứng điều trị và phát hiện sớm tình trạng tái phát vi thể.
Trong y học sinh sản, phương pháp sàng lọc trước sinh không xâm lấn (NIPT) dựa trên giải trình tự các mảnh DNA tự do của thai nhi lưu hành trong máu người mẹ đã trở thành tiêu chuẩn sàng lọc sớm các dị tật lệch bội nhiễm sắc thể phổ biến với độ chính xác cao và an toàn tuyệt đối cho thai phụ.
Trong vi sinh vật học và dịch tễ học phân tử, giải trình tự metagenomics cho phép phân tích toàn bộ vật chất di truyền của các quần xã vi sinh vật phức tạp trực tiếp từ mẫu môi trường hoặc dịch sinh học mà không cần nuôi cấy trong phòng thí nghiệm, hỗ trợ đắc lực cho việc phát hiện nhanh mầm bệnh mới nổi và giám sát các biến chủng virus gây dịch trên phạm vi toàn cầu.