[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"_public_topic_publications_ph%C3%A1t%20hi%E1%BB%87n%20m%C3%B4%20t%C3%ADp{\"limit\":5}":3,"_public_topic_byId_ph%C3%A1t%20hi%E1%BB%87n%20m%C3%B4%20t%C3%ADp":11},{"code":4,"data":5,"meta":10},"SUCCESS",{"latest":6,"mostCited":7,"vietnamFeatured":8,"vietnamLatest":9},[],[],[],[],null,{"code":4,"data":12,"meta":10},{"id":13,"title":14,"description":15,"content":16,"term":17,"englishTitle":18,"synonyms":19,"definition":22,"discipline":23,"references":24,"faqs":73,"createUser":86,"publishUser":90,"keywords":91,"keywordCount":102,"enrichTopicLink":103,"status":104,"createTime":105,"updateTime":106,"publishTime":107,"linkEnrichedTime":108,"publicationScanTime":10,"contentErrorMessage":10,"viewCount":109,"wikidataId":10,"relateTopics":110},"phát hiện mô típ","Phát hiện mô típ (motif discovery) là gì?","Tìm hiểu về phát hiện mô típ (motif discovery): bản chất ma trận PWM, các thuật toán MEME, Gibbs sampling, Matrix Profile và ứng dụng trong hệ gen học.","\u003Cp>Phát hiện mô típ (motif discovery) là bài toán tính toán và sinh tin học nhằm nhận diện các mẫu cấu trúc hoặc trình tự lặp lại có ý nghĩa sinh học hoặc mang tính quy luật thống kê tiềm ẩn bên trong tập dữ liệu chuỗi mà không cần biết trước vị trí xuất hiện chính xác của chúng. Trong sinh học phân tử và hệ gen học, bài toán này tập trung tìm kiếm các đoạn trình tự nucleotide hoặc axit amin ngắn được bảo tồn qua quá trình tiến hóa, thường tương ứng với các vị trí gắn kết của nhân tố phiên mã hoặc các miền chức năng điều hòa biểu hiện gen. Trong khoa học máy tính và khai phá dữ liệu, phát hiện mô típ được tổng quát hóa sang miền chuỗi thời gian nhằm phát hiện các mẫu hình dao động tương đồng lặp đi lặp lại trong các tín hiệu cảm biến, y sinh và chuỗi quan sát vật lý. Bài viết này phân tích toàn diện cơ sở toán học, các họ thuật toán kinh điển từ cực đại hóa kỳ vọng đến lấy mẫu thống kê, phương pháp tiếp cận chuỗi thời gian qua cấu trúc Matrix Profile, cùng những bước chuyển biến của học sâu trong nhận dạng mô típ sinh học.\u003C\u002Fp>\n\n\u003Ch2>Bản chất sinh học và biểu diễn toán học của mô típ trình tự\u003C\u002Fh2>\n\n\u003Cp>Trong cấu trúc {{topic|%7B%22topic%22%3A%22b%E1%BB%99%20gen%22%2C%22text%22%3A%22h%E1%BB%87%20gen%22%7D}}, quá trình điều hòa {{topic|%7B%22topic%22%3A%22bi%E1%BB%83u%20hi%E1%BB%87n%20gen%22%7D}} phụ thuộc chặt chẽ vào sự tương tác giữa các protein điều hòa, đặc biệt là {{topic|%7B%22topic%22%3A%22nh%C3%A2n%20t%E1%BB%91%20phi%C3%AAn%20m%C3%A3%22%7D}} (transcription factor, TF), với các đoạn trình tự DNA đặc hiệu nằm tại vùng khởi động (promoter) hoặc vùng tăng cường (enhancer). Theo tổng quan của Patrik D'haeseleer (2006) trên tạp chí Nature Biotechnology, các mô típ trình tự là những mẫu ngắn lặp lại trong phân tử DNA được giả định là mang {{topic|%7B%22topic%22%3A%22ch%E1%BB%A9c%20n%C4%83ng%20sinh%20h%E1%BB%8Dc%22%7D}}. Các vị trí gắn kết của nhân tố phiên mã (transcription factor binding sites, TFBS) không hoàn toàn cố định về mặt ký tự mà luôn có sự biến thiên nhất định giữa các gen đồng điều hòa hoặc giữa các loài khác nhau do áp lực đột biến và chọn lọc tự nhiên. Khái niệm mô típ trình tự (sequence motif) phản ánh chính xác đặc tính biến thiên có tổ chức này, đại diện cho một họ các chuỗi ngắn có chung chức năng sinh học.\u003C\u002Fp>\n\n\u003Cp>Như Gary D. Stormo (2000) đã hệ thống hóa trong bài báo trên Bioinformatics, việc nghiên cứu các vị trí gắn kết của DNA về mặt tính toán được chia thành hai bài toán cốt lõi: thứ nhất là phát triển mô hình đại diện từ các vị trí đã biết để dự đoán vị trí mới, và thứ hai là phát hiện vị trí chưa biết cùng đặc hiệu của protein từ tập hợp các trình tự chưa gán nhãn. Trước đây, các nhà nghiên cứu thường sử dụng trình tự đồng thuận (consensus sequence) để mô tả mô típ bằng bảng mã IUPAC mở rộng. Tuy nhiên, cách tiếp cận này xem mọi vị trí có vai trò nhị phân và bỏ qua sự khác biệt đáng kể về mức độ ưu tiên giữa các nucleotide tại từng vị trí. Nhằm khắc phục hạn chế trên, mô hình ma trận trọng số vị trí (Position Weight Matrix, PWM), hay còn gọi là ma trận chấm điểm đặc thù vị trí (Position-Specific Scoring Matrix, PSSM), đã trở thành chuẩn mực toán học trong mô hình hóa mô típ sinh học.\u003C\u002Fp>\n\n\u003Cp>Giả sử một mô típ có chiều dài cố định là \u003Cscript type=\"math\u002Ftex\">L\u003C\u002Fscript> nucleotide. Để xây dựng ma trận PWM, trước tiên tập hợp các đoạn trình tự đã căn chỉnh được dùng để đếm tần số xuất hiện của từng loại bazơ nitơ. Nhằm tránh xác suất bằng không đối với những bazơ chưa được quan sát trong các mẫu kích thước nhỏ, tần số quan sát được làm trơn bằng kỹ thuật giả đếm (pseudocount). Xác suất xuất hiện của bazơ \u003Cscript type=\"math\u002Ftex\">b\u003C\u002Fscript> tại vị trí \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript> được tính theo công thức:\u003C\u002Fp>\n\n\u003Cscript type=\"math\u002Ftex; mode=display\">p_{i, b} = \\frac{n_{i, b} + q_b}{N + \\sum_{b'} q_{b'}}\u003C\u002Fscript>\n\n\u003Cp>Trong đó, \u003Cscript type=\"math\u002Ftex\">n_{i, b}\u003C\u002Fscript> là số lần xuất hiện quan sát được của nucleotide \u003Cscript type=\"math\u002Ftex\">b\u003C\u002Fscript> tại vị trí thứ \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript> trong tập mẫu, \u003Cscript type=\"math\u002Ftex\">q_b\u003C\u002Fscript> là tần suất nền của nucleotide \u003Cscript type=\"math\u002Ftex\">b\u003C\u002Fscript> trong toàn bộ hệ gen, và \u003Cscript type=\"math\u002Ftex\">N\u003C\u002Fscript> là tổng số đoạn trình tự được căn chỉnh. Từ phân bố xác suất này, trọng số log-odds tại mỗi ô của ma trận PWM được xác định theo công thức:\u003C\u002Fp>\n\n\u003Cscript type=\"math\u002Ftex; mode=display\">W_{i, b} = \\log_2 \\left( \\frac{p_{i, b}}{q_b} \\right)\u003C\u002Fscript>\n\n\u003Cp>Trong đó, \u003Cscript type=\"math\u002Ftex\">W_{i, b}\u003C\u002Fscript> biểu diễn điểm số đánh đổi log-odds của bazơ \u003Cscript type=\"math\u002Ftex\">b\u003C\u002Fscript> tại vị trí \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript>, phản ánh mức độ ưu tiên của vị trí đó so với một mô hình nền ngẫu nhiên độc lập. Điểm tương đồng của một đoạn trình tự bất kỳ \u003Cscript type=\"math\u002Ftex\">S = (s_1, s_2, \\dots, s_L)\u003C\u002Fscript> có độ dài \u003Cscript type=\"math\u002Ftex\">L\u003C\u002Fscript> đối với mô típ được tính bằng tổng điểm trọng số trên toàn bộ các vị trí:\u003C\u002Fp>\n\n\u003Cscript type=\"math\u002Ftex; mode=display\">Score(S) = \\sum_{i=1}^{L} W_{i, s_i}\u003C\u002Fscript>\n\n\u003Cp>Trong đó, \u003Cscript type=\"math\u002Ftex\">Score(S)\u003C\u002Fscript> là tổng điểm log-odds của đoạn chuỗi \u003Cscript type=\"math\u002Ftex\">S\u003C\u002Fscript>, và \u003Cscript type=\"math\u002Ftex\">s_i\u003C\u002Fscript> là ký tự nucleotide quan sát được tại vị trí thứ \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript>. Bên cạnh điểm số quét trình tự, mức độ bảo tồn thông tin tại từng vị trí của mô típ được đo lường bằng hàm lượng thông tin (information content), dựa trên khái niệm phân kỳ Kullback-Leibler so với phân bố nền:\u003C\u002Fp>\n\n\u003Cscript type=\"math\u002Ftex; mode=display\">I_i = 2 + \\sum_{b \\in \\{A, C, G, T\\}} p_{i, b} \\log_2 p_{i, b}\u003C\u002Fscript>\n\n\u003Cp>Trong đó, \u003Cscript type=\"math\u002Ftex\">I_i\u003C\u002Fscript> là hàm lượng thông tin tính bằng đơn vị bit tại vị trí thứ \u003Cscript type=\"math\u002Ftex\">i\u003C\u002Fscript>. Đối với phân tử DNA gồm 4 loại bazơ nitơ với phân bố nền đồng đều, giá trị hàm lượng thông tin dao động từ 0 bit (hoàn toàn ngẫu nhiên, cả 4 bazơ có xác suất ngang nhau) đến cực đại là 2 bit (vị trí hoàn toàn bất biến, chỉ chấp nhận duy nhất một loại bazơ). Hàm lượng thông tin là cơ sở để dựng biểu đồ trực quan hóa Sequence Logo, trong đó chiều cao tổng cộng của mỗi cột thể hiện mức độ bảo tồn của vị trí, còn chiều cao của từng chữ cái tỷ lệ thuận với tần suất tương đối của bazơ đó.\u003C\u002Fp>\n\n\u003Ch2>Các họ thuật toán phát hiện mô típ kinh điển trong sinh tin học\u003C\u002Fh2>\n\n\u003Cp>Bài toán phát hiện mô típ không có giám sát (de novo motif discovery) đặt ra thách thức tính toán to lớn: cho trước một tập hợp các trình tự DNA hoặc protein nghi ngờ chứa vị trí gắn chung, thuật toán phải đồng thời xác định vị trí bắt đầu của các đoạn mô típ trên từng trình tự và ước lượng các tham số của ma trận PWM tương ứng. Do không gian tìm kiếm bùng nổ theo hàm mũ, các nhà khoa học đã phát triển ba trường phái giải thuật chính.\u003C\u002Fp>\n\n\u003Ch3>1. Phương pháp liệt kê tổ hợp (Enumerative and Combinatorial Methods)\u003C\u002Fh3>\n\n\u003Cp>Phương pháp liệt kê dựa trên việc duyệt toàn bộ không gian các từ có độ dài cố định (k-mer). Thuật toán đếm số lần xuất hiện của từng k-mer hoặc các biến thể cho phép tối đa một số sai khác nhất định trên tập dữ liệu đầu vào. Các công cụ sử dụng cấu trúc dữ liệu cây hậu tố (suffix tree) hoặc đồ thị de Bruijn giúp tăng tốc độ đếm và kiểm định mức độ giàu bất thường (overrepresentation) của từng k-mer dựa trên các phân bố thống kê như phân bố nhị thức hoặc phân bố siêu hình học. Ưu điểm nổi bật của phương pháp này là đảm bảo tìm ra nghiệm tối ưu toàn cục theo tiêu chuẩn thống kê đã định. Tuy nhiên, khi độ dài mô típ tăng lên, không gian tổ hợp mở rộng quá nhanh khiến phương pháp này trở nên kém khả thi đối với các mô típ dài và có mức độ thoái hóa cao.\u003C\u002Fp>\n\n\u003Ch3>2. Phương pháp cực đại hóa kỳ vọng (Expectation-Maximization)\u003C\u002Fh3>\n\n\u003Cp>Phương pháp mô hình hỗn hợp hữu hạn xem tập dữ liệu đầu vào như một sự pha trộn giữa hai nguồn phát sinh: mô hình mô típ (mô tả bằng ma trận PWM) và mô hình nền (mô tả bằng phân bố Markov bậc không hoặc bậc cao). Giải thuật cực đại hóa kỳ vọng (Expectation-Maximization, EM) được ứng dụng để tối ưu hóa đồng thời vị trí mô típ và tham số ma trận mà không cần biết trước gán nhãn thực tế. Quy trình lặp của EM gồm hai bước chính:\u003C\u002Fp>\n\n\u003Cul>\n\u003Cli>\u003Cstrong>Bước kỳ vọng (E-step):\u003C\u002Fstrong> Dựa trên các tham số ma trận PWM hiện tại, thuật toán tính toán phân bố xác suất hậu nghiệm cho thấy mỗi vị trí trên từng trình tự có phải là điểm bắt đầu của một vị trí mô típ hay không.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Bước cực đại hóa (M-step):\u003C\u002Fstrong> Cập nhật lại các xác suất nucleotide của ma trận PWM bằng cách lấy trung bình có trọng số của các đoạn chuỗi con, với trọng số chính là xác suất hậu nghiệm vừa tính được ở bước trước.\u003C\u002Fli>\n\u003C\u002Ful>\n\n\u003Cp>Thuật toán MEME là đại diện tiêu biểu nhất cho hướng tiếp cận này. Theo công bố của Bailey và các cộng sự (2009) trên tạp chí Nucleic Acids Research, hệ sinh thái MEME Suite đã phát triển thành một cổng thông tin trực tuyến toàn diện, tích hợp nhiều công cụ phân tích mô típ mở rộng. Hệ thống này hỗ trợ ba chế độ phân bố vị trí mô típ bao gồm: OOPS (One Occurrence Per Sequence, mỗi trình tự chứa đúng một vị trí mô típ), ZOOPS (Zero Or One Occurrence Per Sequence, mỗi trình tự chứa không hoặc một vị trí mô típ), và ANR (Any Number of Repetitions, mỗi trình tự có thể chứa số lượng bản sao mô típ tùy ý). Nhờ khả năng xử lý mượt mà dữ liệu nhiễu và cung cấp điểm số thống kê E-value vững chắc, thuật toán cực đại hóa kỳ vọng đã trở thành nền tảng của nhiều nghiên cứu hệ gen học chức năng.\u003C\u002Fp>\n\n\u003Ch3>3. Phương pháp lấy mẫu thống kê Gibbs (Gibbs Sampling)\u003C\u002Fh3>\n\n\u003Cp>Khác với giải thuật EM mang tính tất định và dễ bị mắc kẹt tại các cực trị địa phương, phương pháp lấy mẫu Gibbs tiếp cận bài toán dưới dạng chuỗi Markov Monte Carlo (MCMC). Trong công trình mang tính đột phá công bố trên tạp chí Science, Lawrence và các cộng sự (1993) đã giới thiệu chiến lược lấy mẫu Gibbs để nhận diện các tín hiệu trình tự tinh vi trong protein và DNA. Thuật toán bắt đầu bằng cách chọn ngẫu nhiên một vị trí xuất phát cho mô típ trên mỗi trình tự đầu vào, sau đó tiến hành quá trình tối ưu hóa lặp tuần tự:\u003C\u002Fp>\n\n\u003Col>\n\u003Cli>\u003Cstrong>Giai đoạn loại trừ:\u003C\u002Fstrong> Thuật toán chọn ngẫu nhiên một trình tự trong tập dữ liệu và tạm thời loại bỏ đoạn mô típ hiện tại của trình tự đó ra khỏi mô hình.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Giai đoạn ước lượng:\u003C\u002Fstrong> Sử dụng các đoạn mô típ trên những trình tự còn lại để xây dựng ma trận PWM tạm thời.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Giai đoạn lấy mẫu:\u003C\u002Fstrong> Dùng ma trận PWM tạm thời để tính điểm trọng số cho mọi cửa sổ trượt trên trình tự vừa bị loại trừ, chuyển điểm số thành phân bố xác suất, và bốc thăm ngẫu nhiên một vị trí bắt đầu mới theo phân bố xác suất đó.\u003C\u002Fli>\n\u003C\u002Fol>\n\n\u003Cp>Nhờ yếu tố ngẫu nhiên trong bước bốc thăm, thuật toán lấy mẫu Gibbs có khả năng nhảy ra khỏi các hố cực trị địa phương để tiến dần về phân bố cực đại toàn cục. Đáng chú ý, Lawrence và các cộng sự (1993) đã chứng minh rằng {{topic|%7B%22topic%22%3A%22%C4%91%E1%BB%99%20ph%E1%BB%A9c%20t%E1%BA%A1p%20t%C3%ADnh%20to%C3%A1n%22%7D}} của mỗi vòng lặp Gibbs tỷ lệ tuyến tính với số lượng trình tự đầu vào, cho phép thuật toán thực thi chỉ trong vài giây trên các máy trạm máy tính và xử lý hiệu quả các tập dữ liệu sinh học quy mô lớn.\u003C\u002Fp>\n\n\u003Ch2>Phát hiện mô típ trong khai phá dữ liệu chuỗi thời gian\u003C\u002Fh2>\n\n\u003Cp>Không chỉ giới hạn trong các chuỗi ký tự rời rạc của {{topic|%7B%22topic%22%3A%22sinh%20h%E1%BB%8Dc%20ph%C3%A2n%20t%E1%BB%AD%22%7D}}, khái niệm mô típ đã được mở rộng mạnh mẽ sang lĩnh vực khai phá dữ liệu chuỗi thời gian (time series data mining). Trong chuỗi thời gian, một mô típ được định nghĩa là một cặp đoạn con (hoặc một nhóm đoạn con) có hình dạng dao động tương đồng nhau nhất bên trong một chuỗi số thực liên tục kéo dài.\u003C\u002Fp>\n\n\u003Ch3>Định nghĩa hình thức và thách thức tính toán\u003C\u002Fh3>\n\n\u003Cp>Cho một chuỗi thời gian liên tục \u003Cscript type=\"math\u002Ftex\">T\u003C\u002Fscript> có độ dài \u003Cscript type=\"math\u002Ftex\">n\u003C\u002Fscript>, mục tiêu là tìm kiếm hai đoạn con không chồng lấn có độ dài \u003Cscript type=\"math\u002Ftex\">m\u003C\u002Fscript> sao cho khoảng cách Euclidean sau khi chuẩn hóa z-score giữa chúng đạt giá trị nhỏ nhất trong toàn bộ tập hợp các cặp đoạn con khả dĩ. Chuẩn hóa z-score là thao tác bắt buộc nhằm loại bỏ ảnh hưởng của độ lệch biên độ và dịch chuyển đường nền, đảm bảo mô típ phản ánh đúng hình dạng động học cốt lõi của quá trình đo lường.\u003C\u002Fp>\n\n\u003Cp>Thách thức trung tâm của bài toán nằm ở chi phí tính toán. Nếu sử dụng phương pháp duyệt cạn hai vòng lặp lồng nhau (brute-force), số lượng cặp đoạn con cần so sánh có bậc độ phức tạp là \u003Cscript type=\"math\u002Ftex\">O(n^2)\u003C\u002Fscript>. Đối với các chuỗi thời gian thực tế thu thập từ cảm biến công nghiệp, dữ liệu điện tim hoặc điện não kéo dài hàng triệu điểm đo, phương pháp duyệt cạn đòi hỏi thời gian tính toán kéo dài nhiều tuần hoặc nhiều tháng, không thể đáp ứng yêu cầu phân tích.\u003C\u002Fp>\n\n\u003Ch3>Đột phá từ thuật toán MK và cấu trúc Matrix Profile\u003C\u002Fh3>\n\n\u003Cp>Để vượt qua rào cản bậc hai, Mueen và các cộng sự (2009) đã đề xuất thuật toán MK tại hội nghị SIAM SDM, tiên phong chứng minh khả năng tìm kiếm chính xác mô típ chuỗi thời gian mà không cần dựa vào xấp xỉ thô. Bằng cách áp dụng {{topic|%7B%22topic%22%3A%22b%E1%BA%A5t%20%C4%91%E1%BA%B3ng%20th%E1%BB%A9c%20tam%20gi%C3%A1c%22%7D}}, kỹ thuật chặn dưới khoảng cách Euclidean, và cơ chế dừng sớm (early abandoning), thuật toán loại bỏ phần lớn các phép tính khoảng cách thừa thãi, nâng cao tốc độ xử lý nhanh hơn nhiều lần so với phương pháp vét cạn thông thường.\u003C\u002Fp>\n\n\u003Cp>Kế thừa và khái quát hóa bài toán tìm kiếm tương đồng, Yeh và các cộng sự (2016) đã công bố cấu trúc Matrix Profile tại hội nghị IEEE ICDM, định hình một tiêu chuẩn mới cho {{topic|%7B%22topic%22%3A%22ph%C3%A2n%20t%C3%ADch%20chu%E1%BB%97i%20th%E1%BB%9Di%20gian%22%7D}}. Matrix Profile là một vector phụ trợ lưu trữ khoảng cách Euclidean chuẩn hóa nhỏ nhất từ mỗi đoạn con tới láng giềng gần nhất của nó trong toàn bộ chuỗi thời gian, đi kèm với một vector chỉ số hồ sơ (profile index) ghi nhận vị trí chính xác của láng giềng đó. Cấu trúc này mang lại những ưu điểm vượt trội:\u003C\u002Fp>\n\n\u003Cul>\n\u003Cli>\u003Cstrong>Giải quyết đồng thời nhiều bài toán:\u003C\u002Fstrong> Cặp đoạn con tương ứng với giá trị nhỏ nhất toàn cục của Matrix Profile chính là mô típ chuỗi thời gian (mẫu lặp tương đồng nhất), trong khi điểm đạt giá trị khoảng cách lớn nhất đại diện cho dị biệt chuỗi thời gian (time series discord, dấu hiệu của sự cố hoặc bất thường).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Tính toán chính xác và song song hóa:\u003C\u002Fstrong> Các thuật toán như STAMP và STOMP cho phép tính toán Matrix Profile một cách chính xác tuyệt đối, đồng thời tận dụng hiệu quả năng lực tính toán song song của các kiến trúc vi xử lý đồ họa (GPU).\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Không cần tinh chỉnh tham số phức tạp:\u003C\u002Fstrong> Ngoại trừ độ dài cửa sổ đoạn con \u003Cscript type=\"math\u002Ftex\">m\u003C\u002Fscript> do người dùng lựa chọn theo ngữ cảnh miền ứng dụng, toàn bộ quy trình tính toán không phụ thuộc vào các ngưỡng khoảng cách tùy tiện.\u003C\u002Fli>\n\u003C\u002Ful>\n\n\u003Ch2>Học sâu và các phương pháp hiện đại trong phát hiện mô típ\u003C\u002Fh2>\n\n\u003Cp>Sự bùng nổ của các công nghệ giải trình tự thế hệ mới (Next-Generation Sequencing, NGS) như ChIP-seq, ATAC-seq và CLIP-seq đã tạo ra các bộ dữ liệu thực nghiệm khổng lồ, bao gồm hàng chục nghìn đỉnh liên kết trên toàn bộ hệ gen. Quy mô dữ liệu này đã thúc đẩy bước chuyển dịch từ các mô hình xác suất truyền thống sang các kiến trúc học sâu (deep learning).\u003C\u002Fp>\n\n\u003Cp>Mạng nơ-ron tích chập (Convolutional Neural Networks, CNN) thể hiện sự tương thích tự nhiên với dữ liệu trình tự sinh học. Khi biểu diễn chuỗi DNA dưới dạng ma trận one-hot, phép tích chập một chiều giữa một bộ lọc (filter) và chuỗi nucleotide về bản chất tương đương với thao tác trượt một ma trận trọng số vị trí PWM dọc theo chiều dài phân tử. Giá trị kích hoạt tại mỗi vị trí phản ánh mức độ ăn khớp giữa đoạn chuỗi con với mẫu hình mà bộ lọc đã học được trong quá trình huấn luyện mô hình dự đoán chức năng sinh học.\u003C\u002Fp>\n\n\u003Cp>Mặc dù đạt độ chính xác phân loại vượt trội, mạng CNN truyền thống đối mặt với hạn chế nghiêm trọng về khả năng diễn giải: các bộ lọc thường học các biểu diễn phân tán (distributed representations), trong đó nhiều bộ lọc cùng nắm giữ các mảnh rời rạc của cùng một mô típ sinh học, gây khó khăn cho việc phục hồi ma trận PWM hoàn chỉnh. Nghiên cứu của Koo và Ploenzke (2021) trên tạp chí Nature Machine Intelligence đã tạo ra bước đột phá khi chứng minh rằng việc áp dụng hàm kích hoạt hàm mũ cho các bộ lọc ở tầng đầu tiên giúp cải thiện đáng kể khả năng diễn giải, khắc phục hiệu quả hiện tượng biểu diễn phân tán ở tầng đầu tiên so với các hàm kích hoạt phổ biến như ReLU. Hàm kích hoạt hàm mũ tạo ra các phản ứng chọn lọc cao đối với các mẫu trình tự đặc thù, cho phép các bộ lọc nơ-ron trích xuất trực tiếp các biểu diễn mô típ rõ ràng, mạch lạc và tương đồng cao với các ma trận PWM thực nghiệm.\u003C\u002Fp>\n\n\u003Ch2>Bảng so sánh các phương pháp phát hiện mô típ tiêu biểu\u003C\u002Fh2>\n\n\u003Cp>Dưới đây là bảng tổng hợp và so sánh toàn diện các phương pháp phát hiện mô típ trên các chiều cạnh: mô hình biểu diễn, nguyên lý hoạt động, độ phức tạp tính toán, ưu điểm và hạn chế cốt lõi.\u003C\u002Fp>\n\n\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth>Phương pháp\u003C\u002Fth>\n\u003Cth>Mô hình biểu diễn\u003C\u002Fth>\n\u003Cth>Nguyên lý hoạt động\u003C\u002Fth>\n\u003Cth>Độ phức tạp tính toán\u003C\u002Fth>\n\u003Cth>Ưu điểm nổi bật\u003C\u002Fth>\n\u003Cth>Hạn chế chính\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Liệt kê từ tổ hợp\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Trình tự k-mer hoặc chuỗi đồng thuận\u003C\u002Ftd>\n\u003Ctd>Duyệt toàn bộ không gian từ, đếm tần số và đánh giá thống kê mức độ giàu bất thường\u003C\u002Ftd>\n\u003Ctd>Hàm mũ theo độ dài mô típ\u003C\u002Ftd>\n\u003Ctd>Đảm bảo tìm ra nghiệm tối ưu toàn cục theo tiêu chí thống kê xác định\u003C\u002Ftd>\n\u003Ctd>Kém khả thi khi mô típ dài hoặc có mức độ biến thiên bazơ cao\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Cực đại hóa kỳ vọng (EM \u002F MEME)\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Ma trận trọng số vị trí (PWM)\u003C\u002Ftd>\n\u003Ctd>Tối ưu hóa lặp giữa bước tính xác suất vị trí (E) và bước cập nhật trọng số ma trận (M)\u003C\u002Ftd>\n\u003Ctd>Đa thức theo số lượng và chiều dài trình tự\u003C\u002Ftd>\n\u003Ctd>Xử lý tốt dữ liệu nhiễu, cung cấp mô hình xác suất hoàn chỉnh và giá trị E-value\u003C\u002Ftd>\n\u003Ctd>Dễ bị kẹt tại điểm cực trị địa phương tùy thuộc vào điểm khởi tạo ban đầu\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Lấy mẫu Gibbs\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Ma trận xác suất vị trí và chuỗi căn chỉnh\u003C\u002Ftd>\n\u003Ctd>Lấy mẫu chuỗi Markov Monte Carlo lặp qua việc loại trừ và chọn ngẫu nhiên vị trí\u003C\u002Ftd>\n\u003Ctd>Tuyến tính theo số lượng trình tự đầu vào\u003C\u002Ftd>\n\u003Ctd>Khả năng vượt khỏi cực trị địa phương nhờ lấy mẫu ngẫu nhiên, tốc độ nhanh\u003C\u002Ftd>\n\u003Ctd>Kết quả mang tính ngẫu nhiên giữa các lần chạy, cần số vòng lặp đủ lớn để hội tụ\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Thuật toán MK chuỗi thời gian\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Đoạn con số thực chuẩn hóa z-score\u003C\u002Ftd>\n\u003Ctd>Duyệt cặp kết hợp chặn dưới bất đẳng thức tam giác và cơ chế dừng sớm\u003C\u002Ftd>\n\u003Ctd>Dưới bậc hai trên dữ liệu thực tế\u003C\u002Ftd>\n\u003Ctd>Tìm kiếm chính xác nghiệm tối ưu toàn cục, nhanh hơn nhiều lần so với duyệt cạn\u003C\u002Ftd>\n\u003Ctd>Hiệu quả phụ thuộc vào độ chặt của chặn dưới trên từng loại dữ liệu cụ thể\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Cấu trúc Matrix Profile\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Vector khoảng cách 1 láng giềng gần nhất\u003C\u002Ftd>\n\u003Ctd>Tính toán phép nối tương đồng mọi cặp bằng thuật toán STAMP hoặc STOMP\u003C\u002Ftd>\n\u003Ctd>Bậc hai chính xác nhưng tối ưu hóa cao\u003C\u002Ftd>\n\u003Ctd>Phát hiện đồng thời mô típ và dị biệt, hỗ trợ song song hóa mạnh mẽ trên GPU\u003C\u002Ftd>\n\u003Ctd>Đòi hỏi bộ nhớ lưu trữ tỷ lệ thuận với chiều dài chuỗi thời gian đầu vào\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>\u003Cstrong>Mạng nơ-ron tích chập (Deep CNN)\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd>Bộ lọc tích chập và bản đồ kích hoạt\u003C\u002Ftd>\n\u003Ctd>Học biểu diễn tự động qua lan truyền ngược kết hợp hàm kích hoạt hàm mũ\u003C\u002Ftd>\n\u003Ctd>Phụ thuộc cấu trúc mạng và số epoch\u003C\u002Ftd>\n\u003Ctd>Mô hình hóa được các mối tương tác bậc cao và ngữ cảnh hệ gen phức tạp\u003C\u002Ftd>\n\u003Ctd>Đòi hỏi khối lượng dữ liệu huấn luyện lớn và tài nguyên tính toán chuyên dụng\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\n\n\u003Ch2>Ứng dụng thực tiễn trong khoa học và công nghệ\u003C\u002Fh2>\n\n\u003Cp>Phát hiện mô típ đóng vai trò mắt xích then chốt trong nhiều lĩnh vực nghiên cứu khoa học cơ bản và kỹ thuật ứng dụng:\u003C\u002Fp>\n\n\u003Cul>\n\u003Cli>\u003Cstrong>Giải mã cơ chế biểu hiện gen và mạng lưới điều hòa:\u003C\u002Fstrong> Nhận diện các vị trí gắn kết của nhân tố phiên mã giúp xác định các gen đích nằm dưới sự kiểm soát của từng protein điều hòa, từ đó tái tạo mạng lưới điều hòa phiên mã trong tế bào bình thường cũng như tế bào ung thư.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Phân tích biến dị không mã hóa trong y học cá thể hóa:\u003C\u002Fstrong> Phần lớn các biến thể {{topic|%7B%22topic%22%3A%22%C4%91a%20h%C3%ACnh%20%C4%91%C6%A1n%20nucleotide%22%7D}} (SNP) liên quan đến bệnh di truyền nằm ở các vùng không mã hóa của bộ gen. Phát hiện mô típ giúp dự đoán xem một đột biến điểm có làm phá hủy hoặc tạo mới một vị trí gắn kết của nhân tố phiên mã hay không, làm sáng tỏ cơ chế sinh bệnh học. Trong bối cảnh nghiên cứu y sinh học tại Việt Nam, các kỹ thuật này đang được ứng dụng để phân tích dữ liệu giải trình tự hệ gen người Việt nhằm xác định các biến dị đặc trưng quần thể liên quan đến đáp ứng thuốc và nguy cơ bệnh lý tim mạch, ung thư.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Giám sát và phân tích chủng vi sinh vật gây bệnh:\u003C\u002Fstrong> Phân tích mô típ trên hệ gen của các tác nhân truyền nhiễm như virus sốt xuất huyết Dengue hoặc virus cúm giúp phát hiện các đoạn trình tự được bảo tồn nghiêm ngặt qua các đợt bùng phát dịch, hỗ trợ thiết kế mồi chẩn đoán PCR và phát triển kháng thể đơn dòng.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Khai phá tín hiệu y sinh học và cảm biến thông minh:\u003C\u002Fstrong> Trong xử lý tín hiệu y tế, phát hiện mô típ chuỗi thời gian được ứng dụng để định vị các chu kỳ nhịp tim chuẩn trong dữ liệu điện tâm đồ (ECG) hoặc các đợt phóng điện kịch phát trong điện não đồ (EEG), hỗ trợ chẩn đoán tự động rối loạn nhịp tim và động kinh. Trong kỹ thuật công nghiệp, việc nhận diện các mô típ rung động định kỳ từ cảm biến gia tốc giúp phát hiện sớm hiện tượng mỏi cơ học và hỏng hóc trong động cơ tuabin.\u003C\u002Fli>\n\u003C\u002Ful>\n\n\u003Ch2>Thách thức tính toán và xu hướng nghiên cứu tương lai\u003C\u002Fh2>\n\n\u003Cp>Mặc dù đã đạt được nhiều thành tựu vượt bậc, lĩnh vực phát hiện mô típ vẫn đang đối mặt với những rào cản tính toán và sinh học mang tính bản chất:\u003C\u002Fp>\n\n\u003Cp>Thứ nhất, tỷ lệ tín hiệu trên nhiễu trong hệ gen của các sinh vật bậc cao là rất thấp. Vùng không mã hóa ở người chiếm phần lớn chiều dài hệ gen, trong khi các vị trí gắn kết thực sự chỉ dài một đoạn ngắn và phân tán rải rác. Sự hiện diện dày đặc của các đoạn lặp lại nhân bản (transposable elements, microsatellite) dễ dẫn đến các phát hiện dương tính giả về mặt thống kê nhưng không có chức năng sinh học.\u003C\u002Fp>\n\n\u003Cp>Thứ hai, mô típ trong tự nhiên thường không tồn tại đơn lẻ mà hoạt động theo cơ chế tổ hợp (co-binding \u002F composite motifs). Hai hoặc nhiều nhân tố phiên mã có thể cùng liên kết vào DNA theo các cấu hình không gian linh hoạt với khoảng cách ngăn cách thay đổi. Các mô hình PWM truyền thống dựa trên giả định độc lập giữa các vị trí không thể nắm bắt được sự phụ thuộc phức tạp này.\u003C\u002Fp>\n\n\u003Cp>Thứ ba, sự bùng nổ của các mô hình nền tảng (foundation models) dựa trên kiến trúc Transformer đang mở ra hướng tiếp cận mới cho bài toán mô típ. Bằng cơ chế chú ý đa đầu (multi-head self-attention), các mô hình ngôn ngữ hệ gen có thể nắm bắt được mối liên hệ phụ thuộc xa giữa các nhân tố điều hòa cách nhau hàng chục nghìn cặp bazơ. Việc kết hợp giữa khả năng biểu diễn phong phú của mô hình Transformer với tính chặt chẽ, dễ diễn giải của các mô hình mô típ toán học truyền thống đang là tâm điểm phát triển của {{topic|%7B%22topic%22%3A%22tin%20sinh%20h%E1%BB%8Dc%22%7D}} hiện đại.\u003C\u002Fp>\n","Phát hiện mô típ","motif discovery",[20,21],"tìm kiếm mô típ","nhận dạng mô típ","Phát hiện mô típ (motif discovery) là bài toán tính toán nhằm nhận diện các mẫu cấu trúc hoặc trình tự con lặp lại có ý nghĩa sinh học hoặc quy luật thống kê bên trong tập dữ liệu chuỗi mà không biết trước vị trí của chúng. Khái niệm này được ứng dụng rộng rãi từ phân tích vị trí gắn kết nhân tố phiên mã trong hệ gen học đến khai phá mẫu hình dao động trong chuỗi thời gian.","NATURAL_SCIENCES",[25,32,39,46,53,60,66],{"citationText":26,"title":27,"authors":28,"source":29,"year":30,"doi":31,"url":10},"D'haeseleer, P. (2006). What are DNA sequence motifs? Nature Biotechnology, 24(4), 423-425.","What are DNA sequence motifs?","D'haeseleer","Nature Biotechnology",2006,"10.1038\u002Fnbt0406-423",{"citationText":33,"title":34,"authors":35,"source":36,"year":37,"doi":38,"url":10},"Lawrence, C. E., Altschul, S. F., Boguski, M. S., Liu, J. S., Neuwald, A. F., & Wootton, J. C. (1993). Detecting Subtle Sequence Signals: a Gibbs Sampling Strategy for Multiple Alignment. Science, 262(5131), 208-214.","Detecting Subtle Sequence Signals: a Gibbs Sampling Strategy for Multiple Alignment","Lawrence, Altschul, Boguski, Liu, Neuwald, Wootton","Science",1993,"10.1126\u002Fscience.8211139",{"citationText":40,"title":41,"authors":42,"source":43,"year":44,"doi":45,"url":10},"Bailey, T. L., Boden, M., Buske, F. A., Frith, M., Grant, C. E., Clementi, L., Ren, J., Li, W. W., & Noble, W. S. (2009). MEME SUITE: tools for motif discovery and searching. Nucleic Acids Research, 37(Web Server issue), W202-W208.","MEME SUITE: tools for motif discovery and searching","Bailey, Boden, Buske, Frith, Grant, Clementi, Ren, Li, Noble","Nucleic Acids Research",2009,"10.1093\u002Fnar\u002Fgkp335",{"citationText":47,"title":48,"authors":49,"source":50,"year":51,"doi":52,"url":10},"Stormo, G. D. (2000). DNA binding sites: representation and discovery. Bioinformatics, 16(1), 16-23.","DNA binding sites: representation and discovery","Stormo","Bioinformatics",2000,"10.1093\u002Fbioinformatics\u002F16.1.16",{"citationText":54,"title":55,"authors":56,"source":57,"year":58,"doi":59,"url":10},"Yeh, C. C. M., Zhu, Y., Ulanova, L., Begum, N., Ding, Y., Dau, H. A., Silva, D. F., Mueen, A., & Keogh, E. (2016). Matrix Profile I: All Pairs Similarity Joins for Time Series: A Unifying View That Includes Motifs, Discords and Shapelets. 2016 IEEE 16th International Conference on Data Mining (ICDM), 1317-1322.","Matrix Profile I: All Pairs Similarity Joins for Time Series: A Unifying View That Includes Motifs, Discords and Shapelets","Yeh, Zhu, Ulanova, Begum, Ding, Dau, Silva, Mueen, Keogh","2016 IEEE 16th International Conference on Data Mining (ICDM)",2016,"10.1109\u002Ficdm.2016.0179",{"citationText":61,"title":62,"authors":63,"source":64,"year":44,"doi":65,"url":10},"Mueen, A., Keogh, E., Zhu, Q., Cash, S., & Westover, B. (2009). Exact Discovery of Time Series Motifs. Proceedings of the 2009 SIAM International Conference on Data Mining, 373-384.","Exact Discovery of Time Series Motifs","Mueen, Keogh, Zhu, Cash, Westover","Proceedings of the 2009 SIAM International Conference on Data Mining","10.1137\u002F1.9781611972795.41",{"citationText":67,"title":68,"authors":69,"source":70,"year":71,"doi":72,"url":10},"Koo, P. K., & Ploenzke, M. (2021). Improving representations of genomic sequence motifs in convolutional networks with exponential activations. Nature Machine Intelligence, 3(3), 258-266.","Improving representations of genomic sequence motifs in convolutional networks with exponential activations","Koo, Ploenzke","Nature Machine Intelligence",2021,"10.1038\u002Fs42256-020-00291-x",[74,77,80,83],{"question":75,"answer":76},"Sự khác biệt cốt lõi giữa trình tự đồng thuận và ma trận trọng số vị trí (PWM) là gì?","Trình tự đồng thuận sử dụng các ký tự đại diện để mô tả base phổ biến nhất tại mỗi vị trí, dẫn đến việc mất mát thông tin về mức độ bảo tồn định lượng. Ngược lại, ma trận trọng số vị trí (PWM) biểu diễn xác suất xuất hiện độc lập của từng loại nucleotide tại mỗi vị trí thông qua điểm số log-odds, phản ánh chính xác hơn ái lực liên kết hóa sinh của protein với phân tử DNA.",{"question":78,"answer":79},"Thuật toán cực đại hóa kỳ vọng (EM) và lấy mẫu Gibbs khác nhau như thế nào trong phát hiện mô típ?","Thuật toán cực đại hóa kỳ vọng (EM, như trong công cụ MEME) là phương pháp tối ưu hóa tất định, tính toán xác suất kỳ vọng của mọi vị trí bắt đầu và cập nhật ma trận theo từng vòng lặp, nhưng có thể bị mắc kẹt tại cực trị địa phương. Trong khi đó, thuật toán lấy mẫu Gibbs sử dụng kỹ thuật chuỗi Markov Monte Carlo (MCMC) mang tính ngẫu nhiên, cho phép thuật toán nhảy ra khỏi các điểm cực trị địa phương để tìm kiếm cấu hình tối ưu toàn cục.",{"question":81,"answer":82},"Cấu trúc Matrix Profile hỗ trợ phát hiện mô típ chuỗi thời gian như thế nào?","Matrix Profile là một cấu trúc dữ liệu lưu trữ khoảng cách Euclidean chuẩn hóa z-score nhỏ nhất từ mỗi đoạn con đến láng giềng gần nhất của nó trong chuỗi thời gian. Cặp đoạn con tương ứng với giá trị nhỏ nhất toàn cục trong Matrix Profile chính là cặp mô típ lặp lại tương đồng nhất, trong khi giá trị khoảng cách lớn nhất đại diện cho điểm dị biệt hoặc bất thường.",{"question":84,"answer":85},"Tại sao hàm kích hoạt hàm mũ lại cải thiện khả năng phát hiện mô típ của mạng nơ-ron tích chập (CNN)?","Trong mạng CNN truyền thống sử dụng hàm kích hoạt ReLU, các bộ lọc thường học các biểu diễn phân tán và manh mún, khiến việc trích xuất ma trận PWM hoàn chỉnh gặp nhiều khó khăn. Việc áp dụng hàm kích hoạt hàm mũ giúp triệt tiêu các phản ứng nền yếu và tạo ra sự kích hoạt chọn lọc mạnh mẽ cho các mẫu trình tự đặc thù, giúp các bộ lọc học được các mô típ nguyên vẹn và dễ diễn giải sinh học.",{"id":87,"researcherId":10,"name":88,"imageUrl":89},1,"Nguyễn Ngọc Sơn","https:\u002F\u002Flh3.googleusercontent.com\u002Fa\u002FACg8ocLGfGsF1nYQqYK5BasTLhNu1dBrBXg2fcEgBNPXJ0p2gqLQnO7i=s96-c",{"id":87,"researcherId":10,"name":88,"imageUrl":89},[92,93,94,95,96,97,98,99,100,101],"bộ gen","biểu hiện gen","nhân tố phiên mã","chức năng sinh học","độ phức tạp tính toán","sinh học phân tử","bất đẳng thức tam giác","phân tích chuỗi thời gian","đa hình đơn nucleotide","tin sinh học",10,true,"PUBLISHED","2025-12-01T11:20:48.271+00:00","2026-09-17T07:13:33.145+00:00","2026-09-17T06:41:49.567+00:00","2026-09-17T07:13:18.825+00:00",0,[111,114,117,120,123,133,136,139,142,145],{"id":112,"title":113,"term":112,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"biến đổi wavelet","Biến đổi wavelet là gì? Các nghiên cứu khoa học về Wavelet Transform",{"id":115,"title":116,"term":115,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"khối lượng phân tử","Khối lượng phân tử là gì? Các công bố khoa học về Khối lượng phân tử",{"id":118,"title":119,"term":118,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"arima","Arima là gì? Các công bố khoa học về Arima",{"id":121,"title":122,"term":121,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"nghiên cứu liên ngành","Nghiên cứu liên ngành là gì? Các nghiên cứu khoa học",{"id":124,"title":125,"term":124,"englishTitle":126,"definition":127,"discipline":128,"disciplineCode":129,"disciplineLabel":130,"disciplineColor":131,"disciplineIcon":132},"brca1","BRCA1 là gì? Các nghiên cứu khoa học liên quan","BRCA1 DNA repair associated","BRCA1 là gen ức chế khối u nằm trên nhiễm sắc thể 17q21 của người, mã hóa một protein nhân có vai trò duy trì tính toàn vẹn của bộ gen thông qua cơ chế sửa chữa đứt gãy sợi đôi DNA bằng tái tổ hợp tương đồng.","MEDICAL_HEALTH_SCIENCES","medical-health-sciences","Khoa học y - dược","#D6336C","stethoscope",{"id":134,"title":135,"term":134,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"chuột cống trắng","Chuột cống trắng là gì? Các công bố khoa học về Chuột cống trắng",{"id":137,"title":138,"term":137,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"chỉ thị phân tử","Chỉ thị phân tử là gì? Các nghiên cứu khoa học về Chỉ thị phân tử",{"id":140,"title":141,"term":140,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"peptidoglycan","Peptidoglycan là gì? Các bài nghiên cứu khoa học liên quan",{"id":143,"title":144,"term":143,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"saccharomyces cerevisiae","Saccharomyces cerevisiae là gì? Các công bố khoa học về Saccharomyces cerevisiae",{"id":146,"title":147,"term":146,"englishTitle":10,"definition":10,"discipline":10,"disciplineCode":10,"disciplineLabel":10,"disciplineColor":10,"disciplineIcon":10},"vector chuyển gen","Vector chuyển gen là gì? Các nghiên cứu khoa học liên quan"]