Phát hiện mô típ (motif discovery) là bài toán tính toán và sinh tin học nhằm nhận diện các mẫu cấu trúc hoặc trình tự lặp lại có ý nghĩa sinh học hoặc mang tính quy luật thống kê tiềm ẩn bên trong tập dữ liệu chuỗi mà không cần biết trước vị trí xuất hiện chính xác của chúng. Trong sinh học phân tử và hệ gen học, bài toán này tập trung tìm kiếm các đoạn trình tự nucleotide hoặc axit amin ngắn được bảo tồn qua quá trình tiến hóa, thường tương ứng với các vị trí gắn kết của nhân tố phiên mã hoặc các miền chức năng điều hòa biểu hiện gen. Trong khoa học máy tính và khai phá dữ liệu, phát hiện mô típ được tổng quát hóa sang miền chuỗi thời gian nhằm phát hiện các mẫu hình dao động tương đồng lặp đi lặp lại trong các tín hiệu cảm biến, y sinh và chuỗi quan sát vật lý. Bài viết này phân tích toàn diện cơ sở toán học, các họ thuật toán kinh điển từ cực đại hóa kỳ vọng đến lấy mẫu thống kê, phương pháp tiếp cận chuỗi thời gian qua cấu trúc Matrix Profile, cùng những bước chuyển biến của học sâu trong nhận dạng mô típ sinh học.
Bản chất sinh học và biểu diễn toán học của mô típ trình tự
Trong cấu trúc hệ gen, quá trình điều hòa biểu hiện gen phụ thuộc chặt chẽ vào sự tương tác giữa các protein điều hòa, đặc biệt là nhân tố phiên mã (transcription factor, TF), với các đoạn trình tự DNA đặc hiệu nằm tại vùng khởi động (promoter) hoặc vùng tăng cường (enhancer). Theo tổng quan của Patrik D'haeseleer (2006) trên tạp chí Nature Biotechnology, các mô típ trình tự là những mẫu ngắn lặp lại trong phân tử DNA được giả định là mang chức năng sinh học. Các vị trí gắn kết của nhân tố phiên mã (transcription factor binding sites, TFBS) không hoàn toàn cố định về mặt ký tự mà luôn có sự biến thiên nhất định giữa các gen đồng điều hòa hoặc giữa các loài khác nhau do áp lực đột biến và chọn lọc tự nhiên. Khái niệm mô típ trình tự (sequence motif) phản ánh chính xác đặc tính biến thiên có tổ chức này, đại diện cho một họ các chuỗi ngắn có chung chức năng sinh học.
Như Gary D. Stormo (2000) đã hệ thống hóa trong bài báo trên Bioinformatics, việc nghiên cứu các vị trí gắn kết của DNA về mặt tính toán được chia thành hai bài toán cốt lõi: thứ nhất là phát triển mô hình đại diện từ các vị trí đã biết để dự đoán vị trí mới, và thứ hai là phát hiện vị trí chưa biết cùng đặc hiệu của protein từ tập hợp các trình tự chưa gán nhãn. Trước đây, các nhà nghiên cứu thường sử dụng trình tự đồng thuận (consensus sequence) để mô tả mô típ bằng bảng mã IUPAC mở rộng. Tuy nhiên, cách tiếp cận này xem mọi vị trí có vai trò nhị phân và bỏ qua sự khác biệt đáng kể về mức độ ưu tiên giữa các nucleotide tại từng vị trí. Nhằm khắc phục hạn chế trên, mô hình ma trận trọng số vị trí (Position Weight Matrix, PWM), hay còn gọi là ma trận chấm điểm đặc thù vị trí (Position-Specific Scoring Matrix, PSSM), đã trở thành chuẩn mực toán học trong mô hình hóa mô típ sinh học.
Giả sử một mô típ có chiều dài cố định là nucleotide. Để xây dựng ma trận PWM, trước tiên tập hợp các đoạn trình tự đã căn chỉnh được dùng để đếm tần số xuất hiện của từng loại bazơ nitơ. Nhằm tránh xác suất bằng không đối với những bazơ chưa được quan sát trong các mẫu kích thước nhỏ, tần số quan sát được làm trơn bằng kỹ thuật giả đếm (pseudocount). Xác suất xuất hiện của bazơ tại vị trí được tính theo công thức:
Trong đó, là số lần xuất hiện quan sát được của nucleotide tại vị trí thứ trong tập mẫu, là tần suất nền của nucleotide trong toàn bộ hệ gen, và là tổng số đoạn trình tự được căn chỉnh. Từ phân bố xác suất này, trọng số log-odds tại mỗi ô của ma trận PWM được xác định theo công thức:
Trong đó, biểu diễn điểm số đánh đổi log-odds của bazơ tại vị trí , phản ánh mức độ ưu tiên của vị trí đó so với một mô hình nền ngẫu nhiên độc lập. Điểm tương đồng của một đoạn trình tự bất kỳ có độ dài đối với mô típ được tính bằng tổng điểm trọng số trên toàn bộ các vị trí:
Trong đó, là tổng điểm log-odds của đoạn chuỗi , và là ký tự nucleotide quan sát được tại vị trí thứ . Bên cạnh điểm số quét trình tự, mức độ bảo tồn thông tin tại từng vị trí của mô típ được đo lường bằng hàm lượng thông tin (information content), dựa trên khái niệm phân kỳ Kullback-Leibler so với phân bố nền:
Trong đó, là hàm lượng thông tin tính bằng đơn vị bit tại vị trí thứ . Đối với phân tử DNA gồm 4 loại bazơ nitơ với phân bố nền đồng đều, giá trị hàm lượng thông tin dao động từ 0 bit (hoàn toàn ngẫu nhiên, cả 4 bazơ có xác suất ngang nhau) đến cực đại là 2 bit (vị trí hoàn toàn bất biến, chỉ chấp nhận duy nhất một loại bazơ). Hàm lượng thông tin là cơ sở để dựng biểu đồ trực quan hóa Sequence Logo, trong đó chiều cao tổng cộng của mỗi cột thể hiện mức độ bảo tồn của vị trí, còn chiều cao của từng chữ cái tỷ lệ thuận với tần suất tương đối của bazơ đó.
Các họ thuật toán phát hiện mô típ kinh điển trong sinh tin học
Bài toán phát hiện mô típ không có giám sát (de novo motif discovery) đặt ra thách thức tính toán to lớn: cho trước một tập hợp các trình tự DNA hoặc protein nghi ngờ chứa vị trí gắn chung, thuật toán phải đồng thời xác định vị trí bắt đầu của các đoạn mô típ trên từng trình tự và ước lượng các tham số của ma trận PWM tương ứng. Do không gian tìm kiếm bùng nổ theo hàm mũ, các nhà khoa học đã phát triển ba trường phái giải thuật chính.
1. Phương pháp liệt kê tổ hợp (Enumerative and Combinatorial Methods)
Phương pháp liệt kê dựa trên việc duyệt toàn bộ không gian các từ có độ dài cố định (k-mer). Thuật toán đếm số lần xuất hiện của từng k-mer hoặc các biến thể cho phép tối đa một số sai khác nhất định trên tập dữ liệu đầu vào. Các công cụ sử dụng cấu trúc dữ liệu cây hậu tố (suffix tree) hoặc đồ thị de Bruijn giúp tăng tốc độ đếm và kiểm định mức độ giàu bất thường (overrepresentation) của từng k-mer dựa trên các phân bố thống kê như phân bố nhị thức hoặc phân bố siêu hình học. Ưu điểm nổi bật của phương pháp này là đảm bảo tìm ra nghiệm tối ưu toàn cục theo tiêu chuẩn thống kê đã định. Tuy nhiên, khi độ dài mô típ tăng lên, không gian tổ hợp mở rộng quá nhanh khiến phương pháp này trở nên kém khả thi đối với các mô típ dài và có mức độ thoái hóa cao.
2. Phương pháp cực đại hóa kỳ vọng (Expectation-Maximization)
Phương pháp mô hình hỗn hợp hữu hạn xem tập dữ liệu đầu vào như một sự pha trộn giữa hai nguồn phát sinh: mô hình mô típ (mô tả bằng ma trận PWM) và mô hình nền (mô tả bằng phân bố Markov bậc không hoặc bậc cao). Giải thuật cực đại hóa kỳ vọng (Expectation-Maximization, EM) được ứng dụng để tối ưu hóa đồng thời vị trí mô típ và tham số ma trận mà không cần biết trước gán nhãn thực tế. Quy trình lặp của EM gồm hai bước chính:
- Bước kỳ vọng (E-step): Dựa trên các tham số ma trận PWM hiện tại, thuật toán tính toán phân bố xác suất hậu nghiệm cho thấy mỗi vị trí trên từng trình tự có phải là điểm bắt đầu của một vị trí mô típ hay không.
- Bước cực đại hóa (M-step): Cập nhật lại các xác suất nucleotide của ma trận PWM bằng cách lấy trung bình có trọng số của các đoạn chuỗi con, với trọng số chính là xác suất hậu nghiệm vừa tính được ở bước trước.
Thuật toán MEME là đại diện tiêu biểu nhất cho hướng tiếp cận này. Theo công bố của Bailey và các cộng sự (2009) trên tạp chí Nucleic Acids Research, hệ sinh thái MEME Suite đã phát triển thành một cổng thông tin trực tuyến toàn diện, tích hợp nhiều công cụ phân tích mô típ mở rộng. Hệ thống này hỗ trợ ba chế độ phân bố vị trí mô típ bao gồm: OOPS (One Occurrence Per Sequence, mỗi trình tự chứa đúng một vị trí mô típ), ZOOPS (Zero Or One Occurrence Per Sequence, mỗi trình tự chứa không hoặc một vị trí mô típ), và ANR (Any Number of Repetitions, mỗi trình tự có thể chứa số lượng bản sao mô típ tùy ý). Nhờ khả năng xử lý mượt mà dữ liệu nhiễu và cung cấp điểm số thống kê E-value vững chắc, thuật toán cực đại hóa kỳ vọng đã trở thành nền tảng của nhiều nghiên cứu hệ gen học chức năng.
3. Phương pháp lấy mẫu thống kê Gibbs (Gibbs Sampling)
Khác với giải thuật EM mang tính tất định và dễ bị mắc kẹt tại các cực trị địa phương, phương pháp lấy mẫu Gibbs tiếp cận bài toán dưới dạng chuỗi Markov Monte Carlo (MCMC). Trong công trình mang tính đột phá công bố trên tạp chí Science, Lawrence và các cộng sự (1993) đã giới thiệu chiến lược lấy mẫu Gibbs để nhận diện các tín hiệu trình tự tinh vi trong protein và DNA. Thuật toán bắt đầu bằng cách chọn ngẫu nhiên một vị trí xuất phát cho mô típ trên mỗi trình tự đầu vào, sau đó tiến hành quá trình tối ưu hóa lặp tuần tự:
- Giai đoạn loại trừ: Thuật toán chọn ngẫu nhiên một trình tự trong tập dữ liệu và tạm thời loại bỏ đoạn mô típ hiện tại của trình tự đó ra khỏi mô hình.
- Giai đoạn ước lượng: Sử dụng các đoạn mô típ trên những trình tự còn lại để xây dựng ma trận PWM tạm thời.
- Giai đoạn lấy mẫu: Dùng ma trận PWM tạm thời để tính điểm trọng số cho mọi cửa sổ trượt trên trình tự vừa bị loại trừ, chuyển điểm số thành phân bố xác suất, và bốc thăm ngẫu nhiên một vị trí bắt đầu mới theo phân bố xác suất đó.
Nhờ yếu tố ngẫu nhiên trong bước bốc thăm, thuật toán lấy mẫu Gibbs có khả năng nhảy ra khỏi các hố cực trị địa phương để tiến dần về phân bố cực đại toàn cục. Đáng chú ý, Lawrence và các cộng sự (1993) đã chứng minh rằng độ phức tạp tính toán của mỗi vòng lặp Gibbs tỷ lệ tuyến tính với số lượng trình tự đầu vào, cho phép thuật toán thực thi chỉ trong vài giây trên các máy trạm máy tính và xử lý hiệu quả các tập dữ liệu sinh học quy mô lớn.
Phát hiện mô típ trong khai phá dữ liệu chuỗi thời gian
Không chỉ giới hạn trong các chuỗi ký tự rời rạc của sinh học phân tử, khái niệm mô típ đã được mở rộng mạnh mẽ sang lĩnh vực khai phá dữ liệu chuỗi thời gian (time series data mining). Trong chuỗi thời gian, một mô típ được định nghĩa là một cặp đoạn con (hoặc một nhóm đoạn con) có hình dạng dao động tương đồng nhau nhất bên trong một chuỗi số thực liên tục kéo dài.
Định nghĩa hình thức và thách thức tính toán
Cho một chuỗi thời gian liên tục có độ dài , mục tiêu là tìm kiếm hai đoạn con không chồng lấn có độ dài sao cho khoảng cách Euclidean sau khi chuẩn hóa z-score giữa chúng đạt giá trị nhỏ nhất trong toàn bộ tập hợp các cặp đoạn con khả dĩ. Chuẩn hóa z-score là thao tác bắt buộc nhằm loại bỏ ảnh hưởng của độ lệch biên độ và dịch chuyển đường nền, đảm bảo mô típ phản ánh đúng hình dạng động học cốt lõi của quá trình đo lường.
Thách thức trung tâm của bài toán nằm ở chi phí tính toán. Nếu sử dụng phương pháp duyệt cạn hai vòng lặp lồng nhau (brute-force), số lượng cặp đoạn con cần so sánh có bậc độ phức tạp là . Đối với các chuỗi thời gian thực tế thu thập từ cảm biến công nghiệp, dữ liệu điện tim hoặc điện não kéo dài hàng triệu điểm đo, phương pháp duyệt cạn đòi hỏi thời gian tính toán kéo dài nhiều tuần hoặc nhiều tháng, không thể đáp ứng yêu cầu phân tích.
Đột phá từ thuật toán MK và cấu trúc Matrix Profile
Để vượt qua rào cản bậc hai, Mueen và các cộng sự (2009) đã đề xuất thuật toán MK tại hội nghị SIAM SDM, tiên phong chứng minh khả năng tìm kiếm chính xác mô típ chuỗi thời gian mà không cần dựa vào xấp xỉ thô. Bằng cách áp dụng bất đẳng thức tam giác, kỹ thuật chặn dưới khoảng cách Euclidean, và cơ chế dừng sớm (early abandoning), thuật toán loại bỏ phần lớn các phép tính khoảng cách thừa thãi, nâng cao tốc độ xử lý nhanh hơn nhiều lần so với phương pháp vét cạn thông thường.
Kế thừa và khái quát hóa bài toán tìm kiếm tương đồng, Yeh và các cộng sự (2016) đã công bố cấu trúc Matrix Profile tại hội nghị IEEE ICDM, định hình một tiêu chuẩn mới cho phân tích chuỗi thời gian. Matrix Profile là một vector phụ trợ lưu trữ khoảng cách Euclidean chuẩn hóa nhỏ nhất từ mỗi đoạn con tới láng giềng gần nhất của nó trong toàn bộ chuỗi thời gian, đi kèm với một vector chỉ số hồ sơ (profile index) ghi nhận vị trí chính xác của láng giềng đó. Cấu trúc này mang lại những ưu điểm vượt trội:
- Giải quyết đồng thời nhiều bài toán: Cặp đoạn con tương ứng với giá trị nhỏ nhất toàn cục của Matrix Profile chính là mô típ chuỗi thời gian (mẫu lặp tương đồng nhất), trong khi điểm đạt giá trị khoảng cách lớn nhất đại diện cho dị biệt chuỗi thời gian (time series discord, dấu hiệu của sự cố hoặc bất thường).
- Tính toán chính xác và song song hóa: Các thuật toán như STAMP và STOMP cho phép tính toán Matrix Profile một cách chính xác tuyệt đối, đồng thời tận dụng hiệu quả năng lực tính toán song song của các kiến trúc vi xử lý đồ họa (GPU).
- Không cần tinh chỉnh tham số phức tạp: Ngoại trừ độ dài cửa sổ đoạn con do người dùng lựa chọn theo ngữ cảnh miền ứng dụng, toàn bộ quy trình tính toán không phụ thuộc vào các ngưỡng khoảng cách tùy tiện.
Học sâu và các phương pháp hiện đại trong phát hiện mô típ
Sự bùng nổ của các công nghệ giải trình tự thế hệ mới (Next-Generation Sequencing, NGS) như ChIP-seq, ATAC-seq và CLIP-seq đã tạo ra các bộ dữ liệu thực nghiệm khổng lồ, bao gồm hàng chục nghìn đỉnh liên kết trên toàn bộ hệ gen. Quy mô dữ liệu này đã thúc đẩy bước chuyển dịch từ các mô hình xác suất truyền thống sang các kiến trúc học sâu (deep learning).
Mạng nơ-ron tích chập (Convolutional Neural Networks, CNN) thể hiện sự tương thích tự nhiên với dữ liệu trình tự sinh học. Khi biểu diễn chuỗi DNA dưới dạng ma trận one-hot, phép tích chập một chiều giữa một bộ lọc (filter) và chuỗi nucleotide về bản chất tương đương với thao tác trượt một ma trận trọng số vị trí PWM dọc theo chiều dài phân tử. Giá trị kích hoạt tại mỗi vị trí phản ánh mức độ ăn khớp giữa đoạn chuỗi con với mẫu hình mà bộ lọc đã học được trong quá trình huấn luyện mô hình dự đoán chức năng sinh học.
Mặc dù đạt độ chính xác phân loại vượt trội, mạng CNN truyền thống đối mặt với hạn chế nghiêm trọng về khả năng diễn giải: các bộ lọc thường học các biểu diễn phân tán (distributed representations), trong đó nhiều bộ lọc cùng nắm giữ các mảnh rời rạc của cùng một mô típ sinh học, gây khó khăn cho việc phục hồi ma trận PWM hoàn chỉnh. Nghiên cứu của Koo và Ploenzke (2021) trên tạp chí Nature Machine Intelligence đã tạo ra bước đột phá khi chứng minh rằng việc áp dụng hàm kích hoạt hàm mũ cho các bộ lọc ở tầng đầu tiên giúp cải thiện đáng kể khả năng diễn giải, khắc phục hiệu quả hiện tượng biểu diễn phân tán ở tầng đầu tiên so với các hàm kích hoạt phổ biến như ReLU. Hàm kích hoạt hàm mũ tạo ra các phản ứng chọn lọc cao đối với các mẫu trình tự đặc thù, cho phép các bộ lọc nơ-ron trích xuất trực tiếp các biểu diễn mô típ rõ ràng, mạch lạc và tương đồng cao với các ma trận PWM thực nghiệm.
Bảng so sánh các phương pháp phát hiện mô típ tiêu biểu
Dưới đây là bảng tổng hợp và so sánh toàn diện các phương pháp phát hiện mô típ trên các chiều cạnh: mô hình biểu diễn, nguyên lý hoạt động, độ phức tạp tính toán, ưu điểm và hạn chế cốt lõi.
| Phương pháp | Mô hình biểu diễn | Nguyên lý hoạt động | Độ phức tạp tính toán | Ưu điểm nổi bật | Hạn chế chính |
|---|---|---|---|---|---|
| Liệt kê từ tổ hợp | Trình tự k-mer hoặc chuỗi đồng thuận | Duyệt toàn bộ không gian từ, đếm tần số và đánh giá thống kê mức độ giàu bất thường | Hàm mũ theo độ dài mô típ | Đảm bảo tìm ra nghiệm tối ưu toàn cục theo tiêu chí thống kê xác định | Kém khả thi khi mô típ dài hoặc có mức độ biến thiên bazơ cao |
| Cực đại hóa kỳ vọng (EM / MEME) | Ma trận trọng số vị trí (PWM) | Tối ưu hóa lặp giữa bước tính xác suất vị trí (E) và bước cập nhật trọng số ma trận (M) | Đa thức theo số lượng và chiều dài trình tự | Xử lý tốt dữ liệu nhiễu, cung cấp mô hình xác suất hoàn chỉnh và giá trị E-value | Dễ bị kẹt tại điểm cực trị địa phương tùy thuộc vào điểm khởi tạo ban đầu |
| Lấy mẫu Gibbs | Ma trận xác suất vị trí và chuỗi căn chỉnh | Lấy mẫu chuỗi Markov Monte Carlo lặp qua việc loại trừ và chọn ngẫu nhiên vị trí | Tuyến tính theo số lượng trình tự đầu vào | Khả năng vượt khỏi cực trị địa phương nhờ lấy mẫu ngẫu nhiên, tốc độ nhanh | Kết quả mang tính ngẫu nhiên giữa các lần chạy, cần số vòng lặp đủ lớn để hội tụ |
| Thuật toán MK chuỗi thời gian | Đoạn con số thực chuẩn hóa z-score | Duyệt cặp kết hợp chặn dưới bất đẳng thức tam giác và cơ chế dừng sớm | Dưới bậc hai trên dữ liệu thực tế | Tìm kiếm chính xác nghiệm tối ưu toàn cục, nhanh hơn nhiều lần so với duyệt cạn | Hiệu quả phụ thuộc vào độ chặt của chặn dưới trên từng loại dữ liệu cụ thể |
| Cấu trúc Matrix Profile | Vector khoảng cách 1 láng giềng gần nhất | Tính toán phép nối tương đồng mọi cặp bằng thuật toán STAMP hoặc STOMP | Bậc hai chính xác nhưng tối ưu hóa cao | Phát hiện đồng thời mô típ và dị biệt, hỗ trợ song song hóa mạnh mẽ trên GPU | Đòi hỏi bộ nhớ lưu trữ tỷ lệ thuận với chiều dài chuỗi thời gian đầu vào |
| Mạng nơ-ron tích chập (Deep CNN) | Bộ lọc tích chập và bản đồ kích hoạt | Học biểu diễn tự động qua lan truyền ngược kết hợp hàm kích hoạt hàm mũ | Phụ thuộc cấu trúc mạng và số epoch | Mô hình hóa được các mối tương tác bậc cao và ngữ cảnh hệ gen phức tạp | Đòi hỏi khối lượng dữ liệu huấn luyện lớn và tài nguyên tính toán chuyên dụng |
Ứng dụng thực tiễn trong khoa học và công nghệ
Phát hiện mô típ đóng vai trò mắt xích then chốt trong nhiều lĩnh vực nghiên cứu khoa học cơ bản và kỹ thuật ứng dụng:
- Giải mã cơ chế biểu hiện gen và mạng lưới điều hòa: Nhận diện các vị trí gắn kết của nhân tố phiên mã giúp xác định các gen đích nằm dưới sự kiểm soát của từng protein điều hòa, từ đó tái tạo mạng lưới điều hòa phiên mã trong tế bào bình thường cũng như tế bào ung thư.
- Phân tích biến dị không mã hóa trong y học cá thể hóa: Phần lớn các biến thể đa hình đơn nucleotide (SNP) liên quan đến bệnh di truyền nằm ở các vùng không mã hóa của bộ gen. Phát hiện mô típ giúp dự đoán xem một đột biến điểm có làm phá hủy hoặc tạo mới một vị trí gắn kết của nhân tố phiên mã hay không, làm sáng tỏ cơ chế sinh bệnh học. Trong bối cảnh nghiên cứu y sinh học tại Việt Nam, các kỹ thuật này đang được ứng dụng để phân tích dữ liệu giải trình tự hệ gen người Việt nhằm xác định các biến dị đặc trưng quần thể liên quan đến đáp ứng thuốc và nguy cơ bệnh lý tim mạch, ung thư.
- Giám sát và phân tích chủng vi sinh vật gây bệnh: Phân tích mô típ trên hệ gen của các tác nhân truyền nhiễm như virus sốt xuất huyết Dengue hoặc virus cúm giúp phát hiện các đoạn trình tự được bảo tồn nghiêm ngặt qua các đợt bùng phát dịch, hỗ trợ thiết kế mồi chẩn đoán PCR và phát triển kháng thể đơn dòng.
- Khai phá tín hiệu y sinh học và cảm biến thông minh: Trong xử lý tín hiệu y tế, phát hiện mô típ chuỗi thời gian được ứng dụng để định vị các chu kỳ nhịp tim chuẩn trong dữ liệu điện tâm đồ (ECG) hoặc các đợt phóng điện kịch phát trong điện não đồ (EEG), hỗ trợ chẩn đoán tự động rối loạn nhịp tim và động kinh. Trong kỹ thuật công nghiệp, việc nhận diện các mô típ rung động định kỳ từ cảm biến gia tốc giúp phát hiện sớm hiện tượng mỏi cơ học và hỏng hóc trong động cơ tuabin.
Thách thức tính toán và xu hướng nghiên cứu tương lai
Mặc dù đã đạt được nhiều thành tựu vượt bậc, lĩnh vực phát hiện mô típ vẫn đang đối mặt với những rào cản tính toán và sinh học mang tính bản chất:
Thứ nhất, tỷ lệ tín hiệu trên nhiễu trong hệ gen của các sinh vật bậc cao là rất thấp. Vùng không mã hóa ở người chiếm phần lớn chiều dài hệ gen, trong khi các vị trí gắn kết thực sự chỉ dài một đoạn ngắn và phân tán rải rác. Sự hiện diện dày đặc của các đoạn lặp lại nhân bản (transposable elements, microsatellite) dễ dẫn đến các phát hiện dương tính giả về mặt thống kê nhưng không có chức năng sinh học.
Thứ hai, mô típ trong tự nhiên thường không tồn tại đơn lẻ mà hoạt động theo cơ chế tổ hợp (co-binding / composite motifs). Hai hoặc nhiều nhân tố phiên mã có thể cùng liên kết vào DNA theo các cấu hình không gian linh hoạt với khoảng cách ngăn cách thay đổi. Các mô hình PWM truyền thống dựa trên giả định độc lập giữa các vị trí không thể nắm bắt được sự phụ thuộc phức tạp này.
Thứ ba, sự bùng nổ của các mô hình nền tảng (foundation models) dựa trên kiến trúc Transformer đang mở ra hướng tiếp cận mới cho bài toán mô típ. Bằng cơ chế chú ý đa đầu (multi-head self-attention), các mô hình ngôn ngữ hệ gen có thể nắm bắt được mối liên hệ phụ thuộc xa giữa các nhân tố điều hòa cách nhau hàng chục nghìn cặp bazơ. Việc kết hợp giữa khả năng biểu diễn phong phú của mô hình Transformer với tính chặt chẽ, dễ diễn giải của các mô hình mô típ toán học truyền thống đang là tâm điểm phát triển của tin sinh học hiện đại.