[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"_public_topic_publications_boostmec{\"limit\":5}":3,"_public_topic_byId_boostmec":11},{"code":4,"data":5,"meta":10},"SUCCESS",{"latest":6,"mostCited":7,"vietnamFeatured":8,"vietnamLatest":9},[],[],[],[],null,{"code":4,"data":12,"meta":10},{"id":13,"title":14,"description":15,"content":16,"term":17,"englishTitle":17,"synonyms":18,"definition":21,"discipline":22,"references":23,"faqs":47,"createUser":60,"publishUser":64,"keywords":65,"keywordCount":61,"enrichTopicLink":66,"status":67,"createTime":68,"updateTime":69,"publishTime":70,"linkEnrichedTime":10,"publicationScanTime":10,"contentErrorMessage":10,"viewCount":71,"wikidataId":10,"relateTopics":72},"boostmec","BoostMEC là gì? Mô hình dự đoán hiệu quả CRISPR","BoostMEC là mô hình học máy tăng cường gradient LightGBM khai thác 149 đặc trưng trình tự và nhiệt động học để dự đoán chính xác hiệu quả cắt của CRISPR.","\u003Cp>BoostMEC (Boosting Model for Efficient CRISPR) là mô hình học máy tính toán được thiết kế để dự đoán hiệu quả phân cắt tại đích của hệ thống chỉnh sửa gen CRISPR-Cas9 dựa trên thuật toán tăng cường gradient LightGBM và kỹ thuật phân tích 149 đặc trưng trình tự k-mer kết hợp nhiệt động lực học ARN. Trong lĩnh vực tin sinh học và chỉnh sửa hệ gen, BoostMEC cung cấp giải pháp sàng lọc các đoạn RNA dẫn đường đơn có hoạt tính sinh học tối ưu, kết hợp giữa độ chính xác dự báo cao và khả năng giải thích rõ ràng các yếu tố sinh học phân tử chi phối hiệu suất cắt. Bài viết này trình bày cơ sở lý thuyết, kiến trúc thuật toán, không gian đặc trưng, hiệu năng đối chuẩn và các ứng dụng thực tiễn của mô hình BoostMEC trong thiết kế thí nghiệm chỉnh sửa gen.\u003C\u002Fp>\n\n\u003Ch2>Bối cảnh khoa học và thách thức trong thiết kế sgRNA\u003C\u002Fh2>\n\u003Cp>Hệ thống CRISPR-Cas9 từ vi khuẩn Streptococcus pyogenes (SpCas9) đã trở thành công cụ chỉnh sửa hệ gen phổ biến trong nghiên cứu y sinh học phân tử. Phức hợp ribonucleoprotein bao gồm protein endonuclease Cas9 và một đoạn RNA dẫn đường đơn (single guide RNA, sgRNA). Để thực hiện phân cắt sợi đôi phân tử ADN, sgRNA phải nhận diện vùng mục tiêu bổ sung thông qua tương tác bắt cặp bazơ nitơ:\u003C\u002Fp>\n\u003Cp>Đoạn dẫn đường của sgRNA chuẩn có chiều dài gồm 20 nucleotide bổ sung mục tiêu, nằm liền kề với mô-típ nhận diện PAM có trình tự bảo tồn ba nucleotide dạng NGG. Sau khi Cas9 nhận diện mô-típ PAM và mở xoắn sợi đôi ADN, đoạn dẫn 20 nucleotide sẽ lai hóa với sợi đích. Nếu quá trình ghép cặp bazơ đạt độ ổn định nhiệt động học cần thiết, hai miền nuclease RuvC và HNH của Cas9 sẽ kích hoạt và cắt đứt liên kết photphodieste trên cả hai sợi ADN tại vị trí cách mô-típ PAM ba cặp bazơ về phía đầu năm phẩy.\u003C\u002Fp>\n\u003Cp>Tuy nhiên, các quan sát thực nghiệm chỉ ra rằng các sgRNA khác nhau nhắm vào các vị trí khác nhau trong hệ gen biểu hiện hiệu suất phân cắt rất chênh lệch, dao động từ mức hoàn toàn không hoạt động đến mức phân cắt triệt để. Sự biến thiên này phụ thuộc chặt chẽ vào trình tự nucleotide cụ thể của sgRNA, cấu trúc bậc hai của phân tử ARN, năng lượng liên kết lai hóa ADN-ARN và khả năng tiếp cận chất nhiễm sắc. Do việc kiểm tra thực nghiệm từng sgRNA đòi hỏi chi phí và thời gian đáng kể, các công cụ tin sinh học dự đoán hoạt tính phân cắt trước khi tiến hành thí nghiệm đã trở thành nhu cầu thiết yếu.\u003C\u002Fp>\n\n\u003Ch2>Kiến trúc thuật toán và cơ sở toán học của BoostMEC\u003C\u002Fh2>\n\u003Cp>Phần lớn các công cụ dự đoán hiệu quả sgRNA thời kỳ đầu dựa trên các thuật toán hồi quy tuyến tính cổ điển với độ chính xác hạn chế. Ngược lại, các công cụ thế hệ mới ứng dụng mạng nơ-ron tích chập hoặc mạng nơ-ron hồi quy sâu tuy đạt độ chính xác cao nhưng hoạt động như các khối hộp đen phức tạp, không thể giải thích cơ chế sinh học đằng sau các dự đoán. Mô hình BoostMEC do Zarate và cộng sự (2022) đề xuất nhằm giải quyết sự đánh đổi này bằng cách khai thác sức mạnh của thuật toán tăng cường gradient (Gradient Boosting) trên cây quyết định thông qua thư viện LightGBM.\u003C\u002Fp>\n\n\u003Ch3>Mô hình tăng cường gradient LightGBM\u003C\u002Fh3>\n\u003Cp>Thuật toán tăng cường gradient xây dựng một chuỗi các cây quyết định tuần tự, trong đó mỗi cây mới được tối ưu hóa để bù đắp phần dư sai số của tập hợp các cây trước đó. Hàm mục tiêu tối ưu hóa tại vòng lặp thứ \u003Cscript type=\"math\u002Ftex\">t\u003C\u002Fscript> được định nghĩa như sau:\u003C\u002Fp>\n\u003Cscript type=\"math\u002Ftex; mode=display\">\\mathcal{L}^{(t)} = \\sum_{j=1}^{N} l\\left(y_j, \\hat{y}_j^{(t-1)} + f_t(x_j)\\right) + \\Omega(f_t)\u003C\u002Fscript>\n\u003Cp>Trong công thức trên, \u003Cscript type=\"math\u002Ftex\">y_j\u003C\u002Fscript> đại diện cho giá trị hiệu suất phân cắt thực nghiệm của mẫu thứ \u003Cscript type=\"math\u002Ftex\">j\u003C\u002Fscript> trong tập dữ liệu gồm \u003Cscript type=\"math\u002Ftex\">N\u003C\u002Fscript> mẫu, \u003Cscript type=\"math\u002Ftex\">\\hat{y}_j^{(t-1)}\u003C\u002Fscript> là giá trị dự báo tổng hợp tích lũy từ các vòng lặp trước, \u003Cscript type=\"math\u002Ftex\">f_t(x_j)\u003C\u002Fscript> là hàm dự đoán của cây quyết định mới được bổ sung tại vòng lặp hiện tại dựa trên vector đặc trưng \u003Cscript type=\"math\u002Ftex\">x_j\u003C\u002Fscript>, và \u003Cscript type=\"math\u002Ftex\">\\Omega(f_t)\u003C\u002Fscript> là thành phần chính quy hóa khống chế độ sâu và số lượng lá cây nhằm ngăn ngừa hiện tượng quá khớp (overfitting).\u003C\u002Fp>\n\u003Cp>Thư viện LightGBM áp dụng hai kỹ thuật cốt lõi là lấy mẫu đơn hướng dựa trên gradient (GOSS) và gom cụm đặc trưng độc quyền (EFB), cho phép mô hình BoostMEC huấn luyện với tốc độ cực nhanh trên các tập dữ liệu hệ gen quy mô lớn mà vẫn duy trì độ chính xác số học cao.\u003C\u002Fp>\n\n\u003Ch3>Xử lý biến phân loại trực tiếp không qua mã hóa one-hot\u003C\u002Fh3>\n\u003Cp>Một ưu thế thuật toán nổi bật của BoostMEC so với các mô hình học máy truyền thống khác là việc tận dụng khả năng xử lý biến phân loại (categorical features) tự nhiên của LightGBM. Thay vì mở rộng không gian chiều dữ liệu bằng kỹ thuật mã hóa one-hot (vốn sinh ra ma trận thưa lớn và làm chậm quá trình phân nhánh cây), BoostMEC mã hóa các nucleotide và dinucleotide thành các giá trị số nguyên phân loại. LightGBM tự động sắp xếp các giá trị phân loại theo biểu đồ gradient tại mỗi nút phân chia, cho phép tìm kiếm ngưỡng cắt tối ưu với độ phức tạp tính toán giảm thiểu đáng kể.\u003C\u002Fp>\n\n\u003Ch2>Không gian 149 đặc trưng sinh học và hóa lý trong BoostMEC\u003C\u002Fh2>\n\u003Cp>Theo công bố của Zarate và cộng sự (2022), mô hình BoostMEC trích xuất tổng cộng 149 đặc trưng được chia thành các nhóm cấu trúc rõ ràng:\u003C\u002Fp>\n\u003Cul>\n\u003Cli>\u003Cstrong>Đặc trưng tần suất k-mer:\u003C\u002Fstrong> Đếm tần suất xuất hiện của các chuỗi con nucleotide có độ dài từ một đến ba nucleotide (k-mer với k nhận các giá trị một, hai, ba) trên toàn bộ đoạn trình tự mở rộng (bao gồm đoạn dẫn đường 20 nucleotide cùng các vùng đệm hai đầu). Nhóm này phản ánh các mô-típ thành phần bazơ nitơ tổng thể ảnh hưởng đến khả năng nhận diện của Cas9.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Đặc trưng nucleotide và dinucleotide theo vị trí:\u003C\u002Fstrong> Ghi nhận loại bazơ đơn lẻ và cặp bazơ tại từng vị trí cụ thể dọc theo đoạn trình tự mở rộng. Nhóm đặc trưng này được đưa trực tiếp vào LightGBM dưới dạng các biến phân loại, giúp thuật toán nắm bắt các tương tác lân cận giữa các bazơ kề nhau.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Đặc trưng đoạn poly-T:\u003C\u002Fstrong> Đếm số lượng các đoạn lặp thymine có chiều dài từ ba nucleotide trở lên và xác định chiều dài của đoạn poly-T dài nhất trên sgRNA. Trong hệ thống biểu hiện tế bào sử dụng promoter U6, chuỗi poly-T đóng vai trò tín hiệu kết thúc phiên mã sớm của enzyme RNA Polymerase III. Sự hiện diện của poly-T khiến phân tử sgRNA bị cắt ngắn bất thường, dẫn đến suy giảm nghiêm trọng lượng phức hợp Cas9-sgRNA chức năng.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Đặc trưng nhiệt động học và nhiệt độ nóng chảy:\u003C\u002Fstrong> Bao gồm bốn giá trị nhiệt độ nóng chảy Tm được tính toán qua công cụ TmCalculator cho các đoạn lai hóa khác nhau, cùng hai giá trị năng lượng tự do Gibbs cực tiểu biểu thị độ bền cấu trúc bậc hai của ARN được tính toán thông qua phần mềm RNAfold:\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cscript type=\"math\u002Ftex; mode=display\">\\Delta G = \\Delta H - T \\Delta S\u003C\u002Fscript>\n\u003Cp>Trong đó, \u003Cscript type=\"math\u002Ftex\">\\Delta G\u003C\u002Fscript> biểu diễn biến thiên năng lượng tự do Gibbs, \u003Cscript type=\"math\u002Ftex\">\\Delta H\u003C\u002Fscript> là biến thiên entanpi, \u003Cscript type=\"math\u002Ftex\">T\u003C\u002Fscript> là nhiệt độ tuyệt đối và \u003Cscript type=\"math\u002Ftex\">\\Delta S\u003C\u002Fscript> là biến thiên entropi của quá trình hình thành cấu trúc gập nội phân tử. Năng lượng tự do càng âm thì cấu trúc kẹp tóc nội tại của sgRNA càng bền vững, cản trở động học mở sợi để lai hóa với ADN đích.\u003C\u002Fp>\n\n\u003Ch2>Đối chuẩn hiệu năng và đánh giá thực nghiệm\u003C\u002Fh2>\n\u003Cp>Để kiểm chứng độ tin cậy và khả năng tổng quát hóa của thuật toán, Zarate và cộng sự (2022) đã tiến hành huấn luyện mô hình BoostMEC trên các tập dữ liệu giải trình tự hiệu năng cao quy mô lớn và thực hiện các thử nghiệm đối chuẩn khách quan:\u003C\u002Fp>\n\n\u003Ch3>Đánh giá trên các tập dữ liệu độc lập\u003C\u002Fh3>\n\u003Cp>Zarate và cộng sự (2022) đã benchmark mô hình BoostMEC đối đầu trực tiếp với 10 mô hình dự đoán hiệu năng sgRNA phổ biến trong cộng đồng khoa học. Quá trình kiểm định độc lập được thực hiện chéo trên 13 tập dữ liệu bên ngoài thu nhận từ nhiều phòng thí nghiệm độc lập và trên nhiều dòng tế bào sinh vật khác nhau. Kết quả cho thấy mô hình học sâu CNN CRISPRon là công cụ đạt độ tương quan cao nhất tổng thể (đứng đầu ở chín trên 13 tập dữ liệu). Tuy nhiên, BoostMEC vượt trội so với mô hình học sâu DeepSpCas9 ở bảy trên 13 tập dữ liệu và vượt qua mô hình hồi quy CRISPRedict ở phần lớn các tập dữ liệu thử nghiệm so sánh, khẳng định vị thế dẫn đầu trong nhóm các mô hình học máy cây quyết định có khả năng giải thích.\u003C\u002Fp>\n\n\u003Ch3>Chỉ số đánh giá độ tương quan thứ hạng\u003C\u002Fh3>\n\u003Cp>Trong các nghiên cứu đánh giá công cụ CRISPR, các chỉ số thống kê tiêu chuẩn đóng vai trò thước đo cốt lõi. Tổng quan toàn diện của Konstantakos và cộng sự (2022) trên tạp chí Nucleic Acids Research khẳng định rằng hệ số tương quan thứ hạng Spearman là thước đo quan trọng nhất để đánh giá tính nhất quán giữa điểm số dự đoán của mô hình và kết quả đo hoạt tính thực nghiệm. Do dữ liệu đo lường thực nghiệm từ các kỹ thuật giải trình tự sâu thường có phân phối lệch và dải giá trị biến động, việc đánh giá dựa trên thứ hạng giúp phản ánh chính xác khả năng lựa chọn đúng các sgRNA dẫn đầu.\u003C\u002Fp>\n\u003Cp>Nghiên cứu tổng quan đối chuẩn của Zhang và cộng sự (2023) trên tạp chí Briefings in Bioinformatics đã khảo sát 10 phương pháp học sâu đại diện dự đoán hoạt tính tại đích trên 9 tập dữ liệu công khai. Phân tích của Zhang và cộng sự (2023) chỉ ra rằng hiệu năng của các mô hình phụ thuộc rất lớn vào quy mô dữ liệu huấn luyện: các mô hình đạt độ chính xác cao trên các tập dữ liệu quy mô lớn và trung bình, nhưng suy giảm rõ rệt khi áp dụng trên các tập dữ liệu quy mô nhỏ do hiện tượng thiếu mẫu đại diện.\u003C\u002Fp>\n\n\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth>Đặc điểm so sánh\u003C\u002Fth>\n\u003Cth>Mô hình hồi quy tuyến tính cổ điển\u003C\u002Fth>\n\u003Cth>Mô hình BoostMEC (Zarate và cs., 2022)\u003C\u002Fth>\n\u003Cth>Mô hình mạng nơ-ron học sâu\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd>Cơ chế cốt lõi\u003C\u002Ftd>\n\u003Ctd>Hồi quy tuyến tính hoặc cây đơn lẻ\u003C\u002Ftd>\n\u003Ctd>Cây tăng cường gradient LightGBM với 149 đặc trưng\u003C\u002Ftd>\n\u003Ctd>Mạng nơ-ron tích chập hoặc mạng hồi quy\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Khả năng giải thích\u003C\u002Ftd>\n\u003Ctd>Rõ ràng nhưng năng lực biểu diễn yếu\u003C\u002Ftd>\n\u003Ctd>Minh bạch cao thông qua phân tích đóng góp đặc trưng\u003C\u002Ftd>\n\u003Ctd>Hộp đen phức tạp, khó truy nguyên cơ chế\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Yêu cầu dữ liệu\u003C\u002Ftd>\n\u003Ctd>Hoạt động trên tập dữ liệu nhỏ\u003C\u002Ftd>\n\u003Ctd>Tối ưu tốt trên cả dữ liệu vừa và lớn\u003C\u002Ftd>\n\u003Ctd>Đòi hỏi tập dữ liệu khổng lồ để tránh quá khớp\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd>Tốc độ huấn luyện\u003C\u002Ftd>\n\u003Ctd>Rất nhanh\u003C\u002Ftd>\n\u003Ctd>Nhanh nhờ cấu trúc tối ưu của LightGBM\u003C\u002Ftd>\n\u003Ctd>Chậm, tiêu tốn nhiều tài nguyên tính toán\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\n\n\u003Ch2>Khả năng giải thích sinh học của BoostMEC\u003C\u002Fh2>\n\u003Cp>Ưu điểm nổi bật nhất giúp BoostMEC tạo dựng vị thế riêng biệt so với các mạng nơ-ron tích chập là khả năng giải thích sinh học minh bạch. Thông qua các hàm phân tích đóng góp đặc trưng tích hợp sẵn trong thư viện LightGBM, BoostMEC cho phép trích xuất giá trị đóng góp dương hoặc âm của từng nucleotide tại từng vị trí đối với hiệu quả cắt:\u003C\u002Fp>\n\u003Cp>Kết quả giải thích từ BoostMEC chỉ ra sự hiện diện của các quy luật sinh học nhất quán: các vị trí nucleotide nằm gần mô-típ PAM đóng vai trò quyết định hàng đầu đối với sự ổn định của phức hợp Cas9-sgRNA-ADN. Sự xuất hiện của bazơ guanin ở vùng cận kề PAM tạo điều kiện thuận lợi cho liên kết enzyme. Ngược lại, sự xuất hiện của các đoạn poly-T (từ ba thymine liên tiếp trở lên) dẫn đến hiện tượng kết thúc sớm phiên mã của RNA Polymerase III, làm sụt giảm nghiêm trọng hiệu quả chỉnh sửa gen thực tế. Những phát hiện giải thích này hoàn toàn phù hợp với các cấu trúc tinh thể học tia X và dữ liệu hóa sinh thực nghiệm của phức hợp Cas9.\u003C\u002Fp>\n\n\u003Ch2>Hạn chế kỹ thuật và định hướng phát triển\u003C\u002Fh2>\n\u003Cp>Dù thể hiện hiệu năng xuất sắc, việc áp dụng mô hình BoostMEC trong thực tế nghiên cứu vẫn cần lưu ý một số rào cản kỹ thuật:\u003C\u002Fp>\n\u003Col>\n\u003Cli>\u003Cstrong>Phụ thuộc vào biến thể enzyme Cas:\u003C\u002Fstrong> Mô hình BoostMEC nguyên bản được huấn luyện chuyên biệt cho nuclease SpCas9 nhận diện mô-típ PAM dạng NGG. Khi áp dụng cho các biến thể Cas9 kỹ thuật hoặc các enzyme nuclease khác như Cas12a (nhận diện PAM giàu T), mô hình đòi hỏi phải được huấn luyện lại toàn bộ trên các tập dữ liệu đặc thù tương ứng.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Bỏ qua bối cảnh chất nhiễm sắc biểu sinh:\u003C\u002Fstrong> Hiệu quả chỉnh sửa gen trong tế bào sống không chỉ phụ thuộc vào trình tự nucleotide nội tại của sgRNA mà còn chịu tác động sâu sắc bởi trạng thái đóng mở của sợi nhiễm sắc (chromatin accessibility) và mức độ methyl hóa ADN tại vị trí đích. BoostMEC chủ yếu khai thác đặc trưng chuỗi và nhiệt động học, chưa tích hợp các dữ liệu biểu sinh đa omics.\u003C\u002Fli>\n\u003Cli>\u003Cstrong>Phạm vi dự đoán chuyên biệt tại đích:\u003C\u002Fstrong> BoostMEC được thiết kế tối ưu cho dự đoán hiệu quả phân cắt tại vị trí mục tiêu (on-target cleavage efficiency), không bao hàm chức năng dự đoán hoạt tính phân cắt ngoài mục tiêu (off-target activity). Trong thực hành thiết kế liệu pháp gen lâm sàng, việc đánh giá độ an toàn bắt buộc phải phối hợp BoostMEC với các công cụ dự đoán rủi ro phân cắt ngoài đích chuyên dụng.\u003C\u002Fli>\n\u003C\u002Fol>\n","BoostMEC",[19,20],"thuật toán BoostMEC","mô hình BoostMEC","BoostMEC (Boosting Model for Efficient CRISPR) là mô hình học máy tính toán được thiết kế để dự đoán hiệu quả phân cắt tại đích của hệ thống chỉnh sửa gen CRISPR-Cas9 dựa trên thuật toán tăng cường gradient LightGBM và kỹ thuật phân tích 149 đặc trưng trình tự k-mer kết hợp nhiệt động lực học ARN.","NATURAL_SCIENCES",[24,32,39],{"citationText":25,"title":26,"authors":27,"source":28,"year":29,"doi":30,"url":31},"Zarate, O. A., Yang, Y., Wang, X., & Wang, J. P. (2022). BoostMEC: predicting CRISPR-Cas9 cleavage efficiency through boosting models. BMC Bioinformatics, 23(1), 446.","BoostMEC: predicting CRISPR-Cas9 cleavage efficiency through boosting models","Zarate, Yang, Wang, Wang","BMC Bioinformatics",2022,"10.1186\u002Fs12859-022-04998-z","https:\u002F\u002Fdoi.org\u002F10.1186\u002Fs12859-022-04998-z",{"citationText":33,"title":34,"authors":35,"source":36,"year":29,"doi":37,"url":38},"Konstantakos, V., Nentidis, A., Krithara, A., & Paliouras, G. (2022). CRISPR–Cas9 gRNA efficiency prediction: an overview of predictive tools and the role of deep learning. Nucleic Acids Research, 50(7), 3616–3637.","CRISPR–Cas9 gRNA efficiency prediction: an overview of predictive tools and the role of deep learning","Konstantakos, Nentidis, Krithara, Paliouras","Nucleic Acids Research","10.1093\u002Fnar\u002Fgkac192","https:\u002F\u002Fdoi.org\u002F10.1093\u002Fnar\u002Fgkac192",{"citationText":40,"title":41,"authors":42,"source":43,"year":44,"doi":45,"url":46},"Zhang, G., Luo, Y., Dai, X., & Dai, Z. (2023). Benchmarking deep learning methods for predicting CRISPR\u002FCas9 sgRNA on- and off-target activities. Briefings in Bioinformatics, 24(6), bbad333.","Benchmarking deep learning methods for predicting CRISPR\u002FCas9 sgRNA on- and off-target activities","Zhang, Luo, Dai, Dai","Briefings in Bioinformatics",2023,"10.1093\u002Fbib\u002Fbbad333","https:\u002F\u002Fdoi.org\u002F10.1093\u002Fbib\u002Fbbad333",[48,51,54,57],{"question":49,"answer":50},"Mô hình BoostMEC là gì?","BoostMEC là một công cụ tin sinh học ứng dụng thuật toán tăng cường gradient LightGBM kết hợp 149 đặc trưng sinh học và hóa lý để dự đoán hiệu quả phân cắt sợi đôi ADN của phức hợp CRISPR-Cas9.",{"question":52,"answer":53},"BoostMEC có ưu điểm gì nổi bật so với các mô hình học sâu?","Khác với các mạng nơ-ron học sâu dạng hộp đen, BoostMEC cung cấp khả năng giải thích sinh học minh bạch, cho phép phân tích đóng góp cụ thể của từng nucleotide tại từng vị trí trên chuỗi sgRNA đối với hiệu quả cắt.",{"question":55,"answer":56},"Những nhóm đặc trưng sinh học nào được BoostMEC sử dụng?","BoostMEC phân tích 149 đặc trưng gồm tần suất k-mer, nucleotide và dinucleotide theo vị trí dưới dạng biến phân loại, số lượng và độ dài các đoạn poly-T, 4 giá trị nhiệt độ nóng chảy Tm và 2 giá trị năng lượng tự do Gibbs qua RNAfold.",{"question":58,"answer":59},"BoostMEC có dự đoán được hoạt tính phân cắt ngoài mục tiêu (off-target) không?","Không. BoostMEC được thiết kế chuyên biệt cho việc dự đoán hiệu quả phân cắt tại vị trí đích (on-target), do đó cần kết hợp với các công cụ chuyên dụng khác khi đánh giá rủi ro ngoài đích.",{"id":61,"researcherId":10,"name":62,"imageUrl":63},1,"Nguyễn Ngọc Sơn","https:\u002F\u002Flh3.googleusercontent.com\u002Fa\u002FACg8ocLGfGsF1nYQqYK5BasTLhNu1dBrBXg2fcEgBNPXJ0p2gqLQnO7i=s96-c",{"id":61,"researcherId":10,"name":62,"imageUrl":63},[13],false,"PUBLISHED","2025-12-01T11:21:02.490+00:00","2026-10-08T02:32:18.841+00:00","2026-10-08T02:32:18.807+00:00",0,[73,81,86,91,96,101,106,111,116,121],{"id":74,"title":75,"term":74,"englishTitle":74,"definition":76,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"proton","Proton là gì? Cấu trúc và ứng dụng của Proton","Proton là một hạt hạ nguyên tử bền vững thuộc nhóm baryon cấu tạo từ hai quark lên và một quark xuống, mang điện tích nguyên tố dương và có khối lượng nghỉ xấp xỉ 1.6726 x 10^-27 kg nằm trong hạt nhân nguyên tử.","natural-sciences","Khoa học tự nhiên","#0E9F9C","atom",{"id":82,"title":83,"term":82,"englishTitle":84,"definition":85,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"nhiệt độ nóng chảy","Nhiệt độ nóng chảy là gì? Các nghiên cứu khoa học liên quan","nhiet do nong chay","khái niệm và đối tượng nghiên cứu cơ bản trong khoa học tự nhiên, phản ánh các đặc trưng bản chất, cơ chế vận hành và các quy luật tương tác hệ thống trong thực tiễn.",{"id":87,"title":88,"term":87,"englishTitle":89,"definition":90,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"hằng số tốc độ","Hằng số tốc độ là gì? Các bài nghiên cứu khoa học liên quan","rate constant","Hằng số tốc độ (Reaction Rate Constant, ký hiệu k) là một hệ số tỷ lệ đặc trưng trong phương trình động học biểu thị tốc độ của phản ứng hóa học khi nồng độ của tất cả các chất phản ứng bằng đơn vị.",{"id":92,"title":93,"term":92,"englishTitle":94,"definition":95,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"động vật linh trưởng","Động vật linh trưởng là gì? Tiến hóa Perelman, giải phẫu Fleagle và Estrada","primates","Động vật linh trưởng là một bộ thú có vú bậc cao đặc trưng bởi bàn tay ngón cái đối diện, thị giác lập thể 3D và vỏ não phát triển, tiến hóa qua các nhánh Mũi ướt và Mũi khô theo nghiên cứu Perelman-Fleagle.",{"id":97,"title":98,"term":97,"englishTitle":99,"definition":100,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"đồng vị","Đồng vị là gì? Phân loại và ứng dụng trong khoa học hiện đại","isotope","Đồng vị là các biến thể của cùng một nguyên tố hóa học có cùng số proton trong hạt nhân nhưng khác nhau về số neutron, dẫn đến khối lượng nguyên tử khác nhau.",{"id":102,"title":103,"term":102,"englishTitle":104,"definition":105,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"chu trình sinh địa hóa","Chu trình sinh địa hóa: Khái niệm, nguyên lý và ứng dụng","Biogeochemical cycle","Chu trình sinh địa hóa là một thuật ngữ và phạm trù học thuật then chốt trong lĩnh vực natural sciences, phản ánh các nguyên lý, cơ chế và phương pháp luận chuyên sâu đã được chuẩn hóa trong nghiên cứu và ứng dụng thực tiễn.",{"id":107,"title":108,"term":107,"englishTitle":109,"definition":110,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"ethylene","Ethylene là gì? Cấu trúc hóa học, vai trò sinh học và ứng dụng","Ethylene","Ethylene (ethene, công thức hóa học C2H4) là một hydrocarbon không no thuộc nhóm anken đơn giản nhất, tồn tại ở thể khí không màu, đồng thời là một phytohormone dạng khí điều hòa sự chín và rụng ở thực vật.",{"id":112,"title":113,"term":112,"englishTitle":114,"definition":115,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"không khí ẩm","Không khí ẩm là gì? Các công bố khoa học về Không khí ẩm","moist air","Không khí ẩm là hỗn hợp nhiệt động học giữa không khí khô và hơi nước, có các thông số đặc trưng gồm độ ẩm tương đối, độ ẩm tuyệt đối và nhiệt độ điểm sương.",{"id":117,"title":118,"term":117,"englishTitle":119,"definition":120,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"hệ số phân bố","Hệ số phân bố là gì? Ý nghĩa trong hóa học và dược lý","Partition Coefficient","Hệ số phân bố (partition coefficient, ký hiệu P hoặc log P) là đại lượng nhiệt động học biểu thị tỷ lệ nồng độ cân bằng của một chất tan không phân ly giữa hai dung môi không trộn lẫn (thường là 1-octanol và nước).",{"id":122,"title":123,"term":122,"englishTitle":122,"definition":124,"discipline":22,"disciplineCode":77,"disciplineLabel":78,"disciplineColor":79,"disciplineIcon":80},"phytoplankton","Phytoplankton là gì? Vai trò sinh thái, chu trình carbon và hiện tượng nở hoa","Phytoplankton (thực vật phù du) là tập hợp các vi sinh vật tự dưỡng quang hợp trôi nổi trong các thủy vực nước ngọt và đại dương, đóng vai trò sản xuất sơ cấp nền tảng của lưới thức ăn thủy sinh và điều hòa chu trình carbon toàn cầu."]