[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"_public_topic_publications_ph%C3%A2n%20c%E1%BB%A5m%20ph%C3%A2n%20c%E1%BA%A5p{\"limit\":5}":3,"_public_topic_byId_ph%C3%A2n%20c%E1%BB%A5m%20ph%C3%A2n%20c%E1%BA%A5p":11},{"code":4,"data":5,"meta":10},"SUCCESS",{"latest":6,"mostCited":7,"vietnamFeatured":8,"vietnamLatest":9},[],[],[],[],null,{"code":4,"data":12,"meta":10},{"id":13,"title":14,"description":15,"content":16,"term":13,"englishTitle":10,"synonyms":10,"definition":10,"discipline":10,"references":10,"faqs":10,"createUser":17,"publishUser":21,"keywords":25,"keywordCount":18,"enrichTopicLink":26,"status":27,"createTime":28,"updateTime":29,"publishTime":30,"linkEnrichedTime":10,"publicationScanTime":10,"contentErrorMessage":10,"viewCount":31,"wikidataId":10,"relateTopics":32},"phân cụm phân cấp","Phân cụm phân cấp là gì? Các nghiên cứu khoa học liên quan","Phân cụm phân cấp là phương pháp học không giám sát xây dựng cấu trúc nhóm dạng cây để biểu diễn mức độ tương đồng của dữ liệu mà không cần xác định số cụm trước. Khái niệm này mô tả kỹ thuật phân cấp dựa trên ma trận khoảng cách và tiêu chí liên kết nhằm tạo dendrogram phản ánh mối quan hệ phân tầng giữa các điểm dữ liệu. ","\u003Cdiv>\u003Ch2>Khái niệm phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Phân cụm phân cấp là một phương pháp học không giám sát xây dựng cấu trúc phân nhóm dạng cây để mô tả mối quan hệ giữa các đối tượng dựa trên mức độ tương đồng. Thay vì yêu cầu số cụm ngay từ đầu, phương pháp này tạo ra một hệ thống phân cấp theo nhiều lớp, trong đó các cụm nhỏ được hợp nhất thành cụm lớn hơn hoặc ngược lại tùy theo chiến lược thuật toán. Đặc điểm này giúp phân cụm phân cấp trở thành công cụ quan trọng trong phân tích dữ liệu mang tính phân tầng.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp dựa trên ma trận khoảng cách giữa các điểm dữ liệu và một tiêu chí liên kết quy định cách hai cụm được gộp lại. Sự linh hoạt này cho phép mô tả cấu trúc dữ liệu phức tạp mà các phương pháp như k-means không thể thể hiện. Một đặc điểm khác là khả năng biểu diễn toàn bộ quá trình phân nhóm thông qua sơ đồ dendrogram, giúp người dùng hiểu rõ lịch sử hình thành cụm và đưa ra quyết định cắt cụm hợp lý.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp có hai dạng chính: gộp (agglomerative) và tách (divisive). Phương pháp gộp bắt đầu với từng điểm riêng lẻ và hợp nhất dần, trong khi phương pháp tách đi từ một cụm lớn duy nhất và chia nhỏ dần. Bảng dưới đây mô tả sự khác biệt tổng quát:\n\u003C\u002Fp>\u003Ctable border=\"1\" cellpadding=\"4\">\n  \u003Ctbody>\u003Ctr>\n    \u003Cth>Dạng phân cụm\u003C\u002Fth>\n    \u003Cth>Quy trình\u003C\u002Fth>\n    \u003Cth>Đặc điểm\u003C\u002Fth>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Gộp\u003C\u002Ftd>\n    \u003Ctd>Hợp nhất các cụm gần nhau nhất\u003C\u002Ftd>\n    \u003Ctd>Phổ biến, dễ triển khai\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Tách\u003C\u002Ftd>\n    \u003Ctd>Tách cụm lớn thành các cụm nhỏ\u003C\u002Ftd>\n    \u003Ctd>Độ chính xác cao nhưng tốn chi phí\u003C\u002Ftd>\n  \u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\nPhương pháp gộp được sử dụng chủ yếu trong các thư viện học máy như \u003Ca href=\"https:\u002F\u002Fscikit-learn.org\u002Fstable\u002Fmodules\u002Fclustering.html\">Scikit-learn\u003C\u002Fa>.\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Các dạng phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Hai dạng phân cụm phân cấp gồm phương pháp gộp và phương pháp tách, mỗi dạng có cách tiếp cận riêng đối với cấu trúc dữ liệu. Phân cụm gộp là quá trình lặp từng bước, trong đó mỗi điểm ban đầu được xem là một cụm độc lập và sau đó các cụm gần nhau nhất được hợp nhất. Quá trình tiếp tục cho đến khi tất cả điểm thuộc cùng một cụm. Đây là phương pháp phổ biến vì tính đơn giản, dễ áp dụng và khả năng xử lý dữ liệu kích thước trung bình.\u003C\u002Fp>\n\u003Cp>Phân cụm tách hoạt động theo chiều ngược lại: bắt đầu với một cụm duy nhất chứa toàn bộ dữ liệu và phân tách dần thành các cụm nhỏ hơn theo tiêu chí sai khác tăng dần. Dù phương pháp tách mang tính mô tả tốt hơn và có thể tạo ra cấu trúc phân cấp tinh vi hơn, chi phí tính toán rất cao, thường vượt quá khả năng của hệ thống khi dữ liệu lớn. Điều này khiến nó ít được triển khai trong thư viện học máy hơn so với phương pháp gộp.\u003C\u002Fp>\n\u003Cp>Các dạng phân cụm phân cấp còn có thể phân theo tiêu chí liên kết hoặc loại dữ liệu đầu vào. Danh sách dưới đây mô tả các phân nhóm thường gặp:\n\u003C\u002Fp>\u003Cul>\n  \u003Cli>Phân cấp đơn liên kết: tập trung vào khoảng cách ngắn nhất.\u003C\u002Fli>\n  \u003Cli>Phân cấp hoàn liên kết: tập trung vào khoảng cách dài nhất.\u003C\u002Fli>\n  \u003Cli>Phân cấp trung bình liên kết: sử dụng khoảng cách trung bình.\u003C\u002Fli>\n  \u003Cli>Phân cấp dựa trên phương sai như Ward linkage.\u003C\u002Fli>\n\u003C\u002Ful>\nNhững biến thể này làm tăng tính linh hoạt của phương pháp phân cụm phân cấp trong nhiều lĩnh vực khoa học dữ liệu.\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Khoảng cách và tiêu chí liên kết\u003C\u002Fh2>\n\u003Cp>Khoảng cách là yếu tố trung tâm trong phân cụm phân cấp vì nó xác định mức độ khác biệt giữa các điểm dữ liệu. Khoảng cách Euclid được sử dụng rộng rãi cho dữ liệu dạng số, trong khi khoảng cách Manhattan phù hợp với dữ liệu có cấu trúc lưới hoặc phân bố đều. Với dữ liệu văn bản hoặc dữ liệu đặc trưng vector hóa, khoảng cách Cosine được lựa chọn để đo mức độ tương đồng về hướng thay vì độ lớn.\u003C\u002Fp>\n\u003Cp>Ma trận khoảng cách là đầu vào quan trọng nhất của thuật toán gộp. Giá trị trong ma trận này quyết định thứ tự cụm được hợp nhất và chiều sâu của dendrogram. Khi thay đổi thước đo khoảng cách, hình dạng phân cụm có thể thay đổi đáng kể. Vì vậy, lựa chọn thước đo phù hợp đóng vai trò quyết định trong phân tích dữ liệu.\u003C\u002Fp>\n\u003Cp>Tiêu chí liên kết quy định cách tính khoảng cách giữa hai cụm. Một số phương pháp liên kết phổ biến:\n\u003C\u002Fp>\u003Cul>\n  \u003Cli>Single linkage: chọn khoảng cách nhỏ nhất giữa các điểm thuộc hai cụm.\u003C\u002Fli>\n  \u003Cli>Complete linkage: chọn khoảng cách lớn nhất giữa hai cụm.\u003C\u002Fli>\n  \u003Cli>Average linkage: sử dụng giá trị trung bình của toàn bộ khoảng cách.\u003C\u002Fli>\n  \u003Cli>Ward linkage: tối thiểu hóa phương sai nội cụm, giúp tạo cụm đồng nhất.\u003C\u002Fli>\n\u003C\u002Ful>\nBảng sau minh họa đặc trưng của từng tiêu chí:\n\u003Ctable border=\"1\" cellpadding=\"4\">\n  \u003Ctbody>\u003Ctr>\n    \u003Cth>Tiêu chí liên kết\u003C\u002Fth>\n    \u003Cth>Ưu điểm\u003C\u002Fth>\n    \u003Cth>Nhược điểm\u003C\u002Fth>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Single linkage\u003C\u002Ftd>\n    \u003Ctd>Tìm cụm dạng chuỗi hiệu quả\u003C\u002Ftd>\n    \u003Ctd>Dễ bị nhiễu và tạo cụm kéo dài\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Complete linkage\u003C\u002Ftd>\n    \u003Ctd>Tạo cụm nhỏ gọn\u003C\u002Ftd>\n    \u003Ctd>Nhạy cảm với điểm ngoại lai\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Average linkage\u003C\u002Ftd>\n    \u003Ctd>Cân bằng giữa single và complete;\u003C\u002Ftd>\n    \u003Ctd>Có thể làm mờ ranh giới cụm\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Ward linkage\u003C\u002Ftd>\n    \u003Ctd>Tối ưu hóa đồng nhất cụm\u003C\u002Ftd>\n    \u003Ctd>Không phù hợp với dữ liệu không thuộc không gian Euclid\u003C\u002Ftd>\n  \u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Cấu trúc dendrogram\u003C\u002Fh2>\n\u003Cp>Dendrogram là biểu đồ dạng cây mô tả quá trình gộp hoặc tách cụm, thể hiện mối quan hệ phân cấp giữa các điểm dữ liệu. Trục đứng của dendrogram biểu thị độ sai khác hoặc khoảng cách tại thời điểm cụm được hợp nhất. Khi một nhánh nằm ở độ cao lớn, điều đó cho thấy hai cụm được hợp nhất có mức độ khác biệt cao.\u003C\u002Fp>\n\u003Cp>Dendrogram giúp phân tích cấu trúc dữ liệu theo nhiều tầng mức. Người dùng có thể chọn ngưỡng cắt để xác định số cụm phù hợp nhất mà không cần chỉ định trước. Tính trực quan của dendrogram hỗ trợ mô tả phân bố dữ liệu và phát hiện cấu trúc tiềm ẩn mà các phương pháp khác khó mô tả.\u003C\u002Fp>\n\u003Cp>Các công cụ trực quan hóa dendrogram được tích hợp trong nhiều phần mềm phân tích dữ liệu, bao gồm môi trường MATLAB do \u003Ca href=\"https:\u002F\u002Fwww.mathworks.com\u002Fdiscovery\u002Fclustering.html\">MathWorks\u003C\u002Fa> phát triển. Những công cụ này cho phép phóng to, thu nhỏ và đánh dấu các mức cắt, giúp cải thiện khả năng giải thích kết quả.\u003C\u002Fp>\n\u003Ch2>Thuật toán phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Thuật toán phân cụm phân cấp gồm hai nhánh chính: gộp (agglomerative) và tách (divisive). Thuật toán gộp được sử dụng rộng rãi hơn vì tính đơn giản và khả năng hoạt động hiệu quả với quy mô dữ liệu vừa và nhỏ. Quy trình gộp bắt đầu bằng việc xem mỗi điểm dữ liệu là một cụm riêng biệt, sau đó tìm hai cụm gần nhau nhất theo ma trận khoảng cách và hợp nhất chúng lại. Sau mỗi lần hợp nhất, ma trận khoảng cách được cập nhật theo tiêu chí liên kết đã lựa chọn, tiếp tục cho đến khi toàn bộ dữ liệu thuộc một cụm duy nhất.\u003C\u002Fp>\n\u003Cp>Thuật toán tách hoạt động ngược lại. Thay vì hợp nhất, nó bắt đầu với một cụm duy nhất chứa toàn bộ dữ liệu, sau đó tách cụm thành hai nhóm theo tiêu chí phân tách tối ưu. Quá trình lặp lại cho đến khi đạt số cụm mong muốn. Phương pháp tách mô tả cấu trúc phân cấp chi tiết hơn nhưng chi phí tính toán cao, thường tăng theo cấp số mũ khi kích thước dữ liệu tăng. Do đó, nó ít được sử dụng trong các ứng dụng yêu cầu tốc độ.\u003C\u002Fp>\n\u003Cp>Thuật toán gộp có thể được biểu diễn bằng công thức cập nhật khoảng cách:\n\u003Cscript type=\"math\u002Ftex\">d(C_{new}, C_k) = f(d(C_i, C_k), d(C_j, C_k))\u003C\u002Fscript>\nTrong đó \u003Cscript type=\"math\u002Ftex\">C_{new}\u003C\u002Fscript> là cụm mới hình thành từ \u003Cscript type=\"math\u002Ftex\">C_i\u003C\u002Fscript> và \u003Cscript type=\"math\u002Ftex\">C_j\u003C\u002Fscript>, và hàm \u003Cscript type=\"math\u002Ftex\">f\u003C\u002Fscript> phụ thuộc vào phương pháp liên kết. Bảng sau mô tả độ phức tạp tính toán của từng dạng:\n\u003C\u002Fp>\u003Ctable border=\"1\" cellpadding=\"4\">\n  \u003Ctbody>\u003Ctr>\n    \u003Cth>Dạng thuật toán\u003C\u002Fth>\n    \u003Cth>Độ phức tạp trung bình\u003C\u002Fth>\n    \u003Cth>Ứng dụng\u003C\u002Fth>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Gộp\u003C\u002Ftd>\n    \u003Ctd>O(n² log n)\u003C\u002Ftd>\n    \u003Ctd>Khoa học dữ liệu, sinh học phân tử\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Tách\u003C\u002Ftd>\n    \u003Ctd>O(2^n)\u003C\u002Ftd>\n    \u003Ctd>Nghiên cứu chuyên sâu, dữ liệu nhỏ\u003C\u002Ftd>\n  \u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Ưu điểm của phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Phân cụm phân cấp mang lại khả năng mô tả sâu cấu trúc dữ liệu nhờ tạo ra hệ thống phân cấp đa tầng. Không giống như k-means, phương pháp này không yêu cầu xác định số cụm ban đầu, nhờ đó giúp việc khám phá dữ liệu trở nên linh hoạt hơn. Điều này đặc biệt hữu ích khi dữ liệu có cấu trúc phân bố phức tạp hoặc khi chưa có giả định rõ ràng về số cụm.\u003C\u002Fp>\n\u003Cp>Dendrogram là một trong những ưu điểm nổi bật nhất của phương pháp phân cấp. Người dùng có thể trực tiếp quan sát mối quan hệ giữa các điểm dữ liệu, đánh giá độ tương đồng theo nhiều cấp độ và đưa ra quyết định cắt cụm hợp lý. Khả năng quan sát trực quan này giúp cải thiện phân tích thăm dò dữ liệu, hỗ trợ phát hiện các nhóm ẩn mà các thuật toán khác bỏ sót.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp cũng có độ ổn định tốt vì không phụ thuộc vào khởi tạo ngẫu nhiên. Điều này khác biệt với k-means vốn dễ bị ảnh hưởng bởi vị trí điểm khởi tạo. Ngoài ra, phân cụm phân cấp xử lý tốt dữ liệu không hình cầu, nơi các cụm có thể kéo dài hoặc phân tầng phức tạp. Một số ưu điểm có thể liệt kê:\n\u003C\u002Fp>\u003Cul>\n  \u003Cli>Không yêu cầu xác định số cụm ban đầu.\u003C\u002Fli>\n  \u003Cli>Biểu diễn quan hệ phân cấp rõ ràng qua dendrogram.\u003C\u002Fli>\n  \u003Cli>Hoạt động ổn định với dữ liệu phức tạp.\u003C\u002Fli>\n  \u003Cli>Linh hoạt nhờ nhiều tiêu chí liên kết.\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Nhược điểm của phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Dù có nhiều ưu thế, phân cụm phân cấp cũng tồn tại những hạn chế đáng kể. Chi phí tính toán cao là một trong những điểm yếu lớn nhất, đặc biệt với bộ dữ liệu lớn. Việc tính toán ma trận khoảng cách kích thước n×n và cập nhật liên tục trong từng bước hợp nhất khiến thuật toán tiêu tốn nhiều tài nguyên bộ nhớ và thời gian. Điều này làm giảm hiệu quả khi triển khai trên hệ thống lớn hoặc trong xử lý dữ liệu thời gian thực.\u003C\u002Fp>\n\u003Cp>Một nhược điểm khác là tính \"không đảo ngược\". Khi hai cụm đã được hợp nhất, thuật toán không thể sửa lại quyết định này ngay cả khi các bước tiếp theo cho thấy đó là lựa chọn sai. Điều này khiến kết quả dễ bị ảnh hưởng nếu có nhiễu hoặc điểm ngoại lai trong dữ liệu, đặc biệt với single linkage vốn dễ tạo ra hiệu ứng \"chuỗi\" kéo dài cụm không mong muốn.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp cũng khó xử lý dữ liệu không đồng nhất hoặc dữ liệu có kích thước rất lớn. Khi số chiều cao, thước đo khoảng cách có thể trở nên kém hiệu quả do ảnh hưởng của \"lời nguyền chiều cao\". Tóm lược hạn chế:\n\u003C\u002Fp>\u003Cul>\n  \u003Cli>Chi phí tính toán và bộ nhớ lớn.\u003C\u002Fli>\n  \u003Cli>Không thể điều chỉnh sai sót trong quá trình gộp cụm.\u003C\u002Fli>\n  \u003Cli>Nhạy cảm với nhiễu khi dùng tiêu chí single linkage.\u003C\u002Fli>\n  \u003Cli>Hiệu suất giảm với dữ liệu nhiều chiều.\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Ứng dụng của phân cụm phân cấp\u003C\u002Fh2>\n\u003Cp>Phân cụm phân cấp được ứng dụng rộng rãi trong khoa học dữ liệu, sinh học phân tử, phân tích thị trường, xử lý ngôn ngữ tự nhiên và khai phá dữ liệu. Trong sinh học phân tử, phương pháp này giúp phân tích dữ liệu gene, xây dựng cây phân loại sinh học và xác định quan hệ tiến hóa giữa các loài. Dendrogram hỗ trợ trực quan hóa mối quan hệ gene hoặc protein, cho phép phát hiện các nhóm chức năng.\u003C\u002Fp>\n\u003Cp>Trong khoa học dữ liệu, phân cụm phân cấp là công cụ quan trọng trong phân tích khám phá (EDA). Nó giúp nhận diện cấu trúc ẩn trong dữ liệu trước khi áp dụng các thuật toán phức tạp hơn. Trong marketing, phương pháp này hỗ trợ phân nhóm khách hàng dựa trên hành vi mua sắm, giúp thiết kế chiến lược tiếp thị mục tiêu.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp cũng được sử dụng trong xử lý ngôn ngữ tự nhiên để phân nhóm văn bản, trích xuất chủ đề và phát hiện tài liệu tương đồng. Trong an ninh mạng, nó hỗ trợ phân tích mẫu log hệ thống để xác định các nhóm hành vi bất thường. Một số ứng dụng tiêu biểu:\n\u003C\u002Fp>\u003Cul>\n  \u003Cli>Nhóm gene và protein trong sinh học phân tử.\u003C\u002Fli>\n  \u003Cli>Phân nhóm khách hàng trong thương mại.\u003C\u002Fli>\n  \u003Cli>Phân tích văn bản trong NLP.\u003C\u002Fli>\n  \u003Cli>Phân tích log và phát hiện bất thường trong an ninh mạng.\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>So sánh phân cụm phân cấp với các phương pháp khác\u003C\u002Fh2>\n\u003Cp>Phân cụm phân cấp thường được so sánh với k-means, DBSCAN và Gaussian Mixture Models (GMM). K-means có tốc độ nhanh hơn nhưng yêu cầu xác định số cụm trước và khó xử lý cụm không hình cầu. DBSCAN phát hiện tốt các cụm mật độ cao và điểm nhiễu nhưng hoạt động kém nếu mật độ cụm không nhất quán. GMM linh hoạt với dữ liệu phân bố phức tạp nhưng cần tối ưu nhiều tham số.\u003C\u002Fp>\n\u003Cp>Phân cụm phân cấp không yêu cầu số cụm ban đầu, cung cấp cấu trúc phân cấp rõ ràng và hoạt động ổn định hơn. Tuy nhiên, chi phí tính toán lớn hạn chế khả năng mở rộng. Tùy vào dữ liệu và mục tiêu, phân cụm phân cấp có thể là bước khởi đầu tốt để khám phá cấu trúc trước khi áp dụng thuật toán nhanh hơn.\u003C\u002Fp>\n\u003Cp>Bảng so sánh sau minh họa điểm khác biệt:\n\u003C\u002Fp>\u003Ctable border=\"1\" cellpadding=\"4\">\n  \u003Ctbody>\u003Ctr>\n    \u003Cth>Thuật toán\u003C\u002Fth>\n    \u003Cth>Ưu điểm\u003C\u002Fth>\n    \u003Cth>Nhược điểm\u003C\u002Fth>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>Hierarchical Clustering\u003C\u002Ftd>\n    \u003Ctd>Cấu trúc phân cấp trực quan, không cần số cụm\u003C\u002Ftd>\n    \u003Ctd>Chi phí tính toán cao\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>K-means\u003C\u002Ftd>\n    \u003Ctd>Nhanh, dễ mở rộng\u003C\u002Ftd>\n    \u003Ctd>Cần số cụm trước, nhạy cảm với khởi tạo\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n    \u003Ctd>DBSCAN\u003C\u002Ftd>\n    \u003Ctd>Phát hiện nhiễu tốt, không cần số cụm\u003C\u002Ftd>\n    \u003Ctd>Khó tối ưu tham số với dữ liệu không đồng nhất\u003C\u002Ftd>\n  \u003C\u002Ftr>\n\u003C\u002Ftbody>\u003C\u002Ftable>\n\u003Cp>\u003C\u002Fp>\n\n\u003Ch2>Tài liệu tham khảo\u003C\u002Fh2>\n\u003Cul>\n  \u003Cli>Scikit-learn. Clustering Algorithms Overview. Truy cập tại: \u003Ca href=\"https:\u002F\u002Fscikit-learn.org\u002Fstable\u002Fmodules\u002Fclustering.html\">https:\u002F\u002Fscikit-learn.org\u002Fstable\u002Fmodules\u002Fclustering.html\u003C\u002Fa>\u003C\u002Fli>\n  \u003Cli>MathWorks. Clustering and Dendrograms. Truy cập tại: \u003Ca href=\"https:\u002F\u002Fwww.mathworks.com\u002Fdiscovery\u002Fclustering.html\">https:\u002F\u002Fwww.mathworks.com\u002Fdiscovery\u002Fclustering.html\u003C\u002Fa>\u003C\u002Fli>\n  \u003Cli>IBM. Introduction to Clustering Methods. Truy cập tại: \u003Ca href=\"https:\u002F\u002Fwww.ibm.com\u002Ftopics\u002Fclustering\">https:\u002F\u002Fwww.ibm.com\u002Ftopics\u002Fclustering\u003C\u002Fa>\u003C\u002Fli>\n\u003C\u002Ful>\n\u003C\u002Fdiv>",{"id":18,"researcherId":10,"name":19,"imageUrl":20},1,"Nguyễn Ngọc Sơn","https:\u002F\u002Flh3.googleusercontent.com\u002Fa\u002FACg8ocLGfGsF1nYQqYK5BasTLhNu1dBrBXg2fcEgBNPXJ0p2gqLQnO7i=s96-c",{"id":22,"researcherId":10,"name":23,"imageUrl":24},2889,"Lê Xuân Niên","https:\u002F\u002Flh3.googleusercontent.com\u002Fa\u002FACg8ocLuyWIkhyP2W5E59cKwN7ciI2nbjMGUpXO9rVQquC826ujzkqhU=s96-c",[13],false,"PUBLISHED","2025-12-01T11:31:34.073+00:00","2025-12-05T16:21:41.330+00:00","2025-12-05T16:21:41.326+00:00",108,[33,43,49,54,59,69,79,89,99,104],{"id":34,"title":35,"term":34,"englishTitle":36,"definition":37,"discipline":38,"disciplineCode":39,"disciplineLabel":40,"disciplineColor":41,"disciplineIcon":42},"phân tích cụm phân cấp","Phân tích cụm phân cấp là gì? Khái niệm, cơ chế và ứng dụng","Hierarchical cluster analysis (HCA)","Phân tích cụm phân cấp (hierarchical cluster analysis) là phương pháp học máy không giám sát phân nhóm các phần tử dữ liệu thành một cây thứ bậc dựa trên ma trận khoảng cách tương đồng giữa các quan sát.","NATURAL_SCIENCES","natural-sciences","Khoa học tự nhiên","#0E9F9C","atom",{"id":44,"title":45,"term":46,"englishTitle":47,"definition":48,"discipline":38,"disciplineCode":39,"disciplineLabel":40,"disciplineColor":41,"disciplineIcon":42},"khoảng cách tiến hóa","Khoảng cách tiến hóa là gì? Khái niệm, mô hình và ứng dụng","Khoảng cách tiến hóa","evolutionary distance","Khoảng cách tiến hóa là đại lượng định lượng phản ánh số lượng đột biến thay thế nucleotit hoặc axit amin tích lũy trên mỗi vị trí chuỗi sinh học giữa hai dòng dõi kể từ khi chúng phân kỳ từ một tổ tiên chung.",{"id":50,"title":51,"term":50,"englishTitle":52,"definition":53,"discipline":38,"disciplineCode":39,"disciplineLabel":40,"disciplineColor":41,"disciplineIcon":42},"nghiệm riêng","Nghiệm riêng (particular solution) là gì?","particular solution","Nghiệm riêng (particular solution) là nghiệm cụ thể của phương trình vi phân thỏa mãn toàn bộ phương trình mà không chứa bất kỳ hằng số tùy ý nào, nhận được từ nghiệm tổng quát khi cố định điều kiện ban đầu hoặc thu được bằng các phương pháp giải tích cho phương trình không thuần nhất.",{"id":55,"title":56,"term":55,"englishTitle":57,"definition":58,"discipline":38,"disciplineCode":39,"disciplineLabel":40,"disciplineColor":41,"disciplineIcon":42},"chuỗi markov monte carlo","Chuỗi Markov Monte Carlo (Markov chain Monte Carlo) là gì?","markov chain monte carlo","Chuỗi Markov Monte Carlo (MCMC) là nhóm thuật toán điện toán thống kê kết hợp chuỗi Markov với mô phỏng ngẫu nhiên để lấy mẫu từ các phân phối xác suất nhiều chiều phức tạp mà không cần tính tích phân chuẩn hóa.",{"id":60,"title":61,"term":60,"englishTitle":62,"definition":63,"discipline":64,"disciplineCode":65,"disciplineLabel":66,"disciplineColor":67,"disciplineIcon":68},"shunt dưới màng cứng bụng","Shunt dưới màng cứng bụng (subdural-peritoneal shunt) là gì?","subdural-peritoneal shunt","Shunt dưới màng cứng bụng là hệ thống dẫn lưu ngoại khoa chuyên biệt nhằm chuyển dịch não tủy hoặc máu tụ từ khoang dưới màng cứng về khoang phúc mạc ổ bụng. Kỹ thuật này thường được chỉ định trong các trường hợp tụ dịch hoặc tụ máu dưới màng cứng mạn tính tái phát nhiều lần và kháng trị với phẫu thuật dẫn lưu thông thường.","MEDICAL_HEALTH_SCIENCES","medical-health-sciences","Khoa học y - dược","#D6336C","stethoscope",{"id":70,"title":71,"term":70,"englishTitle":72,"definition":73,"discipline":74,"disciplineCode":75,"disciplineLabel":76,"disciplineColor":77,"disciplineIcon":78},"biện pháp tu từ","Biện pháp tu từ là gì? Phân loại, tác dụng và ví dụ","rhetorical device","Biện pháp tu từ (rhetorical device) là kỹ thuật sử dụng ngôn từ có chủ ý lệch khỏi cách diễn đạt thông thường nhằm tạo ra hiệu quả thẩm mỹ, tăng cường sức gợi cảm và tối ưu hóa năng lực thuyết phục người tiếp nhận.","HUMANITIES","humanities","Nhân văn và nghệ thuật","#9333EA","book-open",{"id":80,"title":81,"term":80,"englishTitle":82,"definition":83,"discipline":84,"disciplineCode":85,"disciplineLabel":86,"disciplineColor":87,"disciplineIcon":88},"hạnh phúc","Hạnh phúc là gì? Định nghĩa, thành phần và lý thuyết","happiness","Hạnh phúc (happiness) trong tâm lý học và khoa học xã hội là trạng thái tinh thần tích cực đặc trưng bởi sự thỏa mãn sâu sắc và toàn diện đối với cuộc sống, kết hợp với sự hiện diện thường xuyên của các cảm xúc dễ chịu và sự kiểm soát hiệu quả đối với các cảm xúc tiêu cực.","SOCIAL_SCIENCES","social-sciences","Khoa học xã hội","#E08600","users",{"id":90,"title":91,"term":90,"englishTitle":92,"definition":93,"discipline":94,"disciplineCode":95,"disciplineLabel":96,"disciplineColor":97,"disciplineIcon":98},"kết cấu","Kết cấu là gì? Khái niệm, nguyên lý và phân loại","structure","Kết cấu (structure) là hệ thống các bộ phận chịu lực và truyền tải lực liên kết tương hỗ nhằm bảo đảm tính ổn định, độ bền và khả năng chịu tải của một công trình xây dựng hoặc thiết bị kỹ thuật dưới tác động của các tải trọng tĩnh và động.","ENGINEERING_TECHNOLOGY","engineering-technology","Kỹ thuật và công nghệ","#5B62F4","cpu",{"id":100,"title":101,"term":100,"englishTitle":102,"definition":103,"discipline":38,"disciplineCode":39,"disciplineLabel":40,"disciplineColor":41,"disciplineIcon":42},"trầm tích lỏng","Trầm tích lỏng (fluid mud) là gì?","fluid mud","Trầm tích lỏng là hệ huyền phù đậm đặc của các hạt trầm tích mịn kết dính bão hòa nước, hình thành lớp chuyển tiếp giữa cột nước và đáy cố kết tại các vùng cửa sông ven biển.",{"id":105,"title":106,"term":105,"englishTitle":107,"definition":108,"discipline":64,"disciplineCode":65,"disciplineLabel":66,"disciplineColor":67,"disciplineIcon":68},"chăm sóc đặc biệt thần kinh","Chăm sóc đặc biệt thần kinh (neurocritical care) là gì?","neurocritical care","Chăm sóc đặc biệt thần kinh là phân ngành chuyên sâu của hồi sức cấp cứu và thần kinh học, tập trung theo dõi liên tục, chẩn đoán kịp thời và can thiệp điều trị tích cực nhằm ngăn ngừa tổn thương não thứ phát ở bệnh nhân mắc các bệnh lý thần kinh nguy kịch đe dọa tính mạng."]