Từ điển học thuật Kỹ thuật và công nghệ

Mô hình chất lượng âm thanh hình ảnh là gì?

Tiếng Anhaudiovisual quality model

Tên gọi khácmô hình chất lượng nghe nhìnaudiovisual QoE model

Mô hình chất lượng âm thanh hình ảnh là hệ thống tính toán hoặc mô hình toán học ước lượng chất lượng trải nghiệm tổng thể của con người khi tiếp nhận đồng thời cả hai luồng tín hiệu âm thanh và hình ảnh trên thang điểm Mean Opinion Score từ 1 đến 5.

Cập nhật 29/9/2026

Mô hình chất lượng âm thanh hình ảnh là hệ thống tính toán hoặc mô hình toán học ước lượng chất lượng trải nghiệm tổng thể của con người khi tiếp nhận đồng thời cả hai luồng tín hiệu âm thanh và hình ảnh trên thang điểm Mean Opinion Score từ 1 đến 5. Thay vì đánh giá riêng rẽ luồng thoại hoặc luồng video, mô hình này kết hợp các tham số suy hao kỹ thuật và đặc trưng cảm nhận của cả hai phương thức giác quan thính giác và thị giác để dự đoán mức độ hài lòng cuối cùng của người sử dụng dịch vụ truyền thông đa phương tiện. Bài viết trình bày cơ sở nhận thức đa giác quan, phân loại các phương pháp đánh giá, kiến trúc chuẩn hóa quốc tế ITU-T P.1203 và P.1204, các mô hình toán học tích hợp, thực tiễn áp dụng tại Việt Nam cùng các thách thức công nghệ hiện đại.

Bản chất và cơ sở nhận thức của chất lượng nghe nhìn

Trong các dịch vụ truyền thông đa phương tiện số, người dùng không tiếp nhận âm thanh và hình ảnh như hai kênh thông tin độc lập mà não bộ luôn diễn ra quá trình tích hợp nhận thức đa giác quan. Chất lượng trải nghiệm của dịch vụ nghe nhìn phụ thuộc đồng thời vào độ trung thực của luồng âm thanh, độ sắc nét và mượt mà của luồng hình ảnh cùng mức độ đồng bộ thời gian giữa hai kênh giác quan. Các mô hình đánh giá chất lượng nghe nhìn khách quan được phát triển nhằm tự động hóa việc đo lường và thay thế các bài kiểm nghiệm đánh giá chủ quan vốn tốn kém thời gian và chi phí.

Cơ chế tích hợp đa giác quan thính giác và thị giác

Nghiên cứu thực nghiệm kinh điển của tác giả David S. Hands công bố năm 2004 trên tạp chí IEEE Transactions on Multimedia chỉ ra rằng con người có xu hướng tích hợp nhận thức từ cả hai phương thức thính giác và thị giác để hình thành một đánh giá chất lượng trải nghiệm thống nhất thay vì đánh giá chúng hoàn toàn tách biệt trong 2 thử nghiệm đa phương tiện. Khi tiếp nhận một đoạn nội dung, các kích thích thị giác truyền qua võng mạc và các kích thích thính giác truyền qua màng nhĩ được vỏ não xử lý song song, sau đó hội tụ tại các vùng liên kết thần kinh để tạo nên một phán đoán chất lượng toàn diện.

Mức độ đóng góp của từng phương thức vào cảm nhận tổng thể biến thiên linh hoạt tùy thuộc vào thể loại nội dung và ngữ cảnh thưởng thức. Đối với các nội dung giàu tính thị giác như phim điện ảnh hành động hoặc các trận thi đấu thể thao, người xem có xu hướng tập trung chú ý vào độ nét, độ mượt của chuyển động và sự trung thực của màu sắc. Ngược lại, trong các bối cảnh truyền hình hội nghị, chương trình thời sự hoặc biểu diễn âm nhạc thính phòng, chất lượng âm thanh và độ rõ ràng của giọng nói lại chiếm vị thế chi phối quyết định mức độ hài lòng của người dùng.

Hiện tượng tương tác chéo và ngưỡng đồng bộ tiếng hình

Trong tâm lý học nhận thức và xử lý tín hiệu truyền thông, hiện tượng tương tác chéo giác quan thể hiện rõ qua hiệu ứng che lấp chéo. Khi luồng âm thanh đạt độ trong trẻo và băng thông chất lượng cao, người nghe có xu hướng dễ dàng bỏ qua hoặc giảm bớt cảm giác khó chịu trước một số suy giảm nhẹ của hình ảnh như hiện tượng mờ cục bộ hoặc biến dạng khối nén. Tuy nhiên, tính chất bù trừ này có giới hạn vật lý rõ rệt: hiện tượng bất đối xứng nhận thức chỉ ra rằng khi chất lượng hình ảnh sụt giảm xuống dưới một ngưỡng chất lượng tối thiểu, âm thanh dù đạt độ trung thực cao đến đâu cũng không thể bù đắp trải nghiệm thị giác bị phá vỡ.

Một yếu tố kỹ thuật mang tính sống còn đối với mô hình chất lượng âm thanh hình ảnh là sự đồng bộ thời gian giữa âm thanh và hình ảnh, thường được gọi là hiện tượng khớp tiếng hình. Do vận tốc truyền lan và cơ chế xử lý của hệ thống mã hóa, giải mã âm thanh và video có sự khác biệt, hai luồng tín hiệu rất dễ xuất hiện độ lệch thời gian tương đối. Khuyến nghị ITU-R BT.1359-1 ban hành năm 1998 quy định ngưỡng phát hiện bất đồng bộ âm thanh đi trước hình ảnh là 45 ms và âm thanh đi sau hình ảnh là 125 ms. Khuyến nghị ITU-R BT.1359-1 xác định ngưỡng chấp nhận được đối với hiện tượng lệch tiếng hình là âm thanh đi trước hình ảnh không quá 90 ms và âm thanh đi sau hình ảnh không quá 185 ms. Con người nhạy cảm hơn đối với hiện tượng tiếng đi trước hình do trong môi trường tự nhiên, vận tốc ánh sáng lớn hơn nhiều vận tốc âm thanh, khiến não bộ quen tiếp nhận kích thích thị giác trước hoặc đồng thời với kích thích thính giác.

Phân loại các mô hình chất lượng âm thanh hình ảnh

Theo công trình tổng quan toàn diện của Zahid Akhtar và Tiago H. Falk công bố năm 2017 trên tạp chí IEEE Access, các mô hình đánh giá chất lượng nghe nhìn đa phương tiện được phân thành ba nhóm chính gồm tham chiếu đầy đủ FR, suy giảm tham chiếu RR và không tham chiếu NR tùy thuộc mức độ sẵn có của tín hiệu gốc. Sự phân định này phản ánh sự đánh đổi trực tiếp giữa độ chính xác dự đoán và khả năng ứng dụng thực tế trong hạ tầng mạng truyền dẫn.

Mô hình tham chiếu đầy đủ

Mô hình tham chiếu đầy đủ yêu cầu truy cập toàn bộ tín hiệu gốc không nén để đối chiếu sai khác với tín hiệu thu được, mang lại độ chính xác cao trong phòng thí nghiệm. Ở kênh hình ảnh, mô hình sử dụng các giải thuật đo lường sai số điểm ảnh hoặc mô phỏng hệ thống thị giác người như tỷ số tín hiệu trên tạp âm đỉnh, chỉ số độ tương đồng cấu trúc và chỉ số đánh giá đa phương thức video. Ở kênh âm thanh, mô hình áp dụng các tiêu chuẩn phân tích tâm lý âm học đối sánh tín hiệu thu với tín hiệu phát. Điểm chất lượng của từng kênh sau đó được đưa qua hàm tích hợp để sinh điểm tổng thể. Do đòi hỏi luồng dữ liệu gốc nguyên bản, mô hình tham chiếu đầy đủ không thể triển khai trên các đường truyền mạng thời gian thực mà chủ yếu phục vụ nghiên cứu thuật toán nén codec và kiểm chuẩn thiết bị trong môi trường kiểm nghiệm khép kín.

Mô hình suy giảm tham chiếu

Mô hình suy giảm tham chiếu chỉ trích xuất một tập đặc trưng rút gọn từ tín hiệu phát để so khớp tại điểm thu qua kênh phụ trợ. Thay vì truyền tải toàn bộ tín hiệu gốc có dung lượng khổng lồ, hệ thống phát chỉ tính toán một lượng nhỏ tham số mô tả đặc trưng không gian, đặc trưng thời gian của video và phổ tần số của âm thanh. Điểm thu sử dụng các tham số này để phát hiện các biến dạng suy hao do mã hóa và truyền dẫn. Giải pháp này giúp tiết kiệm đáng kể băng thông đường truyền nhưng đòi hỏi kênh phụ trợ có độ tin cậy cao và quy trình đồng bộ hóa chính xác giữa dòng dữ liệu chính và dữ liệu đặc trưng.

Mô hình không tham chiếu

Mô hình không tham chiếu chỉ phân tích tín hiệu nhận được hoặc thông tin gói tin trên đường truyền mạng mà không cần bất kỳ tín hiệu gốc nào. Đây là hướng tiếp cận có tính thực tiễn cao nhất trong kỷ nguyên truyền phát nội dung số quy mô lớn. Mô hình không tham chiếu được phân chia thành hai nhánh công nghệ bổ trợ:

  • Mô hình dựa trên tín hiệu giải mã: Phân tích trực tiếp dạng sóng âm thanh và khung hình điểm ảnh sau giải mã nhằm tìm kiếm các dấu hiệu biến dạng đặc trưng như khối hóa, nhòe cạnh, giật khung hình, méo tiếng hoặc tạp âm nền. Nhánh mô hình này đạt độ chính xác cảm nhận tốt nhưng tiêu tốn tài nguyên tính toán giải mã tại thiết bị đầu cuối.
  • Mô hình tham số dựa trên luồng bit: Trích xuất trực tiếp các trường tiêu đề gói tin giao thức mạng, thông số đóng gói luồng truyền và thông số cấu hình bộ mã hóa như tốc độ bit, độ phân giải không gian, tốc độ khung hình, kích thước bộ đệm và tỷ lệ mất gói mà không cần giải mã dòng dữ liệu điểm ảnh. Hướng tiếp cận này có tốc độ xử lý tính toán cực nhanh, phù hợp cho việc giám sát chất lượng hàng loạt trên các cổng mạng và máy chủ dịch vụ.

Bảng so sánh các phương pháp đánh giá nghe nhìn

Mỗi nhóm mô hình sở hữu những ưu thế và ràng buộc kỹ thuật riêng biệt, được tổng hợp đối chiếu trong bảng dưới đây:

Phương pháp mô hình Dữ liệu đầu vào yêu cầu Độ phức tạp tính toán Yêu cầu kênh phụ trợ Độ chính xác tương quan MOS Ứng dụng điển hình
Tham chiếu đầy đủ (FR) Tín hiệu gốc và tín hiệu đã xử lý Rất cao Yêu cầu toàn bộ tín hiệu gốc Tối ưu trong môi trường kiểm thử Kiểm chuẩn codec, nghiên cứu phòng thí nghiệm
Suy giảm tham chiếu (RR) Tập đặc trưng rút gọn và tín hiệu thu Trung bình Đòi hỏi kênh phụ truyền đặc trưng Tốt Giám sát phân phối truyền dẫn nội dung
Không tham chiếu luồng bit (NR-P) Tiêu đề gói tin và tham số luồng bit Thấp Không cần thông tin bổ trợ Khá đến tốt Giám sát thời gian thực quy mô nhà mạng
Không tham chiếu điểm ảnh (NR-Px) Tín hiệu âm thanh và điểm ảnh giải mã Cao Không cần thông tin bổ trợ Tốt Đánh giá chất lượng thiết bị đầu cuối

Khung kiến trúc tiêu chuẩn quốc tế ITU-T P.1203 và P.1204

Nhằm thiết lập một thước đo chung có độ tin cậy quốc tế cho các nhà cung cấp nội dung và doanh nghiệp viễn thông, Liên minh Viễn thông Quốc tế đã chuẩn hóa các bộ tiêu chuẩn đo lường chất lượng dịch vụ truyền thông đa phương tiện thích ứng.

Tổng quan tiêu chuẩn ITU-T Recommendation P.1203

Tiêu chuẩn ITU-T Recommendation P.1203 được công bố năm 2017 với mã hiệu số 1203 là khuyến nghị chuẩn quốc tế đầu tiên về mô hình tham số dựa trên luồng bit đánh giá chất lượng trải nghiệm nghe nhìn cho dịch vụ truyền phát trực tuyến thích ứng. Tiêu chuẩn này được thiết kế chuyên biệt cho các giao thức truyền tải tin cậy qua giao thức điều khiển truyền vận như công nghệ truyền phát thích ứng qua giao thức truyền siêu văn bản DASH và HLS. Mô hình ITU-T P.1203 được xây dựng theo kiến trúc ba phân hệ gồm phân hệ ước lượng video P.1203.1, phân hệ ước lượng âm thanh P.1203.2 và phân hệ tích hợp nghe nhìn và suy giảm dừng hình P.1203.3.

Khung đánh giá chất lượng ITU-T P.1203 áp dụng cho các phiên truyền phát video có thời lượng từ 30 giây đến 300 giây. Mô hình ITU-T P.1203 đã được huấn luyện và kiểm chứng thực nghiệm trên bộ dữ liệu quy mô lớn với hơn 1000 chuỗi đa phương tiện nghe nhìn theo công bố của Werner Robitza và cộng sự năm 2018 tại hội nghị ACM MMSys. Mô hình cung cấp bốn chế độ vận hành linh hoạt từ chế độ chỉ khai thác siêu dữ liệu đóng gói đến chế độ phân tích sâu dòng bit mã hóa, cho phép áp dụng hiệu quả ngay cả khi lưu lượng truyền tải bị mã hóa đường truyền.

Các mô hình toán học tích hợp chất lượng âm thanh và hình ảnh

Hàm tích hợp chất lượng nghe nhìn cơ bản thường mô hình hóa điểm chất lượng tổng thể qua tương tác đa thức phi tuyến giữa chất lượng âm thanh và chất lượng hình ảnh. Trong các nghiên cứu nền tảng được tổng hợp bởi Akhtar và Falk năm 2017, mối quan hệ giữa điểm chất lượng âm thanh dự đoán, điểm chất lượng hình ảnh dự đoán và điểm chất lượng nghe nhìn tổng thể thường được biểu diễn qua phương trình đa thức tương tác:

MOSAV=α+β⋅MOSA+γ⋅MOSV+δ⋅(MOSA⋅MOSV)MOS_{AV} = \alpha + \beta \cdot MOS_A + \gamma \cdot MOS_V + \delta \cdot (MOS_A \cdot MOS_V)

Trong phương trình trên, đại lượng MOSAVMOS_{AV} là điểm đánh giá ý kiến trung bình nghe nhìn tích hợp dự đoán, đại lượng MOSAMOS_A là điểm chất lượng của luồng âm thanh thành phần, đại lượng MOSVMOS_V là điểm chất lượng của luồng hình ảnh thành phần. Các tham số α,β,γ\alpha, \beta, \gamma lần lượt là hệ số chặn tự do cùng các trọng số tuyến tính phản ánh mức độ đóng góp độc lập của kênh âm thanh và kênh hình ảnh, còn hệ số δ\delta là trọng số điều chỉnh thành phần tương tác phi tuyến chéo giữa hai giác quan. Toàn bộ tập tham số mô hình α,β,γ,δ\alpha, \beta, \gamma, \delta được tối ưu hóa thông qua các thuật toán hồi quy phi tuyến dựa trên dữ liệu đánh giá chủ quan thực nghiệm.

Trong phân hệ tích hợp P.1203.3 của tiêu chuẩn ITU-T P.1203, quy trình tính toán được thực hiện theo cấu trúc đa tầng chặt chẽ. Trước hết, mô hình tính toán điểm chất lượng tức thời của từng khoảng thời gian một giây cho âm thanh và hình ảnh. Sau đó, một hàm tích hợp thời gian thực hiện gom cụm các giá trị theo trục thời gian nhằm mô phỏng các hiệu ứng tâm lý nhận thức của người xem như hiệu ứng gần nhất, khi người xem có xu hướng nhớ rõ các đoạn suy giảm chất lượng diễn ra ở phần cuối phiên phát hơn các đoạn ở phần đầu. Cuối cùng, điểm chất lượng mã hóa nghe nhìn được kết hợp với mức độ suy giảm do hiện tượng dừng phát đệm dữ liệu và thời gian trễ nạp ban đầu để tính ra điểm chất lượng phiên toàn diện trên thang điểm từ 1 đến 5.

Mở rộng đánh giá siêu nét với tiêu chuẩn ITU-T P.1204

Sự bùng nổ của các thiết bị hiển thị kích thước lớn và mạng băng rộng đòi hỏi các mô hình chất lượng phải hỗ trợ các định dạng video siêu nét. Tiêu chuẩn ITU-T Recommendation P.1204 công bố năm 2020 mở rộng phạm vi đánh giá chất lượng video chuyên biệt lên độ phân giải siêu nét UHD và 4K, cung cấp điểm số chất lượng hình ảnh làm đầu vào phối hợp với các mô-đun tích hợp nghe nhìn. Theo bài báo của Alexander Raake và nhóm chuyên gia quốc tế công bố năm 2020 trên tạp chí IEEE Access, mô hình ITU-T P.1204 hỗ trợ định dạng video với độ phân giải lên đến 3840 nhân 2160 điểm ảnh cùng tốc độ khung hình 60 fps.

Khung tiêu chuẩn P.1204 tích hợp ba hướng tiếp cận độc lập gồm mô hình dựa trên luồng bit P.1204.3, mô hình dựa trên điểm ảnh P.1204.4 và mô hình lai kết hợp cả hai nguồn thông tin P.1204.5. Hệ thống này được kiểm chứng trên các chuẩn nén video tiên tiến gồm H.264, HEVC, VP9 và AV1, cung cấp khả năng dự đoán chính xác sự suy giảm cảm nhận do nén nấc lượng tử hóa và suy hao nội suy tỷ lệ khung hình trong môi trường truyền thông thế hệ mới.

Phương pháp đánh giá chủ quan làm cơ sở chuẩn hóa

Để xây dựng và tinh chỉnh các hệ số toán học cho bất kỳ mô hình chất lượng khách quan nào, các nhà khoa học bắt buộc phải thu thập dữ liệu đo kiểm đánh giá chủ quan từ các quan sát viên con người làm chuẩn chân lý. Về phương diện đo kiểm tâm vật lý, Khuyến nghị ITU-T Recommendation P.911 ban hành năm 1998 từng đặt nền móng chuẩn hóa các phương pháp đánh giá chủ quan chất lượng nghe nhìn đa phương tiện bao gồm phương pháp đánh giá phân loại tuyệt đối ACR và đánh giá suy giảm DCR trên thang điểm 5 mức trước khi được hợp nhất vào năm 2024. Các tiêu chuẩn này thiết lập những quy chuẩn khắt khe về môi trường phòng thí nghiệm gồm độ sáng phòng, khoảng cách quan sát màn hình, độ ồn nền và mức áp suất âm thanh tai nghe.

Trong phương pháp ACR, người tham gia thí nghiệm xem các đoạn video nghe nhìn độc lập và cho điểm trực tiếp theo thang phân loại 5 điểm gồm các mức: 1 điểm ứng với chất lượng rất kém, 2 điểm ứng với chất lượng kém, 3 điểm ứng với chất lượng trung bình, 4 điểm ứng với chất lượng tốt, và 5 điểm ứng với chất lượng xuất sắc. Trong phương pháp DCR, người tham gia được xem chuỗi mẫu đối chứng chất lượng cao trước khi xem chuỗi tín hiệu bị suy giảm, sau đó đánh giá mức độ khó chịu trên thang 5 mức từ không nhận thấy suy giảm đến suy giảm gây rất khó chịu. Giá trị trung bình cộng điểm số của toàn bộ nhóm thử nghiệm tạo thành điểm Mean Opinion Score, làm cơ sở tối ưu hóa hàm hồi quy cho mô hình tính toán khách quan.

Ứng dụng thực tế và chuẩn mực kỹ thuật tại Việt Nam

Tại Việt Nam, sự chuyển dịch mạnh mẽ từ truyền hình truyền thống sang các dịch vụ truyền hình tương tác qua mạng băng rộng và truyền thông trực tuyến OTT đặt ra yêu cầu cấp thiết về kiểm soát chất lượng nghe nhìn. Quy chuẩn kỹ thuật quốc gia QCVN 84:2021/BTTTT do Bộ Thông tin và Truyền thông ban hành năm 2021 quy định dịch vụ truyền hình cáp giao thức Internet IPTV phải đạt độ khả dụng tối thiểu 99,5%. Bên cạnh tiêu chí khả dụng hệ thống, Quy chuẩn kỹ thuật quốc gia QCVN 84:2021/BTTTT quy định chất lượng hình ảnh của dịch vụ truyền hình IPTV phải đạt điểm trung bình ý kiến MOS tối thiểu từ 3,0 trở lên trên thang 5 điểm.

Các doanh nghiệp viễn thông và đơn vị cung cấp dịch vụ truyền hình trực tuyến tại Việt Nam áp dụng các mô hình đánh giá chất lượng nghe nhìn nhằm tối ưu hóa hạ tầng phân phối và nâng cao trải nghiệm thuê bao. Bằng cách tích hợp các giải pháp đo kiểm theo thời gian thực, hệ thống giám sát tự động theo dõi các chỉ số chất lượng dịch vụ mà không làm ảnh hưởng đến hiệu năng thiết bị người dùng. Dữ liệu chất lượng này đóng vai trò quan trọng trong việc hỗ trợ các thuật toán truyền phát thích ứng ABR, giúp hệ thống chủ động điều chỉnh tốc độ dòng dữ liệu khi đường truyền mạng biến động.

Thách thức kỹ thuật và Xu hướng phát triển

Mặc dù các mô hình chất lượng âm thanh hình ảnh đã đạt được nhiều bước tiến chuẩn hóa quan trọng, môi trường mạng hiện đại vẫn đặt ra những thách thức lớn đối với việc duy trì độ chính xác của mô hình:

  • Mã hóa lưu lượng toàn phần: Xu hướng triển khai rộng rãi các giao thức bảo mật tầng truyền vận TLS và giao thức QUIC khiến các gói tin truyền thông bị mã hóa hoàn toàn. Các mô hình dựa trên luồng bit không thể đọc các trường siêu dữ liệu trong tiêu đề gói tin nếu không có cơ chế tích hợp chia sẻ thông tin an toàn giữa ứng dụng và hạ tầng mạng.
  • Đa dạng nội dung người dùng tự tạo: Phần lớn nội dung trên các nền tảng mạng xã hội video do người dùng tự tạo bằng thiết bị di động cá nhân thường có chất lượng thu âm và máy ảnh không đồng đều. Mô hình phải phân biệt được giữa suy hao do mạng truyền dẫn và các khiếm khuyết vốn có sẵn từ khâu quay phim gốc.
  • Sự phong phú của thiết bị đầu cuối: Người dùng trải nghiệm nội dung trên vô số chủng loại thiết bị từ điện thoại thông minh, máy tính bảng đến tivi thông minh màn hình siêu lớn, kết hợp với các loại tai nghe hoặc hệ thống loa khác nhau. Môi trường nghe nhìn xung quanh như ánh sáng phòng và tiếng ồn thực tế tạo ra các sai lệch đáng kể đối với nhận thức chất lượng cá nhân.

Để vượt qua các giới hạn này, hướng phát triển tương lai của mô hình chất lượng nghe nhìn đang tập trung mạnh mẽ vào việc ứng dụng trí tuệ nhân tạo và mạng nơ-ron học sâu. Các kiến trúc nơ-ron đa phương thức cho phép tự động trích xuất các đặc trưng ngữ cảnh phức tạp của nội dung, đồng thời học các hàm liên kết giác quan phi tuyến có khả năng tự thích nghi cao. Ngoài ra, việc mở rộng mô hình sang các phương tiện truyền thông đắm chìm như thực tế ảo, video hình cầu toàn cảnh và âm thanh không gian ba chiều đang mở ra một kỷ nguyên mới trong nghiên cứu đánh giá chất lượng trải nghiệm con người.

Câu hỏi thường gặp

Mô hình chất lượng âm thanh hình ảnh khác gì so với mô hình đánh giá video đơn lẻ?

Khác với mô hình đánh giá video chỉ tập trung vào tín hiệu thị giác, mô hình chất lượng âm thanh hình ảnh ước lượng chất lượng trải nghiệm tổng thể bằng cách tích hợp đồng thời cả hai luồng thính giác và thị giác. Mô hình này tính đến các hiện tượng tâm lý nhận thức phức tạp như sự tương tác chéo, hiệu ứng che lấp và độ trễ bất đồng bộ giữa tiếng và hình.

Tiêu chuẩn ITU-T P.1203 đóng vai trò gì trong đánh giá chất lượng nghe nhìn?

Tiêu chuẩn ITU-T Recommendation P.1203 ban hành năm 2017 là khuyến nghị quốc tế đầu tiên về mô hình tham số dựa trên luồng bit nhằm đánh giá chất lượng trải nghiệm cho dịch vụ truyền phát thích ứng như DASH và HLS. Chuẩn này gồm ba phân hệ độc lập cho video, âm thanh và phân hệ tích hợp nghe nhìn kết hợp với suy giảm dừng hình để đưa ra điểm số phiên toàn diện.

Hiện tượng bất đồng bộ tiếng hình ảnh hưởng thế nào đến chất lượng trải nghiệm?

Hiện tượng lệch thời gian giữa âm thanh và hình ảnh gây suy giảm nghiêm trọng chất lượng trải nghiệm nghe nhìn của người dùng. Theo tiêu chuẩn ITU-R BT.1359-1, con người có thể phát hiện độ lệch khi âm thanh đi trước hình ảnh 45 ms hoặc đi sau 125 ms, và ngưỡng chấp nhận được tối đa là âm thanh đi trước 90 ms hoặc đi sau 185 ms.

Các mô hình không tham chiếu được ứng dụng như thế nào trong thực tế tại Việt Nam?

Tại Việt Nam, các mô hình không tham chiếu dựa trên luồng bit được các nhà mạng và nền tảng truyền hình trực tuyến ứng dụng để giám sát chất lượng các phiên phát sóng theo thời gian thực. Dữ liệu này giúp tự động kiểm soát chất lượng dịch vụ theo quy chuẩn QCVN 84:2021/BTTTT và tối ưu hóa thuật toán chuyển đổi tốc độ bit thích ứng mà không làm tiêu hao tài nguyên thiết bị đầu cuối.

Tài liệu tham khảo

  1. Akhtar, Z., & Falk, T. H. (2017). Audio-Visual Multimedia Quality Assessment: A Comprehensive Survey. IEEE Access, 5, 21090–21117. DOI: 10.1109/ACCESS.2017.2750918
  2. Hands, D. S. (2004). A Basic Multimedia Quality Model. IEEE Transactions on Multimedia, 6(6), 806–816. DOI: 10.1109/TMM.2004.837233
  3. Robitza, W., Göring, S., Raake, A., Lindegren, D., Heikkilä, J., Gustafsson, J., List, P., Feiten, B., Wüstenhagen, U., Garcia, M.-N., Yamagishi, K., & Broom, B. (2018). HTTP adaptive streaming QoE estimation with ITU-T rec. P. 1203. Proceedings of the 9th ACM Multimedia Systems Conference (MMSys '18), 350–355. DOI: 10.1145/3204949.3208124
  4. Raake, A., Borer, S., Satti, S., Gustafsson, J., Rao, R. R. R., Medagli, P., List, P., Goring, S., Lindero, D., Robitza, W., Heikkila, J., Broom, B., Schmidmer, C., Feiten, B., Wustenhagen, U., Wittmann, F., Obermann, M., & Bitto, R. (2020). Multi-Model Standard for Bitstream-, Pixel-Based and Hybrid Video Quality Assessment of UHD/4K: ITU-T P.1204. IEEE Access, 8, 193020–193049. DOI: 10.1109/ACCESS.2020.3032080
  5. ITU-T (2017). ITU-T Recommendation P.1203: Parametric bitstream-based quality assessment of progressive download and adaptive audiovisual streaming services over reliable transport. International Telecommunication Union. Nguồn
  6. ITU-R (1998). ITU-R Recommendation BT.1359-1: Relative timing of sound and vision for broadcasting. International Telecommunication Union. Nguồn
  7. Bộ Thông tin và Truyền thông (2021). QCVN 84:2021/BTTTT: Quy chuẩn kỹ thuật quốc gia về chất lượng dịch vụ truyền hình cáp giao thức Internet. Cổng thông tin điện tử Tiêu chuẩn Đo lường Chất lượng. Nguồn