NVIDIA mang AI thời gian thực đến lĩnh vực Phát sóng, Thể thao và Phát trực tuyến toàn cầu tại IBC

14:08, 15/09/2026

Tại hội nghị IBC, diễn ra từ ngày 11-14 tháng 9 tại Amsterdam, các cộng đồng sáng tạo, công nghệ và kinh doanh đang cùng nhau hội tụ để biến ý tưởng thành hành động và thảo luận về những đổi mới trên khắp các ngành công nghiệp truyền thông và giải trí. Hơn 44.000 người tham dự từ hơn 170 quốc gia đang tập trung để khám phá hơn 1.300 khu trưng bày tại hơn 14 hội trường và không gian ngoài trời, với hơn 600 diễn giả chia sẻ những thông tin chi tiết sâu sắc.

Các công ty truyền thông đang ngày càng tích hợp AI vào sản xuất trực tiếp, thể thao, tin tức và các quy trình phát trực tuyến để khai mở các thông tin chi tiết về hiệu suất phong phú hơn, xác minh tính xác thực của video, cũng như nâng cao và bản địa hóa nội dung - tất cả mà không làm gián đoạn các môi trường phát sóng đáng tin cậy.

Tại IBC 2026 ở Amsterdam, NVIDIA đã công bố một đợt mở rộng lớn cho NVIDIA AI for Media - một bộ sưu tập các bộ công cụ phát triển phần mềm (SDK) được tăng tốc bằng GPU, các vi dịch vụ NVIDIA NIM, cẩm nang (playbooks) và bản thiết kế (blueprints) giúp tăng cường các hiệu ứng âm thanh, video và thực tế tăng cường cho các quy trình truyền thông và giải trí - nhằm khai mở những cách thức mới để hiểu về chuyển động, xác minh và nâng cao video, bản địa hóa chương trình và xây dựng các ứng dụng truyền thông tích hợp AI.

Vi dịch vụ NIM NVIDIA Synthetic Video Detector (SVD), được công bố đầu năm nay tại SIGGRAPH, giúp các tổ chức đánh giá xác suất liệu đoạn phim là xác thực hay do AI tạo ra, cung cấp cho các nhóm biên tập, xác thực nội dung, pháp y kỹ thuật số và tính toàn vẹn truyền thông thêm một điểm phân tích trong quá trình đánh giá của họ.

Kể từ lần phát hành đầu tiên, độ chính xác của SVD đã đạt 99,3% đối với nội dung văn bản thành video và 97,7% đối với nội dung hình ảnh thành video, với mức tăng đặc biệt lớn ở các trường hợp hình ảnh thành video phức tạp.

Dalet đang tích hợp SVD vào một quy trình xác minh an toàn, lưu trữ trên đám mây dành cho các tổ chức tin tức. Điều này cho phép các nhóm biên tập gửi đoạn phim thông qua SVD, kiểm tra và xem xét các điểm số cũng như siêu dữ liệu kết quả ngay trong giao diện Dalet.

TwelveLabs đã công bố tính khả dụng rộng rãi của Compliance by TwelveLabs, ứng dụng đầu tiên được xây dựng trên nền tảng trí tuệ video của công ty, giúp các nhóm truyền thông và phát sóng nhanh chóng sàng lọc nội dung dựa trên các tiêu chuẩn tuân thủ khu vực và tùy chỉnh. Giải pháp này tích hợp SVD để bổ sung các tín hiệu xác thực ở cấp độ khung hình và điểm tin cậy, cho phép các nhóm truyền thông xác định phương tiện truyền thông có khả năng là sản phẩm tổng hợp ngay trong cùng một quy trình tuân thủ.

Wowza, sở hữu công nghệ máy chủ truyền thông Wowza Streaming Engine đang vận hành hơn 35.000 đợt triển khai video trên hơn 170 quốc gia, sẽ phân phối SVD thông qua Wowza Video Intelligence Framework. Giải pháp này, được hỗ trợ bởi cơ sở hạ tầng tăng tốc của NVIDIA, sẽ cho phép các đài truyền hình, nhà cung cấp dịch vụ phát trực tuyến và các tổ chức khác phân tích các luồng video trực tiếp và trích xuất dữ liệu xung quanh các đối tượng, cảnh quay và dấu hiệu do AI tạo ra được phát hiện trong thời gian thực. Nó có thể được triển khai và chạy tại chỗ (on-premises), tại vùng biên (edge), trên đám mây, qua các triển khai lai hoặc cách ly hoàn toàn (air-gapped), mang lại cho các tổ chức quyền kiểm soát lớn hơn đối với các quy trình truyền thông quan trọng.

NVIDIA 3D Body Pose ước tính các vị trí và góc khớp người 2D và 3D từ video được quay bởi một camera duy nhất, giúp biến chuyển động thành dữ liệu có cấu trúc mà không cần các hệ thống chụp ảnh dựa trên điểm đánh dấu.

Đối với các tổ chức thể thao, dữ liệu đó có thể hỗ trợ theo dõi chuyển động của cầu thủ và vận động viên, phân tích cơ sinh học và hiệu suất, nâng cao chất lượng phát lại, quy trình điều hành và trọng tài, ứng dụng an toàn cho cầu thủ, cùng các trải nghiệm tương tác ảo và đắm chìm.

Công nghệ này cũng có thể cung cấp dữ liệu chuyển động con người có cấu trúc cho các quy trình sáng tạo nội dung. Khi được ánh xạ tới một khung nhân vật (character rig) tương thích, dữ liệu chuyển động và khớp có thể đóng vai trò làm đầu vào cho việc thiết lập khung hình hoạt ảnh (animation blocking), bản sao kỹ thuật số, nhắm mục tiêu lại nhân vật (character retargeting) và các trải nghiệm sản xuất ảo.

Vizrt đang sử dụng công nghệ Body Pose trong các môi trường trường quay ảo trực tiếp, với chuyển động cơ thể được theo dõi sẽ điều khiển các hiệu ứng ánh sáng 3D thời gian thực như hình ảnh phản chiếu, bóng đổ và kết xuất môi trường.

Video Frame Generation (VFG) làm cho chuyển động video trông mượt mà hơn bằng cách sử dụng AI tạo sinh để tạo ra các khung hình mới giữa các khung hình gốc của video. Nó có thể tăng tốc độ khung hình lên gấp 2 lần hoặc 4 lần trong khi vẫn giữ nguyên chất lượng hình ảnh và tính nhất quán theo thời gian, mang lại các trải nghiệm thể thao mượt mà hơn, phát lại chuyển động chậm, truyền thông trực tiếp và các trải nghiệm video chuyển động cao khác. VFG cũng hỗ trợ chuyển đổi tốc độ khung hình và tăng cường khung hình cho các quy trình video AI tạo sinh.

Ross Video đang tích hợp VFG vào nền tảng Rio Replay của mình để tạo ra video chuyển động chậm được AI hỗ trợ cho sản xuất thể thao.

Công việc này hỗ trợ tạo chuyển động chậm 6x cho phát lại thể thao. Quá trình phát triển phép nội suy 8x đang được tiến hành, nghĩa là các khung hình trung gian được tạo ra có thể cung cấp cho các nhóm phát lại chuyển động mượt mà hơn mà không yêu cầu mọi khung hình phải được ghi lại bằng một camera nguồn có tốc độ khung hình siêu cao.

NVIDIA Video Super Resolution (VSR) sử dụng AI để nâng cấp độ phân giải video trong khi giảm thiểu nhiễu, mờ và các lỗi nén (compression artifacts). Các chế độ phát trực tuyến mới cho phép các nhà phát triển lựa chọn giữa hiệu suất thời gian thực và chất lượng hình ảnh cao hơn, trong khi các bộ điều khiển có thể tinh chỉnh giúp đạt được mức độ nâng cao mong muốn. VSR cũng bổ sung hỗ trợ video 10-bit và cải thiện hiệu suất cũng như chất lượng tổng thể. VSR hiện khả dụng thông qua NVIDIA Video Effects SDK và vi dịch vụ NIM để sử dụng trong các ứng dụng phát trực tuyến, phát sóng, hội nghị, phát lại video và sáng tạo nội dung.

Công nghệ này có thể hỗ trợ các trình phát video, ứng dụng hội nghị, công cụ cho nhà sáng tạo, dịch vụ phát trực tuyến, bộ chuyển mã và hệ thống phát sóng thông qua một giao diện chung.

NVIDIA TrueHDR chuyển đổi video dải nhạy sáng tiêu chuẩn thành đầu ra dải nhạy sáng cao trong thời gian thực, đạt độ sáng xấp xỉ lên đến 2.000 nits trong khi vẫn giữ nguyên độ tương phản cục bộ và điều chỉnh độ sáng phù hợp với nội dung.

VSR, VFG và TrueHDR có thể được kết hợp trong một quy trình hiệu ứng video duy nhất - giúp các công ty truyền thông nâng cao các thư viện nội dung hiện có cho các quy trình phát trực tuyến, chuyển mã, chơi game và sáng tạo.

Các vi dịch vụ NIM NVIDIA LipSync và Active Speaker Detection giúp các nhà phát triển xây dựng hệ thống bản địa hóa cho các cuộc phỏng vấn, tin tức, thể thao, giải trí và các chương trình khác nơi có nhiều người có thể xuất hiện trên màn hình.

LipSync biến đổi chuyển động của miệng trong video đầu vào sao cho khớp với đoạn âm thanh mục tiêu trong khi vẫn giữ nguyên tư thế đầu, nháy mắt và chuyển động cơ thể tự nhiên. Bản phát hành mới cải thiện khả năng xử lý khi khuôn mặt bị che khuất và giữ lại kết cấu răng, môi và khuôn mặt tốt hơn.

Vi dịch vụ NIM Active Speaker Detection mới không còn yêu cầu phân tách người nói (speaker diarization) đối với nhiều đoạn âm thanh, bổ sung khả năng phát hiện hoạt động giọng nói và mở rộng hỗ trợ triển khai vi dịch vụ NIM thông qua giao diện gRPC cùng khả năng tương thích GPU rộng rãi hơn.

NDI đang sử dụng NVIDIA AI for Media, bao gồm vi dịch vụ NIM NVIDIA LipSync, để hỗ trợ dịch thuật thời gian thực, lồng tiếng khớp khẩu hình và điều chỉnh ngôn ngữ khu vực ngay trong các quy trình phát sóng hiện có. Bằng cách tạo ra các trải nghiệm đa ngôn ngữ từ một luồng truyền thông chung, phương pháp này có thể giúp các đài truyền hình tiếp cận khán giả toàn cầu đồng thời giảm thiểu băng thông, cơ sở hạ tầng và độ phức tạp trong sản xuất vốn thường bắt buộc đối với phân phối đa ngôn ngữ.

Studio Voice bao gồm các Cấu hình Micrô (Microphone Profiles) mới được xây dựng trên các vi dịch vụ NIM NVIDIA Studio Voice, giúp người dùng kiểm soát tốt hơn đặc điểm âm sắc của giọng nói đã được nâng cao.

Tính năng này được thiết kế để triệt tiêu tiếng ồn xung quanh, giảm tiếng vang trong phòng và cải thiện độ rõ nét của giọng nói, sau đó định hình đầu ra đã nâng cao vào một cấu hình micrô được chọn để có các cuộc giao tiếp trực tiếp, phát trực tuyến, podcasting và sáng tạo nội dung trau chuốt hơn.

Hãy dùng thử các vi dịch vụ NIM NVIDIA AI for Media. Xem các quy trình làm việc mới nhất của NVIDIA và đối tác tại IBC 2026.

NVIDIA Holoscan for Media cung cấp Lớp trao đổi truyền thông mở để xây dựng và kết nối các ứng dụng truyền thông trực tiếp


Khi các đài truyền hình, dịch vụ phát trực tuyến và tổ chức thể thao áp dụng phần mềm và AI, cơ sở hạ tầng đằng sau nội dung trực tiếp đang trở nên linh hoạt hơn, kết nối hơn và ngày càng được xây dựng trên điện toán tăng tốc dùng chung.

Việc tích hợp Media Exchange Layer (MXL) với NVIDIA Holoscan for Media giúp tăng tốc quá trình chuyển đổi đó - cung cấp lớp trao đổi chung giúp các ứng dụng truyền thông kết nối và hoạt động cùng nhau.

Holoscan for Media là một kiến trúc tham chiếu mở và bộ công cụ dành cho nhà phát triển để xây dựng các chức năng và ứng dụng truyền thông được hỗ trợ bởi AI cho sản xuất trực tiếp dựa trên phần mềm. MXL bổ sung một phương thức mở để các chức năng truyền thông dựa trên phần mềm đó có thể trao đổi video, âm thanh và dữ liệu trực tiếp trên một môi trường phân tán.

Khi các chức năng sản xuất chuyển sang dạng phần mềm, các nhà phát triển có thể xây dựng các ứng dụng chia sẻ cơ sở hạ tầng tăng tốc, kết nối động và phát triển độc lập. Điều đó có thể giúp các công ty truyền thông sử dụng cơ sở hạ tầng hiệu quả hơn, giới thiệu các khả năng mới nhanh hơn và giảm bớt khối lượng tích hợp tùy chỉnh cần thiết giữa các ứng dụng.

Sự tích hợp này cũng tạo ra một nền tảng vững chắc hơn cho AI trong truyền thông trực tiếp. Quá trình xử lý AI, các ứng dụng video và các chức năng truyền thông truyền thống ngày càng có thể hoạt động trên cùng một cơ sở hạ tầng tăng tốc và trong cùng một môi trường dựa trên phần mềm.

Đối với các nhà cung cấp công nghệ, điều này mở rộng cơ hội xây dựng các ứng dụng có thể hoạt động trên các hệ sinh thái đa nhà cung cấp rộng lớn hơn. Đối với các công ty truyền thông, nó tạo ra một con đường hướng tới cơ sở hạ tầng có thể thích ứng khi các định dạng, ứng dụng và khả năng của AI thay đổi.

Xem bản demo tại IBC ở Gian hàng EBU 10.D21. Tìm hiểu thêm về Holoscan for Media.

NVIDIA Sports Intelligence Playbooks vạch ra con đường tiến tới AI đa phương thức cho Thể thao


Thể thao đang trở thành một bãi thử nghiệm cho một sự dịch chuyển rộng lớn hơn trong AI: từ các mô hình đa dụng sang các mô hình mở được tinh chỉnh xây dựng trên dữ liệu độc quyền.

NVIDIA Sports Intelligence Playbooks được thiết kế để tăng tốc quá trình chuyển đổi đó. Chúng cung cấp cho các giải đấu, công ty truyền thông và nhà cung cấp công nghệ các khuôn khổ có cấu trúc để tinh chỉnh các mô hình mở của NVIDIA trên chính cảnh quay thể thao và các chú thích của riêng họ, tạo ra AI đa phương thức có thể hiểu luật chơi, cầu thủ, cách tính điểm, chiến lược và bối cảnh độc đáo của một môn thể thao.

Các tổ chức thể thao nắm giữ khối lượng lớn video, siêu dữ liệu và thông tin hiệu suất độc quyền mà các đối thủ rất khó sao chép. Các cẩm nang này cung cấp một bản thiết kế thực tế để chuyển đổi những tài sản đó thành các khả năng AI có thể làm nền tảng cho các sản phẩm phân tích, trải nghiệm truyền thông, công cụ tự động hóa và các luồng doanh thu mới.

Các cẩm nang này bao trùm toàn bộ vòng đời AI, bao gồm chuẩn bị dữ liệu, tinh chỉnh, suy luận, đánh giá, tối ưu hóa và triển khai, đồng thời tập hợp các công nghệ của NVIDIA bao gồm Nemotron, NeMo AutoModel, Megatron Bridge, vi dịch vụ NIM và điện toán tăng tốc NVIDIA.

Bằng cách cung cấp một con đường tích hợp từ việc tùy chỉnh mô hình cho đến khi đưa vào sản xuất, Sports Intelligence Playbooks có thể giảm chi phí và độ phức tạp trong việc xây dựng AI thể thao chuyên dụng đồng thời làm tăng nhu cầu trên toàn bộ ngăn xếp tính toán, phần mềm và suy luận của nó.

Thử nghiệm ban đầu chứng minh tiềm năng của việc chuyên môn hóa miền. Khi được đánh giá trên các cảnh quay chưa từng thấy trước đây bằng cách sử dụng các định dạng câu hỏi tương tự như những gì được dùng trong quá trình đào tạo, độ chính xác của trắc nghiệm nhiều lựa chọn đã tăng từ khoảng 53% lên 94% và đánh giá câu hỏi mở tăng từ khoảng 5,7% lên 66%.

Machina Sports đang tích hợp Sports Intelligence Playbooks với cơ sở hạ tầng tác tử, đánh giá và dữ liệu thể thao gốc của mình, cho phép những bên nắm giữ bản quyền biến phương tiện truyền thông và chuyên môn độc quyền thành trí tuệ riêng tư có thể triển khai phục vụ cho sản xuất trực tiếp, nội dung và trải nghiệm của người hâm mộ.

Cơ hội cũng mở rộng khi AI dạng tác tử (agentic AI) ngày càng được áp dụng rộng rãi. Với NVIDIA AI-Q Blueprint, các tổ chức có thể sử dụng các mô hình thể thao chuyên biệt theo lĩnh vực của họ như một trí tuệ chuyên gia bên trong các tác tử có khả năng suy luận trên video, dữ liệu doanh nghiệp và hệ thống phần mềm, mở rộng cẩm nang từ việc thấu hiểu thể thao sang việc ra quyết định và tự động hóa.

Wowza đang tích hợp các mô hình ngôn ngữ thị giác, bao gồm NVIDIA Cosmos 3 và Nemotron, vào Wowza Video Intelligence Framework, được tinh chỉnh thông qua NVIDIA Sports Intelligence Playbooks để phát hiện các khoảnh khắc đặc thù của môn thể thao trong các luồng phát trực tiếp và giảm thời gian hành động.

NVIDIA mang tính năng Bản địa hóa nội dung đa ngôn ngữ đến Phát sóng trực tiếp 

Việc tiếp cận khán giả toàn cầu bằng các chương trình trực tiếp đòi hỏi nhiều hơn là chỉ dịch từ ngữ. Sắc thái ngôn ngữ, giọng nói, thời gian, chuyển động khuôn mặt, phụ đề và đồ họa trên màn hình phải kết hợp với nhau theo thời gian thực, trong khi vẫn phải duy trì ý đồ biên tập và chất lượng sản xuất của chương trình gốc.

Để giúp các đài truyền hình, giải đấu thể thao, đơn vị nắm giữ bản quyền và dịch vụ phát trực tuyến đưa những yếu tố này vào một quy trình bản địa hóa thời gian thực, được xác định bằng phần mềm và thống nhất, NVIDIA đang mang các công nghệ Content Localization (Bản địa hóa nội dung) của mình vào bộ công cụ dành cho nhà phát triển NVIDIA Holoscan for Media. Được thiết kế dành cho các nhà phát triển phát sóng và phát trực tuyến, quy trình tham chiếu này cho phép tạo phụ đề, âm thanh được dịch, lồng tiếng, video đồng bộ và đồ họa bản địa hóa.

Content Localization với Holoscan for Media cung cấp một tài liệu tham chiếu về cách các công nghệ bản địa hóa có thể kết hợp cùng nhau trong các ứng dụng phát sóng dựa trên phần mềm. Các nhà phát triển có thể lựa chọn những khả năng cần thiết cho mỗi chương trình, thị trường hoặc kênh phân phối thay vì phải triển khai cơ sở hạ tầng riêng biệt cho mọi phiên bản bản địa hóa.

Content Localization với Holoscan for Media tích hợp những tiến bộ mới nhất từ NVIDIA AI for Media, bao gồm LipSync được cải thiện khi khuôn mặt bị che khuất một phần và Active Speaker Detection được nâng cao để giúp các ứng dụng xác định ai đang nói trong các cảnh có nhiều người.

Mở rộng tầm vươn của Chương trình trực tiếp

Việc bản địa hóa có thể thay đổi phạm vi tiếp cận và tính kinh tế của các chương trình trực tiếp. Một quy trình làm việc có thể kết hợp (composable) và dùng chung có thể giúp các công ty truyền thông giới thiệu mức độ phủ sóng khu vực nhanh hơn, phục vụ nhiều khán giả hơn và điều chỉnh trải nghiệm cho từng thị trường cụ thể — trong khi vẫn duy trì được thời gian, bối cảnh hình ảnh và khả năng kiểm soát biên tập cần thiết cho sản xuất trực tiếp.

Các công nghệ từ AI-Media, CAMB.AI, Chyron và Panjaya đều giải quyết một phần cụ thể của quá trình bản địa hóa nội dung với Holoscan for Media, từ việc điều chỉnh giọng nói và việc trình bày trên màn hình đến tạo phụ đề đa ngôn ngữ và âm thanh được dịch, bản địa hóa đồ họa, và bảo tồn biểu cảm cũng như danh tính trên cả nội dung trực tiếp và theo yêu cầu.

Các công nghệ Content Localization cũng hỗ trợ các ứng dụng dựa trên tệp (file-based), phát trực tuyến và hậu kỳ. Các nhà phát triển có thể sử dụng giao diện lập trình ứng dụng cho các quy trình làm việc theo yêu cầu và quy trình tham chiếu Holoscan for Media khi quá trình bản địa hóa phải chạy như một phần của môi trường truyền thông trực tiếp. Cùng với nhau, chúng cung cấp một nền tảng nhất quán để xây dựng các dịch vụ truyền thông đa ngôn ngữ xuyên suốt quá trình sản xuất và phân phối.

Tìm hiểu thêm về NVIDIA Holoscan for Media và AI for Media.