🧠 ИИ обещает революцию в сжатии видео

На протяжении последних сорока лет индустрия сжатия видео развивалась эволюционно: от стандартов MPEG-1 и MPEG-2 через эпоху HD-вещания с H.264 (AVC) к современным форматам 4K на базе H.265 (HEVC) и новейшему VVC/H.266.

Однако сегодня, когда технологии искусственного интеллекта проникают во все сферы телепроизводства, на горизонте отчетливо замаячило наступление новой эры – чистого ИИ-кодирования (neural video coding). Знаковым событием для рынка стала покупка ИИ-пионера Deep Render технологическим гигантом InterDigital, что подтверждает стремление крупнейших игроков закрепиться на формирующемся рынке ИИ-нативных кодеков.

История компрессии видео за 5 лет догнала то, что создавалось предыдущие 40 лет. Потенциал нейросетей огромен: они способны решать как новые задачи – автоматизированный анализ контента, так и оптимизировать уже привычные процессы сжатия данных. Тем не менее в краткосрочной и среднесрочной перспективе эксперты не прогнозируют полного вытеснения традиционных кодеков. Наиболее вероятным сценарием выглядит гибридная модель, где ИИ-сервисы интегрируются в классическую программно-аппаратную архитектуру.

Гибридная модель и апскейлинг «на лету»

На текущем этапе ценность ИИ заключается в улучшении качества пользовательского опыта (QoE) и оптимизации затрат. Использование нейросетей на этапе пре-процессинга позволяет более точно подбирать частоту кадров и локально улучшать четкость изображения, а на этапе пост-процессинга – проводить глубокую оценку качества видео в реальном времени, превосходящую традиционные метрики вроде VMAF. ИИ помогает находить идеальный баланс между визуальным качеством для конечного пользователя и затратами на доставку сигнала для операторов.

Еще одно перспективное направление – ИИ-апскейлинг (Super Resolution). Примером служит технологическое партнерство компаний Beamr и Nvidia, продемонстрировавших пайплайн, способный в реальном времени масштабировать HD-контент до разрешения 4K. Это позволяет использовать сильные стороны классического кодека – удаление пространственно-временной избыточности и энтропийное кодирование, но отдавать на абонентские устройства картинку принципиально иного качества. Такой подход закрывает дефицит 4K-инфраструктуры на местах, позволяя вещателям доставлять премиальный контент по стандартным каналам связи.

Барьеры на пути к чистому ИИ-кодированию

Несмотря на очевидные плюсы, переход к полностью нейросетевому кодированию сталкивается с серьезными технологическими и этическими вызовами:

  • Проблема аутентичности и «галлюцинаций». В отличие от математически точных традиционных алгоритмов, генеративный ИИ может дорисовывать пиксели, которых не было в оригинале. В сфере прямых трансляций новостей и спорта, где разворачивается борьба за верификацию контента (в рамках стандартов C2PA), любые ИИ-искажения могут подорвать доверие аудитории.
  • Интероперабельность и стандартизация. Классический кодек можно декодировать в любой точке технологической цепи вещания. ИИ-решения требуют сквозной совместимости. Первым важным шагом в этом направлении стало утверждение стандарта JPEG AI для статических изображений, однако адаптация этих подходов под полноценное видео с удержанием высокой частоты кадров на порядки сложнее.
  • Вычислительная мощность. Нейросетевое кодирование критично к ресурсам GPU, особенно в динамичных трансляциях (например, спортивных матчах). Стоимость развертывания таких GPU-емких облачных воркфлоу пока остается слишком высокой для большинства медиакомпаний.
  • Абонентское оборудование. Самым узким горлышком является экосистема декодеров. Любые изменения, требующие от конечных пользовательских ТВ-приставок или телевизоров выполнять сложные ИИ-вычисления, требуют жесткого экономического обоснования.

Что ждет индустрию в будущем

В традиционном вещании и кинематографе, где критически важно сохранить каждую деталь и первоначальный художественный замысел автора, классические кодеки и гибридные модели будут доминировать еще долгие годы.

Однако в полностью автоматизированных сферах – например, в беспилотном транспорте, где огромные массивы видеоданных с камер передаются для анализа другим ИИ-системам – чистое нейросетевое сжатие может стать стандартом уже в обозримом будущем. Текущая структура видеокодеров последовательна, что накладывает ограничения на параллельные вычисления. ИИ способен разбить этот «стеклянный потолок». Процессы не станут проще, но они станут кратно быстрее.

Источник: TVB Europe