🤪 Нейросети провалили тест на точность поиска стримингового контента

Крупные языковые модели (LLM), такие как ChatGPT и Claude, все чаще используются пользователями в качестве персональных гидов по медиаконтенту.

Однако сравнительный анализ, проведенный платформой агрегации метаданных Reelgood, показал, что искусственный интеллект пока не способен выступать надежным источником информации в категории «где посмотреть». В ходе контролируемого теста 100 популярных в США фильмов и сериалов точность ответов ChatGPT составила всего 43,76%, а Claude – 50,21%. Для сравнения, профилированная база данных Reelgood показала точность в 96,89%.

Когда ИИ-ассистент некорректно сообщает о наличии фильма на платформе, где его нет, это приводит к путанице, напрасным кликам и подрыву доверия к технологии со стороны медиапартнеров. Исследователи Reelgood выделили шесть систематических ошибок, из-за которых LLM выдают неверные результаты:

  • Устаревшие данные (Stale Availability). Самая частая ошибка. Нейросети помнят громкие пресс-релизы о появлении фильма в каталоге, но «не знают», когда он тихо покинул платформу спустя месяцы.
  • Путаница с бандлами и подписками. Модели часто утверждают, что фильм доступен «на Prime Video», забывая уточнить, что для просмотра нужна отдельная платная подписка на партнерский канал (например, Starz внутри Prime).
  • Игнорирование бесплатных сервисов. ИИ систематически упускает из виду бесплатные рекламные платформы вроде Tubi или Pluto TV.
  • Смешение подписки (SVoD) и покупки (TVoD). Сервис указывается как бесплатный по подписке, хотя контент там доступен только для аренды или выкупа.
  • «Слепота» к платной аренде. Модели почти полностью игнорируют опции покупки/аренды в Apple TV и Amazon.
  • Ошибки из-за одинаковых названий. При совпадении имен ИИ путает разные версии произведений (например, аниме-сериал «One Piece» и его игровое лайв-экшен переосмысление от Netflix).

Источник: Advanced Television