🤪 Нейросети провалили тест на точность поиска стримингового контента
Крупные языковые модели (LLM), такие как ChatGPT и Claude, все чаще используются пользователями в качестве персональных гидов по медиаконтенту.
Однако сравнительный анализ, проведенный платформой агрегации метаданных Reelgood, показал, что искусственный интеллект пока не способен выступать надежным источником информации в категории «где посмотреть». В ходе контролируемого теста 100 популярных в США фильмов и сериалов точность ответов ChatGPT составила всего 43,76%, а Claude – 50,21%. Для сравнения, профилированная база данных Reelgood показала точность в 96,89%.
Когда ИИ-ассистент некорректно сообщает о наличии фильма на платформе, где его нет, это приводит к путанице, напрасным кликам и подрыву доверия к технологии со стороны медиапартнеров. Исследователи Reelgood выделили шесть систематических ошибок, из-за которых LLM выдают неверные результаты:
- Устаревшие данные (Stale Availability). Самая частая ошибка. Нейросети помнят громкие пресс-релизы о появлении фильма в каталоге, но «не знают», когда он тихо покинул платформу спустя месяцы.
- Путаница с бандлами и подписками. Модели часто утверждают, что фильм доступен «на Prime Video», забывая уточнить, что для просмотра нужна отдельная платная подписка на партнерский канал (например, Starz внутри Prime).
- Игнорирование бесплатных сервисов. ИИ систематически упускает из виду бесплатные рекламные платформы вроде Tubi или Pluto TV.
- Смешение подписки (SVoD) и покупки (TVoD). Сервис указывается как бесплатный по подписке, хотя контент там доступен только для аренды или выкупа.
- «Слепота» к платной аренде. Модели почти полностью игнорируют опции покупки/аренды в Apple TV и Amazon.
- Ошибки из-за одинаковых названий. При совпадении имен ИИ путает разные версии произведений (например, аниме-сериал «One Piece» и его игровое лайв-экшен переосмысление от Netflix).
Источник: Advanced Television