🧠 Qwen3-VL от Alibaba превзошла GPT-5 и Gemini

Alibaba опубликовала технический отчет об открытой мультимодальной модели Qwen3-VL.

Система обрабатывает двухчасовые видео или сотни страниц документов в контекстном окне из 256 тыс. токенов. Флагманская модель обнаруживает целевые кадры в 30-минутных видео почти со 100% точностью.

В бенчмарках Qwen3-VL-235B-A22B часто превосходит Gemini 2.5 Pro и GPT-5. Модель доминирует в задачах визуального математического анализа, набирая 85,8% в MathVista (GPT-5 – 81,3%) и лидируя в MathVision.

Alibaba реализовала три ключевых обновления:

✔️Interleaved MRoPE: новый метод позиционного встраивания, повышающий производительность с длинными видео;
✔️DeepStack: позволяет модели получать доступ к промежуточным результатам видеокодера для анализа визуальной информации с разной детализацией;
✔️текстовые временные метки: упрощенная система маркировки видеокадров, улучшающая понимание временных задач.