ModelsOpen Source 🇨🇳 28.07.2026 16:03

Alibaba выпустила Qwen2.5-VL: новая флагманская мультимодальная модель

Alibaba/QwenAlibaba/Qwen
Alibaba представила Qwen2.5-VL — новое поколение vision-language модели, доступное в размерах 3B, 7B и 72B. Модель отличается улучшенным визуальным пониманием, поддержкой видео длительностью более часа, способностью к агентным действиям и структурированному выводу.
Группа Qwen из Alibaba выпустила Qwen2.5-VL — новую флагманскую модель для зрения и языка. Она доступна в трёх размерах: 3B, 7B и 72B, как base, так и instruct версии, на Hugging Face и ModelScope. Модель может распознавать объекты, тексты, диаграммы, а также работать в качестве визуального агента: управлять компьютером или телефоном. Она понимает видео длительностью более часа и способна локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью bounding boxes и ключевых точек, а также структурированный вывод в JSON для документов, счетов и таблиц. Флагман Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на бенчмарках, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а 3B, предназначенная для edge AI, превосходит предыдущую 7B-модель. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует HTML-формат для разметки документов (QwenVL HTML).
Сокращения
VL = Vision-Language — визуально-языковая
HTML = HyperText Markup Language — язык гипертекстовой разметки
JSON = JavaScript Object Notation — формат обмена данными
OCR = Optical Character Recognition — оптическое распознавание символов
FPS = Frames Per Second — кадров в секунду
Source: Alibaba Qwen — original
Our earlier posts on this topic ↓
Fresh news