ИсследованияМодели 🇷🇺 21.07.2026 18:02

TAPe+ML: детекция, классификация и сегментация SOTA-уровня с 0.1 млн параметров

Разработана модель TAPe+ML, которая одновременно выполняет детекцию, классификацию и сегментацию с качеством на уровне крупных архитектур, но при радикально меньшем числе параметров (около 0,1 млн). На датасетах COCO и LVIS модель демонстрирует преимущество в точности масок и покрытии объектов по сравнению с YOLO и RF-DETR, работая при этом в режиме, близком к real-time.
Разработчики представили модель TAPe+ML, объединяющую детекцию, классификацию и сегментацию в едином ядре. Ключевая особенность — встроенная сегментация, которая не требует отдельной тяжелой головы, а строится на пиксельном уровне через три этапа: обнаружение границ, формирование замкнутых контуров и слияние внутренних поверхностей. Обучение сегментации и детекции идёт совместно с общим loss, что улучшает обе задачи. Для тренировки сегментации использован датасет LVIS с высокоточными масками и panoptic COCO для отрицательных примеров; потребовалось всего 5 тыс. изображений. На LVIS модель достигает покрытия объектов масками 97–98% и доли масок с AP@75 около 72–74% (против 44% и 21% у YOLO без дообучения). На COCO instance segmentation TAPe+ML показывает Mask mAP50 80,7% и Mask mAP50-95 58,4%, превосходя RF-DETR-Seg-2XL и YOLO26-X-Seg. На COCO detection mAP50-95 составляет 67,3%, на RF100-VL — 68,3% при 0,1 млн параметров, тогда как RF-DETR-2XL имеет 126,9 млн параметров и более низкие показатели. Время инференса всего пайплайна — около 15 мс.
Сокращения
SOTA = State Of The Art — передовой уровень
IoU = Intersection over Union — пересечение над объединением
AP = Average Precision — средняя точность
Источник: Habr — хаб ИИ — оригинал

Наши прошлые публикации по теме

Есть свежие новости