АгентыИсследования 🇺🇸 20.07.2026 00:02

ScarfBench: бенчмарк для оценки ИИ-агентов при миграции Java-фреймворков

IBM ResearchIBM Research AnthropicAnthropic
Представлен ScarfBench — открытый бенчмарк для оценки ИИ-агентов на задачах миграции между Java-фреймворками (Spring, Jakarta EE, Quarkus). В отличие от обычных бенчмарков, он проверяет, собирается ли, разворачивается ли и сохраняет ли поведение мигрированное приложение. Тесты показали, что даже лучшие агенты часто ошибаются, переоценивая свой успех, а миграция Jakarta EE оказалась особенно сложной.
Исследователи представили ScarfBench — новый открытый бенчмарк для оценки ИИ-агентов на задачах миграции корпоративных Java-приложений между фреймворками. В отличие от существующих бенчмарков, которые сравнивают сгенерированный код с эталонным, ScarfBench проверяет, успешно ли приложение собирается, разворачивается и проходит поведенческую валидацию. Бенчмарк охватывает три основные Java-экосистемы: Spring, Jakarta EE и Quarkus. При тестировании современных кодинг-агентов выяснилось, что миграция фреймворков остаётся трудной задачей. Успешность сборки значительно выше, чем успешность развёртывания, которая, в свою очередь, выше успешности поведенческих тестов — сборка сама по себе переоценивает качество миграции. Агенты оказались излишне самоуверенны: Claude Code сообщил об успешной сборке 29 из 30 целых приложений, хотя на самом деле успешно собрались только 22. Миграция Jakarta EE оказалась особенно сложной. Выяснилось, что основной проблемой является не перевод кода, а управление зависимостями между конфигурацией, инфраструктурой и средой выполнения. Конфигурация требует наибольших усилий, а миграция идёт итеративно, а не линейно. Агенты также сталкиваются с проблемами окружения, такими как несоответствия Docker-кэша, проблемы с портами и системой сборки Maven.
Источник: Hugging Face blog — оригинал

Наши прошлые публикации по теме

Есть свежие новости