Чек-лист тестирования поисковой системы: от engine sanity до RAG и графов знаний
Опубликован подробный чек-лист для тестирования поисковых и RAG-систем, включающий шесть уровней проверок: от базовой работоспособности поискового движка до качества генерации, агентных сценариев и поведения на неполных данных. Также представлены сводная таблица инструментов для каждого уровня и глоссарий из более 50 терминов.
На русскоязычном хабе NLP опубликован чек-лист для тестирования поисковых и RAG-систем, включающий шесть уровней проверок. Уровень 0 — функциональный, проверяет базовую работоспособность поискового движка: регистронезависимость, исправление опечаток, работу со спецсимволами и границы длины запроса. Уровень 1 — классический Information Retrieval: оценивает качество ранжирования по метрикам Precision@k, Recall@k, NDCG, MRR и MAP на golden query set. Уровень 2 — качество найденного контекста в RAG: проверяет Contextual Precision и Recall, отсутствие обрезания важной информации. Уровень 3 — качество сгенерированного ответа: включает Faithfulness/Groundedness, Hallucination rate, Answer Relevance, Completeness, Citation accuracy, а также G-Eval и метрики суммаризации. Уровень 4 — агентность и навигация по графу знаний: проверяет multi-hop вопросы, tool/source correctness, task completion, plan adherence, точность fact extraction и disambiguation. Уровень 5 — неполные и слабосвязанные данные: тестирует честное «не знаю», калибровку уверенности, обработку конфликтов и переэкстраполяцию. Для каждого уровня приведены инструменты: pytest, Hypothesis, Postman, k6 для уровня 0; ranx, trec_eval для уровня 1; deepeval и RAGAS для уровней 2 и 3; deepeval для уровня 4; кастомный G-Eval для уровня 5. Чек-лист рекомендует проходить тесты по порядку, начиная с уровня 0, так как проблемы на более низких уровнях могут имитировать проблемы на более высоких.
- Сокращения
- RAG = Retrieval-Augmented Generation — генерация с дополнением поиском
- LLM = Large Language Model — большая языковая модель
- NDCG = Normalized Discounted Cumulative Gain — нормированный дисконтированный накопительный выигрыш
- MRR = Mean Reciprocal Rank — средний обратный ранг
- MAP = Mean Average Precision — средняя средняя точность
- G-Eval = G-Eval — метод оценки качества текста через LLM-как-судью
- CI/CD = Continuous Integration / Continuous Deployment — непрерывная интеграция / непрерывное развертывание
Источник: Habr — хаб NLP —
оригинал
