lab: rag-lab / retrieval / evals
Контекст: LLM может красиво отвечать даже тогда, когда не имеет права быть уверенной. Поэтому RAG для меня начинается не с индекса, а с вопроса: какие ответы можно проверить и какие источники должны быть видны пользователю.
Проблема: если просто нарезать документы и отправить top-k в модель, качество быстро становится случайным. Плохой chunking, шумные совпадения, отсутствие eval cases и невозможность объяснить ответ превращают систему в черный ящик.
Подход: я разделяю ingestion, retrieval, rerank и answer synthesis. Для каждого слоя нужны логи: какой документ попал в контекст, почему он выбран, какую часть ответа он подтверждает и где модель вышла за границы источников.
Вывод: RAG становится production-инструментом только тогда, когда есть маленький, но живой eval-набор. Он показывает регрессии после смены модели, промпта, чанкинга или embedding provider.
Следующий шаг: собрать dashboard качества: hit rate, citation coverage, hallucination flags и ручную разметку спорных ответов.