онлайн
← Назад к заметкам

> less ./notes/llm-rag-pipelines.md

RAG pipeline без магии

Как я собираю retrieval-слой: источники, чанкинг, pgvector, eval-наборы, трассировка и честная проверка качества ответов.

llm-rag-pipelines.md lab: rag-lab / retrieval / evals

lab: rag-lab / retrieval / evals

Контекст: LLM может красиво отвечать даже тогда, когда не имеет права быть уверенной. Поэтому RAG для меня начинается не с индекса, а с вопроса: какие ответы можно проверить и какие источники должны быть видны пользователю.

Проблема: если просто нарезать документы и отправить top-k в модель, качество быстро становится случайным. Плохой chunking, шумные совпадения, отсутствие eval cases и невозможность объяснить ответ превращают систему в черный ящик.

Подход: я разделяю ingestion, retrieval, rerank и answer synthesis. Для каждого слоя нужны логи: какой документ попал в контекст, почему он выбран, какую часть ответа он подтверждает и где модель вышла за границы источников.

Вывод: RAG становится production-инструментом только тогда, когда есть маленький, но живой eval-набор. Он показывает регрессии после смены модели, промпта, чанкинга или embedding provider.

Следующий шаг: собрать dashboard качества: hit rate, citation coverage, hallucination flags и ручную разметку спорных ответов.