lab: prompt-studio / evals / guardrails
Контекст: промпт легко улучшить на одном примере и сломать на десяти других. Поэтому prompt engineering без evals быстро становится вкусовщиной.
Проблема: команды часто хранят промпты в коде или админке без истории решений. Непонятно, почему инструкция такая, какие кейсы она закрывает и что произойдет после смены модели.
Подход: prompt-studio должен хранить версии, наборы примеров, критерии качества, expected failures и tone constraints. Для каждого изменения нужен diff не только текста промпта, но и поведения на контрольных задачах.
Вывод: guardrails — это не один запрет в system prompt. Это набор проверок вокруг сценария: формат, источники, уверенность, fallback и понятное сообщение, когда модель не должна отвечать.
Следующий шаг: сделать сравнение двух версий промпта на одном наборе cases с кратким отчетом: improved, regressed, uncertain.