lab: prompt-studio / evals / guardrails
Kontext: Man kann einen Prompt leicht an einem Beispiel verbessern und an zehn anderen brechen. Prompt Engineering ohne Evals wird schnell Geschmackssache.
Problem: Teams speichern Prompts oft in Code oder Admin-Panels ohne Entscheidungshistorie. Unklar ist, warum die Instruktion so aussieht, welche Cases sie abdeckt und was nach einem Modellwechsel passiert.
Ansatz: prompt-studio speichert Versionen, Beispiele, Qualitätskriterien, erwartete Fehler und Tone Constraints. Jede Änderung braucht nicht nur einen Text-Diff, sondern auch einen Verhaltens-Diff auf Kontrollaufgaben.
Fazit: Guardrails sind kein einzelnes Verbot im System Prompt. Es sind Checks rund um das Szenario: Format, Quellen, Sicherheit, Fallback und eine klare Meldung, wenn das Modell nicht antworten sollte.
Nächster Schritt: zwei Prompt-Versionen auf demselben Case Set vergleichen und berichten: improved, regressed, uncertain.