Der Aufbau einer erfolgreichen LLM-basierten Anwendung beginnt damit, deine Erfolgskriterien klar zu definieren und anschließend Evaluierungen zu entwerfen, um die Leistung daran zu messen. Dieser Zyklus ist zentral für das Prompt Engineering.

Gute Erfolgskriterien sind:
Spezifisch: Definiere klar, was du erreichen willst. Statt „gute Leistung" gib „genaue Sentiment-Klassifizierung" an.
Messbar: Verwende quantitative Metriken oder klar definierte qualitative Skalen. Zahlen bieten Klarheit und Skalierbarkeit, aber qualitative Maße können wertvoll sein, wenn sie konsistent zusammen mit quantitativen Maßen angewendet werden.
| Sicherheitskriterien | |
|---|---|
| Schlecht | Sichere Ausgaben |
| Gut | Weniger als 0,1 % der Ausgaben aus 10.000 Versuchen werden von unserem Inhaltsfilter als toxisch markiert. |
Erreichbar: Stütze deine Ziele auf Branchen-Benchmarks, frühere Experimente, KI-Forschung oder Expertenwissen. Deine Erfolgsmetriken sollten im Hinblick auf die Fähigkeiten aktueller Frontier-Modelle nicht unrealistisch sein.
Relevant: Richte deine Kriterien am Zweck deiner Anwendung und den Bedürfnissen der Nutzer aus. Eine hohe Zitiergenauigkeit mag für medizinische Apps entscheidend sein, für lockere Chatbots aber weniger.
Hier sind einige Kriterien, die für deinen Anwendungsfall wichtig sein könnten. Diese Liste ist nicht abschließend.
Die meisten Anwendungsfälle erfordern eine mehrdimensionale Evaluierung anhand mehrerer Erfolgskriterien.
Wenn du entscheidest, welche Methode du zur Bewertung von Evals verwendest, wähle die schnellste, zuverlässigste und am besten skalierbare Methode:
Codebasierte Bewertung: Am schnellsten und zuverlässigsten, extrem skalierbar, aber es fehlt auch an Nuancen für komplexere Beurteilungen, die weniger regelbasierte Starrheit erfordern.
output == golden_answerkey_phrase in outputMenschliche Bewertung: Am flexibelsten und qualitativ hochwertigsten, aber langsam und teuer. Nach Möglichkeit vermeiden.
LLM-basierte Bewertung: Schnell und flexibel, skalierbar und geeignet für komplexe Beurteilungen. Teste zuerst die Zuverlässigkeit und skaliere dann.
Brainstorme Erfolgskriterien für deinen Anwendungsfall mit Claude auf claude.ai.
Tipp: Füge diese Seite als Orientierung für Claude in den Chat ein!
Weitere Codebeispiele für von Menschen, Code und LLMs bewertete Evals.
Was this page helpful?