Wie Sie wirksame Fragen für Jev entwerfen (Optionen, Granularität, Schwellwerte)
·2 Min. Lesezeit
Wie Sie wirksame Fragen für Jev entwerfen
Die Qualität eines Entscheidungsmodells ist im Wesentlichen die Qualität der Fragen, die Sie ihm stellen. Dieser Leitfaden behandelt das Fragendesign für Jev: Formulierung, Typen, Granularität und die Schwellwert-Logik, die Wahrscheinlichkeiten in Produktverhalten übersetzt.
Kurzfassung: Eine Entscheidung pro Frage. 3–5 exklusive Optionen. Kein „Other“. Schreiben Sie die Frage als das
if, das Sie später kompilieren.
Beginnen Sie mit dem Branch, nicht mit den Daten
Schlecht:
„Analysieren Sie diese Nachricht und beschreiben Sie den emotionalen Zustand des Kunden.“
Gut:
„Welches Team sollte sich darum kümmern?“
Die zweite Frage lässt sich in Code abbilden:
if (selected === 'billing') return enqueueBilling();
Wenn Sie den Branch nicht benennen können, ist die Frage nicht bereit.
Drei Typen, drei Aufgaben
| Typ | Einsatz, wenn | Rückgabe |
|---|---|---|
| Choice | Eine von N Queues / Intents auswählen | selected + Wahrscheinlichkeit je Option |
| Score | Auf einer Skala einordnen (Dringlichkeit, Passung) | gewichtete Position + Wahrscheinlichkeit je Stufe |
| Noul | Ja/nein mit Konfidenz | Wahrscheinlichkeit 0–1 |
Choice
{
"type": "choice",
"text": "Was ist die tatsächliche Absicht hinter dieser Nachricht?",
"options": ["Echte Frage", "Passiv-aggressiv", "Lockeres Plaudern"]
}
Score
{
"type": "score",
"text": "Wie schnell sollte ich antworten?",
"options": ["Heute", "Innerhalb von 3 Tagen", "Nicht dringend"]
}
Noul
{
"type": "noul",
"text": "Enthält diese Nachricht eine Erstattungsanfrage?"
}
Optionen-Formulierungen, die funktionieren
So geht’s
- Verwenden Sie alltägliche Bezeichnungen, die Annotatoren bereits kennen („passiv-aggressiv“, „billing“).
- Halten Sie die Optionen in Grammatik und Länge parallel.
- Sorgen Sie dafür, dass sie sich gegenseitig ausschließen (keine überlappenden „wütend“ und „frustriert“, es sei denn, genau das ist der Punkt).
So nicht
- Erfinden Sie Fachjargon („negatives Affektsignal“).
- Mischen Sie Abstraktionsebenen („billing“, „tech“, „existenzielle Verzweiflung“).
- Packen Sie zwei Entscheidungen in eine Option („billing_or_sales“).
Warum „Other“ meist eine schlechte Voreinstellung ist
- Es absorbiert sämtliche Unsicherheit.
- Sie sehen nicht, welches echte Label fehlschlagen ist.
- Modelle lernen, es als Achselzucken zu benutzen.
Besseres Muster: Lassen Sie eine flache distribution zu und arbeiten Sie dann mit einem Schwellwert:
if (confidence < 0.55) return humanReview();
Granularität: Faustregeln
| Typ | Optimalbereich | Anmerkungen |
|---|---|---|
| Choice | 3–5 Optionen | Ab 7 verschmiert die Wahrscheinlichkeitsmasse |
| Score | 3–4 Stufen | „Niedrig / mittel / hoch“ schlägt 1–10 |
| Noul | binär | Wenn Sie drei Ausgänge brauchen, nehmen Sie Choice |
Benötigen Sie 15 Support-Queues? Clusteren Sie sie zu 4–6 Makro-Queues und fragen Sie die Sub-Queues dann in einem zweiten Aufruf ab.
Trennen Sie getrennte Entscheidungen
Intent und Dringlichkeit sind zwei Urteile. Stellen Sie zwei Fragen in einem API-Aufruf — verschmelzen Sie sie nicht:
"questions": [
{ "type": "choice", "text": "…Intent…", "options": ["…"] },
{ "type": "score", "text": "…Dringlichkeit…", "options": ["…"] }
]
Verschmolzene Fragen zwingen das Modell, zwei Urteile zu mitteln; beide werden dadurch unschärfer.
Der State ist die halbe Frage
Eine großartige Frage auf dünnem Zustandstext schneidet schlechter ab. Für Klassifikation gilt:
- Behalten Sie Tonfall, Interpunktion und Füllwörter bei.
- Nehmen Sie Sprecher / Kanal auf, wenn relevant.
- Fassen Sie nicht so zusammen, dass die Belege verloren gehen.
Schwellwerte als Produkt-Policy
Behandeln Sie confidence als Policy-Eingabe, nicht nur als Modell-Score:
| Konfidenz | Beispiel-Policy |
|---|---|
| ≥ 0.85 | Vollautomatisierung |
| 0.55–0.85 | Vorschlagen + bestätigen |
| < 0.55 | Menschliche Queue |
Justieren Sie die Schwellwerte an 50–100 gelabelten Beispielen. Justieren Sie nach, wenn sich das Vokabular verschiebt (neue Features, neue Märkte).
Anti-Patterns
- Kitchen-sink-Fragen — „Klassifizieren, zusammenfassen und eine Antwort vorschlagen.“
- Taxonomie ohne Branch — Labels, die kein Code verwendet.
- 11-Punkt-Skalen, die niemand verteidigen kann.
- Verstecktes „Other“, getarnt als „Allgemein“.
- Prompts, die Essays verlangen — von einem Entscheidungsmodell.
Checkliste vor dem Release
- Jede Frage bildet auf ein echtes
switch/ifab - Optionen exklusiv und in menschlicher Sprache formuliert
- 3–5 Choice-Optionen (oder 3–4 Score-Stufen)
- Getrennte Frage je Entscheidung
- Schwellwert + menschlicher Fallback definiert
- Logging umfasst distribution + Latenz
FAQ
Sollen Optionen auf Englisch sein?
Richten Sie sich nach Ihrem Label-Set und Ihrer UI. Halten Sie state in der Sprache Ihrer Nutzer.
Wie teste ich die Qualität einer Frage?
Schreiben Sie 20 adversarische Fälle; eine gute Frage trennt sie ohne Zusatzregeln.
Kann ich Few-shot-Beispiele verwenden?
Legen Sie repräsentativen Text in state-Mustern ab und halten Sie die Fragen schlank; bevorzugen Sie Beispiele in der Dokumentation statt in jedem Prompt.