← Zurück zum Blog
FragendesignBest PracticeChoiceScoreNoulMuster

Wie Sie wirksame Fragen für Jev entwerfen (Optionen, Granularität, Schwellwerte)

·2 Min. Lesezeit

Wie Sie wirksame Fragen für Jev entwerfen

Die Qualität eines Entscheidungsmodells ist im Wesentlichen die Qualität der Fragen, die Sie ihm stellen. Dieser Leitfaden behandelt das Fragendesign für Jev: Formulierung, Typen, Granularität und die Schwellwert-Logik, die Wahrscheinlichkeiten in Produktverhalten übersetzt.

Kurzfassung: Eine Entscheidung pro Frage. 3–5 exklusive Optionen. Kein „Other“. Schreiben Sie die Frage als das if, das Sie später kompilieren.


Beginnen Sie mit dem Branch, nicht mit den Daten

Schlecht:

„Analysieren Sie diese Nachricht und beschreiben Sie den emotionalen Zustand des Kunden.“

Gut:

„Welches Team sollte sich darum kümmern?“

Die zweite Frage lässt sich in Code abbilden:

if (selected === 'billing') return enqueueBilling();

Wenn Sie den Branch nicht benennen können, ist die Frage nicht bereit.


Drei Typen, drei Aufgaben

Typ Einsatz, wenn Rückgabe
Choice Eine von N Queues / Intents auswählen selected + Wahrscheinlichkeit je Option
Score Auf einer Skala einordnen (Dringlichkeit, Passung) gewichtete Position + Wahrscheinlichkeit je Stufe
Noul Ja/nein mit Konfidenz Wahrscheinlichkeit 0–1

Choice

{
  "type": "choice",
  "text": "Was ist die tatsächliche Absicht hinter dieser Nachricht?",
  "options": ["Echte Frage", "Passiv-aggressiv", "Lockeres Plaudern"]
}

Score

{
  "type": "score",
  "text": "Wie schnell sollte ich antworten?",
  "options": ["Heute", "Innerhalb von 3 Tagen", "Nicht dringend"]
}

Noul

{
  "type": "noul",
  "text": "Enthält diese Nachricht eine Erstattungsanfrage?"
}

Optionen-Formulierungen, die funktionieren

So geht’s

  • Verwenden Sie alltägliche Bezeichnungen, die Annotatoren bereits kennen („passiv-aggressiv“, „billing“).
  • Halten Sie die Optionen in Grammatik und Länge parallel.
  • Sorgen Sie dafür, dass sie sich gegenseitig ausschließen (keine überlappenden „wütend“ und „frustriert“, es sei denn, genau das ist der Punkt).

So nicht

  • Erfinden Sie Fachjargon („negatives Affektsignal“).
  • Mischen Sie Abstraktionsebenen („billing“, „tech“, „existenzielle Verzweiflung“).
  • Packen Sie zwei Entscheidungen in eine Option („billing_or_sales“).

Warum „Other“ meist eine schlechte Voreinstellung ist

  1. Es absorbiert sämtliche Unsicherheit.
  2. Sie sehen nicht, welches echte Label fehlschlagen ist.
  3. Modelle lernen, es als Achselzucken zu benutzen.

Besseres Muster: Lassen Sie eine flache distribution zu und arbeiten Sie dann mit einem Schwellwert:

if (confidence < 0.55) return humanReview();

Granularität: Faustregeln

Typ Optimalbereich Anmerkungen
Choice 3–5 Optionen Ab 7 verschmiert die Wahrscheinlichkeitsmasse
Score 3–4 Stufen „Niedrig / mittel / hoch“ schlägt 1–10
Noul binär Wenn Sie drei Ausgänge brauchen, nehmen Sie Choice

Benötigen Sie 15 Support-Queues? Clusteren Sie sie zu 4–6 Makro-Queues und fragen Sie die Sub-Queues dann in einem zweiten Aufruf ab.


Trennen Sie getrennte Entscheidungen

Intent und Dringlichkeit sind zwei Urteile. Stellen Sie zwei Fragen in einem API-Aufruf — verschmelzen Sie sie nicht:

"questions": [
  { "type": "choice", "text": "…Intent…", "options": ["…"] },
  { "type": "score", "text": "…Dringlichkeit…", "options": ["…"] }
]

Verschmolzene Fragen zwingen das Modell, zwei Urteile zu mitteln; beide werden dadurch unschärfer.


Der State ist die halbe Frage

Eine großartige Frage auf dünnem Zustandstext schneidet schlechter ab. Für Klassifikation gilt:

  • Behalten Sie Tonfall, Interpunktion und Füllwörter bei.
  • Nehmen Sie Sprecher / Kanal auf, wenn relevant.
  • Fassen Sie nicht so zusammen, dass die Belege verloren gehen.

Schwellwerte als Produkt-Policy

Behandeln Sie confidence als Policy-Eingabe, nicht nur als Modell-Score:

Konfidenz Beispiel-Policy
≥ 0.85 Vollautomatisierung
0.55–0.85 Vorschlagen + bestätigen
< 0.55 Menschliche Queue

Justieren Sie die Schwellwerte an 50–100 gelabelten Beispielen. Justieren Sie nach, wenn sich das Vokabular verschiebt (neue Features, neue Märkte).


Anti-Patterns

  1. Kitchen-sink-Fragen — „Klassifizieren, zusammenfassen und eine Antwort vorschlagen.“
  2. Taxonomie ohne Branch — Labels, die kein Code verwendet.
  3. 11-Punkt-Skalen, die niemand verteidigen kann.
  4. Verstecktes „Other“, getarnt als „Allgemein“.
  5. Prompts, die Essays verlangen — von einem Entscheidungsmodell.

Checkliste vor dem Release

  • Jede Frage bildet auf ein echtes switch / if ab
  • Optionen exklusiv und in menschlicher Sprache formuliert
  • 3–5 Choice-Optionen (oder 3–4 Score-Stufen)
  • Getrennte Frage je Entscheidung
  • Schwellwert + menschlicher Fallback definiert
  • Logging umfasst distribution + Latenz

FAQ

Sollen Optionen auf Englisch sein?
Richten Sie sich nach Ihrem Label-Set und Ihrer UI. Halten Sie state in der Sprache Ihrer Nutzer.

Wie teste ich die Qualität einer Frage?
Schreiben Sie 20 adversarische Fälle; eine gute Frage trennt sie ohne Zusatzregeln.

Kann ich Few-shot-Beispiele verwenden?
Legen Sie repräsentativen Text in state-Mustern ab und halten Sie die Fragen schlank; bevorzugen Sie Beispiele in der Dokumentation statt in jedem Prompt.


Weiterführende Artikel