Suche: drei Entscheidungen, vorher gemessen
Aus dem Projekt beim Energiedienstleister. Jede Änderung wurde mit denselben Testfragen gemessen, bevor sie live ging.
- 55 % → 70 %Stichwort- und Vektorsuche zusammen fanden die richtige Quelle öfter als Stichwortsuche allein. Bei Fragen in den eigenen Worten der Nutzer: 36 % → 58 %.
- 70 % vs. 69 %Eine Datenregel erzwang ein neues Embedding-Modell. Wir haben vorher beide gemessen. Der Wechsel hat nichts gekostet.
- 66 % → 77 %Der eingebaute Reranker der Cloud brachte nichts. Ein anderer hob die Trefferquote um 11 Punkte.
Wie wir die Suche messen: Recall, MRR, nDCG und die neuen Kennzahlen mit KI-Richter. Unten lesen ↓
Wie wir die Suche messen
Eine Zahl reicht nicht. Jede Kennzahl stellt eine andere Frage, und jede hat einen blinden Fleck. Deshalb nutzen wir sie zusammen.
-
1
Haben wir es überhaupt gefunden?
Recall@10 · TrefferquoteIst die richtige Stelle unter den ersten 10 Treffern? Die einfachste Zahl, und die, die zeigt, ob eine Änderung hilft.
- Braucht
- Einen Goldstandard: Testfragen mit ihren bekannten Quellstellen.
- Blinder Fleck
- Die Reihenfolge innerhalb der ersten 10. Und eine gute Stelle, die nicht im Goldstandard steht, zählt als falsch.
-
2
Steht es weit oben?
MRR · nDCG@10MRR: Wie weit oben steht die erste richtige Stelle? nDCG: Stehen die richtigen Stellen oben, und kommen sehr relevante vor wenig relevanten?
- Braucht
- Einen Goldstandard mit Stufen: sehr relevant, etwas relevant, nicht relevant.
- Blinder Fleck
- Derselbe wie bei Recall. Eine Stelle, die niemand bewertet hat, zählt als falsch.
-
3
Ist das Gefundene wirklich nützlich?
KI-Richter · RCP-nDCGNeuEin KI-Richter bewertet jede Stelle, die die Suche liefert, auch die, die niemand bewertet hat. RCP-nDCG von Cohere macht diesen Richter einheitlich: fünf Ja/Nein-Fragen für jede Stelle, dazu direkte Vergleiche. Die Vergleiche legen die Reihenfolge fest. Die Ja/Nein-Fragen setzen sie auf eine Skala, die für alle Fragen gleich ist.
Warum das zählt: In Coheres Studie waren 28 % der Stellen, die ein Benchmark als „nicht relevant“ markiert hatte, für Menschen nützlich.
- Braucht
- Einen Richter, der zuerst gegen Menschen geprüft wird, mit Ihren Fragen.
- Blinder Fleck
- Er ist nur so gut wie der Richter. Deshalb wird der Richter zuerst geprüft.
Der Goldstandard zeigt, ob eine Änderung hilft. Der Richter zeigt, was der Goldstandard übersehen hat. Für die Antwort selbst gibt es zwei weitere Prüfungen: Gibt es jede genannte Quelle, und sagt sie, was die Antwort behauptet? Und welche von zwei Antworten ist besser, blind bewertet?
Stufe 1 und 2 und beide Antwort-Prüfungen nutzen wir heute. RCP-nDCG bauen wir gerade ein. Quelle: Cohere, RCP-nDCG. In der Studie haben 46 Menschen Suchergebnisse in 289 Vergleichen bewertet; RCP-nDCG wählte in 77 % der Fälle das Ergebnis, das die Menschen bevorzugten, klassisches nDCG in 52 %.
30-Minuten-Gespräch anfragen
Keine Folien. Keine Demo. Fünf Fragen zu Ihrem System und eine ehrliche Antwort, ob es passt.
30-Minuten-Gespräch anfragen