Wie wir die Suche messen

Eine Zahl reicht nicht. Jede Kennzahl stellt eine andere Frage, und jede hat einen blinden Fleck. Deshalb nutzen wir sie zusammen.

  1. 1

    Haben wir es überhaupt gefunden?

    Recall@10 · Trefferquote

    Ist die richtige Stelle unter den ersten 10 Treffern? Die einfachste Zahl, und die, die zeigt, ob eine Änderung hilft.

    Braucht
    Einen Goldstandard: Testfragen mit ihren bekannten Quellstellen.
    Blinder Fleck
    Die Reihenfolge innerhalb der ersten 10. Und eine gute Stelle, die nicht im Goldstandard steht, zählt als falsch.
  2. 2

    Steht es weit oben?

    MRR · nDCG@10

    MRR: Wie weit oben steht die erste richtige Stelle? nDCG: Stehen die richtigen Stellen oben, und kommen sehr relevante vor wenig relevanten?

    Braucht
    Einen Goldstandard mit Stufen: sehr relevant, etwas relevant, nicht relevant.
    Blinder Fleck
    Derselbe wie bei Recall. Eine Stelle, die niemand bewertet hat, zählt als falsch.
  3. 3

    Ist das Gefundene wirklich nützlich?

    KI-Richter · RCP-nDCGNeu

    Ein KI-Richter bewertet jede Stelle, die die Suche liefert, auch die, die niemand bewertet hat. RCP-nDCG von Cohere macht diesen Richter einheitlich: fünf Ja/Nein-Fragen für jede Stelle, dazu direkte Vergleiche. Die Vergleiche legen die Reihenfolge fest. Die Ja/Nein-Fragen setzen sie auf eine Skala, die für alle Fragen gleich ist.

    Warum das zählt: In Coheres Studie waren 28 % der Stellen, die ein Benchmark als „nicht relevant“ markiert hatte, für Menschen nützlich.

    Braucht
    Einen Richter, der zuerst gegen Menschen geprüft wird, mit Ihren Fragen.
    Blinder Fleck
    Er ist nur so gut wie der Richter. Deshalb wird der Richter zuerst geprüft.

Der Goldstandard zeigt, ob eine Änderung hilft. Der Richter zeigt, was der Goldstandard übersehen hat. Für die Antwort selbst gibt es zwei weitere Prüfungen: Gibt es jede genannte Quelle, und sagt sie, was die Antwort behauptet? Und welche von zwei Antworten ist besser, blind bewertet?

Stufe 1 und 2 und beide Antwort-Prüfungen nutzen wir heute. RCP-nDCG bauen wir gerade ein. Quelle: Cohere, RCP-nDCG. In der Studie haben 46 Menschen Suchergebnisse in 289 Vergleichen bewertet; RCP-nDCG wählte in 77 % der Fälle das Ergebnis, das die Menschen bevorzugten, klassisches nDCG in 52 %.

30-Minuten-Gespräch anfragen

Keine Folien. Keine Demo. Fünf Fragen zu Ihrem System und eine ehrliche Antwort, ob es passt.

30-Minuten-Gespräch anfragen