Ihr KI-Assistent antwortet falsch. Finden Sie die Stufe, an der es bricht.

Für RAG-Systeme und Agenten auf Ihren Dokumenten. Meistens liegt der Fehler nicht im Sprachmodell, sondern davor: beim Einlesen und Zerteilen der Dokumente. Windtunnel testet jede Stufe auf Ihren Daten und zeigt, was Sie ändern müssen.

Für Systeme im Pilot oder in Produktion. Festpreise.

Echtes EMA-Dokument · Seite 58Parser: PyMuPDF4LLM
✓ Im PDF✗ Was der Parser schreibt
0.31
0.31
0.65
0.65
HAE Attacks
HAE Akttacs
Formprüfung100 %✓ jede Zeile hat alle Zellen
InhaltsprüfungPlatz 10✗ letzter von 10 Parsern

Können Sie das beantworten?

Eine Stufe nach der anderen. Eine Änderung nach der anderen.

  1. 1

    Scraping

    Was reinkommt

  2. 2

    Parsing

    Tabellen, Spalten, Scans

  3. 3

    Cleaning

    Was rausfliegt

  4. 4

    Chunking

    Wo der Text geschnitten wird

  5. 5

    Embedding

    Welches Modell, welche Kosten

  6. 6

    Retrieval

    Fusioniert, gererankt, bewertet

Eine Stufe, gemessen: Parsing

11 Parser auf 22 tabellenlastigen EMA-Dokumenten. Jeder Parser bekommt zwei Noten:

  • Treue Kopie: Stimmen Tabellen, Überschriften und Reihenfolge mit der Seite überein?
  • Für eine KI nutzbar: Findet eine KI mit nur diesem Text einen Wert und weiß, zu welcher Zeile und Spalte er gehört?

Dazu: was es kostet und wie lange es dauert.

ParserTreue KopieFür eine KI nutzbar€ / 1.000 SeitenSekunden / Dok.
Mistral OCR82%73%3,43 €1,7 s
GPT-5.4 Vision + Textebene77%78%9,62 €nicht gemessen
GPT-5.4 Vision70%77%8,53 €nicht gemessen
Cohere Parse 563%noch nicht bewertet1,29 €5,5 s
GPT-5.4 mini Vision58%65%2,56 €7,9 s
Azure AI Document Intelligence46%39%8,57 €5,3 s
pypdf43%40%0 €, läuft lokal0,2 s
anydoc40%48%0 €, läuft lokal0,1 s
Docling36%38%0 €, eigene GPU25,8 s
PyMuPDF4LLM19%19%0 €, läuft lokal2,1 s
pdfplumber15%23%0 €, läuft lokal0,5 s

Anteil gewonnener blinder Direktvergleiche, bewertet von gpt-5.6-terra (5.359 Urteile über alle vier Seitentypen). Kosten zu Listenpreisen in Euro, auf diesem Set gemessen. Zeit pro Dokument, gemessen, wenn der Parser wirklich lief.

Aufräumen vor dem Zerteilen. Kleine Schritte, die Antworten retten.

Für die Suche wird jedes Dokument in kleine Textstücke zerteilt. Vorher räumen wir es auf. Drei Beispiele aus einem Kundenprojekt mit regulierten Fachdokumenten:

Kopfzeilen und Seitenzahlen landen als eigene Mini-Stücke im Index.

Die Suche findet leere Schnipsel statt der Stelle mit der Antwort.

Schritt: Kopfzeilen und Seitenzahlen entfernen

Stücke ohne Inhalt, nur Kopfzeile oder Seitenzahl · weniger ist besser61

Der Produktname oben auf jeder Seite wird für eine Überschrift gehalten.

Textstücke stehen unter der falschen Überschrift. Die KI ordnet eine Angabe dem falschen Abschnitt zu.

Schritt: Produktnamen nicht als Überschrift werten

Stücke unter der falschen Überschrift, von allen Stücken · weniger ist besser4 von 350 von 33

Abschnittsüberschriften gehen beim Einlesen verloren.

Die KI weiß nicht, aus welchem Abschnitt eine Angabe stammt, und kann sie nicht belegen.

Schritt: Überschriften aus der offiziellen Nummerierung wiederherstellen

Gefundene Überschriften in zehn Dokumenten · mehr ist besser149178

Jeder Schritt ist klein. Zusammen entscheiden sie, ob die KI die richtige Stelle findet. Windtunnel misst jeden Schritt einzeln. So sehen Sie, welcher sich lohnt.

Kleine Stichproben: ein Dokument für die ersten zwei Beispiele, zehn Dokumente desselben Typs für das dritte. Sie zeigen, was jede Prüfung findet, keinen Durchschnitt. Kunde und Dokumente werden nicht genannt.

Benchmarks machen die Shortlist. Ihre Daten treffen die Wahl.

Ein öffentlicher Benchmark testet fremde Dokumente. Ob ein Modell mit Ihren funktioniert, zeigt nur ein Test mit Ihren.

  1. 40Modelle und Parser am Markt
  2. Öffentlicher Benchmarkfremde Dokumente, meist Englisch
  3. 4auf der Shortlist
  4. WindtunnelIhre Dokumente, Ihre Fragen, Ihre Sprache
  5. 1die passt zu Ihren Dokumenten

Das Ergebnis ist nicht eine Zahl, sondern pro Stufe: Wie oft wird die richtige Stelle gefunden, was kostet es, wie schnell ist es.

Das bleibt bei Ihnen

Der Korpus-Report

Struktur Ihres Bestands und Fehlerquote je Dokumenttyp, mit Beispielen.

Der Goldstandard

Gelabelte Fragen mit Quellstellen. Er gehört Ihnen.

Der Prüfstand

Bei jeder Änderung neu laufen lassen, auch als CI-Gate.

Der Auditbericht

Methodik, Daten und Ergebnisse. Grundlage für Ihre Nachweise gegenüber QM, Prüfstellen und im Rahmen des EU AI Act.

Sie betreiben, wir messen und verbessern. Läuft in Ihrer Infrastruktur, in der EU. Kein Lock-in.

Festpreise, in drei Schritten

Schritt 1 · 2 Wochen

Ingestion-Check

9.500 €

Kommen Ihre Dokumente heil im System an?

  • Fehlerquote je Dokumenttyp, mit Beispielen
  • Wir brauchen nur Lesezugriff
Wird voll auf das Audit angerechnet
Schritt 2 · 5 Wochen

Qualitätsaudit

25.000 €

Wie gut antwortet Ihr Assistent, und was hilft am meisten?

  • Testfragen mit belegten Antworten, sie gehören Ihnen
  • Ihr System im Vergleich zu Alternativen gemessen
  • Maßnahmenplan und Auditbericht für QM und Prüfstellen
Enthält Schritt 1
Schritt 3 · nach dem Audit

Umsetzung

ab 35.000 €

Wir setzen die Maßnahmen um.

  • Trefferquote vorher und nachher, gegen ein vorab vereinbartes Ziel
  • Der Prüfstand läuft bei jeder Änderung weiter
Festpreis nach dem Audit

✓ Passt: System im Pilot oder in Produktion · Pharma, Medizinprodukte, Energie, Finanzen, Versicherungen

✗ Passt nicht: erste Demo · wir sollen das System betreiben

Tim Treskatis

Tim Treskatis

Windtunnel, Berlin. Ich baue und evaluiere KI-Assistenten und Agenten auf Unternehmenswissen, auch unter MDR-Anforderungen. Mit schwierigen Dokumenten: Tabellen, Scans und regulatorische Unterlagen.

Rund 8 Jahre Data und ML, davon 5 Jahre Enterprise-Beratung, u. a. für Airbus, Lufthansa, Deutsche Bahn und Hapag-Lloyd.

Der Name kommt aus meinem Studium der Luft- und Raumfahrttechnik an der KTH Stockholm: Dort testet man im Windkanal, bevor man fliegt.

30-Minuten-Gespräch anfragen

Keine Folien. Keine Demo. Fünf Fragen zu Ihrem System und eine ehrliche Antwort, ob es passt.

Läuft Ihr System produktiv?

Nur für die Antwort genutzt. Kein Newsletter. Kein Tracking. Datenschutz