← Alle fünf Phasen

Phase 2 · Einlesen

Eine Stufe, gemessen: Parsing

Unser Referenztest: 13 Parser auf 61 öffentlichen EMA- und FDA-Dokumenten, in vier Seitentypen. Bei Ihnen testen wir nur die Parser, die zu Ihren Dokumenten und Regeln passen. Jeder Parser bekommt zwei Noten:

  • Für eine KI nutzbar: Findet eine KI mit nur diesem Text einen Wert und weiß, zu welcher Zeile, Spalte und welchem Abschnitt er gehört?
  • Treue Kopie: Stimmen Tabellen, Überschriften und Reihenfolge mit der Seite überein?

Die erste Note entscheidet über Ihre Antworten, darum steht sie vorne.

Für eine KI nutzbar
ParserTabellenSpaltenFließtextScans€ / 1.000 Seiten
GPT-6 Sol + Textebene79%75%81%70%10,46 €
GPT-5.4 + Textebene74%73%72%67%≈ 9,62 €
Mistral OCR69%67%68%62%3,43 €
GPT-5.469%69%59%66%≈ 8,53 €
GPT-5.4 mini56%69%53%56%≈ 2,56 €
GPT-6 Luna + Textebene65%75%79%9%0,52 €
Cohere Parse 557%44%56%57%1,29 €
anydoc45%55%24%nicht gelaufen0 €, läuft lokal
Docling36%39%nicht gelaufennicht gelaufen0 €, eigene GPU
Azure AI Document Intelligence32%24%34%37%8,57 €
pypdf33%15%37%16%0 €, läuft lokal
PyMuPDF4LLM16%32%21%11%0 €, läuft lokal
pdfplumber19%12%16%18%0 €, läuft lokal
Note „Treue Kopie“ anzeigen
Treue Kopie
ParserTabellenSpaltenFließtextScans€ / 1.000 Seiten
GPT-6 Sol + Textebene77%70%75%54%10,46 €
GPT-5.4 + Textebene75%67%78%71%≈ 9,62 €
Mistral OCR71%71%65%63%3,43 €
GPT-5.469%63%72%67%≈ 8,53 €
GPT-5.4 mini58%61%58%47%≈ 2,56 €
GPT-6 Luna + Textebene59%67%77%10%0,52 €
Cohere Parse 573%59%61%73%1,29 €
anydoc38%47%21%nicht gelaufen0 €, läuft lokal
Docling33%41%nicht gelaufennicht gelaufen0 €, eigene GPU
Azure AI Document Intelligence36%32%37%40%8,57 €
pypdf28%13%23%20%0 €, läuft lokal
PyMuPDF4LLM17%47%20%3%0 €, läuft lokal
pdfplumber15%11%14%19%0 €, läuft lokal
  • GPT-6 Sol + Textebene ist für eine KI am besten, auf allen vier Seitentypen.
  • Bei der treuen Kopie gibt es keinen klaren Sieger. GPT-5.4 + Textebene, GPT-6 Sol + Textebene, Mistral OCR und Cohere Parse 5 liegen nah beieinander.
  • GPT-6 Luna versagt bei Scans (etwa 10 %), obwohl es bei digitalen Seiten stark ist.
  • Die kostenlosen Werkzeuge lesen nur den im PDF gespeicherten Text. Alte Scans haben keinen, darum liefern sie dort fast nichts.

Anteil gewonnener blinder Direktvergleiche, Unentschieden zählt halb, gemittelt über vier KI-Richter (gpt-5.6-terra, Grok 4.6, Grok 4.6 low, gpt-6-astra); ein Richter zählt nur dort, wo er mindestens 90 % der Paare bewertet hat. Tabellen: 22 Zusammenfassungen von Risikomanagementplänen. Spalten: 15 einseitige Tabellen. Fließtext: 12 Bewertungsberichte. Scans: 12 FDA-Prüfakten von vor 2000. Die GPT-Modelle lesen jede Seite als Bild; „+ Textebene“ gibt ihnen zusätzlich den im PDF gespeicherten Text. Kosten in Euro zu Listenpreisen: pro Seite bei Mistral, Azure und Cohere; bei GPT-6 Sol und Luna gemessen an den Tokens, die sie auf den Tabellenseiten verbraucht haben; bei den anderen GPT-Modellen eine Schätzung aus der Seitengröße (≈). Lauf vom 6. Oktober 2026. Unterschiede unter etwa 5 Punkten können Zufall sein.

30-Minuten-Gespräch anfragen

Keine Folien. Keine Demo. Fünf Fragen zu Ihrem System und eine ehrliche Antwort, ob es passt.

30-Minuten-Gespräch anfragen