Warum sich PDF-Dateien immer noch gegen KI wehren

Wir alle kennen diese Situation: Man zieht eine PDF-Datei in einen Assistenten, fordert eine saubere Zusammenfassung oder die Extraktion einer Tabelle an … und erhält einen Text, in dem die Spalten durcheinander geraten sind, Fußnoten mitten im Satz stehen und Tabellen zu unlesbaren Zeichenblöcken werden. Diese Diskrepanz ist umso frustrierender, als genau diese Systeme komplexe Probleme lösen oder Code generieren können. Das Paradoxon ist jedoch gar nicht so rätselhaft: Das PDF-Format war nie dafür gedacht, als strukturiertes Dokument “gelesen” zu werden.

Das PDF ist kein Text, sondern ein Layout.

Für uns ist ein PDF ein Dokument: ein Titel, Untertitel, Absätze, manchmal ein Inhaltsverzeichnis, Abbildungen, Bildunterschriften. Für eine Maschine ist es oft etwas anderes: eine visuelle Beschreibung der Seite, eine Reihe von Anweisungen wie “setze dieses Textfragment hier ein”, “zeichne diese Linie dort”, “zeige dieses Bild an diesen Koordinaten an”. Der Inhalt wird buchstäblich auf die Seite “gemalt”.

Ergebnis: Die logische Reihenfolge (die ein Mensch ganz natürlich befolgt) ist nicht unbedingt in der Datei enthalten. Noch bevor sie antwortet, muss die KI die Struktur des Dokuments rekonstruieren: Wo beginnt die Überschrift, wo enden die Absätze, was ist eine Bildunterschrift, was ist ein Kasten, was ist ein Navigationselement? Und diese Rekonstruktion geht manchmal schief.

HTML vs. PDF: Der Unterschied, der alles verändert

Im Web gibt HTML die Struktur explizit an: Das ist eine Überschrift, das ist ein Absatz, das ist eine Liste, das ist eine Tabellenzelle. Überall gibt es Wegweiser. In einer PDF-Datei kann Text enthalten sein … ohne innere Hierarchie zwischen den Textabschnitten. Selbst wenn der Inhalt “kopierbar” ist, gibt es keine Garantie dafür, dass er so organisiert ist, wie man es sich vorstellt.

Und wenn es mehrere Spalten, Rahmen, übereinanderliegende Elemente, Grafiken, Bildunterschriften gibt – kurz gesagt, alles, was ein echtes redaktionelles Dokument ausmacht –, muss die KI ableiten, was wichtig, nebensächlich, kontextbezogen oder rein dekorativ ist. Genau hier schleichen sich Fehler ein.

Die klassischen Fallstricke: Spalten, Tabellen, Überschriften und Anmerkungen

In der Praxis gibt es drei Bereiche, in denen die Fehlerquote sprunghaft ansteigt.

Die Spalten
Viele Tools extrahieren den Text von links nach rechts, Zeile für Zeile. Auf einer zweispaltigen Seite kann dies dazu führen, dass das Ende der linken Spalte mit dem Anfang der rechten Spalte vermischt wird. Beim Lesen hat man den Eindruck, als wäre ein Absatz “teleportiert” worden.

Die Gemälde
Eine Tabelle ist für den Computer nicht unbedingt eine Tabelle. In vielen PDF-Dateien gibt es kein logisches Raster: nur ausgerichteter Text und ein paar Linien. Das Rekonstruieren der Zellen wird zu einem Rätsel: Wo endet eine Spalte? Wo beginnt die nächste? Ist das ein Trennzeichen oder nur ein grafischer Effekt? Bei der geringsten Unklarheit erhält man eine unvollständige Tabelle oder, schlimmer noch: eine falsche, aber “saubere” Tabelle.

Kopf- und Fußzeilen sowie Fußnoten
Seitenzahlen, Impressumsangaben, Datumsangaben, wiederholte Kapitelüberschriften … Diese Elemente sind für einen Menschen optisch klar erkennbar, können jedoch mit dem Fließtext verwechselt werden, wenn das Tool nicht zwischen “Gestaltungselementen” und Inhalt unterscheidet. Das Ergebnis: Die Zusammenfassung enthält Teile der Fußzeile, oder Fußnoten tauchen mitten in einem Satz auf.

Das Ironischste daran ist, dass die Extraktion zwar “erfolgreich” erscheinen mag (die Wörter sind vorhanden), aber dennoch unbrauchbar ist (die Struktur ist fehlerhaft). Und eine fehlerhafte Struktur führt zu einer wackeligen Zusammenfassung, einer ungenauen Recherche oder einer Analyse, die von Anfang an schiefgeht.

Warum OCR nicht ausreicht

Der erste Reflex – vor allem, wenn es sich bei der PDF-Datei um einen Scan handelt – ist, die OCR-Funktion zu nutzen. Das ist nützlich, manchmal sogar unverzichtbar. Man sollte jedoch einen einfachen Unterschied beachten: Das Erkennen von Zeichen ist nicht dasselbe wie das Verstehen der Hierarchie des Dokuments.

OCR beantwortet die Frage “Welche Wörter siehst du?”, nicht aber “Wo beginnt der Hauptgedanke?”, “Ist das eine Bildunterschrift?” oder “Gehört dieser Satz zum Bild oder zum Absatz?”. Selbst ein sehr gutes OCR-Programm kann eine korrekte Transkription liefern … und eine katastrophale Struktur.

Und wenn die KI etwas erfindet: das heikle Thema der Lücken im Text

Wenn der Text unklare Stellen enthält, füllen manche KI-Systeme diese Lücken. Das geschieht nicht aus böser Absicht, sondern ist oft eine Folge einer komplizierten Verarbeitungskette. Ist der extrahierte Text unvollständig, falsch angeordnet oder gehen bei der Extraktion Passagen verloren, kann das Modell eine plausible – wenn auch nicht unbedingt korrekte – Antwort generieren.

Das passiert vor allem dann, wenn man sehr präzise Fragen stellt (“Wie hoch ist der genaue Betrag von Posten X?”, “Welche Ausnahmen sind in Klausel 7 aufgeführt?”) zu einem Dokument, dessen Struktur durch die Datenextraktion bereits geschwächt wurde. Ausgehend von einer instabilen Grundlage “argumentiert” das Modell auf Sand.

Was sich verbessert: Spezialisierte Modelle und Pipelines

Die Situation entwickelt sich weiter, denn PDF-Dateien enthalten eine enorme Menge an wertvollen Informationen: Berichte, Handbücher, Fachartikel, Verwaltungsdokumente. Die derzeit effektivsten Ansätze basieren auf einer einfachen Idee: Anstatt ein allgemeines Modell alles erraten zu lassen, bereitet man den Weg besser vor.

Konkret wird das Dokument in Segmente unterteilt: Textblöcke, Überschriften, Abschnitte, Tabellen, Abbildungen, Kopfzeilen, Fußnoten. Man ordnet diese Blöcke, stellt eine schlüssige Lesereihenfolge wieder her und übergibt das Ganze dann der KI, um es zusammenzufassen, zu vergleichen oder Informationen zu extrahieren. Das ist keine Zauberei, aber es ist zuverlässiger.

Was Sie ab sofort tun können

Wenn Sie deutlich bessere Ergebnisse erzielen möchten, ist es am zuverlässigsten, die PDF-Datei nicht als einfachen Textstrom zu behandeln, sondern als gestaltete Seite.

  • Entscheiden Sie sich für ein Natives PDF (aus einer Software exportiert) statt als Scan.
  • Wenn möglich, sammeln Sie die Tabellen im CSV-/XLSX-Format anstatt sie aus der PDF-Datei “herauszulesen”.
  • Führen Sie eine kurze Überprüfung durch: Überprüfen Sie die Reihenfolge der Absätze und die korrekte Darstellung der Tabellen, bevor Sie eine Analyse anfordern.
  • Wenn Genauigkeit entscheidend ist (Recht, Finanzen, Daten), legen Sie eine Regel fest: Zuerst extrahieren und validieren, dann interpretieren.

Zum Schluss

Das PDF wird noch lange ein Standard bleiben, gerade weil es das Erscheinungsbild festhält und die Zeit überdauert. Doch diese Stärke ist zugleich seine Schwäche, sobald man eine Maschine dazu auffordert, “wie ein Mensch” zu lesen. Der richtige Ansatz besteht nicht darin, auf das perfekte Modell zu warten, sondern einen Arbeitsablauf zu wählen, der die Natur des PDF-Formats berücksichtigt und zunächst die Struktur rekonstruiert, bevor nach Sinn gesucht wird. Mit diesen Sicherheitsvorkehrungen ist KI kein Glücksspiel mehr, sondern wird zu einem zuverlässigen Werkzeug – zumindest meistens.