Start / Blog / Methoden / Wie funktioniert Dokumentenextraktion mit LLMs richtig?

Wie funktioniert Dokumentenextraktion mit LLMs richtig?

Zusammenfassen mit ChatGPT

Künstliche Intelligenz und Large Language Models (LLMs) sind in aller Munde. Doch wenn es darum geht, diese Technologien wirklich in der Dokumentenverarbeitung bzw. Dokumentenextraktion einzusetzen, zeigt sich schnell: Zwischen Marketing-Versprechen und Praxis-Realität liegen Welten. Ein Entwickler-Einblick zeigt, wie Konfuzio IDP ein grundsätzliches Problem löst, an dem viele andere Systeme scheitern. Ein Thema, mit dem ich mich schon lange Zeit beschäftigte. Meinen nach fast zwei Jahren historisch wirkenden Artikel zu dem Thema finden Sie hier: Datenextraktion aus PDF Dokumenten.

Das Problem: Wenn „1,00 €“ nicht gleich „1,00 €“ ist

Stellen Sie sich eine typische Situation vor: Eine Rechnung listet verschiedene Posten auf:

Rechte an Patenten ........................ 1,00 €
Markenrechte .............................. 1,00 €

Ihre Aufgabe: Die KI soll beide Beträge korrekt den jeweiligen Posten zuordnen. Bei eindeutigen Werten, wie im folgenden Bild, ist dies natprlich einfacher.

Das klingt simpel – ist es aber nicht.

Viele KI-Lösungen arbeiten heute so: Das LLM liest das Dokument und sagt „Für Rechte an Patenten habe ich 1,00 € gefunden“. Soweit so gut. Aber jetzt kommt das Problem: Das System muss diesen Wert im Original-Dokument wiederfinden, um ihn dort zu markieren oder weiterzuverarbeiten.

Und hier wird es kompliziert: Im Dokument steht „1,00 €“ zweimal. Welches ist gemeint? Das erste? Das zweite?

Bei einer Rechnung mit zwei identischen Werten ist das schon schwierig. Aber stellen Sie sich vor:

Plötzlich wird aus einer simplen Aufgabe ein Glücksspiel. Die KI kann nicht zuverlässig sagen: „Dieser spezifische Betrag gehört zu diesem spezifischen Posten.“

Daraus ergeben sich häufig folgende Problemstellungen

  • LLM Halluzination Dokumentenextraktion
  • LLM erfindet Daten aus Dokumenten
  • KI extrahiert falsche Werte aus PDF
  • Dokumenten-KI macht Fehler bei identischen Werten
  • LLM kann gleiche Beträge nicht unterscheiden
  • Textextraktion LLM ungenau
  • OCR Werte richtig zuordnen Problem
  • Mehrfache Beträge Rechnung automatisch zuordnen
  • KI verwechselt Werte in Dokumenten
  • Dokumentenverarbeitung LLM unzuverlässig

Die klassische Lösung funktioniert nicht

Viele Anbieter versuchen, das Problem mit Tricks zu lösen:

  • „Wir nehmen einfach das erste Vorkommen von 1,00 €“ → Führt zu Fehlern
  • „Wir schauen uns den Kontext an“ → Funktioniert bei komplexen Dokumenten nicht zuverlässig
  • „Wir verwenden Näherungswerte“ → Bei langen Dokumenten wird’s chaotisch

Das Grundproblem bleibt: Nachdem die KI einen Wert extrahiert hat, kann man ihn nicht mehr eindeutig seiner ursprünglichen Position im Dokument zuordnen.

Unsere Lösung: Die KI weiß, wo sie sucht.

Die LLM-Integration von Konfuzio IDP funktioniert fundamental anders: Das LLM gibt nicht nur zurück, WAS es gefunden hat, sondern auch, WO genau es das gefunden hat.

So läuft es in der Praxis ab

Schritt 1: Das Dokument wird vorbereitet

Wenn ein Dokument durch die OCR-Texterkennung läuft, bekommt jedes erkannte Wort bereits seine Position im Dokument zugewiesen. Das sieht dann etwa so aus:

Wort "Rechte" steht bei Position x=50, y=100
Wort "an" steht bei Position x=75, y=100
Wort "Patenten" steht bei Position x=95, y=100
Wort "1,00" steht bei Position x=125, y=100
Wort "€" steht bei Position x=130, y=100
Wort "Markenrechte" steht bei Position x=50, y=125
Wort "1,00" steht bei Position x=125, y=125
Wort "€" steht bei Position x=130, y=125

Schritt 2: Das LLM bekommt diese Informationen

Das LLM sieht nicht einfach nur „Rechte an Patenten 1,00 €“, sondern bekommt zu jedem Wort auch die Position mit.

Schritt 3: Das LLM antwortet MIT Position

Statt nur zu sagen „Rechte an Patenten: 1,00 €“, gibt das LLM zurück:

Feld "Rechte an Patenten": 
- Wert: 1,00 €
- Position: x=125/y=100 und x=130/y=100
Feld "Markenrechte":
- Wert: 1,00 €  
- Position: x=125/y=125 und x=130/y=125

Was bringt das in der Praxis?

1. Identische Werte sind kein Problem mehr

Egal ob „1,00 €“ einmal oder hundertmal im Dokument steht – das System weiß immer genau, welcher Wert zu welchem Feld gehört. Das ist besonders wichtig bei:

2. Keine erfundenen Werte

Ein häufiges Problem bei LLMs: Sie „halluzinieren“ manchmal – erfinden also Daten, die gar nicht im Dokument stehen. Bei Konfuzios Ansatz ist das unmöglich. Die KI MUSS eine Position angeben, die aus der OCR-Erkennung stammt.

Ja, Fehler sind möglich – die KI könnte den falschen Wert dem falschen Feld zuordnen. Aber sie kann keine Beträge oder Daten erfinden, die nicht im Original-Dokument stehen.

Für regulierte Branchen wie Banken oder Versicherungen ist das entscheidend.

3. Sie sehen immer, woher ein Wert kommt

In der Document Validation UI können Ihre Mitarbeiter genau sehen: „Dieser extrahierte Wert kommt von genau dieser Stelle im Dokument.“

Das macht die Qualitätskontrolle einfach:

  • Ist der Wert richtig zugeordnet? → Ein Blick genügt
  • Gibt es einen Fehler? → Man sieht sofort, wo
  • Muss man etwas korrigieren? → Die richtige Stelle ist markiert

4. Nachvollziehbarkeit für Compliance

In der Wirtschaftsprüfung, im öffentlichen Sektor oder bei Finanzdienstleistern müssen Sie oft nachweisen: „Woher stammt diese Information?“

Mit dem IDP Koordinaten-basierten Ansatz können Sie jeden extrahierten Wert bis zum exakten Pixel im Originaldokument zurückverfolgen. Das schafft transparente, nachvollziehbare KI.

Der Preis: Mehr Komplexität für die KI

Natürlich ist dieser Ansatz nicht ohne Herausforderungen. Für das LLM ist es deutlich schwieriger:

  • Es muss nicht nur verstehen, WAS extrahiert werden soll
  • Es muss auch die richtigen Koordinaten angeben
  • Es muss mehrere Informationsebenen gleichzeitig verarbeiten

Die Folge: Bei sehr komplexen Dokumenten kann es zu Fehlern kommen – etwa falsch angegebenen Koordinaten oder Verwechslungen.

Aber: Lieber ein System, das bei 95% der Fälle den richtigen Wert an der richtigen Stelle findet, als eines, das bei 98% einfach einen Wert ausspuckt – aber niemand weiß welchen, und das bei der Automatisierung kritischer Prozesse zu teuren Fehlern führt.

Warum das für Ihr Unternehmen wichtig ist

In Zeiten, in denen jeder Anbieter „KI-gestützte Dokumentenverarbeitung“ verspricht, lohnt sich ein Blick hinter die Kulissen. Viele Lösungen funktionieren gut in Demos mit einfachen Beispieldokumenten. Aber wenn es um echte, komplexe Unternehmensdokumente geht, zeigen sich die Unterschiede.

Konfuzios Ansatz ist eine direkte Antwort auf die Herausforderungen, die bei der praktischen Nutzung von LLMs auftreten:

  • Nicht einfach ChatGPT auf Dokumente loslassen
  • Sondern strukturiert, koordinatenbasiert und nachvollziehbar arbeiten
  • Applied AI statt AI-Washing

Das ist besonders relevant, wenn Sie:

  • Viele Dokumente mit wiederkehrenden Werten verarbeiten
  • Hohe Anforderungen an Dunkelverarbeitung haben (also Dokumente ohne manuelle Prüfung durchlaufen sollen)
  • Compliance und Nachvollziehbarkeit gewährleisten müssen
  • Ihre Prozesse wirklich automatisieren wollen – nicht nur digitalisieren

Fazit: Ingenieurskunst statt Marketing-Versprechen

Unser koordinatenbasierter Ansatz zeigt: Gute KI-Lösungen entstehen nicht, indem man einfach das neueste LLM nimmt und hofft, dass es funktioniert. Sie entstehen durch durchdachte Architektur-Entscheidungen, die reale Probleme lösen.

Ja, es ist komplexer. Ja, es erfordert mehr Engineering-Aufwand. Aber genau das macht den Unterschied zwischen einer Demo, die beeindruckt, und einem System, das im täglichen Einsatz zuverlässig funktioniert.


Interessiert an den technischen Details? Kontaktieren Sie uns für einen Austausch auf technischer Ebene.

Fanden Sie die Seite hilfreich?

Vielen Dank für Ihr Feedback!

Würden Sie mir Feedback geben? (anonym)

Wir entwickeln KI-Software für Unternehmen und verzichten bewusst auf störende Werbebanner. Durch unsere Artikel dokumentieren wir Themen, die uns beschäftigen, interessieren und auch unser tägliches Brot finanzieren.

Da unsere Inhalte kostenfrei sind, ist Ihr Feedback unser Lob.

Jeder Autor liest Ihr anonymes Feedback persönlich, obwohl KI es automatisieren könnten, und integriert konstruktive Vorschläge direkt in die nächste Überarbeitung oder nutzt es als Inspiration für den nächsten Artikel.



    • Florian Zyprian
      (Autor)

      Als CTO bei der Helm & Nagel GmbH, dem Unternehmen hinter der Marke Konfuzio.

    de_DEDE