Start / Blog / Anwendungsfälle / Datenblätter und technische Produktdaten mit KI verarbeiten

Datenblätter und technische Produktdaten mit KI verarbeiten

Zusammenfassen mit ChatGPT

Was nach einem klassischen Job für KI-gestützte Dokumentenverarbeitung klingt, wird für Industrieunternehmen schnell zum komplexen Entwicklungsprojekt: Unzählige Produktreihen, die in diversen Ausführungen vertrieben werden, individuelle Messwerte, Prüfnormen und Zertifizierungen – alles in verschiedenen Dokumenten und Layouts.

Ingenieure, Einkaufsteams und Händler verbringen Stunden damit, die PDFs durchzublättern. Dabei interessiert sie eigentlich “nur”, welches Dichtungsmaterial bis 200 Grad hitzebeständig ist, oder ob unter 30 Lieferantenangeboten überhaupt eines die geforderten Zertifizierungen erfüllt. Ganz so banal wirkt die automatisierte Prüfung der Datenblätter dann doch nicht mehr – und erfordert Engineering-Ansätze, die weit über klassische Texterkennung hinausgehen.

Vom Datenblatt zum Datensatz: Intelligent Document Processing - KI für Produktdaten in der Industrie

Was mit strukturierten Produktdaten möglich wird

Ein technisches Datenblatt (TDS), in manchen Branchen auch Produkt- oder Sicherheitsdatenblatt, enthält alle Produktinformationen, die für die technische Kommunikation zwischen Unternehmen unerlässlich sind: Spezifizierungen zu Material- und Verarbeitungseigenschaften sowie Prüfnormen unterstützen Unternehmen bei Kaufentscheidungen und Risikomanagement – klassische Anwendungsszenarien von Künstlicher Intelligenz (KI).

Die Produktdaten automatisiert in eine durchsuchbare Form zu bringen, erleichtert das interne Datenmanagement sowie Aktualisierungen und reduziert die Notwendigkeit personeller Prüfungen erheblich. Zudem lassen sich interaktive Produktselektoren und KI-Chatbots aufsetzen, die Kunden auf Basis strukturierter Daten die Produktauswahl erleichtern. Warum das nicht seit Jahren Industriestandard ist, hatte technische Gründe – bis jetzt.

AnwendungsfallGeschäftsbereichGeschäftsnutzen
ProduktselektorVertrieb, MarketingKunden filtern Produkte selbst nach technischen Anforderungen — weniger Anfragen, kürzere Sales-Zyklen, höhere Conversion.
KI-Chatbot für ProduktberatungVertrieb, MarketingAutomatisierte Beantwortung technischer Produktfragen rund um die Uhr — ohne Belastung des Außendienstes.
LieferantenvergleichEinkaufTechnische Spezifikationen dutzender Lieferanten werden vergleichbar — Entscheidungen in Stunden statt Wochen.
Compliance-PrüfungQualität, EinkaufAutomatisierter Abgleich gegen Normen, Zertifizierungsanforderungen und regulatorische Vorgaben — Risiko sinkt, Aufwand auch.
PIM / ERP-IntegrationIT, ProduktmanagementStrukturierte Daten fließen direkt in bestehende Systeme — keine manuelle Übertragung, keine Medienbrüche.
AusschreibungsantwortenVertrieb, EinkaufRelevante Produktdaten werden automatisch aus dem Datensatz gezogen — Angebotserstellung wird deutlich beschleunigt.
Produktdaten-PflegeProduktmanagement, ITUpdates von Lieferantendaten oder eigenen TDS werden automatisch erkannt und eingespielt — kein manueller Pflegeaufwand.

Die Komplexität technischer Daten überwinden

Zunächst die gute Nachricht: Ja, das Problem ist gelöst. Mit modernen KI-Pipelines auf Basis multimodaler Sprachmodelle lassen sich heute Tausende technischer Datenblätter — unabhängig von Layout, Sprache oder Dokumenttyp — vollautomatisch in strukturierte, durchsuchbare Datensätze überführen. Was früher Wochen manueller Erfassung oder Schema-Erstellung bedeutete, dauert heute Stunden. Die Extraktionsgenauigkeit erreicht dabei Werte, die eine produktive Nutzung ohne manuelle Nachkontrolle erlauben.

Datenblatt IDP Interface
Konfuzio Verification Feature beim Auslesen eines Datenblatts.

Warum das schwieriger ist, als man denken könnte:

  • Heterogene Dokumentstruktur — Gleichartige Dokumente verschiedener Hersteller, Produktlinien oder Jahrzehnte folgen keinem einheitlichen Layout. Abschnittsbezeichnungen, Tabellenstrukturen und Feldreihenfolgen variieren stark.
  • Produkttypen folgen keinem einheitlichen Schema — Nicht jedes Produkt hat dieselben Eigenschaften. Eine Maschinenschraube hat eine Festigkeitsklasse, eine Holzschraube einen Spitzentyp. Eine LED-Lampe hat Lumen und Farbtemperatur, eine Glühbirne nur Watt und Sockel. Starre Datenmodelle verlieren dabei zwangsläufig Informationen.
  • Messwerte verteilen sich über mehrere Zeilen — Key, Einheit, Messbedingung und Wert stehen selten in einer Zeile. Herkömmliche Parser lesen sie als separate Einträge und produzieren unsinnige Ergebnisse.
  • Werte sind keine einfachen Zahlen — Datenblätter enthalten Ranges, Ungleichungen, Näherungen und qualitative Angaben. Wer alles in ein Textfeld packt, zerstört die Filterbarkeit.
  • Synonyme und inkonsistentes Vokabular — Dieselbe Eigenschaft trägt in verschiedenen Dokumenten dutzende Namen. Ohne Normalisierung entstehen Datensätze, die nicht vergleichbar sind.
  • OCR-Qualität als harte Grenze — Sonderzeichen, Einheiten und wissenschaftliche Symbole werden von herkömmlichen PDF-Parsern häufig korrumpiert (z. B. Ω wird zu Q). Was die Texterkennung zerstört, kann kein Sprachmodell reparieren.
  • Vollständigkeit schlägt Genauigkeit — Ein fehlender Messwert macht ein Produkt in Suchanfragen unsichtbar. Die Pipeline muss exhaustiv sein, nicht nur präzise.

Lösungsansätze für heterogene Datenblätter

Die entscheidenden Designentscheidungen bei der Verarbeitung der Datenblätter betreffen nicht einzelne Algorithmen, sondern das Zusammenspiel von Schemadesign, Extraktionsstrategie und Nachverarbeitung. Fünf Prinzipien erweisen sich als wirkungsvoll:

  • Schema für das Ziel entwerfen, nicht für die Quelle — Ein Datenblatt folgt der Logik des Ingenieurs, ein Produktselektor der des Kunden. Wer die Dokumentstruktur im Datenmodell abbildet, erhält eine tiefe Hierarchie voller leerer Felder. Besser: ein flaches Schema, in dem jedes Feld eine Filterfrage beantwortet oder zu einer Messung beiträgt.
  • Extraktion in Teilaufgaben splitten — Ein Extraktor für Klassifizierung und Messwerte gleichzeitig wird bei beiden schlechter. Zwei unabhängige Extraktoren mit fokussiertem Prompt — einer für Metadaten, einer für Messwerte — liefern bessere Ergebnisse. Die Zusammenführung erfolgt nachgelagert.
  • Erst extrahieren, dann klassifizieren — Werte beim Extrahieren direkt in vordefinierte Kategorien zu zwingen liegt nahe, führt aber zu Fehlzuordnungen. Zuverlässiger ist es, Angaben zunächst wortgetreu aus dem Dokument zu übernehmen und erst in einem separaten Schritt zu vereinheitlichen.
  • Werttypen explizit machen —„< 5 MPa“, „200–250 °C“ und „bedingt beständig“ sind allesamt gültige Produktangaben, aber mit völlig unterschiedlicher Bedeutung. Wer sie einheitlich als Text speichert, verliert die Filterbarkeit. Stattdessen sollte jeder Messwert einen Typ mitbringen — Zahl, Bereich, Grenzwert, Näherung oder qualitative Angabe —, damit nachgelagerte Systeme sinnvoll damit arbeiten können.
  • Bedingungen als Freitext behalten — Testbedingungen als strukturierte Objekte zu modellieren klingt elegant, scheitert aber an der Kombinationsvielfalt. Ein Freitext-String ist zuverlässiger und lässt sich nachgelagert parsen. Strukturieren, was man verifizieren kann — den Rest als Text lassen.

Automatische Qualitätsverbesserung — ohne Finetuning

Die Extraktionsqualität lässt sich iterativ steigern, ganz ohne Anpassung der Modellgewichte. Das Prinzip: Ein Testset wird extrahiert, ein unabhängiger Review-Agent prüft jede Extraktion feldweise gegen das Original-PDF und schlägt konkrete Schemaänderungen vor. Ein zweiter Agent aggregiert die Befunde, verwirft Einzelfehler als Rauschen und erzeugt gezielte Anpassungen an Feldbeschreibungen, Regeln und Vokabularen.

Der Zyklus wiederholt sich, bis die Qualität ihr Ziel-Plateau erreicht. Wenige Iterationen genügen oft für deutliche Verbesserungen — bei Problemen, die ein menschlicher Reviewer erst nach stundenlanger Durchsicht Hunderter Seiten finden würde. Das gesamte Lernen findet als menschenlesbarer Text im Prompt statt: prüfbar, nachvollziehbar und jederzeit revidierbar.

Die Software-Lösung im Überblick

Die automatisierte Verarbeitung technischer Daten erfolgt wie dargestellt durch die Software Konfuzio der Helm & Nagel GmbH. Das System kombiniert multimodale Sprachmodelle mit OCR-gestützter Texterkennung, um Produktdaten nicht nur zu extrahieren, sondern auch gegen bestehende Spezifikationen und Normen zu validieren — etwa ob ein extrahierter Prüfwert zur angegebenen DIN/ISO-Norm passt. Wo die automatische Plausibilitätsprüfung an Grenzen stößt, ermöglicht eine grafische Oberfläche die manuelle Korrektur durch Fachpersonal.

KategorieDetails
KerntechnologieMultimodale LLMs, OCR-Grounding, semantische Validierung
InfrastrukturContainerisiert (Docker / Kubernetes), modulare Microservice-Architektur
BetriebsmodelleSaaS (Serverstandort Deutschland/EU) oder On-Premise im eigenen Rechenzentrum
IntegrationREST-API, Anbindung an PIM-, MDM- und ERP-Systeme sowie zentrale Werkstoff- und Normdatenbanken; Batch-Import ganzer Dokumentenbestände
ValidierungAutomatische Plausibilitätsprüfung gegen Geschäftslogik und Spezifikationen; manuelle Korrektur über Verification Feature, natürlichsprachliche Konfiguration
InformationssicherheitISO 27001-zertifiziert
DatenschutzDSGVO-konform, Datenverarbeitung ausschließlich im europäischen Rechtsraum oder autark im unternehmenseigenen Rechenzentrum
RolloutModulare Pipeline, individuell konfigurierbar innerhalb weniger Wochen

Sie haben einen konkreten Dokumentenbestand im Kopf, während Sie das lesen? Nehmen Sie jetzt Kontakt zu uns auf und erhalten Sie eine unverbindliche Ersteinschätzung.

Fazit

Technische Datenblätter sind nur ein Beispiel. Dieselben Muster kehren überall dort wieder, wo Unternehmen auf Hunderten oder Tausenden nicht maschinenlesbarer PDFs sitzen — Abnahmeprüfzertifikate, Sicherheitsdatenblätter, Laborberichte, Konformitätsbescheinigungen. In all diesen Fällen liegt der geschäftliche Hebel nicht in der Extraktion selbst, sondern in dem, was danach möglich wird: Produktselektoren, die tatsächlich funktionieren, Vergleiche über Lieferanten hinweg, Risikobewertungen auf Knopfdruck und Beschaffungsentscheidungen auf Basis vollständiger Daten statt Bauchgefühl.

Drei Einblicke lassen sich verallgemeinern: Das Schema vom Endnutzer her denken, nicht vom Dokument — was der Kunde filtert, bestimmt die Felder. Lesen, Normalisieren und Validieren konsequent trennen, statt alles in einem Schritt zu erzwingen. Und nicht nur die Extraktion automatisieren, sondern auch die Qualitätssicherung — die größten Verbesserungen entstehen durch Feedback-Schleifen, die eigenständig bessere Ergebnisse produzieren.

Dabei gilt: Jede Pipeline hat Dokumente, die sich nicht zuverlässig verarbeiten lassen. Diese Fälle gehören in die Genauigkeitsbilanz, nicht unter den Teppich. Und Vollständigkeit zählt mindestens so sehr wie Präzision — denn in einer filtergesteuerten Anwendung lässt ein fehlendes Feld das Produkt verschwinden.

Fanden Sie die Seite hilfreich?

Vielen Dank für Ihr Feedback!

Würden Sie mir Feedback geben? (anonym)

Wir entwickeln KI-Software für Unternehmen und verzichten bewusst auf störende Werbebanner. Durch unsere Artikel dokumentieren wir Themen, die uns beschäftigen, interessieren und auch unser tägliches Brot finanzieren.

Da unsere Inhalte kostenfrei sind, ist Ihr Feedback unser Lob.

Jeder Autor liest Ihr anonymes Feedback persönlich, obwohl KI es automatisieren könnten, und integriert konstruktive Vorschläge direkt in die nächste Überarbeitung oder nutzt es als Inspiration für den nächsten Artikel.



    • Tim Filzinger
      (Autor)

      Redakteur und Kommunikationsberater. Spezialisiert auf Unternehmenstechnologie und Künstliche Intelligenz.

    de_DEDE