In diesem Blogbeitrag werden wir einen Evaluationsrahmen für Document AI vorstellen, der auf drei verschiedenen Ebenen durchgeführt wird: NER-Ebene (Named Entity Recognition), Konzeptebene und Dokumentenebene. Wir werden diesen Evaluationsrahmen anhand eines Anwendungsbeispiels – den Finanz-KIDs (Key Information Documents) – veranschaulichen, die verschiedene Konzepte wie Emittenten und Vermögenswerte enthalten.
Evaluierung auf NER-Ebene
Bei der Evaluierung von NER-Modellen liegt der Fokus auf der Genauigkeit der Erkennung einzelner benannter Entitäten wie Personen, Orte oder Organisationen. Für unser Beispiel der Finanz-KIDs könnten benannte Entitäten wie Emittentennamen, Standorte oder Produktnamen relevant sein.

- Genauigkeit: Die Genauigkeit gibt an, wie viele der erkannten benannten Entitäten tatsächlich korrekt sind. Ein hoher Genauigkeitswert deutet darauf hin, dass die meisten erkannten Entitäten korrekt sind.
- Falsch-Positiv-Rate: Die Falsch-Positiv-Rate zeigt, wie viele der erkannten Entitäten fälschlicherweise als korrekt identifiziert wurden. Ein niedriger Wert ist wünschenswert, da falsch positive Ergebnisse vermieden werden sollten.
- Falsch-Negativ-Rate: Die Falsch-Negativ-Rate gibt an, wie viele tatsächlich vorhandene Entitäten nicht erkannt wurden. Eine niedrige Falsch-Negativ-Rate deutet darauf hin, dass die meisten relevanten Entitäten erkannt wurden.
Evaluierung auf Konzeptebene
Auf der Konzeptebene werden verschiedene benannte Entitäten zu einem Konzept zusammengefasst, z. B. ein Emittent mit Vorname, Nachname, Geburtsdatum, Straße, Hausnummer und Postleitzahl. In unserem Beispiel könnten Konzepte wie Emittentendaten oder Vermögenswertdetails relevant sein.
- Genauigkeit: Die Genauigkeit zeigt, wie viele der erkannten Konzepte korrekt sind, einschließlich aller zugehörigen Entitäten. Ein hoher Genauigkeitswert bedeutet, dass die meisten erkannten Konzepte korrekt sind.
- Falsch-Positiv-Rate: Die Falsch-Positiv-Rate gibt an, wie viele der erkannten Konzepte fälschlicherweise als korrekt identifiziert wurden. Ein niedriger Wert deutet darauf hin, dass falsch positive Ergebnisse minimiert wurden.
- Falsch-Negativ-Rate: Die Falsch-Negativ-Rate zeigt, wie viele der tatsächlich vorhandenen Konzepte nicht erkannt wurden. Eine niedrige Falsch-Negativ-Rate deutet darauf hin, dass die meisten relevanten Konzepte erkannt wurden.
Evaluierung auf Dokumentenebene
Auf der Dokumentenebene müssen alle Konzepte mit allen korrekten Entitäten gefunden werden. Wenn der Score 100 % beträgt, können alle Dokumente vollständig automatisch verarbeitet werden.
- Genauigkeit: Die Genauigkeit gibt an, wie viele Dokumente korrekt verarbeitet wurden und alle relevanten Konzepte und Entitäten erkannt wurden. Ein hoher Genauigkeitswert bedeutet, dass die meisten Dokumente korrekt verarbeitet wurden.
- Falsch-Positiv-Rate: Die Falsch-Positiv-Rate zeigt, wie viele Dokumente fälschlicherweise als korrekt verarbeitet identifiziert wurden. Ein niedriger Wert ist wünschenswert, da falsch positive Ergebnisse vermieden werden sollten.
- Falsch-Negativ-Rate: Die Falsch-Negativ-Rate gibt an, wie viele Dokumente nicht korrekt verarbeitet wurden und relevante Konzepte oder Entitäten nicht erkannt wurden. Eine niedrige Falsch-Negativ-Rate deutet darauf hin, dass die meisten relevanten Informationen erfolgreich erfasst wurden.
Durch die Anwendung dieses Evaluationsrahmens auf verschiedene Ebenen können wir die Leistung von Document AI umfassend bewerten und sicherstellen, dass alle relevanten Informationen korrekt erfasst werden. Dies ist entscheidend für die Automatisierung von Dokumentenverarbeitungsprozessen und die Gewährleistung ihrer Genauigkeit und Effizienz.
