Lancement / Blog / Python / FUNSD+ | Un jeu de données FUNSD plus grand et révisé

FUNSD+ | Un jeu de données FUNSD plus grand et révisé

Résumer avec ChatGPT

Lors de la création du jeu de données FUNSD+, nous avons cherché à élargir le FUNSD.

En outre, nous voulions configurer l'outil d'étiquetage de manière à ce que le jeu de données FUNSD+ puisse être copié, c'est-à-dire "forké" d'une certaine manière, afin que d'autres chercheurs puissent inspecter, éditer ou étendre le jeu de données FUNSD+. Annotations visuellement ou via le code, voir Exemple de document en direct.

FUNSD = Form Understanding in Noisy Scanned Documents (compréhension des formes dans les documents numérisés bruyants)

Téléchargement via Hugging Face : konfuzio/funsd_plus - Jeux de données à Hugging Face

Exemple de document en direct

JSON

Exemple de formatage JSON : Visite https://git.konfuzio.com/-/snippets/33

Document UI

Visitez https://app.konfuzio.com/d/303962/

Jeu de données FUNSD en arrière-plan

Nous valorisons fortement le FUNSD dataset by Jaume et al. (2019) for form understanding in noisy scanned documents. Guillaume Jaume publié le dataset sur sa page d'accueil. Elle est autorisée à être utilisée à des fins non commerciales, de recherche et d'éducation, voir licence. Le dataset FUNSD est un sous-ensemble de documents publiés sous le nom de RVL-CDIP. RVL-CPID a été introduit par Harley et al. (2015).

Pour construire la base de données FUNSD, nous avons vérifié manuellement les 25 000 images de la catégorie des formulaires. Nous avons éliminé les formulaires illisibles et les formulaires similaires, ce qui nous a permis d'obtenir 3 200 documents éligibles, dont 199 ont été choisis au hasard pour être annotés..

Jaume et al. (2019)

Vous trouverez ici d'autres jeux de données connexes : Papiers avec code

FUNSD contre FUNSD+

Tout en annotant les documents d'une seule page, nous avons intégré les recherches les plus récentes. Vu et al. (2020) reports to have found several inconsistency in labeling, which might impede the FUNSD applicability to the key-value extraction problem.

FUNSD+ donne accès à davantage de documents

Outre l'augmentation de 199 documents à 1113 documents, nous résumons ci-dessous les caractéristiques des deux datasets. Les statistiques de l'ensemble de données FUNSD sont extraites du document de Jaume et al. (2019).

FUNSDFUNSD+ (EN ANGLAIS)
Documents1991113
headers5631604
questions434314695
réponses362312154
questions sans réponses720 (16.6%)2691 (18.3%)
answers without questions*0114 (0.9%)
Tableau 1 : Statistiques FUNSD vs. FUNSD+

* (basically Independent checkboxes in the table above)

FUNSD+ donne accès à davantage de documents

Comme décrit dans le tableau 1, le nombre moyen d'en-têtes, de questions et de réponses par document diffère. Dans le tableau 2, nous résumons les principales différences lors de l'annotation des documents. Ensuite, nous présenterons un certain nombre de documents à l'aide de captures d'écran de l'interface d'annotation.

FUNSDFUNSD+ (EN ANGLAIS)
Réponses manuscritesOui, généralement de bonne qualitéOui si bonne OCR, sinon document exclu
SignaturesInclus même si illisibleOui si bonne OCR, sinon laissé en blanc (nous le déclarons illisible par omission)
Cases à cocherToutes les réponses sont incluses, plus le signe du checkmarkSeule la réponse correcte est liée à la question. Cela permet d'obtenir une paire question-réponse propre, sans autre post-traitement nécessaire.
Cases à cocher indépendantesMarque la marque de contrôle comme la réponse et la réponse textuelle comme une question. Les réponses non cochées sont des questions sans réponse.Seule la réponse cochée est annotée comme une réponse, le reste est étiqueté "Autre" car il ne répond à aucune question.
TablesLie toutes les rangées d'un tableau à la même colonne, il est donc impossible de faire la différence entre plusieurs rangées.Gauche non annoté et étiqueté "Other". Dans une prochaine version, la structure AnnotationSet appropriée aurait des étiquettes "Table column/row header" associées à une seule cellule avec l'étiquette "Table Cell Answer".
En-têtesFullPas de brackets, considérés comme des commentaires sur les en-têtes
Colons flottantsYesNo
Texte/commentaires non pertinents inclus dans les réponses/questionsOui, entièrement annotéNon, uniquement des informations propres issues de Question-Answers pairs
Edge cases / cas ambigusParfois beaucoup d'éléments interconnectés, avec une structure qu'il n'est pas possible de comprendreDocument exclu de l'ensemble de données

FUNSD vs. FUNSD+ exemples visuels

Lignes multiples

FUNSD lie toutes les rangées d'un tableau à la même colonne, il est donc impossible de faire la différence entre plusieurs rangées. Nous n'avons pas annoté les tables pour l'instant. Cependant, nous pourrions étendre le dataset et annoter les tables en utilisant le concept de Sets d'étiquettes.

FUNSD to FUNSD+ side by side comparison

Utilisation des en-têtes

FUNSD lie les en-têtes aux questions de manière incohérente. FUNSD+ essaie de réduire le nombre d'en-têtes et de n'utiliser que des en-têtes annotés qui se rapportent clairement au contenu qui les suit.

FUNSD to FUNSD+ side by side comparison

Annotation de la réponse

FUNSD lie toutes les réponses multiples à une question, même en incluant le symbole du checkmark, ne fournissant ainsi pas d'informations claires sur la bonne réponse.

FUNSD to FUNSD+ side by side comparison

Checkmarks

FUNSD annote le checkmark comme la réponse et la réponse textuelle comme une question (Independent Checkboxes). FUNSD+ annote le texte de la case à cocher sélectionnée.

FUNSD to FUNSD+ side by side comparison

Exclure le texte avec des erreurs d'OCR

FUNSD inclut les signatures illisibles, FUNSD+ n'annote pas le texte qui ne peut pas être reconnu correctement par l'OCR.

FUNSD to FUNSD+ side by side comparison

Réduire le nombre d'annotations

Le FUNSD inclut certains cas limites / ambigus, où parfois de nombreux éléments sont interconnectés, avec une structure qui n'est pas compréhensible. FUNSD+ préfère ne pas annoter les cas ambigus.

FUNSD to FUNSD+ side by side comparison

Accès à l'ensemble de données

Les données peuvent être téléchargées via notre SDK Python ou via Hugging Face.

Si vous souhaitez ajuster vos données, veuillez demander une copie des données et créer un projet dans Konfuzio Server à l'aide de la fonction Snapshot : Konfuzio Guide des instantanés

En plus de cela, notre étiquetage appelé DVUI vous permet de définir facilement des Annotations et structures relationnelles d'entités besides Key Value Pair Labeling comme dans FUNSD.

De cette manière, vous pouvez construire et gérer des ensembles de données individuels.

Comment citer ?

Zagami, D., & Helm, C. (2022, Octobre 18). LE FUNSD+ : Un ensemble de données FUNSD plus grand et révisé. Retrieved November 5, 2022, from https://konfuzio.com/de/en/funsd-plus/

@misc{zagami_helm_2022,
title = {FUNSD+: A larger and revised FUNSD dataset},
author = {Zagami, Davide and Helm, Christopher},
year = 2022,
month = {Oct},
journal = {FUNSD+ | A larger and revised FUNSD dataset},
publisher = {Helm & Nagel GmbH},
url = {https://konfuzio.com/de/funsd-plus/}
}

Références

Harley, A. W., Ufkes, A., & Derpanis, K. G. (2015, août). Évaluation des réseaux convolutionnels profonds pour la classification et la récupération d'images de documents. In 2015 13th International Conference on Document Analysis and Recognition (ICDAR) (pp. 991-995). IEEE. Lien vers le PDF.

Jaume, G., Ekenel, H. K., & Thiran, J.-P. (2019). FUNSD : Un ensemble de données pour la compréhension des formes dans les documents numérisés bruyants. CoRRabs/1905.13538.

Vu, Hieu & Nguyen, Diep. (2020). Revising FUNSD dataset for key-value detection in document images.

Avez-vous trouvé cette page utile ?

Merci beaucoup pour vos commentaires !

Voulez-vous me donner un feedback ? (anonyme)

Nous développons des logiciels d'intelligence artificielle pour les entreprises et renonçons délibérément aux bannières publicitaires gênantes. Par le biais de nos articles, nous documentons des thèmes qui nous préoccupent, nous intéressent et financent également notre pain quotidien.

Comme nos contenus sont gratuits, vos commentaires sont nos félicitations.

Chaque auteur lit personnellement vos commentaires anonymes, même si les IA pourraient les automatiser, et intègre directement les suggestions constructives dans la prochaine révision ou les utilise comme source d'inspiration pour le prochain article.



    • Florian Zyprian
      (auteur)

      En tant que CTO chez Helm & Nagel GmbH, l'entreprise derrière la marque Konfuzio.

    fr_FRFR