Lancement / Blog / Méthodes / Comment l'extraction de documents fonctionne-t-elle correctement avec les LLM ?

Comment l'extraction de documents fonctionne-t-elle correctement avec les LLM ?

Résumer avec ChatGPT

L'intelligence artificielle et les Large Language Models (LLMs) sont sur toutes les lèvres. Mais lorsqu'il s'agit d'appliquer réellement ces technologies au traitement des documents ou à la gestion de la documentation, il est difficile de faire autrement. Extraction de documents on s'aperçoit rapidement qu'il y a un monde entre les promesses marketing et la réalité pratique. Un aperçu du développeur montre comment Konfuzio IDP résout un problème fondamental qui fait échouer de nombreux autres systèmes. C'est un sujet sur lequel je me penche depuis longtemps. Vous trouverez ici mon article sur le sujet, qui semble historique après presque deux ans : Extraction de données à partir de documents PDF.

Le problème : si „1,00 €“ n'est pas égal à „1,00 €“.

Imaginez une situation typique : Une facture énumère différents postes :

Rechte an Patenten ........................ 1,00 €
Markenrechte .............................. 1,00 €

Votre mission : la L'IA doit affecter correctement les deux montants aux postes respectifs. C'est bien sûr plus facile avec des valeurs uniques, comme dans l'image ci-dessous.

Cela semble simple - mais ça ne l'est pas.

De nombreuses solutions d'IA fonctionnent aujourd'hui de cette manière : Le LLM lit le document et dit „Pour les droits sur les brevets, j'ai trouvé 1,00 €“. Jusque-là, tout va bien. Mais voilà le problème : le système doit retrouver cette valeur dans le document original afin de l'y marquer ou de la traiter ultérieurement.

Et c'est là que les choses se compliquent : Le document mentionne deux fois „1,00 €“. Lequel est visé ? Le premier ? Le deuxième ?

Pour un calcul avec deux valeurs identiques, c'est déjà difficile. Mais imaginez :

Soudain, une simple tâche se transforme en jeu de hasard. L'IA ne peut pas dire de manière fiable : „Ce montant spécifique appartient à ce poste spécifique“.“

Il en résulte souvent les problèmes suivants

  • LLM Hallucination Extraction de documents
  • LLM invente des données à partir de documents
  • L'IA extrait des valeurs erronées d'un PDF
  • L'IA documentaire fait des erreurs sur des valeurs identiques
  • LLM ne peut pas distinguer des montants identiques
  • Extraction de texte LLM imprécise
  • Attribuer correctement les valeurs OCR Problème
  • Affectation automatique de montants multiples à une facture
  • L'IA confond les valeurs dans les documents
  • Traitement des documents LLM peu fiable

La solution classique ne fonctionne pas

De nombreux fournisseurs tentent de résoudre le problème par des astuces :

  • „Nous prenons simplement la première occurrence de 1,00 €“. → Conduit à des erreurs
  • „Nous regardons le contexte“ → Ne fonctionne pas de manière fiable pour les documents complexes
  • „Nous utilisons des valeurs approximatives“ → Pour les documents longs, c'est le chaos

Le problème de base demeure : Une fois que l'IA a extrait une valeur, il n'est plus possible de l'associer clairement à sa position initiale dans le document.

Notre solution : l'IA sait où elle cherche.

Le site Intégration LLM de Konfuzio IDP fonctionne de manière fondamentalement différente : Le LLM ne renvoie pas seulement CE QU'il a trouvé, mais aussi OÙ il l'a trouvé exactement.

Voici comment cela se passe dans la pratique

Étape 1 : Le document est préparé

Lorsqu'un document est modifié par la Reconnaissance de texte OCR est en cours, chaque mot reconnu se voit déjà attribuer sa position dans le document. Cela ressemble à quelque chose comme ça :

Wort "Rechte" steht bei Position x=50, y=100
Wort "an" steht bei Position x=75, y=100
Wort "Patenten" steht bei Position x=95, y=100
Wort "1,00" steht bei Position x=125, y=100
Wort "€" steht bei Position x=130, y=100
Wort "Markenrechte" steht bei Position x=50, y=125
Wort "1,00" steht bei Position x=125, y=125
Wort "€" steht bei Position x=130, y=125

Étape 2 : Le LLM reçoit ces informations

Le LLM ne voit pas simplement „Droits sur les brevets 1,00 €“, mais reçoit également la position de chaque mot.

Étape 3 : Le LLM répond à la position MIT

Au lieu de dire simplement „Droits sur les brevets : 1,00 €“, le LLM rend la pareille :

Feld "Rechte an Patenten": 
- Wert: 1,00 €
- Position: x=125/y=100 und x=130/y=100
Feld "Markenrechte":
- Wert: 1,00 €  
- Position: x=125/y=125 und x=130/y=125

Qu'est-ce que cela apporte dans la pratique ?

1. les valeurs identiques ne sont plus un problème

Que „1,00 €“ soit écrit une ou cent fois dans le document, le système sait toujours exactement quelle valeur correspond à quel champ. C'est particulièrement important pour

2. pas de valeurs inventées

Un problème fréquent avec les LLM : ils „hallucinent“ parfois - c'est-à-dire qu'ils inventent des données qui ne figurent pas dans le document. Avec l'approche de Konfuzio, c'est impossible. L'IA DOIT indiquer une position qui provient de la Reconnaissance OCR provient.

Oui, des erreurs sont possibles - l'IA pourrait attribuer la mauvaise valeur au mauvais champ. Mais elle ne peut pas inventer des montants ou des données qui ne figurent pas dans le document original.

Pour les secteurs réglementés comme les banques ou Assurances c'est crucial.

3. vous voyez toujours d'où vient une valeur

Dans la Validation de documents UI vos collaborateurs peuvent voir exactement : „Cette valeur extraite provient de cet endroit précis du document“.“

Cela facilite le contrôle de la qualité :

  • La valeur est-elle correctement attribuée ? → Un coup d'œil suffit
  • Y a-t-il une erreur ? → On voit tout de suite où se situe
  • Faut-il corriger quelque chose ? → Le bon endroit est surligné

4. traçabilité pour la conformité

Dans la Audit, dans le secteur public ou auprès de Fournisseurs de services financiers vous devez souvent démontrer : „D'où vient cette information ?“

Avec l'approche basée sur les coordonnées IDP, vous pouvez suivre chaque valeur extraite jusqu'au pixel exact dans le document original. Cela crée IA transparente et compréhensible.

Le prix à payer : plus de complexité pour l'IA

Bien sûr, cette approche n'est pas sans défis. Pour le LLM, c'est nettement plus difficile :

  • Il ne doit pas seulement comprendre CE QUI doit être extrait
  • Il doit aussi indiquer les bonnes coordonnées
  • Il doit traiter plusieurs niveaux d'information en même temps

Conséquence : des erreurs peuvent survenir dans des documents très complexes - par exemple des coordonnées mal indiquées ou des confusions.

Mais Il vaut mieux un système qui trouve la bonne valeur au bon endroit dans 95% des cas qu'un système qui se contente de cracher une valeur à 98% - mais personne ne sait laquelle, et ce, pour la Automatisation des processus critiques conduit à des erreurs coûteuses.

Pourquoi c'est important pour votre entreprise

À une époque où tous les fournisseurs promettent un „traitement de documents basé sur l'IA“, il vaut la peine de jeter un coup d'œil en coulisses. De nombreuses solutions fonctionnent bien dans le cadre de démonstrations avec de simples exemples de documents. Mais lorsqu'il s'agit de documents d'entreprise réels et complexes, les différences apparaissent.

L'approche de Konfuzio est une réponse directe aux défis rencontrés dans l'utilisation pratique des LLM :

  • Ne pas simplement lâcher ChatGPT sur les documents
  • Mais un travail structuré, basé sur la coordination et compréhensible.
  • IA appliquée au lieu de AI-Washing

Ceci est particulièrement pertinent si vous :

  • Traiter de nombreux documents avec des valeurs récurrentes
  • Exigences élevées pour Traitement de l'obscurité (c'est-à-dire que les documents doivent être traités sans contrôle manuel)
  • doivent garantir la conformité et la traçabilité
  • Votre Automatiser réellement les processus veulent - pas seulement numériser

Conclusion : de l'ingénierie plutôt que des promesses marketing

Notre approche basée sur les coordinations le montre : Les bonnes solutions d'IA ne sont pas créées en prenant simplement le dernier LLM et en espérant qu'il fonctionne. Elles sont le fruit de décisions architecturales réfléchies qui résolvent des problèmes réels.

Oui, c'est plus complexe. Oui, cela demande plus de travail d'ingénierie. Mais c'est précisément ce qui fait la différence entre une démo qui impressionne et un système qui fonctionne de manière fiable dans l'utilisation quotidienne.


Intéressé(e) par les détails techniques ? Contactez-nous pour un échange au niveau technique.

Avez-vous trouvé cette page utile ?

Merci beaucoup pour vos commentaires !

Voulez-vous me donner un feedback ? (anonyme)

Nous développons des logiciels d'intelligence artificielle pour les entreprises et renonçons délibérément aux bannières publicitaires gênantes. Par le biais de nos articles, nous documentons des thèmes qui nous préoccupent, nous intéressent et financent également notre pain quotidien.

Comme nos contenus sont gratuits, vos commentaires sont nos félicitations.

Chaque auteur lit personnellement vos commentaires anonymes, même si les IA pourraient les automatiser, et intègre directement les suggestions constructives dans la prochaine révision ou les utilise comme source d'inspiration pour le prochain article.



    • Florian Zyprian
      (auteur)

      En tant que CTO chez Helm & Nagel GmbH, l'entreprise derrière la marque Konfuzio.

    fr_FRFR