Inicio / Blog / Socio / deepdoctection - Un marco de código abierto para la IA de documentos

deepdoctection - Un marco de código abierto para la IA de documentos

Resumir con ChatGPT

Deepdoctection es una biblioteca de Python que orquesta las tareas de extracción de documentos y análisis de disposición de documentos utilizando modelos de aprendizaje profundo.

Deepdoctection se centra en las aplicaciones y está hecho para quienes desean programar soluciones reales a problemas relacionados con la extracción de documentos de PDF o escaneados en diversos formatos de imagen.

Sitios web frente a documentos y digitalizaciones como soportes de información

Supongamos que desea analizar las reseñas de un sitio web. Con un poco de experiencia en programación, puedes crear estudios exhaustivos como análisis de sentimiento en poco tiempo.

Supongamos ahora que desea analizar de nuevo las opiniones de los clientes. Esta vez, sin embargo, la información está disponible en formularios escaneados. Tal vez no todos los formularios sean idénticos y algunos se hayan rellenado a mano. En este caso, tendrá que dedicar bastante más tiempo a alcanzar sus objetivos.

Pero, ¿cuál es la gran diferencia?

Si desea obtener su información de sitios web, debe obtener y procesar sus datos mediante rastreo web, de modo que de la representación HTML en bruto sólo quede la información que necesita para su análisis. Hasta aquí basta con un enfoque basado en reglas.

Pero ahora pasemos a las formas: Tal vez ya disponga de un documento digitalizado, pero este documento almacena su contenido en forma de píxeles, es decir, en miles y miles de números entre 0 y 255. Motor OCR sobre ella y obtendrás una combinación de palabras y coordenadas.

Ahora empieza el verdadero trabajo, porque aún tienes que dar estructura al formulario. Por ejemplo: ¿Cómo reconozco las entidades del formulario? ¿Qué bloques de palabras van juntos? ¿Qué estructuras hay, como tablas o párrafos?

Para abordar este tipo de problemas, se necesita un fondo de herramientas. Por un lado, la inteligencia artificial puede ser de ayuda, pero, por otro, hay que orquestarla para que sea eficaz como un todo.

deepdoctection - Pipelines para la IA de documentos

deepdoctection es un framework de código abierto basado en Python que te ayuda a extraer información de documentos. Puede encontrar el Código fuente en Github.

deepdoctection

Uso de imagen y texto

A diferencia de los marcos habituales de Procesamiento del Lenguaje Natural, la deepdoctection ofrece la posibilidad de crear pipelines en los que se pueden utilizar modelos multimodales que lean información de imágenes además de texto. Esto incluye Información sobre la posición de palabras y segmentos de texto o toda la imagen. De hecho, se ha demostrado que, especialmente en el caso de los documentos del mundo empresarial cotidiano (formularios, informes, presentaciones), los modelos de IA que tienen en cuenta la información visual funcionan mejor para la extracción. Esto incluye la Familia LayoutLMun grupo de modelos desarrollados por Microsoft.

Con la detección profunda, puede utilizar estos modelos junto con el OCR para la clasificación de documentos o la Extracción de entidades pruébalo.

YouTube

Al cargar el vídeo, aceptas la política de privacidad de YouTube.
Más información

Cargar vídeo

Análisis del diseño y extracción de tablas

Además, la deepdoctection ofrece la posibilidad, Modelos para el análisis de la presentación de documentos a utilizar. Son muy útiles para estructurar el documento en áreas específicas, como tablas, figuras o elementos de lista.

Las tablas también pueden reconstruirse y extraerse como un archivo csv o incluso como una estructura HTML. Puede utilizar Deepdoctection simplemente haz la prueba en línea.

Live Demo

OCR

OCR es una tecnología clave para el tratamiento inteligente de documentos y permite principalmente extraer texto de formatos ópticos como PDF. Para ello, deepdoctection ofrece la posibilidad de utilizar varios marcos de trabajo de OCR. Entre ellos se encuentra el marco de código abierto más conocido Tesseractsino también el más moderno DocTr, que ofrece resultados más precisos para muchos casos de uso.

Formación y evaluación de modelos

Ningún modelo sirve para todos los casos. Pero la precisión puede mejorarse significativamente entrenando los modelos con sus propios datos. Deepdoctection ofrece scripts de entrenamiento preconfigurados para varios modelos básicos, por lo que no tendrá que buscar una configuración adecuada. Antes de poder utilizar un modelo de forma productiva, es necesario evaluarlo para ver si los resultados de predicción son lo suficientemente precisos en datos no vistos.

Para ello, deepdoctection ofrece métricas y herramientas de evaluación que puede utilizar para evaluar exhaustivamente la capacidad predictiva de su modelo. Además, deepdoctection ofrece la opción de crear y registrar sus propios conjuntos de datos. Esto facilita el entrenamiento de modelos básicos y también ofrece la opción de combinar varios conjuntos de datos.

Modelos base de código abierto

En general, con la ayuda de deepdoctection se pueden utilizar varios modelos base de diferentes bibliotecas de código abierto de alta calidad. La ejecución de varios modelos de IA en una sola llamada es el punto fuerte del marco. Esta es actualmente una de las necesidades más importantes de las empresas. Teniendo esto en cuenta, también tiene sentido echar un vistazo a algunos modelos de IA de código abierto. He aquí una selección de los distintos ámbitos de aplicación del tratamiento de documentos.

Visión

DiT - Document Image Transformer es un modelo preentrenado y autocontrolado que trabaja con grandes imágenes de texto sin etiquetas. 

BEiT - Este Transformador de Visión se basa en el modelo de lenguaje BERT de Google y ha sido capaz de superar por primera vez a los modelos entrenados bajo supervisión gracias al preentrenamiento autocontrolado.

Idioma

Donut - OCR-free Document Understanding Transformer consigue resultados impresionantes en la comprensión de documentos y la extracción de texto, sin necesidad de OCR.

UniLM - Este modelo lingüístico preentrenado de Microsoft puede ajustarse tanto para el procesamiento como para la generación del lenguaje.

Multimodal

LayoutXLM - Este desarrollo multimodal de LayoutLM para el análisis de documentos multilingües tiene en cuenta la información sobre el texto, el diseño y las imágenes, con un rendimiento superior al de los modelos anteriores más avanzados.

DocLLM - Como extensión de los modelos clásicos de gran lenguaje, DocLLM es adecuado para el procesamiento multimodal de la estructura de disposición espacial.

Otras herramientas de tratamiento inteligente de documentos específicas de PDF son, por ejemplo

Requisitos empresariales para la arquitectura de IA

Con estas posibilidades en rápido crecimiento y el número de modelos disponibles para la IA documental, también han aumentado los requisitos técnicos de las grandes organizaciones. En los primeros tiempos de los grandes modelos lingüísticos, al principio parecía previsible que las organizaciones pudieran entrenar continuamente sus propios modelos en función de sus datos y requisitos individuales. Sin embargo, el número de soluciones aplicables y desplegadas ha alcanzado una dimensión en la que este enfoque está perdiendo su rentabilidad. 60% de las organizaciones utilizan diversos modelos, entre ellos Informe de Menlo sobre IA empresarial. Por tanto, la mayor parte de la disposición a pagar no está relacionada con la formación, sino con la inferencia de IA, es decir, con la usabilidad normalizada de varios modelos de IA.

En este punto, la deepdoctection se enfrenta a ciertos retos, a pesar de toda la solidez y flexibilidad que ofrece el marco. A pesar de las transcripciones de formación y evaluación preconfiguradas, el uso de un marco de código abierto no suele ser suficiente para las empresas. Se necesitan recursos adicionales para reducir los costes de desarrollo y garantizar altos niveles de seguridad. La posibilidad de desarrollo interno y la integración de otros modelos son también peticiones frecuentes. Por lo tanto, se aconseja a las empresas que busquen una plataforma segura y flexible para explotar el marco y/o integrar modelos adicionales.

IA empresarial para la detección profunda y otros modelos básicos

deepdoctection puede funcionar con la ayuda de Konfuzio, una plataforma para IA empresarial. Esto permite la rápida realización de casos de uso individuales y la prueba de nuevos modelos en ciclos de iteración cortos. El resultado es Varias ventajas:

  • Uso óptimo de los modelos de IA - deepdoctection también permite orquestar los modelos de IA disponibles, en un entorno de software personalizado. Además, puede utilizarse cualquier otro modelo de código abierto, por ejemplo los enumerados anteriormente, con disponibilidad constante.
  • Menos esfuerzo de desarrollo - El esfuerzo general de desarrollo se reduce significativamente gracias a una interfaz proporcionada, así como a su propia API, SDK y base de datos. 
  • Características del mercado - Además de utilizar los modelos mostrados, hay disponibles numerosos modelos de IA preentrenados, específicos del sector y listos para usar. Aquí puede Realizar pruebas no vinculantes.
  • Gestión de usuarios - En las grandes organizaciones, las políticas de protección de datos y gobernanza pueden ser más complejas. Konfuzio apoya la implantación con un sofisticado sistema de gestión de usuarios que permite asignar autorizaciones de acceso individuales.
  • Seguridad de las empresas - Konfuzio funciona con altos estándares de seguridad en la ubicación del servidor en Alemania. Otra opción muy utilizada es el funcionamiento in situ, de modo que ningún dato sale de los servidores propios de la empresa.

IA de documentos en el SDK de Python de Konfuzio

Konfuzio lo hace posible Cargue su propia IA, Extracción de información individual y mucho más. Para ello existe un kit de desarrollo de software ya preparado.

Así es como se procede si se desea utilizar deepdoctection o varios modelos de IA de documentos a través del SDK de Python - utilizando el ejemplo de una IA de extracción:

  1. La instalación de konfuzio_sdk
!pip install konfuzio-sdk
  1. Los paquetes necesarios pueden importarse de la siguiente manera.
import os
import sys
import konfuzio_sdk
from konfuzio_sdk.data import Project
from konfuzio_sdk.trainer.information_extraction import RFExtractionAI
from konfuzio_sdk.tokenizer.regex import WhitespaceTokenizer
from konfuzio_sdk.api import upload_ai_model
  1. El siguiente paso es inicializar el proyecto
from tests.variables import OFFLINE_PROJECT, TEST_DOCUMENT_ID
project = Project(id_=None, project_folder=OFFLINE_PROJECT)
  1. Determinación de la categoría correspondiente.
category = project.get_category_by_id(63)
  1. Inicialización del proceso de formación. La categoría RFExtraction es intercambiable.
pipeline = RFExtractionAI(use_separate_labels=True)
pipeline.category = category
  1. Para la evaluación posterior, se requiere test_documents como atributo de la canalización. 
pipeline.test_documents = category.test_documents()
  1. Así se consultan los documentos de la categoría especificada:
documents = category.documents()
  1. Aplique la canalización a los documentos.
pipeline.fit(documents)
  1. De este modo, es posible extraer archivos PDF nuevos y archivos cargados.
text = "..."
document = category.create_document(text, filename="test.pdf")
pipeline.process_document(document)
annotations = document.annotations()

Deeptoctection, así como sus propios modelos o los modelos básicos descritos anteriormente, se pueden cargar en Konfuzio utilizando el SDK de Python a través de la función upload_ai_model.

Conclusión

Como marco de código abierto en el campo de la IA de documentos, Deepdoctection muestra un gran potencial para la orquestación de modelos de IA. Permite un procesamiento eficiente de la información mediante la integración de análisis de texto e imágenes, lo que resulta especialmente relevante para el procesamiento de documentos reales como formularios e informes. La combinación de varios modelos de aprendizaje profundo y técnicas de OCR pone de relieve la flexibilidad y adaptabilidad del marco. A pesar de estas amplias posibilidades, deepdoctection también reconoce ciertos límites, sobre todo en lo que respecta a los requisitos empresariales y la garantía de protección y seguridad de los datos.

La cooperación con plataformas como Konfuzio puede resolver estos retos simplificando el desarrollo y acelerando la aplicación de modelos. Además, existen otras muchas opciones para la integración de modelos mediante el SDK de Python con el fin de lograr resultados óptimos incluso en casos de uso muy complejos y personalizados.

¿Le gustaría utilizar deepdoctection, los modelos de IA que se muestran aquí o sus propios modelos de IA en un entorno empresarial seguro? Póngase en contacto con nosotros. Estaremos encantados de ayudarle.









    Elija el paquete adecuado a sus necesidades



    Sobre el autor de deepdoctection

    Janis Meyer

    La Dra. Janis Meyer lleva muchos años trabajando como ingeniera independiente de aprendizaje automático y consultora de gestión.

    El desencadenante a tratar Documento AI temas para él era un proyecto que consistía en extraer cifras clave específicas de informes financieros.

    Ha desarrollado la deepdoctection para crear nuevos modelos de aprendizaje automático en ciclos de iteración cortos para resolver problemas de IA de documentos en Tuberías integrar.

    La Dra. Janis Meyer asesora a clientes finales y operadores de plataformas en la introducción e innovación de temas de automatización inteligente. Esto incluye asesoramiento general, así como supervisión de proyectos, implementación, pruebas y producción.

    ¿Le ha resultado útil esta página?

    Gracias por sus comentarios.

    ¿Podría darme su opinión? (anónimo)

    Desarrollamos software de inteligencia artificial para empresas y evitamos deliberadamente los molestos banners publicitarios. A través de nuestros artículos, documentamos temas que nos ocupan e interesan y también financian nuestro pan de cada día.

    Como nuestro contenido es gratuito, sus comentarios son nuestro elogio.

    Cada autor lee personalmente tus comentarios anónimos, aunque la IA podría automatizarlos, e integra las sugerencias constructivas directamente en la siguiente revisión o las utiliza como inspiración para el siguiente artículo.



      </artículo
      • Florian Zyprian
        (Autor)

        Como Director Técnico de Helm & Nagel GmbH, la empresa que está detrás del Konfuzio.

      es_ESES