Inicio / Blog / Información sobre el producto / Hot AI - Inferencia acelerada mediante contenedor Konfuzio

Hot AI - Inferencia acelerada mediante contenedor Konfuzio

Resumir con ChatGPT

La creciente relevancia de la inteligencia artificial (IA) y el aprendizaje automático (AM) está aumentando la presión para optimizar aún más la eficiencia de los modelos de IA, sobre todo en lo que respecta a la inferencia. La inferencia -el tiempo que necesita un modelo para hacer una predicción o emprender una acción- se está convirtiendo en el centro de atención, ya que influye significativamente en el rendimiento y el tiempo de reacción de un sistema. La IA en caliente ofrece la oportunidad de reducir significativamente los tiempos de reacción de los modelos de IA, aumentando así la eficacia de los procesos de inferencia.

En esta entrada de blog, utilizamos datos reales de un caso de uso real para ilustrar el ahorro que supone Hot AI y cómo Konfuzio ha implantado con éxito esta tecnología.

¿Qué es la IA de contenedores y cómo funciona?

La IA de contenedores es un enfoque basado en Contenedores para proporcionar inteligencia artificial de forma eficiente. El entorno completo que requiere una aplicación de IA se empaqueta de forma compacta en un contenedor. Técnicamente hablando Contenedor AI Así pues, los contenedores contienen los componentes necesarios de una aplicación de IA y se ejecutan en entornos denominados "ligeros". Un contenedor de IA en Konfuzio funciona, por tanto, como un espacio de trabajo virtual para una IA.

Modelos de IA de Konfuzio: antes y ahora

Antes, los modelos de IA Konfuzio se recargaban con cada documento y no funcionaban de forma aislada, lo que resultaba lento en una comparación directa (véase la comparación más abajo en el artículo). Ahora, con Container AI, hay tres modos de funcionamiento para que los modelos de IA sean más flexibles y rápidos de utilizar, en función de las necesidades:

  • IA a la carta - La IA tarda unos segundos en cargar el primer documento y se apaga automáticamente tras 10 minutos de inactividad.
  • IA caliente - El contenedor está "siempre activo", lo que elimina el tiempo de carga.
  • Autoescalado AI - Aquí se utiliza IA en caliente con una función de autoescalado. El contenedor está "siempre activo" y escalable, que elimina el tiempo de carga y sigue el ritmo del aumento de los volúmenes de datos.

Los tres modos de funcionamiento ofrecen distintas ventajas, en función de los requisitos de cada empresa. Para más información, pulse aquí. El siguiente caso de uso se centra en Hot AI.

¿Qué es la IA caliente y cómo funciona?

La IA en caliente significa que estos espacios de trabajo virtuales (contenedores) permanecen siempre encendidos y listos para su uso inmediato (modo siempre en línea). Esto garantiza que la IA se inicie inmediatamente sin perder tiempo en la puesta en marcha. Esto elimina el tiempo de espera.

Ventajas de la IA en caliente

La IA en caliente no sólo acorta los tiempos de inferencia. Otras ventajas son

  • Seguridad - Cada contenedor es un espacio de trabajo autónomo que funciona en estricto aislamiento de otros contenedores y sistemas. Un posible error o ataque dentro de un contenedor no afecta ni a otros procesos ni al sistema en general. Sus datos permanecen en un entorno virtual completamente protegido.
  • Velocidad - Con la nueva Hot AI, se han eliminado casi por completo todos los tiempos de carga, lo que permite a Konfuzio aumentar significativamente el rendimiento de los servicios de AI. Esto se traduce en un procesamiento más rápido de los documentos y una experiencia de usuario mejorada.
  • Escalabilidad - Con una "función de autoescalado" opcional, Hot AI garantiza que los modelos Konfuzio AI no sólo sean portátiles, sino que también tengan una gran capacidad de respuesta en escenarios en tiempo real. En caso de aumento repentino de la demanda, también se pueden poner en marcha inmediatamente contenedores adicionales sin tener que soportar los mayores retrasos que se producen cuando la aplicación se recarga por completo por primera vez.
  • Ahorro de costes - El menor tiempo de carga y el uso más eficiente de los recursos informáticos reducen de forma sostenible los costes de explotación. Como el modelo de IA requiere menos tiempo de computación, se reducen los costes por tarea realizada.

Caso práctico - Konfuzio Hot AI en uso

Un caso típico en el que estas ventajas se hicieron patentes procede de un cliente de la Helm & Nagel GmbHla empresa que está detrás de Konfuzio.

Situación inicial

El cliente lleva utilizando IA para procesar documentos de cumplimiento desde 2022. Estos documentos son críticos en cuanto al tiempo, ya que son esenciales para cumplir los requisitos de conformidad. Cada día se cargan entre 10 y 100 documentos en la plataforma Konfuzio, lo que supone más de 12 000 documentos procesados desde el inicio de la colaboración. 

Desafío

Aunque el cliente estaba satisfecho con la plataforma Konfuzio, se quejaba de los tiempos de tramitación irregulares y a veces largos. Como los documentos se colocaban en una cola general, esto impedía un procesamiento inmediato. En concreto, el arranque y la carga del modelo de IA provocaban retrasos, ya que el modelo tenía que cargarse por completo antes de estar listo para procesar los documentos. Estos tiempos de procesamiento de hasta 25 segundos no se ajustaban a los requisitos del cliente, que necesitaba un proceso de procesamiento rápido y eficaz.

El procesamiento rápido de los documentos de conformidad es clave para cumplir los requisitos de conformidad críticos. Los retrasos podrían interrumpir la producción y las cadenas de suministro y causar graves trastornos. Por tanto, el procesamiento de documentos debe estar disponible en tiempo real para garantizar la fluidez de los procesos y evitar sanciones.

Destino

El objetivo era reducir drásticamente los tiempos de carga mediante el uso de IA en caliente. Los modelos de IA debían estar disponibles de inmediato en "modo siempre en línea" para que los documentos pudieran procesarse inmediatamente después de cargarse sin tener que esperar en cola a que se cargara el modelo de IA.

Solución y realización

Los expertos de Konfuzio implementaron tres contenedores paralelos para mantener el modelo de IA permanentemente cargado. De este modo, los documentos podían procesarse inmediatamente después de cargarse sin perder tiempo en cargar el modelo. De este modo, el tiempo de carga se redujo prácticamente a cero. Esta solución tecnológica también permitió procesar varios documentos en paralelo, lo que aumentó la eficacia de todo el proceso.

Resultado

Con Hot AI, los tiempos de carga se eliminan por completo, por lo que el modelo de AI está disponible de inmediato y se inicia entre 40 y 70 veces más rápido. Además, Konfuzio procesa páginas individuales tres veces más rápido y documentos enteros cuatro veces más rápido que antes.

Comparación: ahorro de tiempo de inferencia

En este caso de uso, el tiempo de carga del modelo de IA con Hot AI se redujo de 8 a 25 segundos a 0,099 a 0,506 segundos, siendo 0,099 segundos el valor óptimo. Esto redujo el tiempo total de procesamiento de un documento de 1 a 8 segundos, lo que se tradujo en flujos de trabajo significativamente más rápidos y una mayor satisfacción del cliente. En comparación directa:

Antes de

Distribución del tiempo de carga (segundos)Distribución del tiempo total (segundos)
PercentilTiempoPercentil.Tiempo
P16,721P18,829
P59,651P511,340 
P1010,315 P1012,169
P2511,426P2513,666 
P5012,792P5015,258 
P7514,590P7517,315
P9016,465P9019,591 
P9517,203P9521,047
P9919,460P9925,843
Los valores se basan en 684 documentos cargados durante un periodo de 62 días.

En

Distribución del tiempo de carga (segundos)Distribución del tiempo total (segundos)
PercentilTiempoPercentilTiempoMejora
P10,099 P11,78779,8 %
P50,108 P52,02182,2 %
P100,125P102,13182,5 %
P250,173 P252,41182,4 %
P500,202P502,74382,0 %
P750,240P753,38280,5 %
P900,333P904,29178,1 %
P950,404P955,14675,6 %
P990,506 P998,07768,7 %
Los valores se basan en 564 documentos cargados del mismo proyecto durante un periodo de 4 días, que son similares en tamaño y alcance a los documentos de la tabla anterior.

Las tablas ilustran la mejora con Hot AI utilizando percentiles que muestran los tiempos de procesamiento con mayor precisión. Antes de la optimización, el 99 % de los documentos tardaba hasta 25 segundos, mientras que el 1 % más rápido tardaba sólo 8 segundos. Tras la introducción de la nueva función, el 99 % de los documentos se procesa en 8 segundos o menos. Estos cambios demuestran el aumento significativo del rendimiento y la eficacia de la solución.

Conclusión

Como ilustra el caso de uso, cambiar a Hot AI puede aumentar drásticamente la velocidad de los procesos de inferencia. Las empresas que procesan grandes cantidades de datos en tiempo real se benefician directamente de la reducción de los tiempos de espera y de la agilización de los flujos de trabajo. Si las empresas tienen otros requisitos para los modelos de IA, existen otros modos de funcionamiento además de la IA en caliente: una función adicional de autoescalado puede permitir la escalabilidad de los sistemas, o una función bajo demanda puede conservar los recursos a largo plazo.

Tomar ahora Contacto y nuestros expertos le asesorarán detalladamente sobre qué contenedor AI se adapta mejor a sus necesidades. Asegúrese ventajas competitivas decisivas.

¿Le ha resultado útil esta página?

Gracias por sus comentarios.

¿Podría darme su opinión? (anónimo)

Desarrollamos software de inteligencia artificial para empresas y evitamos deliberadamente los molestos banners publicitarios. A través de nuestros artículos, documentamos temas que nos ocupan e interesan y también financian nuestro pan de cada día.

Como nuestro contenido es gratuito, sus comentarios son nuestro elogio.

Cada autor lee personalmente tus comentarios anónimos, aunque la IA podría automatizarlos, e integra las sugerencias constructivas directamente en la siguiente revisión o las utiliza como inspiración para el siguiente artículo.



    </artículo
    es_ESES