La creciente relevancia de la inteligencia artificial (IA) y el aprendizaje automático (AM) está aumentando la presión para optimizar aún más la eficiencia de los modelos de IA, sobre todo en lo que respecta a la inferencia. La inferencia -el tiempo que necesita un modelo para hacer una predicción o emprender una acción- se está convirtiendo en el centro de atención, ya que influye significativamente en el rendimiento y el tiempo de reacción de un sistema. La IA en caliente ofrece la oportunidad de reducir significativamente los tiempos de reacción de los modelos de IA, aumentando así la eficacia de los procesos de inferencia.
En esta entrada de blog, utilizamos datos reales de un caso de uso real para ilustrar el ahorro que supone Hot AI y cómo Konfuzio ha implantado con éxito esta tecnología.
¿Qué es la IA de contenedores y cómo funciona?
La IA de contenedores es un enfoque basado en Contenedores para proporcionar inteligencia artificial de forma eficiente. El entorno completo que requiere una aplicación de IA se empaqueta de forma compacta en un contenedor. Técnicamente hablando Contenedor AI Así pues, los contenedores contienen los componentes necesarios de una aplicación de IA y se ejecutan en entornos denominados "ligeros". Un contenedor de IA en Konfuzio funciona, por tanto, como un espacio de trabajo virtual para una IA.
Modelos de IA de Konfuzio: antes y ahora
Antes, los modelos de IA Konfuzio se recargaban con cada documento y no funcionaban de forma aislada, lo que resultaba lento en una comparación directa (véase la comparación más abajo en el artículo). Ahora, con Container AI, hay tres modos de funcionamiento para que los modelos de IA sean más flexibles y rápidos de utilizar, en función de las necesidades:
- IA a la carta - La IA tarda unos segundos en cargar el primer documento y se apaga automáticamente tras 10 minutos de inactividad.
- IA caliente - El contenedor está "siempre activo", lo que elimina el tiempo de carga.
- Autoescalado AI - Aquí se utiliza IA en caliente con una función de autoescalado. El contenedor está "siempre activo" y escalable, que elimina el tiempo de carga y sigue el ritmo del aumento de los volúmenes de datos.
Los tres modos de funcionamiento ofrecen distintas ventajas, en función de los requisitos de cada empresa. Para más información, pulse aquí. El siguiente caso de uso se centra en Hot AI.
¿Qué es la IA caliente y cómo funciona?
La IA en caliente significa que estos espacios de trabajo virtuales (contenedores) permanecen siempre encendidos y listos para su uso inmediato (modo siempre en línea). Esto garantiza que la IA se inicie inmediatamente sin perder tiempo en la puesta en marcha. Esto elimina el tiempo de espera.
Ventajas de la IA en caliente
La IA en caliente no sólo acorta los tiempos de inferencia. Otras ventajas son
- Seguridad - Cada contenedor es un espacio de trabajo autónomo que funciona en estricto aislamiento de otros contenedores y sistemas. Un posible error o ataque dentro de un contenedor no afecta ni a otros procesos ni al sistema en general. Sus datos permanecen en un entorno virtual completamente protegido.
- Velocidad - Con la nueva Hot AI, se han eliminado casi por completo todos los tiempos de carga, lo que permite a Konfuzio aumentar significativamente el rendimiento de los servicios de AI. Esto se traduce en un procesamiento más rápido de los documentos y una experiencia de usuario mejorada.
- Escalabilidad - Con una "función de autoescalado" opcional, Hot AI garantiza que los modelos Konfuzio AI no sólo sean portátiles, sino que también tengan una gran capacidad de respuesta en escenarios en tiempo real. En caso de aumento repentino de la demanda, también se pueden poner en marcha inmediatamente contenedores adicionales sin tener que soportar los mayores retrasos que se producen cuando la aplicación se recarga por completo por primera vez.
- Ahorro de costes - El menor tiempo de carga y el uso más eficiente de los recursos informáticos reducen de forma sostenible los costes de explotación. Como el modelo de IA requiere menos tiempo de computación, se reducen los costes por tarea realizada.
Caso práctico - Konfuzio Hot AI en uso
Un caso típico en el que estas ventajas se hicieron patentes procede de un cliente de la Helm & Nagel GmbHla empresa que está detrás de Konfuzio.
Situación inicial
El cliente lleva utilizando IA para procesar documentos de cumplimiento desde 2022. Estos documentos son críticos en cuanto al tiempo, ya que son esenciales para cumplir los requisitos de conformidad. Cada día se cargan entre 10 y 100 documentos en la plataforma Konfuzio, lo que supone más de 12 000 documentos procesados desde el inicio de la colaboración.
Desafío
Aunque el cliente estaba satisfecho con la plataforma Konfuzio, se quejaba de los tiempos de tramitación irregulares y a veces largos. Como los documentos se colocaban en una cola general, esto impedía un procesamiento inmediato. En concreto, el arranque y la carga del modelo de IA provocaban retrasos, ya que el modelo tenía que cargarse por completo antes de estar listo para procesar los documentos. Estos tiempos de procesamiento de hasta 25 segundos no se ajustaban a los requisitos del cliente, que necesitaba un proceso de procesamiento rápido y eficaz.
El procesamiento rápido de los documentos de conformidad es clave para cumplir los requisitos de conformidad críticos. Los retrasos podrían interrumpir la producción y las cadenas de suministro y causar graves trastornos. Por tanto, el procesamiento de documentos debe estar disponible en tiempo real para garantizar la fluidez de los procesos y evitar sanciones.
Destino
El objetivo era reducir drásticamente los tiempos de carga mediante el uso de IA en caliente. Los modelos de IA debían estar disponibles de inmediato en "modo siempre en línea" para que los documentos pudieran procesarse inmediatamente después de cargarse sin tener que esperar en cola a que se cargara el modelo de IA.
Solución y realización
Los expertos de Konfuzio implementaron tres contenedores paralelos para mantener el modelo de IA permanentemente cargado. De este modo, los documentos podían procesarse inmediatamente después de cargarse sin perder tiempo en cargar el modelo. De este modo, el tiempo de carga se redujo prácticamente a cero. Esta solución tecnológica también permitió procesar varios documentos en paralelo, lo que aumentó la eficacia de todo el proceso.
Resultado
Con Hot AI, los tiempos de carga se eliminan por completo, por lo que el modelo de AI está disponible de inmediato y se inicia entre 40 y 70 veces más rápido. Además, Konfuzio procesa páginas individuales tres veces más rápido y documentos enteros cuatro veces más rápido que antes.
Comparación: ahorro de tiempo de inferencia
En este caso de uso, el tiempo de carga del modelo de IA con Hot AI se redujo de 8 a 25 segundos a 0,099 a 0,506 segundos, siendo 0,099 segundos el valor óptimo. Esto redujo el tiempo total de procesamiento de un documento de 1 a 8 segundos, lo que se tradujo en flujos de trabajo significativamente más rápidos y una mayor satisfacción del cliente. En comparación directa:
Antes de
| Distribución del tiempo de carga (segundos) | Distribución del tiempo total (segundos) | ||
| Percentil | Tiempo | Percentil. | Tiempo |
| P1 | 6,721 | P1 | 8,829 |
| P5 | 9,651 | P5 | 11,340 |
| P10 | 10,315 | P10 | 12,169 |
| P25 | 11,426 | P25 | 13,666 |
| P50 | 12,792 | P50 | 15,258 |
| P75 | 14,590 | P75 | 17,315 |
| P90 | 16,465 | P90 | 19,591 |
| P95 | 17,203 | P95 | 21,047 |
| P99 | 19,460 | P99 | 25,843 |
En
| Distribución del tiempo de carga (segundos) | Distribución del tiempo total (segundos) | |||
| Percentil | Tiempo | Percentil | Tiempo | Mejora |
| P1 | 0,099 | P1 | 1,787 | 79,8 % |
| P5 | 0,108 | P5 | 2,021 | 82,2 % |
| P10 | 0,125 | P10 | 2,131 | 82,5 % |
| P25 | 0,173 | P25 | 2,411 | 82,4 % |
| P50 | 0,202 | P50 | 2,743 | 82,0 % |
| P75 | 0,240 | P75 | 3,382 | 80,5 % |
| P90 | 0,333 | P90 | 4,291 | 78,1 % |
| P95 | 0,404 | P95 | 5,146 | 75,6 % |
| P99 | 0,506 | P99 | 8,077 | 68,7 % |
Las tablas ilustran la mejora con Hot AI utilizando percentiles que muestran los tiempos de procesamiento con mayor precisión. Antes de la optimización, el 99 % de los documentos tardaba hasta 25 segundos, mientras que el 1 % más rápido tardaba sólo 8 segundos. Tras la introducción de la nueva función, el 99 % de los documentos se procesa en 8 segundos o menos. Estos cambios demuestran el aumento significativo del rendimiento y la eficacia de la solución.
Conclusión
Como ilustra el caso de uso, cambiar a Hot AI puede aumentar drásticamente la velocidad de los procesos de inferencia. Las empresas que procesan grandes cantidades de datos en tiempo real se benefician directamente de la reducción de los tiempos de espera y de la agilización de los flujos de trabajo. Si las empresas tienen otros requisitos para los modelos de IA, existen otros modos de funcionamiento además de la IA en caliente: una función adicional de autoescalado puede permitir la escalabilidad de los sistemas, o una función bajo demanda puede conservar los recursos a largo plazo.
Tomar ahora Contacto y nuestros expertos le asesorarán detalladamente sobre qué contenedor AI se adapta mejor a sus necesidades. Asegúrese ventajas competitivas decisivas.
