La pertinence croissante de l'intelligence artificielle (IA) et de l'apprentissage automatique (ML) augmente la pression pour optimiser davantage l'efficacité des modèles d'IA, notamment en ce qui concerne l'inférence. L'inférence - le temps nécessaire à un modèle pour effectuer une prédiction ou une action - est de plus en plus au centre de l'attention, car elle a une influence déterminante sur la performance et le temps de réaction d'un système. Hot AI offre une possibilité de réduire de manière significative les temps de réaction des modèles d'IA et d'augmenter ainsi l'efficacité des processus d'inférence.
A l'aide de données réelles d'un cas d'application réel, nous illustrons dans ce blog post les économies réalisées grâce à Hot AI et comment Konfuzio a mis en œuvre cette technologie avec succès.
Qu'est-ce que l'IA en conteneur et comment fonctionne-t-elle ?
Container AI est une approche basée sur Containers pour fournir une intelligence artificielle efficace. L'environnement complet dont une application d'IA a besoin est ainsi emballé de manière compacte dans un conteneur. D'un point de vue technique, les conteneurs isolent Conteneur AI Les conteneurs d'IA contiennent donc les composants nécessaires à une application d'IA et fonctionnent dans des environnements dits "légers". Un conteneur IA chez Konfuzio fonctionne donc comme un espace de travail virtuel pour une IA.
Modèles d'IA de Konfuzio - avant vs. aujourd'hui
Auparavant, les modèles d'IA Konfuzio étaient rechargés avec chaque document et ne fonctionnaient pas de manière isolée - en comparaison directe (voir la comparaison plus bas dans l'article), c'était lent. Maintenant, avec Container AI, il y a trois modes de fonctionnement pour rendre les modèles d'IA plus flexibles et plus rapides à utiliser, selon les besoins :
- AI à la demande - L'IA prend quelques secondes pour charger le premier document et s'éteint automatiquement après 10 minutes d'inactivité.
- Hot AI - Le conteneur est "Always-On", ce qui élimine le temps de chargement.
- IA automatique - C'est là qu'intervient Hot AI avec une fonction Autoscaled. Le conteneur est "Always-On". et évolutif, ce qui permet d'éliminer le temps de chargement et de suivre l'augmentation du volume des données.
Les trois modes de fonctionnement offrent des avantages différents, qui dépendent des besoins individuels de l'entreprise. Pour plus de détails, cliquez ici. Dans le cas d'application suivant, c'est Hot AI qui est mis en avant.
Qu'est-ce que l'IA chaude et comment fonctionne-t-elle ?
Hot AI signifie que ces espaces de travail virtuels (conteneurs) restent toujours allumés et sont immédiatement prêts à l'emploi (mode toujours en ligne). Cela permet à l'IA de démarrer immédiatement, sans perdre de temps pour le démarrage. Le temps d'attente est ainsi éliminé.
Avantages de Hot AI
Hot AI ne réduit pas seulement les temps d'inférence. Elle présente d'autres avantages :
- Sécurité - Chaque conteneur est un espace de travail fermé qui fonctionne de manière strictement isolée des autres conteneurs et systèmes. Une erreur ou une attaque potentielle au sein d'un conteneur n'affecte ni les autres processus ni le système dans son ensemble. Vos données restent dans un environnement virtuel entièrement protégé.
- Rapidité - Avec la nouvelle Hot AI, tous les temps de chargement ont été presque entièrement éliminés, ce qui permet à Konfuzio d'améliorer considérablement les performances des services d'IA. Il en résulte un traitement plus rapide des documents et une meilleure expérience utilisateur.
- Évolutivité - Hot AI assure que les modèles d'IA Konfuzio ne sont pas seulement portables, mais aussi très réactifs dans des scénarios en temps réel, grâce à une "fonction d'auto-échantillonnage" optionnelle. En cas d'augmentation soudaine de la demande, il est également possible de lancer immédiatement des conteneurs supplémentaires sans avoir à subir les longs retards liés au rechargement complet de l'application.
- Réduction des coûts - La réduction du temps de chargement et l'utilisation plus efficace des ressources de calcul réduisent durablement les coûts d'exploitation. Comme le modèle d'IA nécessite moins de temps de calcul, les coûts par tâche exécutée sont réduits.
Cas d'application - Konfuzio Hot AI en action
Un cas d'application typique où ces avantages sont devenus visibles provient d'un client de la Helm & Nagel GmbHla société derrière Konfuzio.
Situation de départ
Depuis 2022, le client utilise l'IA pour traiter les documents de conformité. Ces documents sont critiques en termes de temps, car ils sont essentiels pour le respect des exigences de conformité. Chaque jour, entre 10 et 100 documents sont téléchargés sur la plateforme Konfuzio, ce qui a permis de traiter plus de 12.000 documents depuis le début de la collaboration.
Le défi
Bien que le client soit satisfait de la plate-forme Konfuzio, il se plaignait de temps de traitement irréguliers et parfois longs. Comme les documents étaient placés dans une file d'attente générale, cela empêchait un traitement immédiat. En particulier, le démarrage et le chargement du modèle d'IA entraînaient des retards, car le modèle devait être entièrement chargé avant d'être prêt à traiter les documents. Ces temps de traitement, qui pouvaient atteindre 25 secondes, ne correspondaient pas aux exigences du client, qui avait besoin d'un processus de traitement rapide et efficace.
Le traitement rapide des documents de conformité est la clé du respect des exigences de conformité critiques. Des retards pourraient interrompre les chaînes de production et d'approvisionnement et entraîner de graves perturbations. Le traitement des documents doit donc être disponible en temps réel afin de garantir le bon déroulement des opérations et d'éviter les pénalités.
Objectif
L'objectif était de réduire drastiquement les temps de chargement grâce à l'utilisation de l'IA à chaud. Pour ce faire, les modèles d'IA devaient être immédiatement disponibles en "mode toujours en ligne", de sorte que les documents puissent être traités directement après leur téléchargement, sans devoir attendre dans une file d'attente que le modèle d'IA se charge.
Solution et mise en œuvre
Les experts de Konfuzio ont implémenté trois conteneurs parallèles afin de maintenir le modèle d'IA chargé en permanence. Cette approche a permis de garantir que les documents pouvaient être traités immédiatement après leur chargement, sans perdre de temps pour le chargement du modèle. Le temps de chargement a ainsi été réduit à presque rien. Cette solution technologique a également permis de traiter plusieurs documents en parallèle, augmentant ainsi l'efficacité de l'ensemble du processus.
Résultat
Avec Hot AI, les temps de chargement sont totalement supprimés, de sorte que le modèle d'IA est immédiatement disponible et démarre 40 à 70 fois plus vite. En outre, Konfuzio traite les pages individuelles trois fois plus vite et les documents entiers quatre fois plus vite qu'auparavant.
Comparaison - Economies sur le temps d'inférence
Dans ce cas d'application, le temps de chargement du modèle d'IA avec Hot AI a été réduit de 8 à 25 secondes à 0,099 à 0,506 seconde, 0,099 seconde étant la valeur optimale. Le temps de traitement total d'un document a ainsi été réduit à 1 à 8 secondes, ce qui a permis d'accélérer considérablement les flux de travail et d'augmenter la satisfaction des clients. En comparaison directe :
Avant
| Répartition du temps de chargement (secondes) | Répartition du temps total (secondes) | ||
| Centile | Temps | percentile. | Temps |
| P1 | 6,721 | P1 | 8,829 |
| P5 | 9,651 | P5 | 11,340 |
| P10 | 10,315 | P10 | 12,169 |
| P25 | 11,426 | P25 | 13,666 |
| P50 | 12,792 | P50 | 15,258 |
| P75 | 14,590 | P75 | 17,315 |
| P90 | 16,465 | P90 | 19,591 |
| P95 | 17,203 | P95 | 21,047 |
| P99 | 19,460 | P99 | 25,843 |
Après
| Répartition du temps de chargement (secondes) | Répartition du temps total (secondes) | |||
| Centile | Temps | Centile | Temps | Amélioration |
| P1 | 0,099 | P1 | 1,787 | 79,8 % |
| P5 | 0,108 | P5 | 2,021 | 82,2 % |
| P10 | 0,125 | P10 | 2,131 | 82,5 % |
| P25 | 0,173 | P25 | 2,411 | 82,4 % |
| P50 | 0,202 | P50 | 2,743 | 82,0 % |
| P75 | 0,240 | P75 | 3,382 | 80,5 % |
| P90 | 0,333 | P90 | 4,291 | 78,1 % |
| P95 | 0,404 | P95 | 5,146 | 75,6 % |
| P99 | 0,506 | P99 | 8,077 | 68,7 % |
Les tableaux illustrent l'amélioration apportée par Hot AI à l'aide de centiles qui représentent plus précisément les temps de traitement. Avant l'optimisation, 99 % des documents prenaient jusqu'à 25 secondes, tandis que les 1 % les plus rapides ne prenaient que 8 secondes. Après l'introduction de la nouvelle fonction, 99 % des documents sont traités en 8 secondes maximum. Ces changements témoignent de l'amélioration significative des performances et de l'efficacité de la solution.
Conclusion
Comme l'illustre le cas d'application, le passage à l'IA à chaud permet d'augmenter drastiquement la vitesse des processus d'inférence. Les entreprises qui traitent de grandes quantités de données en temps réel bénéficient directement de temps d'attente réduits et de processus de travail plus rapides. Si les entreprises ont d'autres exigences en matière de modèles d'IA, il existe d'autres modes d'exploitation en plus de Hot AI : soit une fonction Autoscaled supplémentaire permet de rendre les systèmes évolutifs - soit une fonction à la demande permet de ménager durablement les ressources.
Prenez maintenant Contact et nos experts vous conseilleront en détail sur le type d'AI de conteneur le mieux adapté à vos besoins. Assurez-vous des avantages décisifs par rapport à la concurrence !
