Start / Blog / Produktinformationen / Hot AI – Beschleunigte Inferenz durch Konfuzio Container

Hot AI – Beschleunigte Inferenz durch Konfuzio Container

Zusammenfassen mit ChatGPT

Die steigende Relevanz von künstlicher Intelligenz (KI) und maschinellem Lernen (ML) erhöht den Druck, die Effizienz der KI-Modelle weiter zu optimieren, insbesondere bei der Inferenz. Die Inferenz – die Zeit, die ein Modell für eine Vorhersage oder Aktion benötigt – rückt dabei in den Fokus, da sie maßgeblich die Leistungsfähigkeit und Reaktionszeit eines Systems beeinflusst. Hot AI bietet eine Möglichkeit, die Reaktionszeiten von KI-Modellen signifikant zu reduzieren und steigert dadurch die Effizienz der Inferenzprozesse.

Anhand echter Daten eines realen Anwendungsfalls verdeutlichen wir in diesem Blogpost die Einsparungen von Hot AI und wie Konfuzio diese Technologie erfolgreich implementiert hat.

Was ist Container AI und wie funktioniert sie?

Container AI ist ein Ansatz, der auf Containern basiert, um künstliche Intelligenz effizient bereitzustellen. Dabei wird die vollständige Umgebung, die eine KI-Anwendung benötigt, kompakt in einem Container verpackt. Technisch gesehen isolieren AI Container somit die notwendigen Komponenten einer KI-Anwendung und laufen in sogenannten „leichtgewichtigen“ Umgebungen. Eine Container AI bei Konfuzio fungiert also wie ein virtueller Arbeitsraum für eine KI.

KI-Modelle von Konfuzio – früher vs. heute

Früher wurden die Konfuzio KI-Modelle mit jedem Dokument neu geladen und liefen nicht isoliert – im direkten Vergleich (s. Gegenüberstellung weiter unten im Artikel) war das langsam. Jetzt gibt es mit Container AI drei Betriebsmodi, um die KI-Modelle flexibler und schneller einsetzbar machen, je nach Bedarf:

  • On Demand AI – KI benötigt einige Sekunden beim Laden des ersten Dokuments und schaltet sich nach 10 Minuten Inaktivität automatisch ab.
  • Hot AI – Container ist „Always-On“, was die Ladezeit eliminiert.
  • Autoscaled AI – Hier kommt Hot AI mit einer Autoscaled-Funktion zum Einsatz. Der Container ist „Always-On“ und skalierbar, was die Ladezeit eliminiert und beim Anstieg von Datenmengen Schritt hält.

Alle drei Betriebsmodi bieten unterschiedliche Vorteile, die von den individuellen Unternehmensanforderungen abhängen. Für mehr Details klicken Sie hier. Im Folgenden Anwendungsfall rückt Hot AI in den Fokus.

Was ist Hot AI und wie funktioniert sie?

Hot AI bedeutet, dass diese virtuellen Arbeitsräume (Container) immer eingeschaltet bleiben und sofort einsatzbereit sind (Always-Online-Modus). Das sorgt dafür, dass die KI sofort startet, ohne Zeit fürs Hochfahren zu verlieren. Die Wartezeit wird dadurch eliminiert.

Vorteile von Hot AI

Hot AI verkürzt nicht nur die Inferenzzeiten. Weitere Vorzüge sind:

  • Sicherheit – Jeder Container ist ein abgeschlossener Arbeitsraum, der strikt isoliert von anderen Containern und Systemen funktioniert. Ein potenzieller Fehler oder Angriff innerhalb eines Containers beeinflusst weder andere Prozesse noch das Gesamtsystem. Ihre Daten bleiben in einem vollständig geschützten, virtuellen Umfeld.
  • Schnelligkeit – Mit der neuen Hot AI konnten sämtliche Ladezeiten nahezu vollständig eliminiert werden, wodurch Konfuzio die Leistung der KI-Dienste deutlich steigert. Das führt zu einer schnelleren Dokumentenverarbeitung und einer verbesserten Nutzererfahrung.
  • Skalierbarkeit – Hot AI sorgt mit einer optionalen „Auto-Scaled-Funktion“ dafür, dass die Konfuzio KI-Modelle nicht nur portabel sind, sondern auch in Echtzeitszenarien hochgradig reaktionsfähig. Bei plötzlicher Nachfragesteigerung lassen sich zusätzliche Container ebenfalls sofort starten, ohne die längeren Verzögerungen in Kauf nehmen zu müssen, bei dem die Anwendung erst komplett neu geladen wird.
  • Kosteneinsparungen – Die reduzierte Ladezeit und der effizientere Einsatz von Rechenressourcen senken die Betriebskosten nachhaltig. Da das KI-Modell weniger Rechenzeit benötigt, reduzieren sich die Kosten pro durchgeführter Aufgabe.

Anwendungsfall – Konfuzio Hot AI im Einsatz

Ein typischer Anwendungsfall, bei dem diese Vorteile sichtbar wurden, stammt von einem Kunden der Helm & Nagel GmbH, dem Unternehmen hinter Konfuzio.

Ausgangssituation

Seit 2022 nutzt der Kunde die KI zur Verarbeitung von Compliance-Dokumenten. Diese Dokumente sind zeitkritisch, da sie essentiell für die Einhaltung von Compliance-Vorgaben sind. Täglich werden zwischen 10 und 100 Dokumente auf der Konfuzio Plattform hochgeladen, was seit Beginn der Zusammenarbeit zu über 12.000 verarbeiteten Dokumenten führte. 

Herausforderung

Obwohl der Kunde mit der Konfuzio Plattform zufrieden war, klagte er über unregelmäßige und teilweise lange Verarbeitungszeiten. Da die Dokumente in eine allgemeine Warteschlange eingereiht wurden, verhinderte dies eine sofortige Verarbeitung. Insbesondere das Starten und Laden des KI-Modells führte zu Verzögerungen, da das Modell erst vollständig geladen werden musste, bevor es für die Dokumentenverarbeitung bereitstand. Diese Verarbeitungszeiten von bis zu 25 Sekunden passten nicht zu den Anforderungen des Kunden, der einen schnellen und effizienten Verarbeitungsprozess benötigte.

Die schnelle Verarbeitung der Compliance-Dokumente ist der Schlüssel für die Erfüllung kritischer Compliance-Anforderungen. Verzögerungen könnten Produktions- und Lieferketten unterbrechen und schwerwiegende Störungen nach sich ziehen. Die Dokumentenverarbeitung muss daher in Echtzeit verfügbar sein, um reibungslose Abläufe zu gewährleisten und Strafzahlungen zu vermeiden.

Ziel

Das Ziel bestand darin, die Ladezeiten durch den Einsatz von Hot AI drastisch zu reduzieren. Dabei sollten die KI-Modelle im „Always-Online-Modus“ sofort verfügbar sein, sodass Dokumente direkt nach dem Upload verarbeitet werden konnten, ohne in einer Warteschlange auf das Laden des KI-Modells warten zu müssen.

Lösung und Umsetzung

Die Konfuzio Experten implementierten drei parallele Container, um das KI-Modell permanent geladen zu halten. Dieses Vorgehen stellte sicher, dass die Dokumente sofort nach dem Hochladen verarbeitet werden konnten, ohne dass Zeit für das Modell-Laden verloren ging. Die Ladezeit wurde dadurch auf nahezu Null reduziert. Diese technologische Lösung erlaubte zudem eine parallele Verarbeitung mehrerer Dokumente und erhöhte damit die Effizienz des gesamten Prozesses.

Ergebnis

Mit Hot AI entfallen die Ladezeiten vollständig, sodass das KI-Modell sofort verfügbar ist und 40- bis 70-mal schneller startet. Außerdem verarbeitet Konfuzio einzelne Seiten dreimal und ganze Dokumente viermal schneller als zuvor.

Gegenüberstellung – Einsparungen bei der Inferenzzeit

In diesem Anwendungsfall reduzierte sich die Ladezeit des KI-Modells mit Hot AI von 8 bis 25 Sekunden auf 0,099 bis 0,506 Sekunden, wobei 0,099 Sekunden den Optimalwert darstellt. Dadurch sank die Gesamtverarbeitungszeit eines Dokuments auf 1 bis 8 Sekunden, was zu deutlich schnelleren Arbeitsabläufen und erhöhter Kundenzufriedenheit führte. Im direkten Vergleich:

Vorher

Verteilung der Ladezeit (Sekunden)Verteilung der Gesamtzeit (Sekunden)
PerzentilZeitPerzentil.Zeit
P16,721P18,829
P59,651P511,340 
P1010,315 P1012,169
P2511,426P2513,666 
P5012,792P5015,258 
P7514,590P7517,315
P9016,465P9019,591 
P9517,203P9521,047
P9919,460P9925,843
Die Werte basieren auf 684 hochgeladenen Dokumenten über einen Zeitraum von 62 Tagen.

Nachher

Verteilung der Ladezeit (Sekunden)Verteilung der Gesamtzeit (Sekunden)
PerzentilZeitPerzentilZeitVerbesserung
P10,099 P11,78779,8 %
P50,108 P52,02182,2 %
P100,125P102,13182,5 %
P250,173 P252,41182,4 %
P500,202P502,74382,0 %
P750,240P753,38280,5 %
P900,333P904,29178,1 %
P950,404P955,14675,6 %
P990,506 P998,07768,7 %
Die Werte basieren auf 564 hochgeladenen Dokumenten aus demselben Projekt über einen Zeitraum von 4 Tagen, die in Umfang und Ausmaß den Dokumenten aus der vorherigen Tabelle ähneln.

Die Tabellen verdeutlichen die Verbesserung mit Hot AI anhand von Perzentilen, die die Verarbeitungszeiten genauer darstellen. Vor der Optimierung benötigten 99 % der Dokumente bis zu 25 Sekunden, während die schnellsten 1 % nur 8 Sekunden brauchten. Nach der Einführung der neuen Funktion verarbeiten 99 % der Dokumente in maximal 8 Sekunden. Diese Änderungen belegen die signifikante Leistungssteigerung und Effizienz der Lösung.

Fazit

Wie der Anwendungsfall verdeutlicht, lässt sich mit der Umstellung auf Hot AI die Geschwindigkeit der Inferenzprozesse drastisch erhöhen. Unternehmen, die große Datenmengen in Echtzeit verarbeiten, profitieren direkt von reduzierten Wartezeiten und schnelleren Arbeitsabläufen. Wenn Unternehmen andere Anforderungen an KI-Modelle haben, gibt es neben Hot AI weitere Betriebsmodi: Entweder kann durch eine zusätzliche Autoscaled-Funktion die Skalierbarkeit der Systeme ermöglicht – oder durch eine On-Demand-Funktion Ressourcen nachhaltig geschont werden.

Nehmen Sie jetzt Kontakt auf und unsere Experten beraten Sie ausführlich, welche Container AI am besten zu Ihren Anforderungen passt. Sichern Sie sich konkurrenzentscheidende Vorteile!

Fanden Sie die Seite hilfreich?

Vielen Dank für Ihr Feedback!

Würden Sie mir Feedback geben? (anonym)

Wir entwickeln KI-Software für Unternehmen und verzichten bewusst auf störende Werbebanner. Durch unsere Artikel dokumentieren wir Themen, die uns beschäftigen, interessieren und auch unser tägliches Brot finanzieren.

Da unsere Inhalte kostenfrei sind, ist Ihr Feedback unser Lob.

Jeder Autor liest Ihr anonymes Feedback persönlich, obwohl KI es automatisieren könnten, und integriert konstruktive Vorschläge direkt in die nächste Überarbeitung oder nutzt es als Inspiration für den nächsten Artikel.



    de_DEDE