Start / Blog / Künstliche Intelligenz / Zero-Shot Learning – Unbekanntes verstehen

Zero-Shot Learning – Unbekanntes verstehen

Zusammenfassen mit ChatGPT

Neue Problemstellungen lösen zu können entspricht einer der bekanntesten Definitionen von Intelligenz. Seit Jahrzehnten versuchen Computerwissenschaftler, diese wertvolle Fähigkeit auf lernende Systeme zu übertragen. Doch was bereits lange als Künstliche Intelligenz bekannt ist, scheint demnach nicht wirklich intelligent zu sein. Es handelt sich in den meisten Fällen um die automatisierte Reproduktion von Regeln, die aus eindeutigen Beispielen herausgefiltert werden. Seit die verwendeten Datenmengen allerdings rapide angestiegen sind, wächst auch die Fähigkeit der Modelle, nicht explizit enthaltene Konzepte zu verstehen. Bekannt ist dieser Ansatz als Zero-Shot Learning, das sich als Einfallstor für eine zunehmend menschenähnliche KI entpuppen könnte.

Definition und Grundlagen

Zero-Shot Learning ist ein Paradigma des maschinellen Lernens, bei dem KI-Modelle bis dahin ungesehene Klassen vorhersagen oder prinzipiell unbekannte Objekte verarbeiten sollen, ohne für diese spezifische Aufgabe konzipiert zu sein. Hintergrund ist, dass bei herkömmlichen überwachten Lernverfahren in der Regel umfangreiche Datenbeschriftungen notwendig sind, die bei leichten Kontextveränderungen zu aufwändig oder für seltene Klassen nur schwer zu beschaffen sind. Um auf diese nachträglichen Feinabstimmungen verzichten zu können, kommen bereits im Vorfeld bestimmte Methoden zum Einsatz, die es den Modellen erlauben, von bereits analysierten Informationen auf das Unbekannte zu schließen. Das ist beispielsweise durch semantische Eigenschaften, vektorielle Darstellungen oder durch neue Kombinationen bereits bekannter Attribute möglich.

Zero-Shot Learning ist somit kein spezifisches Lernverfahren, sondern beschreibt die Art der Problemstellung, die eine unmittelbare Lösung für eine nicht exakt bekannte Aufgabe erfordert. Man könnte also auch von Zero-Shot Fähigkeiten eines Modells sprechen, die auf verschiedenen Ressourcen beruhen. In dieser Hinsicht sorgen Large Language Models (LLMs) seit Jahren für besonders großes Aufsehen. Da die neuronalen Netze auf Basis der Transformer-Architektur mit immensen Mengen an Textdaten trainiert wurden, verfügen sie über eine ungemein große Wissensbasis. Unter Berücksichtigung statistischer Zusammenhänge zwischen Wörtern können sie auch auf noch nie erhaltene Eingaben mit einem passenden Output reagieren. Zero-Shot Learning hat daher längst den Weg in den Alltag von Millionen von Menschen gefunden und bleibt dennoch für spezielle Aufgaben in der Wirtschaft ein intensiv bearbeitetes Problem.

Einordnung und Beispiel

Um Zero-Shot Learning besser verstehen zu können, lassen sich am Beispiel von LLMs wesentliche Grundkonzepte einordnen und abgrenzen.

  • Fine-Tuning – Bei dieser Technik durchläuft ein vortrainiertes Open-Source oder proprietäres Modell ein weiteres Training anhand beispielhafter Zuweisungen für die geplante Aufgabe. Dabei kommt es zu einer Anpassung der neuronalen Gewichtungen des zugrunde liegenden Netzwerks. Anschließend kann dieses mit erhöhter Genauigkeit auf den vorliegenden Aufgabentyp angewandt werden. Der am häufigsten verwendete Lernalgorithmus ist die Backpropagation.
  • Prompt Engineering – Darunter versteht man die Optimierung des verwendeten Eingabetexts (Prompt), um einen möglichst genauen Output entsprechend des individuellen Vorhabens zu erhalten. Es müssen keine spezifischen Beispiele genannt werden.
zero-shot prompting LLM
Prompt Engineering mit einem benutzerdefinierten Chatbot
  • Few-Shot Learning – Bei dieser Methode erhält das Modell eine geringe Anzahl von Beispielen im Rahmen des initialen oder darauf folgenden Prompts. Dadurch lässt sich die Genauigkeit bzw. die Übereinstimmung mit dem gewünschten Ergebnis erheblich steigern. Beim Umgang mit LLMs handelt es sich um eine Form von Prompt Engineering. Im Beispiel hätte der Autor dem Modell auch eigene Erklärungen des Konzepts oder ähnliche Passagen zur Verfügung stellen können, sodass sogar eine Annäherung des Outputs an seinen menschlichen Sprachstil möglich ist.
  • Zero-Shot Learning – In der Regel bedeutet der Ansatz einen kompletten Verzicht auf aufgabenspezifisches Fine-Tuning und Trainingsbeispiele. Stattdessen wird die generische Trainingsdomäne bzw. generalisierte Fähigkeiten des Modells genutzt, um wie im Beispiel auf Anhieb das gewünschte Ergebnis zu erhalten. Hier handelte es sich um einen einzelnen, präzisen Prompt, man spricht dabei auch von Zero-Shot Prompting. Demnach sind die Konzepte Zero-Shot Learning und Prompt Engineering bei LLMs sehr gut miteinander vereinbar. Da die Anzahl der verwendeten Trainingsbeispiele gleich null ist, könnte man auch von einem Spezialfall des Few-Shot Learnings sprechen.

Technische Herangehensweisen

Anstatt nur auf die reine Wissensbasis in den Trainingsdaten zu vertrauen, gibt es sowohl einige allgemeine Ansätze als auch spezielle Methoden, um für gesteigerte Zero-Shot Fähigkeiten zu sorgen. In den meisten Fällen hat das Modell jedoch bereits ein umfassendes Pre-Training mit Text- oder Bilddaten durchlaufen, um ein umfassendes Bild verschiedener weltlicher Konzepte und deren Beziehungen zu erlernen.

Generalisiertes Zero-Shot Learning

Hierbei ist ein überwachtes Training vorgesehen, das semantische Beziehungen zwischen bekannten und unbekannten Klassen in den Daten ermöglichen soll. Dieser Unterschied wird einerseits durch die stichprobenartige Ziehung von Datenpunkten modelliert, andererseits sind bestimmte Attribute enthalten, über die sich Gemeinsamkeiten zwischen den Klassen abbilden lassen. Das Modell wird damit gezielt auf die Problemstellung von Zero-Shot Learning vorbereitet, bei der zunächst entschieden werden muss, ob es sich um eine bereits eindeutig definierte Klasse oder eine Abwandlung davon handelt. In einem wissenschaftlichen Review unterscheiden Pourpanah et alt. (2023) zwei Arten von Methoden für diesen Transfer:

Embedding-Methoden nutzen graphische Darstellungen oder aus der Transformer-Architektur bekannte Elemente wie Autoencoder und Aufmerksamkeitsmodule.

Generative Methoden haben dagegen die Erstellung eines generativen Modells zur Erzeugung von Trainingspatterns aus bekannten und unbekannten Worteinbettungen oder Graphen zum Ziel.

Transfer Learning

Wurde ein Modell bereits durch überwachtes Training auf eine spezifische Aufgabe vorbereitet und hat entsprechende neuronale Anpassungen erfahren, lassen sich diese z. B. durch Federated Learning auf ein weiteres Modell übertragen. Dieses kann anschließend auf eine neue, leicht veränderte Aufgabe angewendet werden, wobei die erfolgten Gewichtungen einen erheblichen Vorteil gegenüber dem ursprünglichen, generalistischen Modell bedeuten. Im Prinzip wird also ein bereits erfolgter Lerneffekt recycelt, um mit teilweise übereinstimmenden Gegebenheiten umzugehen. Die weitere Anpassung bedeutet einen deutlich gesenkten Ressourcenverbrauch in puncto Zeit, Rechenleistung und Daten. Im Rahmen von Transfer Learning findet häufig folgende konkretere Technik Anwendung.

Semantische Embeddings

Erlernbare Eigenschaften von Klassen, die ein Modell erkennen soll, lassen sich als räumliche Vektoren darstellen. Diese Embeddings bilden einzelne Informationen oder Attribute in einer mathematischen und damit maschinenlesbaren Form ab. Konkret kann es sich dabei um Hinweise auf bestimmte Wortbedeutungen, bei der Bildverarbeitung auch um optische Merkmale wie Größe oder Farbe handeln. Auch wenn ein Modell noch nicht auf ein bestimmtes Zielkonzept trainiert worden ist, kann es nach einem Training mit gelabelten Daten bestimmte Rückschlüsse in Hinblick auf die Zusammensetzung bereits bekannter Vektoren und deren Abstände ziehen. Eine für die Sprachverarbeitung häufig eingesetzte Technik ist Word2vec.

Word embeddings
Ein Modell, das nie explizit mit dem Konzept “Königin” konfrontiert wurde, könnte im vektoriellen Raum auf das weibliche Pendant zu “König” schließen.

Weitere Kategorien von Methoden sind zum Beispiel:

  • Korrespondenzmethoden – Jede Klasse erhält einen repräsentativen Prototyp im semantischen Raum sowie einen binären Klassifikator, der die Entscheidung, ob es sich um diese Klasse handelt, modelliert. Zwischen diesen beiden Elementen wird eine Korrespondenzfunktion erlernt.
  • Projektionsmethoden – Hierbei werden Instanzen aus dem Merkmalsraum und Prototypen aus dem semantischen Raum in einen gemeinsamen Raum projiziert, um gelabelte Instanzen für ungesehene Klassen zu generieren.
  • Instance-Borrowing-Methoden – Die gelabelten Instanzen vergleichbarer Klassen dienen der Generierung von Beispielen für unbekannte Klassen, indem gewisse Ähnlichkeiten festgestellt werden.

Herausforderungen

Die genannten Methoden bedeuten zwar in der Anwendung erhebliche Erleichterung, wenn es um neue Klassen geht, allerdings bringen sie selbst wesentliche Herausforderungen für die Entwicklung mit sich.

  • Komplexität der Modelle – Das Trainieren von Zero-Shot Modellen ist zeitintensiv und erfordert eine große Rechenleistung. Es ist genau abzuwägen, ob das den Mehrwert in der Anwendung rechtfertigt, oder ob auch ein Modell “from-scratch” für neue Aufgaben möglich ist.
  • Heterogenität – Werden die Unterschiede zwischen gesehenen und ungesehenen Klassen zu groß, kann das zu Leistungseinbußen führen. Bei zu heterogenen Daten gibt es derzeit noch Grenzen.
  • Ähnlichkeiten – Wenn sich die Klassen jedoch zu stark ähneln, kann das zu Mehrdeutigkeiten führen, die das Ergebnis verfälschen.

Wachsendes Potenzial für die Text- und Bildverarbeitung

Wie bereits deutlich wurde, gibt es zwei wesentliche Dimensionen, in denen für Menschen verständliche Informationen auch für KI-Modelle erfassbar werden können: Text und Bild. Im Laufe der Jahrzehnte haben sich dafür zwei wichtige KI-Anwendungsfelder herauskristallisiert, die besonders von Zero-Shot Learning profitieren.

Computer Vision

Neue Objekte in Bildern erkennen zu können, ohne explizite Trainingsbeispiele zu benötigen, galt lange als rein theoretisches Ziel. Durch die große Menge an Bildinformationen, die inzwischen verarbeitet werden können, erhalten die Modelle jedoch immer mehr Hinweise auf unbekannte Klassen und deren Zusammensetzung aus Attributen. Auf diese Weise lassen sich zum Beispiel in der medizinischen Diagnostik seltene Krankheiten wie Tumore in Scans erkennen. Auch in der Fertigung, Robotik und Sensorik sind die gesteigerten Fähigkeiten hilfreich, um mit Abweichungen umzugehen.

zero-shot vision classification
Quelle: A Review of Generalized Zero-Shot Learning Methods

Natural Language Processing

Die Möglichkeiten in der generativen KI dürften wohl kaum jemandem entgangen sein. Allerdings geht das Potenzial inzwischen über die Nutzung generischer Trainingsdomänen von Large Language Models hinaus und erstreckt sich auch auf spezifische Aufgaben wie das präzise Erkennen von Textklassen in fachlichen Kontexten. So sind zum Beispiel Zero-Shot Inhaltsanalysen ungewöhnlicher Nachrichtenlagen anhand verschiedener Labels möglich. Das kann helfen, die künftigen Auswirkungen von Katastrophen und anderen Extremereignissen auf Wirtschaft und Gesellschaft abzuschätzen.

zero shot text analysis
Quelle: Benchmarking Zero-shot Text Classification: Datasets, Evaluation and Entailment Approach

In der Praxis lassen sich auch einzelne Worte kategorisieren, um zum Beispiel für medizinische Zwecke wertvolle Basisanalysen zu schaffen:

medical named entity recognition
Die KI-Software Konfuzio beim Auslesen eines medizinischen Berichts mittels Named-Entity Recognition.

Zero-Shot Fähigkeiten sorgen für einen deutlich reduzierten Aufwand bei der Anpassung und Implementierung von KI-Systemen wie Konfuzio. Die Notwendigkeit, in Dokumenten die Felder und Daten bei Abweichungen neu zu beschriften, konnten unsere Experten zuletzt erheblich verringern. Zudem lassen sich diverse, bereits trainierte oder eigene KI-Modelle sowie individuelle Chatbots unmittelbar (Zero-Shot) nutzen, um die Produktivität in Unternehmen zu maximieren.

Fazit

Indem Modelle der Künstlichen Intelligenz zunehmend Aufgaben lösen und Klassen erkennen können, für die sie nicht explizit trainiert sind, findet eine wachsende Generalisierung ihrer Anwendbarkeit statt. Dieses als Zero-Shot Learning bekannte Phänomen entspricht keiner konkreten Technik maschinellen Lernens sondern einer Perspektive: Aus Anwendersicht handelt es sich bereits beim unmittelbaren Gebrauch eines Modells um Zero-Shot-Learning, wenn er kein eigenes Training durchführt oder Beispiele eingibt. Aber die Entwicklung hat höchstwahrscheinlich genau das getan, um ihr Modell auf verschiedene Arten von Eingaben vorzubereiten.

Wie weit hier die Definition des Begriffs reicht, ist reine Ansichtssache. In vielen Fällen setzt Zero-Shot Learning jedoch eine große Wissensbasis aus Daten oder bestimmte Trainingsmethoden voraus, die Beziehungen zwischen bekannten und unbekannten Klassen modellieren. Letzten Endes geht es darum, das Anwendungsspektrum zu vergrößern und den individuellen Aufwand zu verringern. Als Vorbild dient dabei seit jeher der Mensch, der sich mit bislang unnachahmlicher Geschwindigkeit und kognitiver Präzision in neuen Situationen zurechtfinden kann. Ob es zu einer deutlichen Annäherung durch Künstliche Intelligenz kommt, ist eine vieldiskutierte Frage, die nur Jahre der weiteren Entwicklung beantworten können.

Planen Sie ein spezielles KI-Vorhaben, bei dem es auf die Generalisierbarkeit von Dokumenten-KI oder GenAI ankommt? Schreiben Sie uns gern eine Nachricht, um sich von Experten beraten zu lassen.

Fanden Sie die Seite hilfreich?

Vielen Dank für Ihr Feedback!

Würden Sie mir Feedback geben? (anonym)

Wir entwickeln KI-Software für Unternehmen und verzichten bewusst auf störende Werbebanner. Durch unsere Artikel dokumentieren wir Themen, die uns beschäftigen, interessieren und auch unser tägliches Brot finanzieren.

Da unsere Inhalte kostenfrei sind, ist Ihr Feedback unser Lob.

Jeder Autor liest Ihr anonymes Feedback persönlich, obwohl KI es automatisieren könnten, und integriert konstruktive Vorschläge direkt in die nächste Überarbeitung oder nutzt es als Inspiration für den nächsten Artikel.



    • Tim Filzinger
      (Autor)

      Redakteur und Kommunikationsberater. Spezialisiert auf Unternehmenstechnologie und Künstliche Intelligenz.

    de_DEDE