Start / Blog / Daten / Was ist Datenannotation und warum benötigt KI diese?

Was ist Datenannotation und warum benötigt KI diese?

Zusammenfassen mit ChatGPT

Egal, ob man von dem Annotieren der Daten, der Annotation von Daten oder Datenannotation spricht, meint man damit das Anreichern von Rohdaten mit kontextuellem Wissen.

Diesen möglicherweise kryptischen Satz werde ich in folgendem Artikel genauer erklären.

Datenannotationen beginnen immer mit Rohdaten, die den Ausgangspunkt jeder Analyse bilden. Sie sind das Fundament, auf dem Systeme Inhalte erkennen, interpretieren und kategorisieren. Um zu verstehen, was hinter Annotationen steckt, lohnt sich ein Blick auf Rohdaten.

Was sind Rohdaten?

Rohdaten sind Beobachtungen in technischer Form und bilden die Vorstufe von Informationen.

5 Beispiele für Rohdaten

BeispielQuelle der RohdatenDatentypSpeicherformatAttributbeispieleUnverarbeiteter ZustandKontextabhängigkeitZeitstempel/OrtsangabenQualität/SpeicherortWeitere Besonderheiten
Geburtstagsfeier fotografiert mit SmartphoneFotoaufnahme durch KameraBilddateiJPEG/PNGFarbgebung, Auflösung, Aufnahmezeitpunkt, GeotaggingJaHoch, z. B. für Erinnerungen oder KI-TrainingsdatenJaLokal oder Cloud (je nach Kamera/App)Enthält Metadaten (EXIF), integriert in soziale Medien
Los des Lottogewinners im ScannerEingescanntes PapierdokumentDigitales DokumentPDFScandatum, Auflösung, FarbtiefeJaMittel, z. B. für NachweiseNeinLokale oder serverbasierte SpeicherungKann digitalen Signaturschutz erfordern
Herzschlag durch SmartwatchMessung durch SensorenXML-DateiXMLZeitstempel, Herzfrequenz, MessgenauigkeitJaHoch, z. B. für GesundheitsüberwachungJaCloud oder GerätedatenErfordert Vorverarbeitung/Validierung für Analyse
Zusage neuer Job per WhatsApp-SprachnachrichtSprachnachricht über Smartphone-AppAudiodateiOPUSAufnahmedauer, Codec, SamplingrateJaHoch, z. B. für KommunikationsnachweiseEventuellIn den Cloudrichtlinien von Meta gespeichertDatenschutz und Nutzerrechte beachten
Volle Badewanne gemessen vom ZählerMechanische Zählung durch WasserzählerMechanische DatenRollenzählwerkZählwerkstand, Wasservolumen in LiternJaMittel, z. B. für AbrechnungenSeltenLokal auf mechanischem Zählwerk gespeichertWartungssensitiv, Möglichkeit mechanischer Fehler

Wenn Sie diese Beispiele lesen, verbinden Sie mit diesen eine Erinnerung. Wenn man die Geburtstagsfeier, den Notarvertrag, den Herzschlag, die Jobzusage oder die volle Badewanne in ihrer technischen Form betrachtet, werden diese abstrakt.

Als einfaches Beispiel zeige ich Ihnen die Rohdaten eines Bildes in der Kodierung Base64.

Bei den Rohdaten setzt die Datenannotation an. Der Vortrag von Herrn Gossen zeigt in folgender Präsentation einen umfangreichen Überblick.

Klicken Sie auf den unteren Button, um den Inhalt von www.slideshare.net zu laden.

Inhalt laden

Was bedeutet Datenannotation?

Datenannotationen kontextualisieren Rohdaten. Vereinfacht gesagt, werden Rohdaten durch deren Annotation inhaltlich angereichert.

Um bei dem Beispiel der Buchstabenkette zu bleiben: Wenn Sie die zuvor genannte Kette aus Buchstaben kopieren und als black.png auf Ihrem Computer speichern, können Sie diese Datei öffnen. Sie sehen dann folgendes Bild.

das Schwarze Quadrat von Kasimir Sewerinowitsch Malewitsch

Der Name gibt den Daten somit einen ersten Kontext. Sie könnten auf Ihrem Computer auch einen Ordner anlegen, den Sie »Farben« nennen. Durch dieses Vorgehen könnten Sie weiteren Kontext »annotieren«. Durch diesen Ordner annotieren Sie, dass dieses Bild eines der Bilder ist, das eine Farbe zeigt. Danach könnten Sie in den Ordner blau.png, rot.png usw. ablegen. Durch dieses Vorgehen, würden Sie, unbeeindruckt von mancher volkskulturellen Debatte, zudem annotieren, dass Schwarz für »Sie« eine Farbe ist.

Was sich bereits an diesem einfachen Beispiel zeigt. Selbst die einfachsten Annotationen, in Form des Dateinamens oder auch des Ordners, in dem Sie das Bild ablegen, genauer gesagt klassifizieren, sind eine Interpretation.

In einem anderen Kontext, z. B. beim Sortieren von Urlaubsbildern, würden Sie dieses Bild in den Papierkorb legen. Wenn Sie Sammler von Kunstwerken sind, könnte das Bild das Schwarze Quadrat von Kasimir Sewerinowitsch Malewitsch zeigen.

Kurz gesagt: Datenannotation ist die Interpretation von Rohdaten.

Genau diese Interpretationen werden verwendet, um kontrolliert maschinell zu lernen. Diese annotierten Daten werden im supvervised Trainingsansatz, im Vergleich zum unsupervised Training, verwendet, damit Maschinen diese menschliche Interpretation der Rohdaten erlernen.

Alle Daten, egal ob Audio, Video, Ton, Bild oder Text, können annotiert werden. Die Qualität, Konsistenz und Granularität der Annotation bestimmen jedoch maßgeblich die Leistungsfähigkeit der resultierenden Modelle.

Was sind die Grenzen der Annotation von Daten?

Bevor wir gleich exemplarisch ein Katzenbild betrachten, lohnt sich ein kleiner gedanklicher Umweg. Denn hinter jeder Annotation steckt nicht nur Technik, sondern auch eine Interpretation – mal sachlich, mal widersprüchlich, mal sogar charmant menschlich.

Annotationen strukturieren Daten, sie entscheiden, was sichtbar wird und wie es bewertet wird. Zum Beispiel in Banken und Versicherungen ist diese Zuordnung entscheidend: Ist ein Kunde ein Risikofall oder eine Chance? Ist ein Schaden standardisiert oder gibt es Sondermerkmale? Die Qualität der Annotation bestimmt die Präzision der Modelle – und damit die Grundlage jeder Entscheidung. Klarheit und Konsistenz in der Interpretation sind keine Option, sondern Pflicht.

Ein kleiner Exkurs zu einem einfacheren Thema – Katzen

Verschiedene Objekte in einem Bild zu erkennen war bereits 2017 sehr einfach möglich, siehe Computer Vision on the Web with WebRTC and TensorFlow – webrtcHacks: Zwei Katzen, ein Bett und ein Laptop. Das damals populäre Framework TensorFlow von Google bot mit der Object Detection API tausend unterschiedliche Arten von Objekten, die durch annotierte Daten »automatisch« erkannt werden konnten. Nach vielen Jahren ist die Technik sehr viel genauer. Jedoch bleibt bis heute folgender Aspekt zu berücksichtigen:

Was auf den ersten Blick aussieht wie eine neutrale Zuordnung – »das ist ein Laptop«, »das ist ein Bett« – kann im Detail komplex werden: Sollten die beiden Katzen nicht nur als Katze erkannt werden, sondern mit dem jeweiligen Namen. Doch diese Annotationen könnten wahrscheinlich nur das Herrchen, genauer gesagt der Experte dieser beiden Katzen, Chad Hart anbringen.

In 2017 zeigt Chad Hart bereits die Möglichkeiten der ObjectDetection API von Tensorflow.
In 2017 zeigt Chad Hart bereits die Möglichkeiten der ObjectDetection API von Tensorflow.

Genau hier zeigt sich die Kraft und die Tücke von Annotationen: Sie machen Daten greifbar, aber sie tun das durch unsere Brille – und diese Brille ist nie ganz objektiv. Und das ist keine Schwäche, sondern ein Aufruf zur Aufmerksamkeit: Denn maschinelles Lernen beginnt immer bei uns.

Dieses Bild ist mehr als ein technischer Schnappschuss: Es ist ein Beweis dafür, dass Maschinen beginnen, unsere Welt zu sehen – aber nur so, wie wir sie ihnen beschreiben.

Entwicklung und Zukunft der Datenannotation

Egal, ob man von dem Annotieren der Daten, der Annotation oder der Dateninterpretation spricht, geht es stets darum: Rohdaten mit Kontext anzureichern, damit Maschinen in der Lage sind, mit diesen Daten zu lernen. Datenannotation ist der Schlüssel, um aus einer unbehandelten technischen Beobachtung eine sinnvolle Basis für maschinelles Lernen zu machen. Doch die Art und Weise, wie diese Annotation erfolgt, hat sich in den vergangenen Jahren massiv gewandelt.

  • Von der manuellen Annotation zur Automatisierung: Früher war die Aufgabe der Datenannotation schlicht, aber arbeitsintensiv: Menschen gaben jeder einzelnen Beobachtung – ob Pixel, Text oder Signal – eine Bedeutung. Jedes einzelne Bild, jeder Absatz Text wurde akribisch durchgesehen und manuell gelabelt. Dies war präzise, aber nicht skalierbar. Der steigende Bedarf an Daten ging mit einem Wandel der Methoden einher.
  • Die Unterstützung durch vorannotierte Daten: Mit der Verlagerung hin zu vorannotierten Daten wurde der Mensch zum Prüfer statt zum Ersteller. Algorithmen machten Vorschläge, die nachträglich korrigiert wurden. Diese hybride Methode sparte Zeit, führte jedoch auch zu neuen Herausforderungen, etwa der unkritischen Übernahme algorithmischer Fehler und damit zur Verschärfung bestehender Vorannahmen. Es blieb ein Mittelding – schneller, aber nicht perfekt.
  • Der Einstieg in synthetische Daten: Synthetische Daten waren der nächste logische Schritt. Sie wurden mithilfe von Algorithmen, Simulationen oder generativen Modellen wie GANs komplett künstlich erschaffen, aber durch ihren Ursprung automatisch annotiert. Sie lösten das Problem der Datenverfügbarkeit bei gleichzeitig hoher Skalierbarkeit. Doch auch hier zeigten sich Einschränkungen. Das Problem der Domänenvalidität blieb ungelöst: Synthetische Daten spiegeln meist idealisierte Bedingungen wider und können reale Anwendungen oft nicht vollständig abbilden.
  • Unsupervised Transformer und das maschinelle Verstehen: Mit dem Aufstieg unüberwachter transformerbasierter Modelle wie GPT änderte sich erneut die Spielweise. Datenannotation schien überflüssig zu werden. Ausgangspunkt war die Idee, dass Maschinen sich Bedeutungen eigenständig erschließen könnten, indem sie Muster in großen Mengen unbehandelter Daten analysieren. Statt expliziten Labels genügte der rohe Datenfluss; anstelle von Annotation trat die Korrelation. Modelle wie diese zielten darauf ab, Bedeutungen aus Daten autonome zu erkennen – ein Paradigmenwechsel.

Ein Schritt zurück? Warum Annotation in 2025 wieder relevanter wird

Auch wenn unsupervised Learning theoretisch ohne Annotation auskommt, wird in der Praxis deutlich: Annotationen bleiben auch in dieser neuen Ära unverzichtbar. Große Sprachmodelle wie GPT haben wiederholt gezeigt, dass sie in spezifischen Anwendungen an ihre Grenzen stoßen, wenn die Trainingsdaten keine klare menschliche Überprüfung oder Anpassung erfahren.

Feine, gezielte Datenannotationen werden in verschiedenen Bereichen wichtig:

  • Domänenspezifisches Wissen: Sprachmodelle, die in Unternehmen oder spezialisierten Anwendungen genutzt werden sollen, erfordern präzise, branchenspezifische Anpassungen.
  • Fairness: Ohne gezielte Annotation verstärken unsupervised Modelle bestehende Biases, da sie unkontrolliert auf den Datenpool angewiesen sind.
  • Qualitätsprüfung: Hochwertige Annotation dient als Goldstandard, um die Leistung eines Modells zu validieren, zu erklären oder zu hinterfragen.

These 1: Unsupervised Learning ersetzt Annotation nicht – es macht sie gezielter.

Der Zielkonflikt bleibt: Unsupervised Lernen hat Annotation nie ersetzt, sondern nur verlagert. Mit der Vielzahl an agnostischen Datensätzen ist es die präzise menschliche Korrektur, die den Unterschied macht.

Annotation wird nicht mehr massenhaft durchgeführt, sondern dient als strategisches Feintuning. Sie ist die Brücke zwischen maschineller Allgemeinheit und unternehmerischer Relevanz. Unternehmen, die ihre Modelle effektiv nutzen wollen, müssen zuvor investieren: in eine neue, gezielte Form der Datenannotation.

These 2: Selbst Unsupervised Learning ist nie unbeaufsichtigt

Selbst sogenanntes Unsupervised Learning ist – bei näherer Betrachtung – nie vollkommen unbeaufsichtigt. Denn auch wenn beim Lernen selbst keine expliziten Labels vorgegeben werden, bleibt die Auswahl der Daten stets eine zutiefst menschliche Entscheidung.

Welche Daten gesammelt, gespeichert und verarbeitet werden, ist weder zufällig noch vollständig – und genau darin liegt die verborgene Supervision: Eine Maschine kann nicht wissen, was sie nicht sieht. Ihr fehlt die Fähigkeit zur gezielten Neugier, zum aktiven Beobachten oder gar zum Infragestellen ihrer eigenen Perspektive.

Stattdessen ist sie auf die Welt angewiesen, wie sie ihr präsentiert wird – selektiv, fragmentarisch, oft verzerrt. So wird jede vermeintlich objektive Entdeckung zu einem Spiegel menschlicher Vorannahmen, Auswahlprozesse und blinder Flecken.

Fazit

Die Annotation von Daten erlaubt es, Rohdaten zu interpretieren. Auch wenn man in der Forschung davon ausgeht, dass Annotationen richtig oder falsch sein können, interpretieren Annotationen die Daten durch den menschlichen Annotator.

Fanden Sie die Seite hilfreich?

Vielen Dank für Ihr Feedback!

Würden Sie mir Feedback geben? (anonym)

Wir entwickeln KI-Software für Unternehmen und verzichten bewusst auf störende Werbebanner. Durch unsere Artikel dokumentieren wir Themen, die uns beschäftigen, interessieren und auch unser tägliches Brot finanzieren.

Da unsere Inhalte kostenfrei sind, ist Ihr Feedback unser Lob.

Jeder Autor liest Ihr anonymes Feedback persönlich, obwohl KI es automatisieren könnten, und integriert konstruktive Vorschläge direkt in die nächste Überarbeitung oder nutzt es als Inspiration für den nächsten Artikel.



    de_DEDE