Lancement / Blog / Données / Qu'est-ce que l'annotation de données et pourquoi l'IA en a-t-elle besoin ?

Qu'est-ce que l'annotation de données et pourquoi l'IA en a-t-elle besoin ?

Résumer avec ChatGPT

Que l'on parle d'annotation des données, d'annotation de données ou d'annotation de données, on entend par là l'enrichissement des données brutes par des connaissances contextuelles.

Je vais expliquer plus en détail cette phrase potentiellement énigmatique dans l'article suivant.

Les annotations de données commencent toujours par des données brutes, qui constituent le point de départ de toute analyse. Elles sont le fondement sur lequel les systèmes reconnaissent, interprètent et catégorisent les contenus. Pour comprendre ce qui se cache derrière les annotations, il vaut la peine de jeter un coup d'œil aux données brutes.

Que sont les données brutes ?

Les données brutes sont des observations sous forme technique et constituent le stade préliminaire de l'information.

5 Exemples de données brutes

ExempleSource des données brutesType de donnéesFormat de stockageExemples d'attributsÉtat non transforméDépendance au contexteHorodatage/localisationQualité/lieu de stockageAutres particularités
Fête d'anniversaire photographiée avec un smartphonePrise de photos par appareil photoFichier imageJPEG/PNGColorisation, résolution, heure de prise de vue, géolocalisationOuiÉlevé, par exemple pour les rappels ou les données d'entraînement de l'IAOuiLocal ou cloud (selon la caméra/l'application)Contient des métadonnées (EXIF), intégrées aux médias sociaux
Le billet du gagnant du loto dans le scannerDocument papier numériséDocument numériquePDFdate de numérisation, résolution, profondeur de couleurOuiMoyens, par exemple pour les preuvesNonStockage local ou sur serveurPeut nécessiter une protection de la signature numérique
Battement de cœur par smartwatchMesure par capteursFichier XMLXMLHorodatage, fréquence cardiaque, précision de la mesureOuiÉlevé, par ex. pour la surveillance de la santéOuiDonnées du cloud ou de l'appareilNécessite un prétraitement/une validation pour l'analyse
Promesse de nouvel emploi par message vocal WhatsAppMessage vocal via l'application pour smartphoneFichier audioOPUSDurée d'enregistrement, codec, taux d'échantillonnageOuiÉlevé, par ex. pour les preuves de communicationÉventuellementStocké dans les politiques de cloud de MetaRespecter la protection des données et les droits des utilisateurs
Bain plein mesuré par le compteurComptage mécanique par compteur d'eauDonnées mécaniquesCompteur à rouleauxNiveau du compteur, volume d'eau en litresOuiMoyens, par exemple pour les décomptesRarementEnregistré localement sur un compteur mécaniqueSensible à la maintenance, possibilité d'erreurs mécaniques

Lorsque vous lisez ces exemples, vous les associez à un souvenir. Si vous considérez la fête d'anniversaire, l'acte notarié, le battement de cœur, la promesse d'embauche ou la baignoire pleine sous leur forme technique, ils deviennent abstraits.

Comme exemple simple, je vous montre les données brutes d'une image dans le codage Base64.

L'annotation des données intervient au niveau des données brutes. L'exposé de M. Gossen en donne un aperçu complet dans la présentation suivante.

Cliquez sur le bouton ci-dessous pour charger le contenu de www.slideshare.net.

Charger le contenu

Que signifie l'annotation de données ?

Les annotations de données contextualisent les données brutes. Pour simplifier, on peut dire que les données brutes sont enrichies en termes de contenu par leur annotation.

Pour rester dans l'exemple de la chaîne de lettres : Si vous copiez la chaîne de lettres mentionnée précédemment et l'enregistrez en tant que black.png sur votre ordinateur, vous pouvez ouvrir ce fichier. Vous verrez alors l'image suivante.

das Schwarze Quadrat von Kasimir Sewerinowitsch Malewitsch

Le nom donne ainsi un premier contexte aux données. Vous pourriez également créer un dossier sur votre ordinateur que vous nommeriez "Couleurs". En procédant ainsi, vous pouvez "annoter" un autre contexte. Grâce à ce dossier, vous annotez le fait que cette image est l'une des images montrant une couleur. Ensuite, vous pouvez placer dans le dossier bleu.png, rouge.png, etc. En procédant de la sorte, vous pourriez, sans vous laisser impressionner par certains débat sur la culture populaireLe texte de l'article est en allemand.

Ce qui ressort déjà de ce simple exemple. Même les annotations les plus simples, sous la forme du nom de fichier ou même du dossier dans lequel vous placez l'image, ou plus exactement la classez, sont une interprétation.

Dans un autre contexte, par exemple lorsque vous triez des photos de vacances, vous mettriez cette image à la corbeille. Si vous êtes un collectionneur d'œuvres d'art, l'image pourrait être le Carré noir de Kazimir Severinovitch Malevitch.

En bref, l'annotation de données est l'interprétation de données brutes.

Ce sont précisément ces interprétations qui sont utilisées pour l'apprentissage automatique contrôlé. Ces données annotées sont utilisées dans l'approche d'apprentissage supvervised, par rapport au formation non superviséeLe logiciel de traitement des données est utilisé pour que les machines apprennent cette interprétation humaine des données brutes.

Toutes les données, qu'il s'agisse d'audio, de vidéo, de son, d'image ou de texte, peuvent être annotées. Cependant, la qualité, la cohérence et la granularité de l'annotation déterminent en grande partie la performance des modèles qui en résultent.

Quelles sont les limites de l'annotation de données ?

Avant d'examiner tout de suite une image de chat à titre d'exemple, il vaut la peine de faire un petit détour intellectuel. Car derrière chaque annotation se cache non seulement une technique, mais aussi une interprétation - parfois objective, parfois contradictoire, parfois même charmante et humaine.

Les annotations structurent les données, elles décident de ce qui sera visible et de la manière dont cela sera évalué. Par exemple, dans les banques et les assurances, cette attribution est décisive : un client est-il un cas à risque ou une opportunité ? Un sinistre est-il standardisé ou présente-t-il des caractéristiques particulières ? La qualité de l'annotation détermine la précision des modèles - et donc la base de toute décision. La clarté et la cohérence de l'interprétation ne sont pas une option, mais une obligation.

Une petite digression sur un sujet plus simple - les chats

Reconnaître différents objets dans une image était déjà possible très facilement en 2017, voir Vision par ordinateur sur le web avec WebRTC et TensorFlow - webrtcHacksDeux chats, un lit et un ordinateur portable. Le framework TensorFlow de Google, très populaire à l'époque, proposait avec l'Object Detection API des milliers de types d'objets différents qui pouvaient être reconnus "automatiquement" grâce à des données annotées. Après de nombreuses années, la technique est devenue beaucoup plus précise. Cependant, l'aspect suivant reste à prendre en compte jusqu'à aujourd'hui :

Ce qui, à première vue, semble être une attribution neutre - "ceci est un ordinateur portable", "ceci est un lit" - peut devenir complexe dans le détail : Si les deux chats devaient être reconnus non seulement en tant que chat, mais aussi avec leur nom respectif. Mais ces annotations ne pourraient probablement être faites que par le maître, ou plus précisément par l'expert de ces deux chats, Chad Hart fixer.

In 2017 zeigt Chad Hart bereits die Möglichkeiten der ObjectDetection API von Tensorflow.
En 2017, Chad Hart montre déjà les possibilités de l'API ObjectDetection de Tensorflow.

C'est précisément là que l'on voit la force et la malice des annotations : Elles rendent les données tangibles, mais elles le font à travers nos lunettes - et ces lunettes ne sont jamais tout à fait objectives. Et ce n'est pas une faiblesse, mais un appel à l'attention : car l'apprentissage automatique commence toujours par nous.

Cette image est plus qu'un simple cliché technique : elle est la preuve que les machines commencent à voir notre monde - mais seulement tel que nous le leur décrivons.

Développement et avenir de l'annotation de données

Que l'on parle d'annotation des données, d'annotation ou d'interprétation des données, il s'agit toujours d'enrichir les données brutes avec du contexte afin que les machines soient en mesure d'apprendre avec ces données. L'annotation des données est la clé pour transformer une observation technique non traitée en une base utile pour l'apprentissage automatique. Mais la manière dont cette annotation est réalisée a énormément évolué ces dernières années.

  • De l'annotation manuelle à l'automatisation : auparavant, la tâche d'annotation des données était simple mais exigeait beaucoup de travail : les gens donnaient une signification à chaque observation, qu'il s'agisse de pixels, de texte ou de signaux. Chaque image, chaque paragraphe de texte était minutieusement passé en revue et étiqueté manuellement. C'était précis, mais pas évolutif. La demande croissante de données s'est accompagnée d'une évolution des méthodes.
  • L'assistance par des données pré-notifiées : Avec le passage aux données prénotées, l'homme est devenu un vérificateur plutôt qu'un créateur. Les algorithmes faisaient des propositions qui étaient corrigées par la suite. Cette méthode hybride a permis de gagner du temps, mais a également entraîné de nouveaux défis, comme l'adoption non critique d'erreurs algorithmiques et donc le renforcement des présupposés existants. Cela restait un juste milieu - plus rapide, mais pas parfait.
  • L'entrée dans les données synthétiques : les données synthétiques ont été l'étape logique suivante. Elles étaient créées de manière totalement artificielle à l'aide d'algorithmes, de simulations ou de modèles génératifs comme les GAN, mais annotées automatiquement par leur origine. Ils résolvaient le problème de la disponibilité des données tout en offrant une grande évolutivité. Mais là aussi, des restrictions sont apparues. Le problème de la validité du domaine n'a pas été résolu : les données synthétiques reflètent généralement des conditions idéalisées et ne peuvent souvent pas reproduire entièrement des applications réelles.
  • Les transformateurs non supervisés et la compréhension automatique : Avec la montée en puissance des modèles non supervisés basés sur les transformateurs, tels que GPT, la manière de jouer a de nouveau changé. L'annotation des données semblait devenir superflue. L'idée de départ était que les machines pouvaient trouver des significations de manière autonome en analysant des modèles dans de grandes quantités de données non traitées. Au lieu d'étiquettes explicites, le flux de données brutes suffisait ; la corrélation remplaçait l'annotation. Des modèles comme celui-ci visaient à identifier de manière autonome les significations des données - un changement de paradigme.

Un pas en arrière ? Pourquoi l'annotation redeviendra-t-elle plus pertinente en 2025 ?

Même si l'apprentissage non supervisé peut théoriquement se passer d'annotation, la pratique montre clairement que les annotations restent indispensables dans cette nouvelle ère. Les grands modèles linguistiques tels que GPT ont montré à plusieurs reprises qu'ils atteignent leurs limites dans des applications spécifiques lorsque les données d'apprentissage ne font pas l'objet d'une vérification ou d'une adaptation humaine claire.

Des annotations de données fines et ciblées deviennent importantes dans différents domaines :

  • Connaissances spécifiques au domaine : les modèles linguistiques destinés à être utilisés dans des entreprises ou des applications spécialisées nécessitent des adaptations précises et spécifiques au secteur.
  • Équité : sans annotation ciblée, les modèles non supervisés renforcent les biais existants, car ils dépendent de manière incontrôlée du pool de données.
  • Contrôle de la qualité : l'annotation de haute qualité sert d'étalon-or pour valider, expliquer ou remettre en question les performances d'un modèle.

Thèse 1 : l'apprentissage non supervisé ne remplace pas l'annotation - il la rend plus ciblée.

Le conflit d'objectifs demeure : L'apprentissage non supervisé n'a jamais remplacé l'annotation, il l'a seulement déplacée. Avec la multitude de jeux de données agnostiques, c'est la correction humaine précise qui fait la différence.

L'annotation n'est plus effectuée en masse, mais sert de réglage fin stratégique. Elle est le pont entre la généricité de la machine et la pertinence de l'entreprise. Les entreprises qui souhaitent utiliser efficacement leurs modèles doivent investir au préalable : dans une nouvelle forme ciblée d'annotation des données.

Thèse 2 : même l'apprentissage non supervisé n'est jamais sans surveillance

Même les soi-disant Apprentissage non supervisé n'est - à y regarder de plus près - jamais totalement non supervisé. Car même si aucun label explicite n'est donné lors de l'apprentissage lui-même, le choix des données reste toujours une décision profondément humaine.

Les données qui sont collectées, stockées et traitées ne sont ni aléatoires ni complètes - et c'est là que réside la supervision cachée : une machine ne peut pas savoir ce qu'elle va faire. pas voit. Il lui manque la capacité d'une curiosité ciblée, d'une observation active ou même d'une remise en question de sa propre perspective.

Au lieu de cela, elle est tributaire du monde tel qu'il lui est présenté - de manière sélective, fragmentaire, souvent déformée. Ainsi, toute découverte prétendument objective devient un miroir des présupposés humains, des processus de sélection et des points aveugles.

Conclusion

L'annotation des données permet d'interpréter les données brutes. Même si l'on considère dans la recherche que les annotations peuvent être justes ou fausses, les annotations interprètent les données par l'annotateur humain.

Avez-vous trouvé cette page utile ?

Merci beaucoup pour vos commentaires !

Voulez-vous me donner un feedback ? (anonyme)

Nous développons des logiciels d'intelligence artificielle pour les entreprises et renonçons délibérément aux bannières publicitaires gênantes. Par le biais de nos articles, nous documentons des thèmes qui nous préoccupent, nous intéressent et financent également notre pain quotidien.

Comme nos contenus sont gratuits, vos commentaires sont nos félicitations.

Chaque auteur lit personnellement vos commentaires anonymes, même si les IA pourraient les automatiser, et intègre directement les suggestions constructives dans la prochaine révision ou les utilise comme source d'inspiration pour le prochain article.



    fr_FRFR