Que l'on parle d'annotation des données, d'annotation de données ou d'annotation de données, on entend par là l'enrichissement des données brutes par des connaissances contextuelles.
Je vais expliquer plus en détail cette phrase potentiellement énigmatique dans l'article suivant.
Les annotations de données commencent toujours par des données brutes, qui constituent le point de départ de toute analyse. Elles sont le fondement sur lequel les systèmes reconnaissent, interprètent et catégorisent les contenus. Pour comprendre ce qui se cache derrière les annotations, il vaut la peine de jeter un coup d'œil aux données brutes.
Que sont les données brutes ?
Les données brutes sont des observations sous forme technique et constituent le stade préliminaire de l'information.
5 Exemples de données brutes
| Exemple | Source des données brutes | Type de données | Format de stockage | Exemples d'attributs | État non transformé | Dépendance au contexte | Horodatage/localisation | Qualité/lieu de stockage | Autres particularités |
|---|---|---|---|---|---|---|---|---|---|
| Fête d'anniversaire photographiée avec un smartphone | Prise de photos par appareil photo | Fichier image | JPEG/PNG | Colorisation, résolution, heure de prise de vue, géolocalisation | Oui | Élevé, par exemple pour les rappels ou les données d'entraînement de l'IA | Oui | Local ou cloud (selon la caméra/l'application) | Contient des métadonnées (EXIF), intégrées aux médias sociaux |
| Le billet du gagnant du loto dans le scanner | Document papier numérisé | Document numérique | date de numérisation, résolution, profondeur de couleur | Oui | Moyens, par exemple pour les preuves | Non | Stockage local ou sur serveur | Peut nécessiter une protection de la signature numérique | |
| Battement de cœur par smartwatch | Mesure par capteurs | Fichier XML | XML | Horodatage, fréquence cardiaque, précision de la mesure | Oui | Élevé, par ex. pour la surveillance de la santé | Oui | Données du cloud ou de l'appareil | Nécessite un prétraitement/une validation pour l'analyse |
| Promesse de nouvel emploi par message vocal WhatsApp | Message vocal via l'application pour smartphone | Fichier audio | OPUS | Durée d'enregistrement, codec, taux d'échantillonnage | Oui | Élevé, par ex. pour les preuves de communication | Éventuellement | Stocké dans les politiques de cloud de Meta | Respecter la protection des données et les droits des utilisateurs |
| Bain plein mesuré par le compteur | Comptage mécanique par compteur d'eau | Données mécaniques | Compteur à rouleaux | Niveau du compteur, volume d'eau en litres | Oui | Moyens, par exemple pour les décomptes | Rarement | Enregistré localement sur un compteur mécanique | Sensible à la maintenance, possibilité d'erreurs mécaniques |
Lorsque vous lisez ces exemples, vous les associez à un souvenir. Si vous considérez la fête d'anniversaire, l'acte notarié, le battement de cœur, la promesse d'embauche ou la baignoire pleine sous leur forme technique, ils deviennent abstraits.
Comme exemple simple, je vous montre les données brutes d'une image dans le codage Base64.
data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAIkAAACJAQMAAAAi6omKAAAAAXNSR0IArs4c6QAAAARnQU1BAACxjwv8YQUAAAADUExURQAAAKd6PdoAAAAJcEhZcwAAMsAAADLAAShkWtsAAAAaSURBVEjH7cGBAAAAAMOg+VNf4AhVAADw1AAKKwABPzKW5wAAAABJRU5ErkJggg==L'annotation des données intervient au niveau des données brutes. L'exposé de M. Gossen en donne un aperçu complet dans la présentation suivante.
Cliquez sur le bouton ci-dessous pour charger le contenu de www.slideshare.net.
Que signifie l'annotation de données ?
Les annotations de données contextualisent les données brutes. Pour simplifier, on peut dire que les données brutes sont enrichies en termes de contenu par leur annotation.
Pour rester dans l'exemple de la chaîne de lettres : Si vous copiez la chaîne de lettres mentionnée précédemment et l'enregistrez en tant que black.png sur votre ordinateur, vous pouvez ouvrir ce fichier. Vous verrez alors l'image suivante.

Le nom donne ainsi un premier contexte aux données. Vous pourriez également créer un dossier sur votre ordinateur que vous nommeriez "Couleurs". En procédant ainsi, vous pouvez "annoter" un autre contexte. Grâce à ce dossier, vous annotez le fait que cette image est l'une des images montrant une couleur. Ensuite, vous pouvez placer dans le dossier bleu.png, rouge.png, etc. En procédant de la sorte, vous pourriez, sans vous laisser impressionner par certains débat sur la culture populaireLe texte de l'article est en allemand.
Ce qui ressort déjà de ce simple exemple. Même les annotations les plus simples, sous la forme du nom de fichier ou même du dossier dans lequel vous placez l'image, ou plus exactement la classez, sont une interprétation.
Dans un autre contexte, par exemple lorsque vous triez des photos de vacances, vous mettriez cette image à la corbeille. Si vous êtes un collectionneur d'œuvres d'art, l'image pourrait être le Carré noir de Kazimir Severinovitch Malevitch.
En bref, l'annotation de données est l'interprétation de données brutes.
Ce sont précisément ces interprétations qui sont utilisées pour l'apprentissage automatique contrôlé. Ces données annotées sont utilisées dans l'approche d'apprentissage supvervised, par rapport au formation non superviséeLe logiciel de traitement des données est utilisé pour que les machines apprennent cette interprétation humaine des données brutes.
Toutes les données, qu'il s'agisse d'audio, de vidéo, de son, d'image ou de texte, peuvent être annotées. Cependant, la qualité, la cohérence et la granularité de l'annotation déterminent en grande partie la performance des modèles qui en résultent.
Quelles sont les limites de l'annotation de données ?
Avant d'examiner tout de suite une image de chat à titre d'exemple, il vaut la peine de faire un petit détour intellectuel. Car derrière chaque annotation se cache non seulement une technique, mais aussi une interprétation - parfois objective, parfois contradictoire, parfois même charmante et humaine.
Les annotations structurent les données, elles décident de ce qui sera visible et de la manière dont cela sera évalué. Par exemple, dans les banques et les assurances, cette attribution est décisive : un client est-il un cas à risque ou une opportunité ? Un sinistre est-il standardisé ou présente-t-il des caractéristiques particulières ? La qualité de l'annotation détermine la précision des modèles - et donc la base de toute décision. La clarté et la cohérence de l'interprétation ne sont pas une option, mais une obligation.
Une petite digression sur un sujet plus simple - les chats
Reconnaître différents objets dans une image était déjà possible très facilement en 2017, voir Vision par ordinateur sur le web avec WebRTC et TensorFlow - webrtcHacksDeux chats, un lit et un ordinateur portable. Le framework TensorFlow de Google, très populaire à l'époque, proposait avec l'Object Detection API des milliers de types d'objets différents qui pouvaient être reconnus "automatiquement" grâce à des données annotées. Après de nombreuses années, la technique est devenue beaucoup plus précise. Cependant, l'aspect suivant reste à prendre en compte jusqu'à aujourd'hui :
Ce qui, à première vue, semble être une attribution neutre - "ceci est un ordinateur portable", "ceci est un lit" - peut devenir complexe dans le détail : Si les deux chats devaient être reconnus non seulement en tant que chat, mais aussi avec leur nom respectif. Mais ces annotations ne pourraient probablement être faites que par le maître, ou plus précisément par l'expert de ces deux chats, Chad Hart fixer.

C'est précisément là que l'on voit la force et la malice des annotations : Elles rendent les données tangibles, mais elles le font à travers nos lunettes - et ces lunettes ne sont jamais tout à fait objectives. Et ce n'est pas une faiblesse, mais un appel à l'attention : car l'apprentissage automatique commence toujours par nous.
Cette image est plus qu'un simple cliché technique : elle est la preuve que les machines commencent à voir notre monde - mais seulement tel que nous le leur décrivons.
Développement et avenir de l'annotation de données
Que l'on parle d'annotation des données, d'annotation ou d'interprétation des données, il s'agit toujours d'enrichir les données brutes avec du contexte afin que les machines soient en mesure d'apprendre avec ces données. L'annotation des données est la clé pour transformer une observation technique non traitée en une base utile pour l'apprentissage automatique. Mais la manière dont cette annotation est réalisée a énormément évolué ces dernières années.
- De l'annotation manuelle à l'automatisation : auparavant, la tâche d'annotation des données était simple mais exigeait beaucoup de travail : les gens donnaient une signification à chaque observation, qu'il s'agisse de pixels, de texte ou de signaux. Chaque image, chaque paragraphe de texte était minutieusement passé en revue et étiqueté manuellement. C'était précis, mais pas évolutif. La demande croissante de données s'est accompagnée d'une évolution des méthodes.
- L'assistance par des données pré-notifiées : Avec le passage aux données prénotées, l'homme est devenu un vérificateur plutôt qu'un créateur. Les algorithmes faisaient des propositions qui étaient corrigées par la suite. Cette méthode hybride a permis de gagner du temps, mais a également entraîné de nouveaux défis, comme l'adoption non critique d'erreurs algorithmiques et donc le renforcement des présupposés existants. Cela restait un juste milieu - plus rapide, mais pas parfait.
- L'entrée dans les données synthétiques : les données synthétiques ont été l'étape logique suivante. Elles étaient créées de manière totalement artificielle à l'aide d'algorithmes, de simulations ou de modèles génératifs comme les GAN, mais annotées automatiquement par leur origine. Ils résolvaient le problème de la disponibilité des données tout en offrant une grande évolutivité. Mais là aussi, des restrictions sont apparues. Le problème de la validité du domaine n'a pas été résolu : les données synthétiques reflètent généralement des conditions idéalisées et ne peuvent souvent pas reproduire entièrement des applications réelles.
- Les transformateurs non supervisés et la compréhension automatique : Avec la montée en puissance des modèles non supervisés basés sur les transformateurs, tels que GPT, la manière de jouer a de nouveau changé. L'annotation des données semblait devenir superflue. L'idée de départ était que les machines pouvaient trouver des significations de manière autonome en analysant des modèles dans de grandes quantités de données non traitées. Au lieu d'étiquettes explicites, le flux de données brutes suffisait ; la corrélation remplaçait l'annotation. Des modèles comme celui-ci visaient à identifier de manière autonome les significations des données - un changement de paradigme.
Un pas en arrière ? Pourquoi l'annotation redeviendra-t-elle plus pertinente en 2025 ?
Même si l'apprentissage non supervisé peut théoriquement se passer d'annotation, la pratique montre clairement que les annotations restent indispensables dans cette nouvelle ère. Les grands modèles linguistiques tels que GPT ont montré à plusieurs reprises qu'ils atteignent leurs limites dans des applications spécifiques lorsque les données d'apprentissage ne font pas l'objet d'une vérification ou d'une adaptation humaine claire.
Des annotations de données fines et ciblées deviennent importantes dans différents domaines :
- Connaissances spécifiques au domaine : les modèles linguistiques destinés à être utilisés dans des entreprises ou des applications spécialisées nécessitent des adaptations précises et spécifiques au secteur.
- Équité : sans annotation ciblée, les modèles non supervisés renforcent les biais existants, car ils dépendent de manière incontrôlée du pool de données.
- Contrôle de la qualité : l'annotation de haute qualité sert d'étalon-or pour valider, expliquer ou remettre en question les performances d'un modèle.
Thèse 1 : l'apprentissage non supervisé ne remplace pas l'annotation - il la rend plus ciblée.
Le conflit d'objectifs demeure : L'apprentissage non supervisé n'a jamais remplacé l'annotation, il l'a seulement déplacée. Avec la multitude de jeux de données agnostiques, c'est la correction humaine précise qui fait la différence.
L'annotation n'est plus effectuée en masse, mais sert de réglage fin stratégique. Elle est le pont entre la généricité de la machine et la pertinence de l'entreprise. Les entreprises qui souhaitent utiliser efficacement leurs modèles doivent investir au préalable : dans une nouvelle forme ciblée d'annotation des données.
Thèse 2 : même l'apprentissage non supervisé n'est jamais sans surveillance
Même les soi-disant Apprentissage non supervisé n'est - à y regarder de plus près - jamais totalement non supervisé. Car même si aucun label explicite n'est donné lors de l'apprentissage lui-même, le choix des données reste toujours une décision profondément humaine.
Les données qui sont collectées, stockées et traitées ne sont ni aléatoires ni complètes - et c'est là que réside la supervision cachée : une machine ne peut pas savoir ce qu'elle va faire. pas voit. Il lui manque la capacité d'une curiosité ciblée, d'une observation active ou même d'une remise en question de sa propre perspective.
Au lieu de cela, elle est tributaire du monde tel qu'il lui est présenté - de manière sélective, fragmentaire, souvent déformée. Ainsi, toute découverte prétendument objective devient un miroir des présupposés humains, des processus de sélection et des points aveugles.
Conclusion
L'annotation des données permet d'interpréter les données brutes. Même si l'on considère dans la recherche que les annotations peuvent être justes ou fausses, les annotations interprètent les données par l'annotateur humain.
