Lancement / Blog / Intelligence artificielle / Zero-Shot Learning - Comprendre l'inconnu

Zero-Shot Learning - Comprendre l'inconnu

Résumer avec ChatGPT

La capacité à résoudre de nouveaux problèmes est l'une des définitions les plus connues de l'intelligence. Depuis des décennies, les informaticiens tentent d'appliquer cette précieuse capacité aux systèmes d'apprentissage. Mais ce qui est connu depuis longtemps sous le nom d'intelligence artificielle ne semble pas être réellement intelligent. Dans la plupart des cas, il s'agit de la reproduction automatisée de règles filtrées à partir d'exemples clairs. Cependant, depuis que les volumes de données utilisés ont augmenté rapidement, la capacité des modèles à comprendre des concepts non explicites s'est également accrue. Cette approche est connue sous le nom de Zero-Shot Learning, qui pourrait se révéler être une porte d'entrée pour une IA de plus en plus proche de l'homme.

Définition et principes de base

Le Zero-Shot Learning est un paradigme d'apprentissage automatique dans lequel les modèles d'IA doivent prédire des classes jusqu'alors non vues ou traiter des objets en principe inconnus, sans être conçus pour cette tâche spécifique. La raison en est que les méthodes d'apprentissage supervisé traditionnelles nécessitent généralement des inscriptions de données étendues qui sont trop coûteuses en cas de légers changements de contexte ou difficiles à obtenir pour des classes rares. Pour pouvoir renoncer à ces ajustements fins a posteriori, on utilise déjà en amont certaines méthodes qui permettent aux modèles de déduire l'inconnu à partir d'informations déjà analysées. Cela est par exemple possible grâce à des propriétés sémantiques, des représentations vectorielles ou de nouvelles combinaisons d'attributs déjà connus.

Le Zero-Shot Learning n'est donc pas une méthode d'apprentissage spécifique, mais décrit le type de problème qui nécessite une solution immédiate pour une tâche qui n'est pas connue avec précision. On pourrait donc aussi parler de Zero-Shot Compétences d'un modèle, qui reposent sur différentes ressources. À cet égard, les Large Language Models (LLM) font particulièrement parler d'eux depuis des années. Comme les réseaux neuronaux basés sur l'architecture Transformer ont été entraînés avec d'immenses quantités de données textuelles, ils disposent d'une base de connaissances incroyablement vaste. En tenant compte des relations statistiques entre les mots, ils peuvent également réagir à des entrées encore jamais reçues avec une sortie appropriée. Le Zero-Shot Learning a donc depuis longtemps trouvé sa place dans le quotidien de millions de personnes et reste néanmoins un problème intensément traité pour des tâches spéciales dans l'économie.

Classification et exemple

Pour mieux comprendre le Zero-Shot Learning, l'exemple des LLM permet de classer et de délimiter les concepts de base essentiels.

  • Fine-Tuning - Dans cette technique, un modèle open-source ou propriétaire pré-entraîné subit un nouvel entraînement à l'aide d'exemples d'affectations pour la tâche prévue. Les pondérations neuronales du réseau sous-jacent sont alors adaptées. Celui-ci peut ensuite être appliqué avec une plus grande précision au type de tâche en question. L'algorithme d'apprentissage le plus couramment utilisé est la Propagation de la cuisson.
  • Ingénierie de la promptitude - On entend par là l'optimisation du texte d'entrée utilisé (prompt) afin d'obtenir un output aussi précis que possible en fonction du projet individuel. Il n'est pas nécessaire de citer des exemples spécifiques.
zero-shot prompting LLM
Ingénierie de l'invite avec un chatbot personnalisé
  • Few-Shot Learning - Avec cette méthode, le modèle reçoit un petit nombre d'exemples dans le cadre du prompt initial ou du prompt suivant. Cela permet d'augmenter considérablement la précision ou la concordance avec le résultat souhaité. L'utilisation des LLM est une forme d'ingénierie de l'invite. Dans l'exemple, l'auteur aurait pu fournir au modèle ses propres explications du concept ou des passages similaires, de sorte qu'il est même possible de rapprocher l'output de son style de langage humain.
  • Apprentissage en tir groupé - En règle générale, cette approche implique un renoncement complet au réglage fin spécifique à la tâche et aux exemples d'entraînement. Au lieu de cela, le domaine d'entraînement générique ou les capacités généralisées du modèle sont utilisés pour obtenir du premier coup le résultat souhaité, comme dans l'exemple. Il s'agissait ici d'un seul prompt précis, on parle également de Zero-Shot Prompting. Les concepts de Zero-Shot Learning et de Prompt Engineering sont donc parfaitement compatibles dans les LLM. Comme le nombre d'exemples de formation utilisés est nul, on pourrait aussi parler d'un cas particulier de Few-Shot Learning.

Approches techniques

Plutôt que de se fier uniquement à la base de connaissances des données de formation, il existe des approches générales et des méthodes spécifiques pour améliorer les capacités de prise de vue zéro. Cependant, dans la plupart des cas, le modèle a déjà subi un pré-entraînement complet avec des données textuelles ou visuelles afin d'acquérir une image complète des différents concepts du monde et de leurs relations.

Apprentissage généralisé en plan zéro

Un apprentissage supervisé est prévu ici, qui doit permettre d'établir des relations sémantiques entre les classes connues et inconnues dans les données. Cette différence est modélisée d'une part par l'échantillonnage de points de données, et d'autre part par certains attributs permettant de représenter les points communs entre les classes. Le modèle est ainsi préparé de manière ciblée à la problématique du Zero-Shot Learning, pour laquelle il faut d'abord décider s'il s'agit d'une classe déjà clairement définie ou d'une modification de celle-ci. Dans une revue scientifique, on distingue Pourpanah et alt. (2023) deux types de méthodes pour ce transfert :

Méthodes d'intégration utilisent des représentations graphiques ou tirées de la Architecture du transformateur des éléments connus comme l'auto-encodeur et les modules d'attention.

Méthodes génératives ont en revanche pour objectif la création d'un modèle génératif permettant de générer des patterns d'apprentissage à partir d'enchâssements de mots ou de graphes connus et inconnus.

Apprentissage par transfert

Si un modèle a déjà été préparé à une tâche spécifique par un entraînement supervisé et qu'il a subi des adaptations neuronales correspondantes, ces dernières peuvent par exemple être obtenues par le biais de Apprentissage fédéré sur un autre modèle. Celui-ci peut ensuite être appliqué à une nouvelle tâche, légèrement différente, et les pondérations effectuées représentent un avantage considérable par rapport au modèle généraliste initial. En principe, on recycle donc un apprentissage déjà effectué pour faire face à des circonstances partiellement concordantes. La poursuite de l'adaptation implique une nette réduction de la consommation de ressources en termes de temps, de puissance de calcul et de données. La technique suivante, plus concrète, est souvent utilisée dans le cadre de l'apprentissage par transfert.

Embarquements sémantiques

Les attributs de classes qui peuvent être appris et qu'un modèle doit reconnaître peuvent être représentés sous forme de vecteurs spatiaux. Ces embeddings représentent des informations ou des attributs individuels sous une forme mathématique et donc lisible par une machine. Concrètement, il peut s'agir d'indications sur la signification de certains mots ou, dans le cas du traitement d'images, de caractéristiques optiques telles que la taille ou la couleur. Même si un modèle n'a pas encore été entraîné à un concept cible particulier, il peut, après un entraînement avec des données étiquetées, tirer certaines conclusions en ce qui concerne la composition de vecteurs déjà connus et leurs distances. Une technique fréquemment utilisée pour le traitement de la parole est la suivante Word2vec.

Word embeddings
Un modèle qui n'a jamais été explicitement confronté au concept de "reine" pourrait conclure, dans l'espace vectoriel, à l'équivalent féminin de "roi".

D'autres catégories de méthodes sont par exemple

  • Méthodes de correspondance - Chaque classe reçoit un prototype représentatif dans l'espace sémantique ainsi qu'un classificateur binaire qui modélise la décision de savoir s'il s'agit de cette classe. Une fonction de correspondance est apprise entre ces deux éléments.
  • Méthodes de projection - Dans ce cas, les instances de l'espace des caractéristiques et les prototypes de l'espace sémantique sont projetés dans un espace commun afin de générer des instances étiquetées pour les classes non vues.
  • Méthodes d'emprunt d'instances - Les instances étiquetées de classes comparables servent à générer des exemples de classes inconnues en constatant certaines similitudes.

Défis à relever

Si les méthodes mentionnées ci-dessus facilitent considérablement l'utilisation de nouvelles classes, elles posent elles-mêmes des défis importants en matière de développement.

  • Complexité des modèles - L'entraînement de modèles "zero shot" prend beaucoup de temps et nécessite une grande puissance de calcul. Il faut bien évaluer si cela justifie la valeur ajoutée dans l'application ou si un modèle "from-scratch" est également possible pour de nouvelles tâches.
  • Hétérogénéité - Si les différences entre les classes vues et non vues sont trop importantes, cela peut entraîner une baisse des performances. Lorsque les données sont trop hétérogènes, il existe actuellement des limites.
  • Similitudes - Toutefois, si les classes se ressemblent trop, cela peut entraîner des ambiguïtés qui faussent le résultat.

Un potentiel croissant pour le traitement de texte et d'images

Comme nous l'avons déjà vu, il existe deux dimensions essentielles dans lesquelles des informations compréhensibles pour les humains peuvent également être saisies par des modèles d'IA : Le texte et l'image. Au fil des décennies, deux champs d'application importants de l'IA ont été identifiés, qui profitent particulièrement de l'apprentissage en temps réel.

Vision par ordinateur

Pouvoir reconnaître de nouveaux objets dans des images sans avoir besoin d'exemples d'entraînement explicites a longtemps été considéré comme un objectif purement théorique. Cependant, grâce à la grande quantité d'informations sur les images qui peuvent désormais être traitées, les modèles reçoivent de plus en plus d'indications sur des classes inconnues et leur composition en attributs. De cette manière, il est par exemple possible de détecter des maladies rares telles que les tumeurs dans les scans dans le domaine du diagnostic médical. Ces capacités accrues sont également utiles dans la fabrication, la robotique et la technologie des capteurs pour gérer les anomalies.

zero-shot vision classification
Source : Une revue des méthodes d'apprentissage généralisées à tir nul

Traitement du langage naturel

Les possibilités offertes par l'IA générative n'ont sans doute échappé à personne. Toutefois, le potentiel va désormais au-delà de l'utilisation des domaines d'entraînement génériques des grands modèles linguistiques et s'étend à des tâches spécifiques telles que la reconnaissance précise de classes de textes dans des contextes spécialisés. Il est par exemple possible de réaliser des analyses de contenu zero shot de situations d'actualité inhabituelles à l'aide de différents labels. Cela peut aider à évaluer l'impact futur des catastrophes et autres événements extrêmes sur l'économie et la société.

zero shot text analysis
Source : Benchmarking Zero-shot Text Classification : Datasets, Evaluation and Entailment Approach

Dans la pratique, il est également possible de catégoriser des mots individuels afin de créer des analyses de base précieuses à des fins médicales, par exemple :

medical named entity recognition
Le logiciel d'IA Konfuzio lors de la lecture d'un rapport médical à l'aide de la reconnaissance d'entités nommées.

Les capacités "zero shot" permettent de réduire considérablement les efforts d'adaptation et de mise en œuvre de systèmes d'IA tels que Konfuzio. Dernièrement, nos experts ont pu réduire considérablement la nécessité d'étiqueter à nouveau les champs et les données dans les documents en cas de divergences. De plus, divers modèles d'IA, déjà entraînés ou propres à l'entreprise, ainsi que des modèles d'IA de la société peuvent être utilisés. chatbots individuels (Zero-Shot) pour maximiser la productivité des entreprises.

Conclusion

Dans la mesure où les modèles d'intelligence artificielle sont de plus en plus capables de résoudre des tâches et de reconnaître des classes pour lesquelles ils n'ont pas été explicitement formés, on assiste à une généralisation croissante de leur applicabilité. Ce phénomène, connu sous le nom de Zero-Shot Learning, ne correspond pas à une technique concrète d'apprentissage automatique, mais à une perspective : du point de vue de l'utilisateur, il s'agit déjà d'un Zero-Shot-Learning lors de l'utilisation directe d'un modèle, s'il n'effectue pas d'entraînement personnel ou ne saisit pas d'exemples. Mais c'est très probablement ce que le développement a fait pour préparer son modèle à différents types d'entrées.

L'étendue de la définition de ce terme est ici une pure question d'opinion. Toutefois, dans de nombreux cas, l'apprentissage en temps réel nécessite une base de connaissances importante à partir de données ou des méthodes d'apprentissage spécifiques qui modélisent les relations entre les classes connues et inconnues. En fin de compte, il s'agit d'élargir le champ d'application et de réduire l'effort individuel. L'homme a toujours servi de modèle, capable de s'adapter à de nouvelles situations avec une rapidité et une précision cognitive jusqu'ici inégalées. La question de savoir si l'on assistera à un rapprochement significatif grâce à l'intelligence artificielle fait l'objet de nombreux débats, et seules des années de développement ultérieur pourront y répondre.

Vous avez un projet d'IA spécifique qui nécessite la généralisation de l'IA documentaire ou de l'IAG ? N'hésitez pas à nous envoyer un message pour obtenir des conseils d'experts.

Avez-vous trouvé cette page utile ?

Merci beaucoup pour vos commentaires !

Voulez-vous me donner un feedback ? (anonyme)

Nous développons des logiciels d'intelligence artificielle pour les entreprises et renonçons délibérément aux bannières publicitaires gênantes. Par le biais de nos articles, nous documentons des thèmes qui nous préoccupent, nous intéressent et financent également notre pain quotidien.

Comme nos contenus sont gratuits, vos commentaires sont nos félicitations.

Chaque auteur lit personnellement vos commentaires anonymes, même si les IA pourraient les automatiser, et intègre directement les suggestions constructives dans la prochaine révision ou les utilise comme source d'inspiration pour le prochain article.



    • Tim Filzinger
      (auteur)

      Rédacteur et consultant en communication. Spécialisé dans les technologies d'entreprise et l'intelligence artificielle.

    fr_FRFR