La capacidad de resolver nuevos problemas es una de las definiciones más conocidas de la inteligencia. Durante décadas, los informáticos han intentado trasladar esta valiosa capacidad a los sistemas de aprendizaje. Sin embargo, lo que desde hace tiempo se conoce como inteligencia artificial no parece ser verdaderamente inteligente. En la mayoría de los casos, se trata de la reproducción automatizada de reglas que se filtran a partir de ejemplos claros. Sin embargo, dado que la cantidad de datos utilizados ha aumentado rápidamente, también ha crecido la capacidad de los modelos para comprender conceptos que no se incluyen explícitamente. Este planteamiento se conoce como aprendizaje cero, que podría convertirse en la puerta de entrada a una IA cada vez más parecida a la humana.
Definición y conceptos básicos
El aprendizaje cero es un paradigma del aprendizaje automático en el que se supone que los modelos de IA predicen clases no vistas previamente o procesan objetos fundamentalmente desconocidos sin estar diseñados para esta tarea específica. Esto se debe a que los métodos convencionales de aprendizaje supervisado suelen requerir un extenso etiquetado de los datos, lo que lleva demasiado tiempo en el caso de ligeros cambios de contexto o es difícil de obtener para clases poco frecuentes. Para poder prescindir de estos pasos posteriores de ajuste fino, se utilizan previamente ciertos métodos que permiten a los modelos inferir lo desconocido a partir de información ya analizada. Esto es posible, por ejemplo, mediante propiedades semánticas, representaciones vectoriales o nuevas combinaciones de atributos ya conocidos.
Por tanto, el aprendizaje de tiro cero no es un método de aprendizaje específico, sino que describe el tipo de problema que requiere una solución inmediata a una tarea que no se conoce con exactitud. Por lo tanto, también se puede hablar de Habilidades de un modelo que se basan en recursos diferentes. En este sentido, los grandes modelos lingüísticos (LLM) llevan años causando furor. Como las redes neuronales basadas en la arquitectura Transformer se han entrenado con inmensas cantidades de datos de texto, disponen de una base de conocimientos increíblemente amplia. Al tener en cuenta las correlaciones estadísticas entre palabras, también pueden responder con una salida adecuada a entradas que nunca antes han recibido. Así pues, hace tiempo que el aprendizaje cero se ha hecho un hueco en la vida cotidiana de millones de personas y, sin embargo, sigue siendo un problema intensamente investigado para tareas especiales en las empresas.
Clasificación y ejemplo
Para comprender mejor el aprendizaje sin disparos, se pueden categorizar y diferenciar los conceptos básicos clave utilizando el ejemplo de los LLM.
- Ajuste fino - En esta técnica, un modelo de código abierto o propietario preentrenado se somete a un nuevo entrenamiento utilizando asignaciones ejemplares para la tarea prevista. El resultado es un ajuste de las ponderaciones neuronales de la red subyacente. A continuación, puede aplicarse con mayor precisión al tipo de tarea en cuestión. El algoritmo de aprendizaje más utilizado es el Retropropagación.
- Ingeniería Prompt - Se refiere a la optimización del texto de entrada (prompt) utilizado para obtener el resultado más preciso posible en función de cada proyecto. No es necesario dar ejemplos concretos.

- Aprendizaje con pocos disparos - Con este método, el modelo recibe un pequeño número de ejemplos como parte de la solicitud inicial o posterior. Esto puede aumentar significativamente la precisión o la concordancia con el resultado deseado. El tratamiento de los LLM es una forma de ingeniería de instrucciones. En el ejemplo, el autor también podría haber proporcionado al modelo sus propias explicaciones del concepto o pasajes similares, de modo que incluso es posible aproximar el resultado a su estilo de lenguaje humano.
- Aprendizaje sin disparos - Por regla general, este enfoque implica prescindir por completo de la puesta a punto y de los ejemplos de entrenamiento específicos para cada tarea. En su lugar, se utiliza el dominio de entrenamiento genérico o las capacidades generalizadas del modelo para obtener directamente el resultado deseado, como en el ejemplo. Se trata de una indicación única y precisa, lo que también se denomina "indicación cero". Esto significa que los conceptos de aprendizaje de disparo cero e ingeniería de instrucciones son muy compatibles en los LLM. Como el número de ejemplos de entrenamiento utilizados es cero, también se podría hablar de un caso especial de aprendizaje de pocos disparos.
Enfoques técnicos
En lugar de confiar únicamente en la base de conocimientos puros de los datos de entrenamiento, existen algunos enfoques generales, así como métodos especializados para garantizar una mayor capacidad de disparo cero. En la mayoría de los casos, sin embargo, el modelo ya se ha sometido a un amplio preentrenamiento con datos de texto o imágenes para aprender una imagen completa de diversos conceptos del mundo y sus relaciones.
Aprendizaje generalizado de tiro por cero
Se trata de una formación supervisada, cuyo objetivo es permitir establecer relaciones semánticas entre las clases conocidas y desconocidas de los datos. Por un lado, esta diferencia se modela dibujando aleatoriamente puntos de datos; por otro, se incluyen determinados atributos que pueden utilizarse para trazar similitudes entre las clases. De este modo, el modelo está específicamente preparado para el problema del aprendizaje cero, en el que primero hay que decidir si se trata de una clase ya claramente definida o de una variación de la misma. En una revisión científica se distingue entre Pourpanah et alt. (2023) dos tipos de métodos para esta transferencia:
Métodos de incrustación utilizar representaciones gráficas o del Arquitectura del transformador elementos familiares como los autocodificadores y los módulos de atención.
Métodos generativos por otro lado, pretenden crear un modelo generativo para generar patrones de entrenamiento a partir de incrustaciones o grafos de palabras conocidas y desconocidas.
Aprendizaje por transferencia
Si un modelo ya ha sido preparado para una tarea específica mediante un entrenamiento supervisado y ha sufrido las correspondientes adaptaciones neuronales, éstas pueden analizarse, por ejemplo, mediante Aprendizaje federado transferido a otro modelo. A continuación, éste puede aplicarse a una nueva tarea ligeramente diferente, en la que las ponderaciones aplicadas representan una ventaja considerable con respecto al modelo generalista original. En principio, un efecto de aprendizaje que ya se ha producido se recicla para hacer frente a circunstancias parcialmente idénticas. La adaptación posterior supone una reducción significativa del consumo de recursos en términos de tiempo, potencia de cálculo y datos. En el contexto del aprendizaje por transferencia suele utilizarse la siguiente técnica más específica.
Incrustaciones semánticas
Las propiedades aprendibles de las clases que un modelo debe reconocer pueden representarse como vectores espaciales. Estas incrustaciones representan elementos individuales de información o atributos en una forma matemática y, por tanto, legible por la máquina. En concreto, pueden ser referencias a determinados significados de palabras o, en el caso del tratamiento de imágenes, características visuales como el tamaño o el color. Aunque un modelo aún no se haya entrenado en un concepto objetivo concreto, tras entrenarse con datos etiquetados puede extraer ciertas conclusiones respecto a la composición de vectores ya conocidos y sus distancias. Una técnica muy utilizada en el tratamiento del lenguaje es Palabra2vec.

Otras categorías de métodos son, por ejemplo
- Métodos de correspondencia - A cada clase se le asigna un prototipo representativo en el espacio semántico, así como un clasificador binario que modela la decisión sobre si esta clase está implicada. Se aprende una función de correspondencia entre estos dos elementos.
- Métodos de proyección - Aquí, las instancias del espacio de características y los prototipos del espacio semántico se proyectan en un espacio común para generar instancias etiquetadas para clases no vistas.
- Métodos de préstamo de instancias - Las instancias etiquetadas de clases comparables se utilizan para generar ejemplos de clases desconocidas mediante la identificación de ciertas similitudes.
Desafíos
Aunque los métodos mencionados facilitan considerablemente la aplicación de nuevas clases, ellos mismos plantean importantes retos para el desarrollo.
- Complejidad de los modelos - El entrenamiento de modelos "zero-shot" lleva mucho tiempo y requiere mucha potencia de cálculo. Hay que sopesar cuidadosamente si esto justifica el valor añadido en la aplicación o si también es posible un modelo "desde cero" para nuevas tareas.
- Heterogeneidad - Si las diferencias entre las clases vistas y no vistas son demasiado grandes, puede producirse una pérdida de rendimiento. Actualmente sigue habiendo límites si los datos son demasiado heterogéneos.
- Similitudes - Sin embargo, si las clases son demasiado similares, pueden producirse ambigüedades que distorsionen el resultado.
Potencial creciente para el tratamiento de textos e imágenes
Como ya ha quedado claro, hay dos dimensiones esenciales en las que la información comprensible para el ser humano también puede ser captada por los modelos de IA: El texto y la imagen. A lo largo de las décadas, han surgido dos importantes campos de aplicación de la IA que se benefician especialmente del aprendizaje sin disparos.
Visión por ordenador
Ser capaz de reconocer nuevos objetos en imágenes sin necesidad de ejemplos explícitos de entrenamiento se consideró durante mucho tiempo un objetivo puramente teórico. Sin embargo, debido a la gran cantidad de información de imagen que puede procesarse ahora, los modelos reciben cada vez más información sobre clases desconocidas y su composición de atributos. Así, por ejemplo, en los diagnósticos médicos pueden detectarse enfermedades raras, como tumores, en las exploraciones. El aumento de las capacidades también es útil en la producción, la robótica y la tecnología de sensores para hacer frente a las desviaciones.

Procesamiento del lenguaje natural
Es probable que las posibilidades de la IA generativa no hayan escapado a la atención de nadie. Sin embargo, su potencial va ahora más allá del uso de dominios genéricos de entrenamiento de grandes modelos lingüísticos y se extiende también a tareas específicas como el reconocimiento preciso de clases de texto en contextos especializados. Por ejemplo, es posible realizar análisis de contenido de noticias inusuales utilizando varias etiquetas. Esto puede ayudar a evaluar el futuro impacto de catástrofes y otros sucesos extremos en la economía y la sociedad.

En la práctica, las palabras individuales también pueden categorizarse para crear valiosos análisis básicos con fines médicos, por ejemplo:

Las capacidades de disparo cero reducen considerablemente el esfuerzo que supone personalizar e implantar sistemas de IA como Konfuzio. Recientemente, nuestros expertos han logrado reducir considerablemente la necesidad de volver a etiquetar los campos y datos de los documentos en caso de desviaciones. Además, varios modelos de IA ya entrenados o personalizados y chatbots individuales (disparo cero) para maximizar la productividad en las empresas.
Conclusión
A medida que los modelos de inteligencia artificial son cada vez más capaces de resolver tareas y reconocer clases para las que no han sido explícitamente entrenados, su aplicabilidad se generaliza cada vez más. Este fenómeno, conocido como aprendizaje de tiro cero, no corresponde a una técnica específica de aprendizaje automático, sino más bien a una perspectiva: desde el punto de vista del usuario, el uso directo de un modelo ya es aprendizaje de tiro cero si el usuario no realiza su propio entrenamiento ni introduce ejemplos. Pero lo más probable es que el equipo de desarrollo haya hecho exactamente eso para preparar su modelo para distintos tipos de entrada.
Hasta dónde llega aquí la definición del término es una mera cuestión de opinión. En muchos casos, sin embargo, el aprendizaje sin disparos requiere una gran base de datos de conocimiento o determinados métodos de formación que modelen las relaciones entre clases conocidas y desconocidas. En última instancia, el objetivo es aumentar el abanico de aplicaciones y reducir el esfuerzo individual. Los seres humanos siempre han servido de modelo en este sentido, ya que son capaces de orientarse en situaciones nuevas con una rapidez y una precisión cognitiva inigualables. Si la inteligencia artificial traerá consigo una convergencia significativa es una cuestión muy debatida que sólo años de desarrollo podrán responder.
¿Está planeando un proyecto especial de IA que depende de la generalizabilidad de la IA documental o GenAI? No dude en enviarnos un mensaje para recibir asesoramiento experto.
