Inicio / Blog / Datos / ¿Qué es la anotación de datos y por qué la necesita la IA?

¿Qué es la anotación de datos y por qué la necesita la IA?

Resumir con ChatGPT

Independientemente de si se habla de anotación de datos, anotación de datos o anotación de datos, se refiere al enriquecimiento de datos brutos con conocimientos contextuales.

Explicaré esta frase posiblemente críptica con más detalle en el siguiente artículo.

Las anotaciones de datos empiezan siempre con los datos brutos, que constituyen el punto de partida de todo análisis. Es la base sobre la que los sistemas reconocen, interpretan y categorizan los contenidos. Para entender qué hay detrás de las anotaciones, merece la pena echar un vistazo a los datos brutos.

¿Qué son los datos brutos?

Los datos brutos son observaciones en forma técnica y constituyen la fase preliminar de la información.

5 Ejemplos de datos brutos

EjemploFuente de los datos brutosTipo de datosFormato de almacenamientoEjemplos de atributosEstado sin procesarDependencia del contextoFecha y lugarCalidad/almacenamientoOtras particularidades
Fiesta de cumpleaños fotografiada con smartphoneFoto tomada por la cámaraArchivo de imagenJPEG/PNGColoración, resolución, hora de grabación, geoetiquetadoAlta, por ejemplo, para recordatorios o datos de entrenamiento de IALocal o en la nube (dependiendo de la cámara/aplicación)Contiene metadatos (EXIF), integrados en las redes sociales
El billete ganador de la lotería en el escánerDocumento en papel escaneadoDocumento digitalPDFFecha de escaneado, resolución, profundidad de colorMedios, por ejemplo, para verificacionesNoAlmacenamiento local o en servidorPuede requerir protección de firma digital
Latidos del corazón a través del smartwatchMedición mediante sensoresArchivo XMLXMLMarca de tiempo, frecuencia cardiaca, precisión de la mediciónAlta, por ejemplo, para la vigilancia de la saludDatos de la nube o del dispositivoRequiere preprocesamiento/validación para el análisis
Confirmación del nuevo empleo a través de un mensaje de voz de WhatsAppMensaje de voz a través de una aplicación para smartphoneArchivo de audioOPUSDuración de la grabación, códec, frecuencia de muestreoAlta, por ejemplo, para pruebas de comunicaciónPosiblementeAlmacenadas en las políticas de la nube MetaRespetar la protección de datos y los derechos de los usuarios
Bañera completa medida desde el mostradorRecuento mecánico mediante contador de aguaDatos mecánicosContador de rodillosLectura del totalizador, volumen de agua en litrosFondos, por ejemplo, para liquidacionesRaroAlmacenado localmente en el totalizador mecánicoSensible al mantenimiento, posibilidad de averías mecánicas

Cuando uno lee estos ejemplos, los asocia a un recuerdo. Si observas la fiesta de cumpleaños, el contrato notarial, el latido del corazón, la promesa de trabajo o la bañera llena en su forma técnica, se vuelven abstractos.

Como ejemplo sencillo, le mostraré los datos brutos de una imagen en la codificación Base64.

La anotación de datos empieza con los datos brutos. La siguiente presentación del Sr. Gossen ofrece una visión de conjunto.

Haga clic en el botón de abajo para cargar el contenido de www.slideshare.net.

Cargar contenido

¿Qué significa "anotación de datos"?

Las anotaciones de datos contextualizan los datos brutos. En pocas palabras, el contenido de los datos brutos se enriquece anotándolos.

Siguiendo con el ejemplo de la cadena de letras: Si copias la cadena de letras antes mencionada y la guardas como black.png en tu ordenador, podrás abrir este archivo. Entonces verá la siguiente imagen.

das Schwarze Quadrat von Kasimir Sewerinowitsch Malewitsch

El nombre da así a los datos un contexto inicial. También puedes crear una carpeta en tu ordenador y llamarla "Colores". Este procedimiento le permitiría "anotar" más contexto. A través de esta carpeta usted anota que esta imagen es una de las imágenes que muestra un color. A continuación, podrías colocarla en la carpeta blue.png, red.png, etc. Al hacer esto, usted, no impresionado por algunos debate cultural populary anota que el negro es un color para "ti".

Este sencillo ejemplo ya lo demuestra. Incluso las anotaciones más simples, en forma del nombre del archivo o de la carpeta en la que almacena la imagen, o más exactamente la clasifica, son una interpretación.

En otro contexto, por ejemplo al clasificar las fotos de las vacaciones, tiraría esta foto a la basura. Si eres coleccionista de obras de arte, el cuadro podría ser el Cuadrado negro de Kazimir Severinovich Malevich.

En resumen: la anotación de datos es la interpretación de datos brutos.

Son precisamente estas interpretaciones las que se utilizan para el aprendizaje automático controlado. Estos datos anotados se utilizan en el enfoque de formación supvervisada, en comparación con la formación no supervisadapara que las máquinas puedan aprender esta interpretación humana de los datos brutos.

Todos los datos, ya sean de audio, vídeo, sonido, imagen o texto, pueden anotarse. Sin embargo, la calidad, coherencia y granularidad de la anotación determinan significativamente el rendimiento de los modelos resultantes.

¿Cuáles son los límites de la anotación de datos?

Antes de fijarnos en una foto de un gato como ejemplo, merece la pena hacer un breve desvío mental. Porque detrás de cada anotación no sólo hay tecnología, sino también una interpretación, a veces objetiva, a veces contradictoria, a veces incluso encantadoramente humana.

Las anotaciones estructuran los datos, deciden qué se hace visible y cómo se evalúa. En bancos y aseguradoras, por ejemplo, esta categorización es crucial: ¿un cliente es un caso de riesgo o una oportunidad? ¿Un siniestro es normalizado o tiene características especiales? La calidad de la anotación determina la precisión de los modelos y, por tanto, la base de toda decisión. La claridad y la coherencia en la interpretación no son una opción, sino un deber.

Una pequeña digresión sobre un tema más sencillo: los gatos

Reconocer diferentes objetos en una imagen ya era muy fácil en 2017, ver Visión por computador en la Web con WebRTC y TensorFlow - webrtcHacksDos gatos, una cama y un portátil. El marco TensorFlow de Google, muy popular en aquella época, ofrecía miles de tipos de objetos diferentes con su API de detección de objetos, que podían reconocerse "automáticamente" utilizando datos anotados. Muchos años después, la tecnología es mucho más precisa. Sin embargo, todavía hoy es necesario tener en cuenta el siguiente aspecto:

Lo que a primera vista parece una asignación neutra - "esto es un portátil", "esto es una cama"- puede volverse compleja en detalle: ¿Deben reconocerse los dos gatos no sólo como gatos, sino por sus respectivos nombres? Pero estas anotaciones probablemente sólo pueda hacerlas el maestro, o más exactamente, el experto de estos dos gatos, Chad Hart adjuntar.

In 2017 zeigt Chad Hart bereits die Möglichkeiten der ObjectDetection API von Tensorflow.
En 2017, Chad Hart ya muestra las posibilidades de la API ObjectDetection de Tensorflow.

Precisamente aquí es donde se ponen de manifiesto las ventajas y los inconvenientes de las anotaciones: Hacen tangibles los datos, pero lo hacen a través de nuestros ojos, y estos ojos nunca son completamente objetivos. Y eso no es una debilidad, sino una llamada de atención: porque el aprendizaje automático siempre empieza por nosotros.

Esta imagen es algo más que una instantánea técnica: es la prueba de que las máquinas empiezan a ver nuestro mundo, pero sólo como nosotros se lo describimos.

Desarrollo y futuro de la anotación de datos

Independientemente de si hablamos de anotación de datos, anotación o interpretación de datos, siempre se trata de enriquecer los datos brutos con contexto para que las máquinas sean capaces de aprender con estos datos. La anotación de datos es la clave para convertir una observación técnica no tratada en una base significativa para el aprendizaje automático. Sin embargo, la forma en que se lleva a cabo esta anotación ha cambiado drásticamente en los últimos años.

  • De la anotación manual a la automatización: en el pasado, la tarea de anotación de datos era sencilla pero laboriosa: las personas asignaban un significado a cada observación, ya fuera un píxel, un texto o una señal. Cada imagen, cada párrafo de texto se revisaba meticulosamente y se etiquetaba a mano. Era preciso, pero no escalable. La creciente demanda de datos vino acompañada de un cambio de métodos.
  • Apoyo mediante datos preanotados: Con el cambio hacia los datos preanotados, los humanos se convirtieron en verificadores en lugar de creadores. Los algoritmos hacían sugerencias que luego se corregían. Este método híbrido ahorraba tiempo, pero también planteaba nuevos retos, como la aceptación acrítica de los errores algorítmicos y, por tanto, el endurecimiento de los supuestos existentes. Seguía siendo un término medio: más rápido, pero no perfecto.
  • La entrada en los datos sintéticos: Los datos sintéticos fueron el siguiente paso lógico. Se creaban de forma completamente artificial mediante algoritmos, simulaciones o modelos generativos como los GAN, pero se anotaban automáticamente debido a su origen. Resolvían el problema de la disponibilidad de datos con una gran escalabilidad al mismo tiempo. Sin embargo, también presentaban limitaciones. El problema de la validez del dominio seguía sin resolverse: los datos sintéticos suelen reflejar condiciones idealizadas y a menudo no pueden representar plenamente las aplicaciones reales.
  • Transformadores no supervisados y comprensión de máquinas: Con el auge de los modelos basados en transformadores no supervisados, como GPT, el juego volvió a cambiar. La anotación de datos parecía superflua. El punto de partida fue la idea de que las máquinas podían inferir significados de forma independiente analizando patrones en grandes cantidades de datos sin procesar. En lugar de etiquetas explícitas, bastaba con el flujo de datos en bruto; la correlación sustituía a la anotación. Modelos como éstos pretendían reconocer significados a partir de datos de forma autónoma: un cambio de paradigma.

¿Un paso atrás? Por qué la anotación volverá a ser relevante en 2025

Aunque en teoría el aprendizaje no supervisado puede prescindir de las anotaciones, en la práctica está claro que éstas siguen siendo indispensables en esta nueva era. Los grandes modelos lingüísticos como GPT han demostrado en repetidas ocasiones que alcanzan sus límites en aplicaciones específicas si los datos de entrenamiento no se someten a una clara verificación o adaptación humana.

Las anotaciones finas y específicas de los datos son importantes en diversos ámbitos:

  • Conocimientos específicos del sector: los modelos lingüísticos que se van a utilizar en empresas o aplicaciones especializadas requieren adaptaciones precisas y específicas del sector.
  • Equidad: sin una anotación específica, los modelos no supervisados refuerzan los sesgos existentes, ya que se basan en el conjunto de datos de forma incontrolada.
  • Control de calidad: la anotación de alta calidad sirve como patrón oro para validar, explicar o cuestionar el rendimiento de un modelo.

Tesis 1: El aprendizaje no supervisado no sustituye a la anotación, sino que la hace más específica.

El conflicto de objetivos persiste: El aprendizaje no supervisado nunca ha sustituido a la anotación, sólo la ha desplazado. Con la multitud de conjuntos de datos agnósticos, es la corrección humana precisa la que marca la diferencia.

La anotación ya no se realiza en masa, sino que sirve de Ajuste estratégico. Es el puente entre la generalidad de las máquinas y la pertinencia empresarial. Las empresas que quieran utilizar sus modelos con eficacia deben invertir primero en una forma nueva y específica de anotación de datos.

Tesis 2: Incluso el aprendizaje no supervisado nunca lo es

Incluso los llamados Aprendizaje no supervisado nunca es completamente no supervisado. Porque aunque no se especifiquen etiquetas explícitas durante el propio proceso de aprendizaje, la selección de los datos sigue siendo siempre una decisión profundamente humana.

Los datos que se recogen, almacenan y procesan no son aleatorios ni completos, y ahí es precisamente donde radica la supervisión oculta: una máquina no puede saber lo que está haciendo. no ve. Carece de la capacidad de ser intencionadamente curiosa, de observar activamente o incluso de cuestionar su propia perspectiva.

Por el contrario, depende del mundo tal y como se le presenta: de forma selectiva, fragmentaria y, a menudo, distorsionada. De este modo, todo descubrimiento supuestamente objetivo se convierte en un espejo de las suposiciones, los procesos de selección y los puntos ciegos humanos.

Conclusión

La anotación de datos permite interpretar los datos brutos. Aunque en la investigación se asume que las anotaciones pueden ser correctas o incorrectas, las anotaciones interpretan los datos a través del anotador humano.

¿Le ha resultado útil esta página?

Gracias por sus comentarios.

¿Podría darme su opinión? (anónimo)

Desarrollamos software de inteligencia artificial para empresas y evitamos deliberadamente los molestos banners publicitarios. A través de nuestros artículos, documentamos temas que nos ocupan e interesan y también financian nuestro pan de cada día.

Como nuestro contenido es gratuito, sus comentarios son nuestro elogio.

Cada autor lee personalmente tus comentarios anónimos, aunque la IA podría automatizarlos, e integra las sugerencias constructivas directamente en la siguiente revisión o las utiliza como inspiración para el siguiente artículo.



    </artículo
    es_ESES