Explorar guías

Artículos de AI Glossary

162

Datos de entrenamiento

Los datos de entrenamiento son el corpus que se usa para ajustar los parámetros de un modelo. Su cobertura fija el techo del modelo: los huecos, los errores y los sesgos de los datos reaparecen como huecos, errores y sesgos en las salidas. Bajo el EU AI Act, los datos de entrenamiento tienen una definición formal y, para los sistemas de alto riesgo, obligaciones de gobernanza asociadas. En la práctica: Un modelo de contratación entrenado sobre todo con contrataciones pasadas de un solo grupo demográfico reproducirá ese patrón. ...

Datos de prueba

Los datos de prueba son la calificación honesta. Tienen que quedar intactos durante el desarrollo, porque cualquier decisión tomada en base a los resultados de prueba los convierte en datos de validación. Cuando los ejemplos de prueba se filtran al entrenamiento — contaminación —, los puntajes reportados dejan de significar algo. En la práctica: Un modelo que saca 95% en un benchmark cuyas respuestas estaban en sus datos de entrenamiento no aprendió nada. ...

Datos de validación

Los datos de validación quedan entre el entrenamiento y la prueba. Los usas para elegir hiperparámetros y para detectar el sobreajuste temprano, porque el modelo nunca aprende de ellos directamente. Reutilizarlos con demasiada insistencia filtra información y los convierte, en silencio, en un segundo conjunto de entrenamiento. En la práctica: Si la pérdida de validación empieza a subir mientras la de entrenamiento sigue bajando, estás sobreajustando — detente.

Datos sintéticos

Los datos sintéticos llenan huecos donde los datos reales son escasos, sensibles o caros — casos límite raros, registros restringidos por privacidad, ejemplos balanceados de una clase minoritaria. El riesgo se acumula: un modelo entrenado con su propio tipo de salida puede alejarse de la realidad y amplificar los sesgos existentes en vez de corregirlos. En la práctica: Generar 5,000 tickets de soporte plausibles para cubrir un escenario del que tienes tres ejemplos reales. ...

Deepfake

Los deepfakes combinan generación de video o clonación de voz con la imagen de una persona real. La detección es poco confiable y va empeorando, así que las defensas prácticas son las señales de procedencia, los canales de verificación y los procesos organizacionales. El EU AI Act impone obligaciones de divulgación sobre este tipo de contenido. En la práctica: Una voz clonada del director general en una llamada autorizando una transferencia bancaria. ...

Deriva del Modelo

La deriva ocurre porque la realidad cambia: el comportamiento de los clientes se mueve, el vocabulario se mueve, un competidor lanza algo. El modelo sigue igual, pero su exactitud decae en silencio. El peligro es que falla sin arrojar errores, así que solo el monitoreo la detecta. En la práctica: Un pronóstico de demanda entrenado antes de la inflación que sigue devolviendo números seguros y equivocados.

Descenso de Gradiente

El descenso de gradiente calcula en qué dirección debe moverse cada parámetro para reducir la pérdida y luego da un paso pequeño en esa dirección. Repítelo millones de veces y el modelo converge. Casi todo el entrenamiento moderno usa alguna variante, normalmente Adam. En la práctica: Es como bajar una colina en la niebla: no ves el valle, pero sientes la pendiente bajo tus pies.

Destilación

En la destilación, un modelo maestro grande genera salidas que entrenan a un modelo estudiante más pequeño. El estudiante termina siendo más barato y más rápido, y retiene buena parte del comportamiento del maestro en la distribución objetivo. La mayoría de los modelos de producción asequibles son destilados de algo más grande. En la práctica: Un modelo 10× más pequeño y 20× más barato que atiende igual de bien el 90% de tu tráfico. ...

Documentación técnica

El artículo 11 y el anexo IV establecen qué debe contener el expediente: descripción del sistema, decisiones de diseño, datos, entrenamiento y pruebas, métricas de desempeño, gestión de riesgos y plan posterior a la comercialización. Debe existir antes de que el sistema salga al mercado y mantenerse después. Es el artefacto de cumplimiento — sin expediente, no hay conformidad. En la práctica: El documento que una autoridad pide primero, y que los equipos empiezan a escribir demasiado tarde. ...

Ejemplo adversario

Los ejemplos adversarios aprovechan que las fronteras de decisión de un modelo no coinciden con la percepción humana. Cambios mínimos y dirigidos invierten la salida con alta confianza. Son un recordatorio de que una alta exactitud en los benchmarks no dice nada sobre el comportamiento bajo ataque. En la práctica: Una señal de alto con unas cuantas calcomanías que un modelo de visión lee como una señal de límite de velocidad. ...