Lección 2 de 5 · 35 minutos
Cómo aprende una máquina: datos, patrones y errores
Al terminar esta lección
podrás explicar con tus propias palabras cómo una máquina aprende a partir de ejemplos, qué es un modelo y por qué a veces acierta y a veces se equivoca, y habrás entrenado tu primer modelo desde el navegador.
Camila estudia noveno en un colegio de Bucaramanga y le pidieron un proyecto de tecnología. Quiere hacer algo que separe automáticamente las fotos de su celular: las de tareas por un lado y las de paseos por otro. Se sienta a pensar cómo lo programaría y se estrella: ¿cuál es la regla exacta que distingue una foto de un cuaderno de una foto de un río? ¿El color? ¿Las líneas rectas? Cada intento de regla se le rompe con la primera excepción.
Ese estrellón es justo la puerta de entrada al tema de hoy. En la lección 1 vimos que la inteligencia artificial no es un cerebro ni un ser que piensa. Ahora vamos a ver de dónde sale su habilidad: no de reglas escritas por alguien, sino de miles de ejemplos y de un proceso muy terco de equivocarse, medir el error y corregir un poquito. Al final de la lección vas a entrenar tu propio modelo, gratis, desde el celular o el computador, y vas a verlo fallar en vivo. Ese fallo es lo más educativo de todo el curso.
De dar órdenes a dar ejemplos
Un programa de computador tradicional es una receta: una persona escribe las reglas y la máquina las obedece al pie de la letra. Si en una hoja de cálculo pones nota_final = parcial1*0.3 + parcial2*0.3 + final*0.4, eso funciona perfecto, porque la regla es exacta, la conocemos y se puede escribir en una línea.
El problema es que muchísimas tareas útiles no se dejan escribir así. Intenta escribir la regla exacta para distinguir la foto de un aguacate maduro de uno verde, o para saber si un mensaje que te llegó al WhatsApp es una estafa. Vas a decir "si dice premio, es estafa", y al rato llega un mensaje legítimo de tu universidad que dice "premio". Las reglas escritas a mano se rompen con las excepciones, y en el mundo real casi todo son excepciones.
Ahí aparece el aprendizaje automático (en inglés machine learning): en vez de escribir la regla, le mostramos a la máquina muchos casos ya resueltos y dejamos que ella busque la regla sola. A cada caso resuelto lo llamamos ejemplo etiquetado: un dato más su respuesta correcta. La foto es el dato; "maduro" es la etiqueta. El mensaje es el dato; "estafa" es la etiqueta.
La diferencia de fondo es quién escribe la regla. En la programación clásica, la escribe una persona. En el aprendizaje automático, la persona escribe el procedimiento para encontrar la regla, y aporta los ejemplos; la regla final la arma la máquina. Por eso a veces ni quien la construyó puede explicar en palabras exactamente qué está mirando el sistema, y por eso también hereda lo bueno y lo malo de los ejemplos que le dimos.
Mini caso: recoges 400 mensajes de un grupo de WhatsApp de tu carrera y marcas a mano cada uno como "estafa" o "normal". Eso es tu conjunto de ejemplos etiquetados. No le explicas a la máquina qué es una estafa: le muestras 400 veces cómo se ve una.
Qué es un modelo: la receta que la máquina se escribe sola
Cuando alguien dice "un modelo de IA", suena a algo abstracto. En la práctica, un modelo es un archivo con muchísimos números adentro, más una fórmula fija que dice cómo combinarlos. Esos números se llaman parámetros o pesos, y son lo único que cambia durante el aprendizaje.
Una imagen que ayuda: piensa en la consola de sonido de la emisora del colegio, con decenas de perillas. La fórmula (cómo se mezclan los canales) no cambia; lo que el técnico ajusta son las perillas hasta que suena bien. Un modelo es esa consola, pero con muchísimas más perillas, y quien las mueve no es una persona sino el proceso de entrenamiento.
Hay que separar dos momentos que suelen confundirse:
- Entrenamiento: se mueven las perillas usando los ejemplos. Es lento, caro y se hace una vez (o de vez en cuando).
- Inferencia o uso: las perillas quedan quietas y le pasas un dato nuevo para que te dé una respuesta. Es lo que haces cada vez que le escribes a un chatbot.
Un detalle importante: el modelo, por lo general, no guarda los ejemplos. Guarda el patrón que sacó de ellos. Es parecido a cuando aprendiste a reconocer la letra de tu mamá: no tienes archivadas todas las notas que te escribió, tienes una noción difusa de cómo se ve su letra. Por eso un modelo puede responder ante algo que nunca vio, y por eso también puede responder con seguridad algo falso: está aplicando un patrón, no consultando una base de datos.
Los modelos pequeños, como el que vas a entrenar hoy, tienen relativamente pocos parámetros. Los modelos grandes detrás de los chatbots tienen del orden de miles de millones. Es la misma idea, a escalas muy distintas.
Cuando descargas un modelo entrenado, bajas un archivo (a veces de pocos megabytes, a veces de muchos gigabytes). Adentro no hay fotos ni textos: hay listas de números. Ese archivo es "lo aprendido".
El ciclo del aprendizaje: predecir, medir el error, ajustar
Aquí está el corazón de todo, y no necesita matemáticas para entenderse. El entrenamiento es un ciclo que se repite muchísimas veces:
1. El modelo arranca con las perillas puestas al azar, así que sus primeras respuestas son basura. 2. Le pasamos un ejemplo y hace su predicción: "esto es un aguacate maduro, con 51% de confianza". 3. Comparamos con la etiqueta verdadera y medimos qué tan lejos estuvo. A esa medida se le llama error o pérdida. 4. Ajustamos un poquito los parámetros en la dirección que habría reducido ese error. 5. Volvemos al paso 2 con el siguiente ejemplo. Y otra vez. Y otra vez.
Una pasada completa por todos los ejemplos se llama época (epoch), y normalmente se dan muchas pasadas.
La analogía más honesta es aprender a encestar en la cancha del barrio. Tiras, ves que se fue corta, corriges la fuerza un poco, tiras otra vez. Nadie te dio la fórmula de la parábola: tu cuerpo ajustó "perillas" con retroalimentación. Fíjate en dos cosas que también aplican a las máquinas: si corriges demasiado en cada tiro, oscilas y nunca cuadras; si corriges muy poquito, tardas una eternidad. Ese tamaño del ajuste es una decisión humana del diseño.
Dos consecuencias prácticas que conviene tener claras desde ya. Primera: el error nunca llega a cero, y no debería. Un modelo con error cero en sus ejemplos casi siempre está memorizando, no aprendiendo. Segunda: el modelo optimiza exactamente lo que le pusimos a medir, no lo que nosotros queríamos. Si mides "cuántas veces acierta" en un conjunto donde el 95% de los casos son "normal", un modelo que responda siempre "normal" saca 95% sin haber aprendido absolutamente nada.
Prueba mental: entrenas un detector de fraude con 1.000 transacciones donde solo 20 son fraude. Si responde "no es fraude" siempre, acierta el 98%. Suena excelente en el reporte y es inservible en la vida real.
Por qué necesita tantos datos, y tan variados
La pregunta natural es: si el modelo ajusta perillas con retroalimentación, ¿por qué no le bastan diez ejemplos? Porque lo que buscamos es el patrón general, y con pocos ejemplos cualquier coincidencia boba parece un patrón.
Imagina que entrenas un clasificador de perros y gatos, y todas tus fotos de perros las tomaste en el parque y todas las de gatos dentro de la casa. El modelo puede aprender "si hay pasto, es perro". Acierta perfecto en tus ejemplos y falla apenas alguien le muestre un gato en un antejardín. Nunca vio un perro. Vio pasto. Con muchos ejemplos variados, la coincidencia del pasto se cae sola, porque aparecen perros en la sala y gatos en el parque.
Por eso importa tanto la variedad y no solo la cantidad:
- Fotos con luz de día, de noche, con flash, borrosas, torcidas.
- Voces costeñas, paisas, rolas, pastusas, y no solo de un locutor de estudio.
- Textos con tildes, sin tildes, con errores de dedo, con "parce" y con lenguaje formal.
Y aquí está el cuello de botella real: etiquetar cuesta trabajo humano. Alguien tiene que marcar esas miles de fotos o mensajes. Por eso los datos públicos valen oro. En Colombia, el portal de datos abiertos del Estado, datos.gov.co, publica conjuntos de datos de entidades públicas que puedes descargar gratis y usar para practicar.
Existe un atajo que hoy usa casi todo el mundo: partir de un modelo preentrenado, uno que ya aprendió a ver formas, bordes y texturas con millones de imágenes, y solo reajustarle la parte final con tus pocos ejemplos. Eso se llama transferencia de aprendizaje, y es exactamente por lo que en la práctica de hoy te van a bastar unas decenas de fotos en vez de un millón.
Antes de tomar tus fotos de práctica, hazte esta pregunta: ¿qué tienen en común todas mis fotos de una clase que NO tiene que ver con lo que quiero detectar? El fondo, la mano que sostiene el objeto, la hora del día. Eso es lo que el modelo va a aprender por error.
Acertar, equivocarse y engañarse: prueba, sobreajuste y sesgo
¿Cómo sabemos si un modelo aprendió? No preguntándole por los mismos ejemplos con los que estudió. Eso sería como darte de examen exactamente el simulacro que te dieron para practicar: sacas 5.0 y nadie sabe si entendiste o memorizaste.
Por eso los datos se parten en al menos dos montones antes de entrenar:
- Datos de entrenamiento: con los que el modelo ajusta sus parámetros.
- Datos de prueba: apartados, que el modelo nunca vio, y con los que medimos de verdad.
Cuando un modelo va muy bien en entrenamiento y mal en prueba, decimos que hay sobreajuste (overfitting): memorizó los casos en vez de captar el patrón. Es el error más común de todos y se combate con más datos, más variados, y con modelos menos exagerados para el problema.
Hay que entender también cómo se ve una equivocación. Un modelo de clasificación casi nunca dice "no sé": entrega su mejor apuesta con un porcentaje de confianza. Y ese porcentaje no es una probabilidad de tener la razón. Puedes ver un tranquilísimo "98% moneda de $1.000" apuntando a un botón de camisa. La máquina no tiene forma de saber que está fuera de su terreno. Guarda bien esta idea: en la lección 3 vas a ver que las famosas "alucinaciones" de los chatbots son exactamente el mismo fenómeno, con texto en vez de imágenes.
Finalmente, el sesgo: no es un error aleatorio sino sistemático, y casi siempre viene de los datos. Si un sistema de selección de hojas de vida aprendió de decisiones pasadas de una empresa, va a reproducir los patrones de esas decisiones, incluidos los injustos. El modelo no tiene intenciones; tiene estadísticas. Por eso, cuando algo importante para la vida de alguien depende de un modelo, la pregunta correcta no es "¿es inteligente?" sino "¿con qué datos aprendió y en quién falla?".
Al medir, no te quedes con el porcentaje global. Anota en qué casos falla: ¿falla más con luz baja? ¿con una clase específica? Ese detalle vale más que el número general.
Práctica: Entrena tu primer modelo en 20 minutos con Teachable Machine
Abre el navegador (sirve el del celular, pero es más cómodo en computador) y busca 'Teachable Machine', la herramienta gratuita de Google en teachablemachine.withgoogle.com. Elige 'Proyecto de imagen' y luego 'Modelo de imagen estándar'. No necesitas instalar nada.
Define tres clases con objetos que tengas a la mano: por ejemplo 'Moneda de $500', 'Moneda de $1.000' y 'Mesa vacía'. La tercera clase es clave: sin ella, el modelo está obligado a ver una moneda donde no hay ninguna.
Toma unas 30 fotos por clase con la cámara, pero hazlo con variedad a propósito: mueve el objeto, cámbialo de posición, acércate y aléjate, usa fondos distintos y prende y apaga la luz. Recuerda el problema del pasto de la sección 4.
Antes de entrenar, escribe en una hoja tus 6 situaciones de prueba, que serán tus 'datos de prueba': por ejemplo moneda muy lejos, con poca luz, sobre tela oscura, tapada a medias con el dedo, un objeto que no es ninguna de las tres clases, y una foto fácil de control.
Haz clic en 'Entrenar modelo' y espera sin cerrar la pestaña. Estás viendo, en vivo, el ciclo de predecir, medir el error y ajustar del que habla la sección 3.
Prueba tus 6 situaciones en la vista previa y anota para cada una: qué clase dijo, con qué porcentaje de confianza, y si acertó o no. Cuenta cuántos aciertos de 6.
Ahora corrige como lo haría un profesional: agrega unas 15 fotos nuevas parecidas a los casos donde falló, vuelve a entrenar y repite exactamente las mismas 6 pruebas. Compara los dos resultados.
Escribe tres frases de conclusión: en qué falló, qué le agregaste y si mejoró o si dañaste algo que antes funcionaba.
Al terminar tienes: Tendrás un modelo propio funcionando en el navegador y una tabla comparativa de aciertos antes y después de mejorar los datos, que demuestra en la práctica que la calidad de los ejemplos manda sobre todo lo demás.
Dónde se equivoca la gente
- Tomar las 30 fotos de una clase sin moverte, en el mismo sitio y con la misma luz, en diez segundos.Varía a propósito posición, distancia, fondo e iluminación. Si todas tus fotos son iguales, en la práctica le diste un ejemplo repetido 30 veces, no 30 ejemplos.
- Probar el modelo con las mismas fotos con las que lo entrenaste y celebrar el 100%.Aparta siempre casos nuevos que el modelo nunca vio y mide ahí. Un 100% en los datos de entrenamiento es señal de sospecha, no de éxito.
- Creer que el porcentaje de confianza es la probabilidad de que la respuesta sea correcta.Trátalo solo como 'a cuál de las clases que le enseñé se parece más'. Frente a algo fuera de su terreno, el modelo puede estar muy seguro y muy equivocado; por eso conviene crear una clase de 'ninguna de las anteriores'.
- Pensar que si el modelo falla es porque le faltó potencia o porque el computador es viejo.En proyectos pequeños, la mayoría de las fallas viene de los datos: pocos, repetidos, mal etiquetados o desbalanceados. Antes de buscar un modelo más grande, arregla los ejemplos.
Lo que te llevas
- En la programación clásica una persona escribe la regla; en el aprendizaje automático la persona aporta ejemplos etiquetados y la máquina encuentra la regla.
- Un modelo es un archivo de números ajustables (parámetros) más una fórmula fija; entrenar es ajustar esos números, usarlo es dejarlos quietos.
- El entrenamiento es un ciclo terco: predecir, medir qué tan lejos estuvo, ajustar un poquito y repetir muchas veces.
- Se necesitan muchos datos y sobre todo variados, porque con pocos ejemplos cualquier coincidencia tonta (el fondo, la luz) parece un patrón.
- La única medida honesta de aprendizaje se toma con datos de prueba que el modelo nunca vio; si va bien en entrenamiento y mal en prueba, hay sobreajuste.
- El modelo no dice 'no sé': entrega su mejor apuesta con un porcentaje de confianza que puede ser alto y estar equivocado, y hereda los sesgos de los datos con los que aprendió.
Palabras nuevas
- Ejemplo etiquetado
- Un dato acompañado de su respuesta correcta, como una foto de una moneda junto con el texto 'moneda de $1.000'. Es el material con el que la máquina aprende.
- Modelo
- El resultado del entrenamiento: un archivo con muchos números ajustados (parámetros o pesos) que, aplicados a un dato nuevo, producen una predicción. No guarda los ejemplos, guarda el patrón.
- Época (epoch)
- Una pasada completa del entrenamiento por todos los ejemplos disponibles. Normalmente se dan varias pasadas para que los ajustes se acumulen.
- Sobreajuste (overfitting)
- Cuando el modelo memoriza los ejemplos de entrenamiento en vez de captar el patrón general: acierta casi todo con lo que estudió y falla con casos nuevos.
- Sesgo
- Un error sistemático, no aleatorio, que el modelo hereda de los datos con los que aprendió; por ejemplo, funcionar peor con voces o rostros poco representados en esos datos.
Quiz de la lección
Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.
Ya sabes que un modelo ajusta números a partir de ejemplos y que puede equivocarse con toda seguridad: en la lección 3 aplicaremos esa misma idea al texto para entender, sin fórmulas, qué pasa por dentro cuando le escribes a ChatGPT.