Lección 2 de 5 · 40 minutos
Evaluaciones a prueba de IA
Al terminar esta lección
podrás rediseñar una tarea tuya para que la IA sea parte del proceso y no un atajo, con una rúbrica que califique lo que un chatbot no puede fingir y un momento de verificación oral o en clase.
Camila dicta Ciencias Sociales en noveno en un colegio de Bucaramanga. En abril dejó el mismo ensayo de siempre: "El conflicto armado en Colombia: causas y consecuencias, tres páginas". Recibió 34 trabajos. Veintiocho estaban bien escritos, ordenados, con introducción, desarrollo y conclusión, y todos decían prácticamente lo mismo con palabras distintas. Ninguno tenía un error de ortografía. Camila se pasó el fin de semana leyendo textos que nadie escribió y calificando algo que no le dice nada sobre lo que sus estudiantes aprendieron.
La reacción normal es pensar "tengo que descubrir quién usó IA". Esa es la ruta más larga y la que menos sirve: los detectores fallan y se equivocan con estudiantes reales (lo vemos en la lección 4). La ruta corta es otra y empieza con una pregunta incómoda: si un chatbot gratuito resuelve tu tarea en veinte segundos, ¿qué estaba midiendo tu tarea? En esta lección vas a rediseñar una tarea tuya para que siga siendo exigente aunque todo el curso tenga IA en el bolsillo, y a construir la rúbrica y el momento de verificación que la sostienen.
Primero: ¿qué estás evaluando de verdad?
En evaluación hay una palabra clave: validez. Una evaluación es válida cuando mide lo que dice medir. Si tu objetivo era "que el estudiante explique con sus palabras las causas del conflicto" pero lo que calificas es un texto de tres páginas bien redactado, entonces estás midiendo producción de texto. Y producir texto genérico y ordenado es exactamente lo que un modelo de lenguaje hace mejor y más barato que cualquier persona.
Antes de rediseñar nada, haz la prueba del chatbot. Copia tu enunciado tal como se lo entregas a los estudiantes, pégalo en una herramienta de IA gratuita y mira qué sale. No lo hagas para asustarte: hazlo para diagnosticar. Hay tres resultados posibles.
- Sale un trabajo que pondrías 4.5 sobre 5. La tarea necesita rediseño completo. No mide aprendizaje, mide acceso a internet.
- Sale algo decente pero genérico, que se cae apenas pides detalle. La tarea se salva agregando anclaje y proceso.
- La IA no puede ni empezar porque le faltan datos que solo el estudiante tiene. Vas bien.
Ojo con una trampa: rediseñar no es dificultar. Poner un tema más raro no sirve, porque la IA también sabe de temas raros. Lo que la IA no tiene es lo que pasó en tu salón el martes, lo que respondió el tendero del barrio, los datos que el estudiante descargó y filtró con sus propias manos, y el razonamiento que puede defender mirándote a los ojos.
Hay tres palancas, y las vas a combinar: anclar la tarea a lo local y verificable, hacer visible el proceso (incluido el uso de IA), y verificar en vivo aunque sea en una muestra. Ninguna sola es suficiente; las tres juntas hacen que copiar y pegar cueste más trabajo que aprender.
Prompt para hacerte el diagnóstico a ti misma: `Actúa como un estudiante de noveno grado con un promedio de 3.8. Resuelve esta tarea tal como la entregaría él. No la mejores, no la adornes: entrégala como la entregaría un estudiante promedio. Tarea: [pega aquí tu enunciado completo]`. Después pregúntale: `¿Qué partes de esta tarea no pudiste resolver bien por falta de información específica?` Esa respuesta es tu lista de rediseño.
Anclar: darle a la tarea algo que la IA no tiene
Anclar es amarrar la tarea a información que el estudiante debe conseguir, generar o verificar en el mundo real, y que tú puedas comprobar. El criterio práctico se llama especificidad verificable: la respuesta debe contener nombres, fechas, cifras o detalles que solo existen si la persona hizo el trabajo.
Cuatro tipos de anclaje que funcionan y no cuestan plata:
- Datos propios. Que el estudiante recoja algo: contar cuántos buses pasan por su esquina en 20 minutos, medir el tiempo de carga de tres páginas web, encuestar a diez compañeros. Diez datos suyos valen más que mil de internet.
- Datos públicos que hay que procesar. En
datos.gov.cohay conjuntos de datos abiertos del Estado colombiano. Pide que descarguen uno, filtren su municipio y comparen con otro. La IA puede explicar el método, pero el estudiante tiene que hacer el filtro y defender qué encontró. - Fuentes vivas. Una entrevista de cinco preguntas a un familiar, un egresado, un comerciante del barrio. Se entrega el audio o la transcripción más el análisis.
- Lo que pasó en clase. "Conecta tu argumento con lo que dijo tu compañero Andrés el jueves y explica en qué estás de acuerdo y en qué no." La IA no estuvo ahí.
Dos advertencias honestas. La primera: no pidas datos personales sensibles (salud, situación migratoria, ingresos de la familia, datos de menores identificables). Si hay entrevistas, que la persona entrevistada sepa para qué es y que se pueda usar solo el nombre de pila. La segunda: el anclaje hay que calificarlo, no solo pedirlo. Si el dato local vale cero en la nota, nadie lo va a tomar en serio y volverás a recibir 28 ensayos idénticos con un párrafo de relleno al final.
Antes: "Ensayo de 3 páginas sobre el manejo de residuos sólidos en Colombia." Después: "Durante una semana, registra qué botan en tu casa y clasifícalo en cinco categorías. Toma tres fotos de los puntos de recolección de tu barrio o colegio. Compara tu registro con lo que establece el plan de manejo de residuos de tu colegio (pídelo en coordinación) y propón un cambio concreto que se pueda hacer este semestre, con su costo aproximado en pesos."
Usar IA como parte del trabajo, no a escondidas
Si la IA está prohibida, se usa igual y se esconde, y tú pierdes toda la información sobre cómo la están usando. Si la IA es parte del entregable, se vuelve evaluable. Tres formatos que puedes montar hoy:
1. Auditoría de alucinaciones. Una alucinación es cuando el modelo afirma algo falso con total seguridad: una ley que no existe, una cifra inventada, un autor que nunca escribió ese libro. Pide al estudiante que le haga una pregunta del tema a la IA, pegue la respuesta completa y luego verifique cada afirmación contra una fuente real, marcando: correcto, impreciso o falso. Se califica la verificación, no la respuesta de la IA.
2. Borrador de la IA, versión del estudiante. El estudiante pide un primer borrador, lo pega tal cual, y entrega al lado su versión corregida con comentarios al margen: "aquí la IA generalizó", "esto no aplica en Colombia porque...", "le faltó el dato de mi encuesta". Esto obliga a leer críticamente, que es la competencia que de verdad importa.
3. Bitácora o anexo de IA. Una página al final con: qué herramienta usó, los prompts exactos (un prompt es la instrucción que le escribes a la IA), qué le sirvió, qué descartó y por qué. Si no usó IA, lo dice y también está bien.
El anexo tiene un efecto secundario valioso: los estudiantes que solo copiaron y pegaron no saben qué escribir ahí, porque no hubo decisiones. Y los que sí trabajaron descubren que su criterio es lo que vale. Deja claro desde el principio que declarar el uso no baja la nota; ocultarlo sí es una falta. Esa regla la vas a escribir formalmente en la lección 5.
Plantilla de anexo, cópiala en tu guía de trabajo: ``` ANEXO DE USO DE IA 1. Herramienta usada y para qué: 2. Prompt más importante que escribí (textual): 3. Algo que la IA propuso y ACEPTÉ. Por qué: 4. Algo que la IA propuso y RECHACÉ. Por qué: 5. Un dato de la IA que verifiqué. Fuente con la que lo verifiqué: ```
La rúbrica: repartir la nota hacia donde está el aprendizaje
Una rúbrica es una tabla que dice qué vas a calificar (los criterios), cuánto pesa cada cosa y cómo se ve cada nivel de desempeño. No es burocracia: es el mensaje más claro que puedes mandarle al curso sobre dónde poner el esfuerzo.
La regla de oro para una evaluación a prueba de IA: el producto final pulido no puede valer más de la mitad de la nota. Si la redacción impecable pesa 70%, estás premiando justo lo que la máquina regala. Un reparto que funciona:
- Anclaje y evidencia propia: 30%
- Análisis y criterio (el "y entonces qué"): 25%
- Proceso y anexo de IA: 20%
- Defensa oral o verificación en clase: 15%
- Redacción, estructura y citación: 10%
Los descriptores tienen que ser observables, no adjetivos. "Excelente análisis" no sirve porque cada quien lo interpreta distinto. Compara:
- Vago: "Usa bien los datos."
- Observable: "Presenta al menos 8 datos recogidos por el estudiante, con fecha y lugar, y los usa para sostener una afirmación propia distinta de la fuente."
Entrega la rúbrica con el enunciado, no después de calificar. Y usa una escala corta: tres niveles (Logrado / En proceso / Insuficiente) es más rápido y más consistente que cinco, y reduce la discusión de notas.
Un detalle que ahorra horas: si un criterio no lo puedes observar en el entregable, no va en la rúbrica. "Demuestra interés" no es evaluable. "Incorpora en la versión final al menos dos correcciones de la retroalimentación anterior, señaladas en el texto" sí lo es, y además se puede verificar en segundos.
Puedes armarla en una hoja de cálculo gratuita y reutilizarla todo el año cambiando solo la fila de anclaje.
Fila de rúbrica lista para copiar. Criterio: Proceso y anexo de IA (20%).
- **Logrado:** El anexo muestra al menos una propuesta aceptada y una rechazada con razón sustantiva ligada al contenido del curso; verifica un dato con fuente identificable.
- **En proceso:** El anexo existe y lista prompts, pero las razones son genéricas ("no me gustó") o no verifica ningún dato.
- **Insuficiente:** No hay anexo, o los prompts no corresponden al trabajo entregado.
Oral y en clase: verificar sin volverse policía
La verificación en vivo es la pieza que sostiene todo lo demás, y no necesita que interrogues a 40 estudiantes.
Defensa de 3 minutos. El estudiante trae su trabajo. Le haces dos preguntas fijas, iguales para todos —"¿cuál fue la decisión más difícil de este trabajo?" y "¿qué harías distinto con una semana más?"— y una tercera sacada de su texto: "en la página 2 afirmas X, ¿de dónde salió ese dato?". Tres minutos por persona son dos horas para 40 estudiantes, repartibles en varias clases mientras el resto trabaja en algo.
Muestreo anunciado. Si no tienes ese tiempo, anuncia desde el día uno: "el 30% del curso, elegido al azar, defenderá su trabajo, y esa defensa vale 15%". No saber si te toca cambia el comportamiento de todos. Sortea delante del curso para que sea transparente.
Escritura en clase. Veinte minutos, a mano o en un documento compartido, respondiendo una pregunta que solo se puede contestar si se hizo el trabajo previo. El historial de versiones de un procesador de texto en línea te muestra cómo creció el documento; un texto que aparece completo en un solo pegado es una señal para conversar, no una prueba de nada.
Quiz de seguimiento. Cinco preguntas en un formulario gratuito, sobre el trabajo que cada quien entregó. Quien lo hizo, responde en cuatro minutos.
Dos cosas honestas para cerrar. Esto no es infalible: alguien decidido puede estudiarse un texto ajeno y defenderlo. Y el propósito no es atrapar a nadie —es que el camino más corto hacia la nota vuelva a pasar por aprender—. Cuando una defensa sale mal, la conversación correcta empieza con "cuéntame cómo lo hiciste", no con una acusación.
Guion de defensa que cabe en una ficha, con casilla de calificación al frente para no llevar trabajo a la casa: 1. En una frase, ¿qué encontraste? (0-3) 2. ¿Cuál fue la decisión más difícil? (0-3) 3. [Pregunta del texto]: "Dices que ___, ¿de dónde salió?" (0-3) 4. ¿Qué harías con una semana más? (0-1) Total sobre 10. Se califica al terminar los 3 minutos, no después.
Práctica: Rediseña una tarea tuya y pruébala contra la IA
Escoge una tarea real que ya hayas dejado este año y cópiala tal cual en un documento nuevo. Debajo escribe en una sola frase qué querías que el estudiante aprendiera con ella.
Haz la prueba del chatbot: pega el enunciado en una herramienta de IA gratuita pidiéndole que responda como un estudiante promedio. Guarda el resultado en el mismo documento. Anota qué tan cerca está de un trabajo que aprobarías.
Agrega un anclaje: cambia el enunciado para exigir al menos un dato que el estudiante deba recoger, descargar o verificar (encuesta, entrevista, conteo, un archivo de datos.gov.co filtrado por su municipio).
Agrega el proceso: incluye el anexo de uso de IA en el entregable, con la plantilla de cinco puntos de esta lección.
Arma la rúbrica en una hoja de cálculo gratuita: cinco criterios con el reparto de pesos sugerido y tres niveles por criterio, con descriptores observables (qué se ve, cuántos, dónde).
Escribe el guion de verificación: dos preguntas fijas, una del texto, y define si la aplicas a todo el curso o a una muestra del 30% sorteada en clase.
Vuelve a pegar el enunciado nuevo en la IA con el mismo prompt del paso 2 y compara las dos respuestas. Si la segunda ya no alcanza para aprobar, el rediseño funcionó.
Escribe tres renglones para tus estudiantes explicando qué cambió y por qué, y déjalos junto al enunciado.
Al terminar tienes: Un enunciado rediseñado, su rúbrica de cinco criterios y un guion de defensa de 3 minutos, listos para aplicar en tu próxima unidad.
Dónde se equivoca la gente
- Prohibir la IA en el enunciado y creer que con eso queda resuelto.La prohibición sin rediseño solo esconde el uso y te deja sin información. Cambia la tarea y declara reglas claras de uso permitido; esconderlo es la falta, no usarlo.
- Pedir el anexo de uso de IA pero no asignarle nota.Lo que no pesa en la rúbrica no se hace. Dale al menos 20% y califica la calidad de las decisiones (qué rechazó y por qué), no la cantidad de prompts.
- Poner temas más difíciles o más raros pensando que así la IA no puede.La dificultad del tema no es barrera para un modelo de lenguaje. La barrera es la información que solo existe si la persona hizo el trabajo: sus datos, su contexto, su clase.
- Usar rúbricas con descriptores como "excelente", "bueno" o "demuestra interés".Reemplázalos por conductas contables y observables: cuántos datos, con qué fecha, dónde aparece en el texto, cuántas correcciones incorporó.
Lo que te llevas
- Si un chatbot resuelve tu tarea en veinte segundos, la tarea medía producción de texto, no aprendizaje: haz la prueba del chatbot antes de rediseñar.
- Anclar significa exigir datos propios, locales o verificables que la IA no puede tener, y además calificarlos.
- Volver la IA parte del entregable (auditoría de alucinaciones, borrador comentado, anexo de uso) convierte el atajo en objeto de evaluación.
- En la rúbrica, el producto final pulido no debe pesar más de la mitad; el resto va a evidencia, criterio, proceso y defensa.
- Los descriptores tienen que ser observables y la rúbrica se entrega junto con el enunciado, nunca después.
- Una verificación en vivo de tres minutos, aunque sea por muestreo anunciado, sostiene todo el diseño; y cuando algo no cuadra, se conversa, no se acusa.
Palabras nuevas
- Validez de una evaluación
- Que la evaluación realmente mida lo que dice medir. Un ensayo que se puede generar en veinte segundos no mide comprensión: mide acceso a una herramienta.
- Rúbrica
- Tabla que define los criterios de calificación, cuánto pesa cada uno y cómo se ve cada nivel de desempeño, con descripciones observables en vez de adjetivos.
- Prompt
- La instrucción que le escribes a una herramienta de IA. Entre más contexto, rol y formato le des, más útil es la respuesta.
- Alucinación
- Cuando un modelo de IA afirma algo falso con total seguridad: una cifra, una ley, una fuente o un autor inventados. Por eso todo dato debe verificarse.
- Anclaje de la tarea
- Amarrar el trabajo a información que solo existe si el estudiante la recogió, la procesó o la vivió: su encuesta, su barrio, un archivo que descargó, la clase del martes.
Quiz de la lección
Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.
Ya tienes tareas que exigen trabajo real; en la lección 3 verás cómo devolver retroalimentación rápida y útil sobre ellas sin quedarte calificando hasta la medianoche.