Lección 4 de 5 · 35 minutos
Detectores de IA: lo que dicen y lo que no
Al terminar esta lección
podrás explicar cómo funciona un detector de IA, por qué produce falsos positivos y a quién perjudica más, y aplicar un procedimiento justo y documentado cuando sospeches que un trabajo no fue escrito por tu estudiante.
Mariana, estudiante de octavo en un colegio de Bucaramanga, entrega un ensayo sobre el río Magdalena. Le quedó bien: frases ordenadas, vocabulario correcto, sin errores de ortografía porque lo revisó tres veces. Su profesora, que viene escuchando hablar de ChatGPT todo el año, pega el texto en un detector gratuito y le sale “96% generado por IA”. Esa tarde Mariana recibe un mensaje: nota cero y citación con acudiente. Mariana escribió cada palabra.
Ese escenario se repite en colegios y universidades de todo el país, y es el peor resultado posible: un estudiante honesto castigado, una familia furiosa y un docente sin forma de sustentar la decisión. En esta lección no vamos a decirte que los detectores sean inútiles, ni que los uses a ciegas. Vamos a abrir la caja: qué calculan realmente, por qué se equivocan, por qué se equivocan más con unos estudiantes que con otros, y qué hacer —paso a paso— cuando la sospecha aparece. Vas a salir con una tabla de evidencia propia y con un procedimiento que puedes defender frente a coordinación académica.
Qué mide realmente un detector de IA
Cuando pegas un texto y te devuelve “92% generado por IA”, es fácil leer eso como una medición, parecida a la de un termómetro. No lo es. El detector no tiene acceso al computador de tu estudiante, ni a su historial de navegación, ni a la conversación que pudo tener con un chatbot. Solo ve las palabras, y sobre ellas calcula probabilidades.
Casi todos se apoyan en dos ideas. La primera es la perplejidad: qué tan sorpresivo resulta un texto para un modelo de lenguaje. Si el modelo puede adivinar fácil la palabra que sigue (“la capital de Colombia es…”), la perplejidad es baja. Los textos de IA tienden a tener perplejidad baja, porque el modelo va escogiendo, palabra por palabra, la continuación más probable. La segunda idea es la variación (en inglés la llaman burstiness): las personas escribimos a saltos, mezclamos una frase larga y enredada con otra de cuatro palabras, nos desviamos del tema y volvemos. La IA suele mantener un ritmo parejo.
Encima de eso, muchos detectores agregan un clasificador: un modelo entrenado con miles de textos etiquetados “humano” o “IA”, que aprende qué combinaciones de rasgos aparecen más en cada grupo y devuelve una probabilidad.
La consecuencia es incómoda pero clara. El número que ves no significa “esto lo escribió una IA”. Significa “este texto se parece, en sus patrones estadísticos, a los textos que en mi entrenamiento venían de una IA”. Es como un aparato que decide si una arepa es hecha a mano o de máquina mirando solamente qué tan redonda quedó: acierta bastante, y se equivoca justo con la señora que amasa muy parejo.
Compara estas dos frases. “El río Magdalena es una de las arterias fluviales más importantes de Colombia y ha desempeñado un papel fundamental en el desarrollo económico del país.” Perplejidad baja: cada palabra es la esperable. “El Magdalena. Ahí aprendió a pescar mi abuelo, y hoy uno lo ve y le da tristeza.” Perplejidad alta y mucha variación. Un detector marcaría la primera como sospechosa aunque la haya escrito una persona copiando el estilo de un libro de texto.
Falsos positivos y falsos negativos: la aritmética que nadie hace
Dos términos que vas a necesitar toda la vida. Un falso positivo es cuando el detector marca como IA un texto que escribió una persona: acusa a un inocente. Un falso negativo es cuando deja pasar como humano un texto generado por IA: no detecta al que sí copió. Ningún detector puede bajar los dos errores a la vez; si lo ajustas para que atrape más tramposos, acusa a más inocentes, y al contrario.
Haz la cuenta con tus propios números. Supón —es un ejemplo, no un dato de un detector real— que un detector se equivoca en 5 de cada 100 textos humanos. Si tienes 120 estudiantes y recoges un ensayo, son unos 6 estudiantes honestos señalados. En un semestre con seis entregas, la herramienta acusa injustamente decenas de veces. Y cada acusación no es un número en una hoja: es una citación, una angustia, una familia que pierde la confianza en el colegio.
Hay otro detalle que se pasa por alto. Los porcentajes que muestran los detectores no son la probabilidad de que tu estudiante haya hecho trampa. “98% IA” no quiere decir “98% de probabilidad de que copió”. Es la salida de un modelo sobre el parecido estadístico del texto, y esa salida cambia si el mismo párrafo lo pegas en otro detector, o incluso en el mismo un mes después, porque las herramientas se actualizan sin avisar.
Señal de humildad que conviene recordar: OpenAI, que fabrica ChatGPT, publicó su propio detector de texto y después lo retiró reconociendo que su precisión era insuficiente. Quien mejor conoce cómo escribe el modelo no logró detectarlo de forma confiable.
Regla práctica: antes de usar un detector, escribe en tu cuaderno de clase la respuesta a esta pregunta: “¿Cuántos estudiantes honestos estoy dispuesto a señalar por mes para atrapar a uno que copió?”. Si la respuesta honesta es “ninguno”, entonces el porcentaje no puede ser tu evidencia, solo una alerta privada.
El sesgo: el error no cae parejo
Si el error fuera azar puro, sería un problema de calidad. Lo grave es que se concentra en grupos concretos, y casi siempre en los que tienen menos poder para defenderse.
El caso más documentado es el de quienes escriben en un idioma que no es su lengua materna. Tu estudiante de Cúcuta que redacta un ensayo para la clase de inglés usa el vocabulario que domina: palabras frecuentes, estructuras que practicó en clase, conectores de la lista que le diste. Eso es exactamente un texto de perplejidad baja y poca variación: predecible, parejo, correcto. Para el detector, huele a máquina. No porque copiara, sino porque escribir con recursos limitados produce las mismas señales que escribir con un modelo.
El mismo mecanismo golpea a otros perfiles. Estudiantes que siguen tu rúbrica al pie de la letra y arman el ensayo con la fórmula “introducción, tres argumentos, conclusión”. Estudiantes que escriben en prosa muy formal porque así les enseñaron. Estudiantes que corrigen ortografía y gramática con un asistente gratuito antes de entregar, o que piensan en su lengua y traducen. Estudiantes con formas de escritura muy estructuradas y repetitivas, algo común en personas neurodivergentes. Y estudiantes con menos práctica de escritura libre, que tienden a pegarse del molde.
Mira el patrón: el detector no penaliza la trampa, penaliza la escritura promedio, plana y obediente. En Colombia eso significa que el riesgo de ser acusado injustamente es mayor para quien estudia en inglés sin haber crecido con el idioma, para quien viene de un colegio con menos horas de escritura y para quien hace exactamente lo que le pediste. Es un sesgo con dirección, y va en contra de la equidad que buscas.
Prueba rápida que puedes hacer hoy: pega en un detector un texto propio de hace cinco años, escrito en inglés o en un registro muy formal (un informe, un proyecto institucional). Muchos docentes se sorprenden con su propio “porcentaje de IA”. Ese susto vale más que cualquier explicación teórica.
Lo que un detector no puede decirte (y el problema de subir trabajos)
Hagamos explícita la lista de cosas que el porcentaje no distingue, porque ahí es donde se toman las decisiones injustas.
- No distingue niveles de uso. Un texto escrito por el estudiante y luego corregido con un asistente de gramática puede dar el mismo resultado que un texto generado completo. Son faltas muy distintas, o ninguna falta, según tu política de clase.
- No identifica autoría. No puede decir “esto lo escribió tal modelo” ni “esto lo escribió esta persona”. Solo compara con patrones.
- No resiste el disfraz. Existen “humanizadores” y basta pedirle al propio chatbot que reescriba con frases de distinta longitud, en primera persona y con un error ocasional para que el porcentaje caiga. O sea: atrapa al que usó IA sin cuidado, y deja pasar al que se tomó dos minutos más.
- No exculpa. Un “0% IA” tampoco prueba que el trabajo sea propio; pudo escribirlo otra persona.
Hay además un tema de datos personales. Cuando pegas el trabajo de un estudiante en una página web, estás enviando información de una persona identificable —muchas veces menor de edad— a una empresa tercera, que puede almacenarla y usarla para entrenar sus modelos. En Colombia el tratamiento de datos personales está regulado por la ley de protección de datos personales (Ley 1581 de 2012) y requiere una base legítima y, en el caso de menores, cuidados especiales. La práctica prudente y sencilla: no subas textos con nombre, documento, datos familiares ni información sensible; y si tu institución tiene una herramienta contratada con condiciones de tratamiento de datos, úsala por ese canal y no por páginas sueltas.
Suma todo y queda una conclusión sobria: el detector puede ser, como máximo, una alerta privada para que tú mires con más atención. Nunca la prueba.
Frase para no volver a escribir en un correo: “El sistema detectó que usaste inteligencia artificial”. Frase que sí puedes sostener: “Quiero entender cómo construiste este trabajo; cuéntame tu proceso y muéstrame los borradores”.
Un procedimiento justo cuando hay sospecha
La salida no es ignorar el problema, es cambiar la fuente de evidencia: del producto al proceso. Este procedimiento de seis pasos se puede defender ante coordinación y ante una familia.
1. Trata la sospecha como hipótesis, no como hallazgo. Anótala en privado. No la comentes con el grupo, ni en el chat de padres, ni con otros docentes.
2. Reúne evidencia de proceso. El historial de versiones de Google Docs o de Word en línea muestra cómo creció el texto: escritura progresiva con correcciones frente a un solo pegado de 900 palabras a las 11:47 p. m. Suma borradores, esquemas, fotos del cuaderno, fuentes citadas.
3. Compara con una línea base. Si tienes un texto corto escrito en clase, a mano, tienes con qué comparar voz, errores típicos y nivel. Si no la tienes, este es el momento de empezar a recogerla cada periodo.
4. Conversa, no interrogues. Cinco minutos, en privado, con preguntas abiertas sobre el contenido: por qué escogió ese argumento, qué le costó, de dónde salió tal dato, qué dejó por fuera. Quien escribió, explica y amplía; quien pegó, suele no poder ir más allá del texto.
5. Decide con lo que tienes, no con el porcentaje. Si el estudiante explica y muestra proceso, la sospecha se cierra y se lo dices con claridad para no dejarlo marcado. Si no puede, tampoco lo declares tramposo tú solo: aplica el conducto institucional, por escrito, con derecho a ser escuchado y a presentar pruebas.
6. Documenta y ajusta el diseño. Registra fecha, evidencia, conversación y decisión. Y pregúntate qué cambio en la tarea —entregas por etapas, defensa oral, escritura en clase— hace que el año entrante no dependas de un detector.
Guion de apertura, para que no suene a acusación: ``` “Leí tu ensayo y quiero conversarlo contigo cinco minutos, no es un regaño. Cuéntame cómo lo armaste: ¿por dónde empezaste, qué parte te costó más, qué dejaste por fuera? Y si tienes borradores o el historial del documento, muéstramelos, me sirve para entender tu proceso.” ```
Práctica: Audita un detector con tus propios textos y arma tu tabla de evidencia
En un documento (computador o celular) prepara cinco textos de unas 150 a 200 palabras, todos de origen conocido por ti: (A) algo tuyo de años pasados, (B) un texto generado por un chatbot gratuito con un enunciado típico de tu materia, (C) ese mismo texto de IA reescrito a mano por ti, (D) un texto tuyo muy formal o en inglés (simula al estudiante no nativo), (E) un texto tuyo siguiendo al pie de la letra la estructura de tu propia rúbrica.
No uses trabajos reales de estudiantes con datos identificables: estás practicando también el cuidado de datos personales que viste en la lección.
Pega cada texto, uno por uno, en un detector con chequeo gratuito y anota el porcentaje que te da. Repite el ejercicio completo en un segundo detector distinto.
Toma el texto B (el de IA) y pídele al chatbot: “Reescribe este texto con frases de distinta longitud, en primera persona, con un par de expresiones coloquiales colombianas y sin conectores formales”. Mide el resultado en los dos detectores y compara con el original.
Arma una tabla en una hoja de cálculo gratuita con estas columnas: texto, origen real, detector 1, detector 2, ¿acertó?, ¿los dos coinciden?
Escribe abajo tres conclusiones en tus palabras y una regla personal de una frase que empiece así: “No usaré el resultado de un detector para…”.
Añade a la misma hoja una segunda pestaña llamada “Evidencia de proceso” y lista las tres cosas que sí vas a pedir desde la próxima entrega (por ejemplo: documento compartido con historial activo, esquema previo, defensa oral de tres minutos).
Guarda el archivo: lo vas a usar en la lección 5 para redactar la política de IA de tu clase.
Al terminar tienes: Tendrás una tabla propia que muestra en qué casos el detector acierta, en cuáles se equivoca y cuánto se contradicen dos herramientas entre sí, más una regla escrita y una lista de evidencia de proceso lista para aplicar.
Dónde se equivoca la gente
- Usar el porcentaje del detector como prueba para poner cero o abrir un proceso disciplinario.Trátalo como alerta privada. La decisión se toma con evidencia de proceso (historial de versiones, borradores) y una conversación documentada, nunca con la cifra.
- Pegar el trabajo completo del estudiante, con nombre y datos, en cualquier página web de detección.Quita nombre y datos personales, usa fragmentos y prefiere la herramienta que la institución haya contratado con condiciones claras de tratamiento de datos.
- Creer que si dos detectores coinciden, entonces ya es seguro.Ambos miden lo mismo (predictibilidad y variación), así que comparten los mismos sesgos: coinciden en el error con el estudiante que escribe plano o en un segundo idioma. Coincidir no es confirmar.
- Mencionar la sospecha delante del grupo, en el chat de padres o con “de todos modos ya sé quiénes fueron”.Conversa en privado, con presunción de buena fe, y cierra el caso explícitamente cuando el estudiante demuestre su proceso, para que no quede marcado.
Lo que te llevas
- Un detector no identifica autoría: estima si el texto se parece estadísticamente a lo que produce una IA, midiendo perplejidad (qué tan predecible es) y variación del ritmo.
- Todo detector intercambia falsos positivos por falsos negativos; con 120 estudiantes, incluso una tasa baja de error significa varios estudiantes honestos señalados por entrega.
- El error no es aleatorio: castiga a quien escribe en un segundo idioma, a quien sigue tu rúbrica al pie de la letra y a quien tiene menos práctica de escritura libre.
- Un par de reescrituras basta para bajar el porcentaje, así que la herramienta atrapa al descuidado y deja pasar al que se esmera en esconderlo.
- Subir trabajos de estudiantes a páginas de detección es enviar datos personales a un tercero; anonimiza y usa los canales institucionales.
- El procedimiento justo cambia el producto por el proceso: historial de versiones, borradores, línea base escrita en clase, conversación abierta, conducto institucional y registro escrito.
Palabras nuevas
- Perplejidad
- Medida de qué tan sorpresivo es un texto para un modelo de lenguaje. Baja perplejidad significa que casi cada palabra era la esperable; es la señal principal que usan los detectores.
- Falso positivo
- Cuando la herramienta marca como generado por IA un texto que escribió una persona. Es el error que arruina la confianza en la clase.
- Falso negativo
- Cuando la herramienta acepta como humano un texto que sí generó una IA. Bajar este error siempre sube los falsos positivos.
- Clasificador
- Modelo entrenado con textos etiquetados “humano” o “IA” que aprende a asignarle una probabilidad a un texto nuevo. Depende por completo de los ejemplos con los que fue entrenado.
- Humanizador
- Herramienta o simple instrucción a un chatbot para reescribir un texto con frases irregulares y tono personal, con el fin de bajar el puntaje de los detectores.
Quiz de la lección
Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.
Ya sabes por qué no puedes delegarle la confianza a un detector; en la lección 5 vas a escribir la política de IA de tu clase, con reglas claras de qué se permite, qué se declara y cómo se verifica el proceso.