Lección 4 de 5 · 40 minutos
Analizar datos cualitativos y cuantitativos con ayuda
Al terminar esta lección
podrás codificar entrevistas, resumir respuestas de encuestas y pedir pruebas estadísticas con ayuda de IA, verificando a mano cada resultado antes de escribirlo en tu tesis.
Camila terminó doce entrevistas para su trabajo de grado en una universidad de Bucaramanga. Tiene 180 páginas de transcripciones, una encuesta con 240 respuestas en Google Forms y tres semanas para entregar el capítulo de resultados. Su directora le dijo "codifique y triangule", y ella entendió la mitad. Abre un chatbot, pega una entrevista completa y pide "analízamela". Lo que recibe suena espectacular: categorías elegantes, porcentajes redondos, hasta una cita textual conmovedora. El problema aparece cuando busca esa cita en su archivo con Ctrl+F y no existe. La IA la escribió.
Esa es la trampa de esta lección y también su oportunidad. La IA es muy buena para lo que a ti te toma horas mecánicas: leer un fragmento y ponerle una etiqueta, agrupar 240 respuestas abiertas en categorías, explicarte qué prueba estadística corresponde a tus variables y escribir el código que la calcula. Es mala, en cambio, para lo que tu tesis exige: garantizar que un dato existe, que un número está bien contado y que una interpretación es defendible ante un jurado. Aquí vas a aprender a usarla como asistente de codificación y como profesora de estadística, no como fuente de verdad. La regla que atraviesa todo: la IA propone, tú verificas, y lo que no puedas verificar no entra al documento.
Primero los datos, después la IA: preparar y anonimizar
Antes de escribir un solo prompt necesitas dos cosas: datos limpios y datos protegidos.
Protegidos. Tus entrevistados te dieron información bajo un consentimiento informado. En Colombia, el tratamiento de datos personales está regulado por la ley de protección de datos (conocida como Habeas Data), y tu comité de ética o tu director te dirá qué puedes hacer. La regla práctica es sencilla: nunca subas a una herramienta en internet un texto donde aparezca el nombre, la cédula, el teléfono, el correo, el cargo exacto o el barrio de alguien. Haz seudonimización: reemplaza cada nombre por un código (E01, E02, E03), "el colegio X", "la empresa Y". Guarda la tabla que conecta el código con la persona real en un archivo aparte, en tu computador, sin subirla a ningún lado. Ese archivo no lo ve la IA nunca.
Limpios. Distingue tus dos tipos de datos:
- Cualitativos: texto. Transcripciones, respuestas abiertas, diarios de campo. Guárdalos en archivos
.txto en un documento por entrevista, con los turnos marcados (ENTREVISTADOR:/E01:). - Cuantitativos: números y categorías en una tabla. Una fila por persona, una columna por pregunta, la primera fila con nombres cortos de variable (
edad,semestre,usa_ia), sin celdas combinadas ni títulos decorativos arriba. Google Sheets exporta esto a.csvsin problema.
Revisa a ojo antes de analizar: ¿hay filas vacías?, ¿hay edades de 999?, ¿la misma respuesta escrita como "Sí", "si" y "SI"? La IA no va a notar esos errores; los va a analizar como si fueran reales y te va a entregar resultados falsos con mucha seguridad.
Antes: "Yo soy Juan Pablo Restrepo, trabajo en el colegio San Bartolomé de Ibagué...". Después: "[E04], docente de un colegio público de una ciudad intermedia...". Y en tu archivo privado `claves.xlsx`: E04 = Juan Pablo Restrepo, entrevista del 3 de marzo.
Codificar entrevistas: de la frase suelta al código
Codificar es ponerle a cada fragmento de texto una etiqueta corta que diga de qué trata. Si diez entrevistados hablan de que no tienen internet estable, todos esos fragmentos reciben el código conectividad_limitada. Después agrupas códigos parecidos en categorías y de ahí salen tus hallazgos.
El error de principiante es pedirle a la IA que codifique todo de una. El orden correcto tiene tres pasos:
1. Codifica tú dos entrevistas a mano. Sí, a mano. Así conoces tus datos y descubres los códigos que salen del terreno, no de la imaginación del modelo. 2. Escribe un libro de códigos. Es una tabla con tres columnas: nombre del código, definición en una frase, y un ejemplo real. Cinco a quince códigos para empezar. 3. Ahora sí, usa la IA para aplicar ese libro al resto del material, fragmento por fragmento, no entrevista completa.
Dos precauciones que cambian todo. Primera: exige que la IA copie la cita textual del fragmento, no que la reescriba; así puedes buscarla con Ctrl+F en tu archivo y comprobar que existe. Si no aparece, ese resultado se descarta entero. Segunda: dale permiso explícito de decir "ninguno". Un modelo al que no le das salida siempre encuentra algo, y te llena de códigos falsos.
Cuando aparezcan fragmentos que no encajan en ningún código, no los borres: son los más interesantes. Márcalos como nuevo y decide tú si merecen un código propio. Ese juicio es tuyo y es lo que tu jurado va a evaluar.
Prompt para copiar: ``` Actúa como asistente de codificación cualitativa. Te doy un LIBRO DE CÓDIGOS y un FRAGMENTO de entrevista anonimizada. Devuelve una tabla con: código asignado | cita textual copiada EXACTAMENTE del fragmento | por qué encaja (1 frase) | confianza alta/media/baja. Reglas: solo puedes usar códigos del libro. Si ninguno aplica, escribe "NINGUNO". No reescribas ni resumas las citas. No inventes texto que no esté en el fragmento. LIBRO DE CÓDIGOS: - conectividad_limitada: el participante menciona fallas de internet o datos que afectan su estudio. Ej: "se me cae el wifi en clase". - (…tus otros códigos…) FRAGMENTO (E04, líneas 40-75): """…pega aquí…""" ```
Encuestas: preguntas cerradas y respuestas abiertas
Una encuesta tiene dos mundos y se tratan distinto.
Preguntas cerradas (opción múltiple, escalas de 1 a 5, sí/no). Aquí no necesitas IA para el cálculo: necesitas una tabla dinámica. En Google Sheets, selecciona tus datos, Insertar > Tabla dinámica, pon la variable en Filas y la misma variable en Valores como COUNTA. Eso te da la frecuencia de cada respuesta. Para cruzar dos variables (por ejemplo, semestre contra uso de IA), pon una en Filas y otra en Columnas. La IA sí te sirve para explicarte la fórmula o escribirte un =CONTAR.SI($B$2:$B$241;"Sí") cuando no recuerdas la sintaxis. Que ella cuente y que tú confíes en el número es otra cosa: los modelos de lenguaje no calculan bien de memoria.
Respuestas abiertas ("¿qué dificultad tuviste?"). Aquí la IA rinde muchísimo. El método que funciona es clasificación con categorías fijas: primero lees 30 respuestas al azar, defines de 5 a 8 categorías más una llamada otra, y luego pides a la IA que clasifique en lotes de 20, devolviendo el número de fila junto a la categoría. Trabajar por lotes con el número de fila es clave: si le pasas 240 respuestas de una, se salta filas, las desordena o resume, y pierdes la trazabilidad con tu tabla original.
Un truco de control barato: pásale el mismo lote dos veces, en dos conversaciones distintas. Las respuestas donde cambie de categoría son las ambiguas; revísalas tú. Ese porcentaje de coincidencia consigo misma es información útil que puedes reportar en tu metodología.
``` Clasifica cada respuesta en UNA categoría de esta lista: acceso, tiempo, comprensión, apoyo docente, costos, otra. Formato de salida: fila | categoría | cita corta (máx 8 palabras copiadas). No cambies el orden de las filas. Si la respuesta está vacía o no se entiende, escribe "sin_dato". No agregues filas que yo no te di. 12 | "no tengo computador propio" 13 | "me falta tiempo por el trabajo" … ```
Pedir pruebas estadísticas explicadas (y código, no números)
Aquí está el mejor uso de la IA para quien no es estadístico: que te enseñe a elegir, no que te dé el resultado.
La elección de prueba depende del tipo de tus variables:
- Dos variables categóricas (carrera × usa IA sí/no): tabla de contingencia y prueba chi-cuadrado.
- Una categórica de dos grupos y una numérica (nota promedio de dos grupos): prueba t para muestras independientes.
- Dos variables numéricas (horas de estudio × nota): correlación.
Pídele a la IA que te justifique la elección, que te diga qué supuestos exige esa prueba (por ejemplo, tamaño mínimo esperado por celda, o distribución de los datos) y qué haces si no se cumplen. Esa explicación la contrastas con tu director o con el libro de metodología de tu programa.
Regla dura: no le pidas el número, pídele el código o los pasos. Un modelo de lenguaje puede "calcular" un valor p de memoria y equivocarse sin avisar. En cambio, si te escribe cinco líneas de Python que corres gratis en Google Colab, el cálculo lo hace el computador y es reproducible. Si prefieres no programar, pídele los pasos exactos en jamovi, un programa estadístico gratuito con menús, que se instala en tu computador.
Cuando tengas el resultado, exige interpretación en español simple: qué significa el valor p (aproximadamente, la probabilidad de ver una diferencia así de grande si en realidad no hubiera diferencia), y sobre todo el tamaño del efecto, que responde "¿qué tan grande es la diferencia?". Un resultado "significativo" con 240 personas puede ser una diferencia diminuta, irrelevante en la práctica.
``` Tengo un CSV con las columnas: semestre (texto), usa_ia (Sí/No), promedio (número 0-5). 1) Dime qué prueba estadística corresponde para comparar el promedio entre quienes usan IA y quienes no, y por qué. 2) Lista los supuestos y cómo verificarlos. 3) Escríbeme el código de Python (pandas + scipy) para Google Colab que lo calcule, incluyendo el tamaño del efecto. 4) NO inventes resultados ni números: yo voy a correr el código. ```
Validar a mano: el protocolo mínimo que te salva la sustentación
Todo lo anterior no vale nada sin esta sección. Validar no es leer por encima y decir "se ve bien": es un procedimiento con reglas fijas, y te toma menos de lo que crees.
1. Muestra al azar del 10 al 20 %. De los fragmentos codificados por la IA, escoge al azar 1 de cada 10 y códificalos tú sin mirar lo que ella puso. Luego compara. Si coinciden en menos de 8 de cada 10, tu libro de códigos está mal definido: no es culpa de la máquina, es que tus definiciones se solapan. Reescríbelas y vuelve a correr.
2. Verificación de citas. Toma diez citas textuales y búscalas con Ctrl+F en la transcripción original. Cualquier cita que no aparezca literal invalida ese lote completo.
3. Recálculo cruzado. Todo número que vaya al documento debe salir dos veces por caminos distintos: la tabla dinámica de Sheets y el código de Colab, o jamovi y una cuenta manual. Si no coinciden, no publiques ninguno hasta entender por qué.
4. Bitácora de análisis. Una hoja con: fecha, qué herramienta usaste, qué prompt, sobre qué archivo, qué cambiaste tú después. Esa bitácora es tu defensa cuando el jurado pregunte "¿cómo llegó a esta categoría?" y es la base de la declaración de uso de IA que vas a escribir en la lección 5.
5. Triangulación. Contrasta lo cualitativo con lo cuantitativo. Si tus entrevistados hablan de falta de acceso y tu encuesta muestra que el 80 % tiene computador propio, ahí hay algo que explicar. Esas tensiones son los mejores hallazgos de una tesis.
Fila de bitácora: `2026-09-09 | Chatbot (plan gratis) | prompt "codificación v3" | entrevistas E05-E08 anonimizadas | revisé 12 de 60 fragmentos, cambié 3 códigos, eliminé 1 cita no verificable`.
Práctica: Codifica, cuenta y valida un mini estudio en una sola sesión
Consigue material real: tres respuestas largas de una encuesta tuya, o entrevista por WhatsApp a tres compañeros con la misma pregunta abierta (por ejemplo, "¿qué es lo más difícil de estudiar hoy?"). Anonimiza: reemplaza nombres por E01, E02, E03 y guarda la tabla de equivalencias en un archivo aparte que no subes a ningún lado.
Lee los tres textos y codifica el primero tú mismo, a mano, en una hoja de Google Sheets con las columnas: fragmento | código | por qué. Con eso arma un libro de códigos de 5 a 8 códigos, cada uno con definición en una frase y un ejemplo.
Abre un chatbot con plan gratis y aplícale el libro de códigos a los textos E02 y E03 usando el prompt de la sección 2 (con la regla de "NINGUNO" y citas copiadas literalmente). Pega el resultado en tu hoja de cálculo.
Valida: verifica con Ctrl+F que cinco citas existan tal cual en los textos originales, y recodifica tú mismo cinco fragmentos al azar sin mirar lo que puso la IA. Anota cuántos coincidieron.
Crea una tabla pequeña de datos numéricos (puede ser de la misma encuesta o inventada por ti para practicar: 20 filas con semestre, usa_ia y horas_estudio) y saca una frecuencia con tabla dinámica en Google Sheets.
Pídele a la IA qué prueba estadística corresponde para esas variables, sus supuestos, y el código de Python para Google Colab. Corre el código en Colab (es gratis, solo necesitas cuenta de Google) y compara el conteo del código con el de tu tabla dinámica.
Abre una pestaña llamada 'bitácora' y registra las cinco columnas: fecha, herramienta, prompt usado, archivo, qué corregiste tú.
Escribe en tres frases un hallazgo que combine lo cualitativo y lo cuantitativo, y una frase sobre una tensión entre los dos.
Al terminar tienes: Una hoja de cálculo con tu libro de códigos, los fragmentos codificados y verificados, un conteo confirmado por dos caminos, una bitácora de análisis y un hallazgo triangulado listo para el capítulo de resultados.
Dónde se equivoca la gente
- Pegar la entrevista completa y pedir "analízamela", esperando categorías y hallazgos de una vez.Trabaja por fragmentos y con un libro de códigos que tú definiste antes. Pide una tarea concreta por prompt: asignar código, copiar cita, marcar confianza.
- Aceptar citas textuales que suenan perfectas sin buscarlas en el archivo original.Verifica cada cita con Ctrl+F en la transcripción. Si no aparece literal, descarta ese lote completo y vuelve a correrlo exigiendo copia exacta.
- Pedirle a la IA el valor p, el promedio o el porcentaje directamente en el chat.Pídele el código (Python en Google Colab) o los pasos en jamovi, y corre tú el cálculo. Confirma cada número con un segundo método antes de escribirlo.
- Subir la base de datos con nombres, cédulas o correos de los participantes.Seudonimiza antes de tocar cualquier herramienta en línea y guarda la tabla de equivalencias solo en tu computador; revisa lo que exige tu comité de ética.
Lo que te llevas
- Anonimiza y limpia los datos antes de usar cualquier herramienta de IA: la tabla que conecta códigos con personas reales nunca se sube a internet.
- Codifica tú las primeras entrevistas y construye el libro de códigos; la IA sirve para aplicarlo a escala, no para inventarlo.
- Exige citas copiadas literalmente y permite la respuesta "NINGUNO": sin esas dos reglas, el modelo llena vacíos con texto falso.
- En encuestas, cuenta las preguntas cerradas con tabla dinámica y clasifica las abiertas por lotes con categorías fijas y número de fila.
- Para estadística, pide explicación, supuestos y código; el cálculo lo hace el computador, no el chat.
- Valida siempre: muestra al azar recodificada por ti, verificación de citas, recálculo por dos caminos y bitácora de análisis.
Palabras nuevas
- Codificar (análisis cualitativo)
- Ponerle a un fragmento de texto una etiqueta corta que resume de qué trata, para luego agrupar fragmentos parecidos y construir hallazgos.
- Libro de códigos
- Tabla con el nombre de cada código, su definición en una frase y un ejemplo real; es lo que hace que dos personas (o una persona y una IA) codifiquen igual.
- Seudonimización
- Reemplazar los datos que identifican a alguien por códigos (E01, E02), guardando la tabla de equivalencias por separado y fuera de internet.
- Valor p
- Medida que indica, aproximadamente, qué tan probable sería observar un resultado como el tuyo si en la población no existiera la diferencia o relación que crees ver; no dice qué tan grande ni qué tan importante es el efecto.
- Triangulación
- Contrastar hallazgos obtenidos por métodos o fuentes distintas (entrevistas y encuesta, por ejemplo) para ver si se confirman o se contradicen.
Quiz de la lección
Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.
Con los hallazgos verificados y la bitácora en la mano, en la lección 5 escribirás la tesis con tu propia voz y declararás de forma honesta y precisa en qué partes usaste IA.