Saltar al contenido
Aprende IA

Lección 3 de 5 · 35 minutos

Cómo funciona ChatGPT por dentro, sin fórmulas

Nacho

Al terminar esta lección
podrás explicar con tus propias palabras qué es un modelo de lenguaje, cómo predice la siguiente palabra, qué son los tokens y el contexto, y por qué una IA puede sonar segura y estar equivocada.

Camila está en octavo semestre en Bogotá y le pidió a ChatGPT que le resumiera un texto para una exposición. El resumen quedó impecable: bien escrito, ordenado, con un dato buenísimo sobre un estudio de una universidad colombiana. En la exposición, el profesor le preguntó de dónde salió ese estudio. Camila lo buscó esa noche durante una hora. No existía. Ni el estudio, ni los autores, ni el año.

Lo que le pasó a Camila no fue mala suerte ni un "bug". Fue el funcionamiento normal de la herramienta, y se entiende perfectamente cuando sabes qué está haciendo la máquina por dentro. En esta lección vamos a abrir el capó de ChatGPT sin una sola fórmula. Vas a ver que no hay una biblioteca adentro, ni un buscador, ni alguien que "entienda" tu pregunta: hay una máquina de continuar textos, muy grande y muy bien entrenada. Cuando entiendas eso, vas a poder predecir cuándo te va a servir muchísimo y cuándo te va a mentir con cara de seriedad.

Un modelo de lenguaje es una máquina de continuar textos

Un modelo de lenguaje (en inglés, language model) es un programa que recibe un texto y calcula qué tan probable es cada posible continuación. Eso es todo lo que hace. No busca en internet, no consulta una base de datos, no razona como tú razonas cuando resuelves un problema: estima probabilidades sobre el siguiente pedacito de texto.

Cuando oyes LLM, es la sigla de large language model, o sea modelo de lenguaje grande. "Grande" quiere decir dos cosas. Primero, que fue entrenado leyendo una cantidad enorme de texto (páginas web, libros, foros, código de programación). Segundo, que tiene muchísimos parámetros: números internos que el modelo ajustó durante el entrenamiento. Piensa en un ecualizador de sonido con perillas de graves, medios y agudos. Un LLM es un ecualizador con miles de millones de perillas, y el entrenamiento fue el proceso de moverlas hasta que el sonido —el texto— saliera parecido al humano.

Acá viene lo importante: ChatGPT, Gemini, Claude o DeepSeek no son el modelo. Son productos construidos encima de un modelo: le agregan una interfaz de chat, memoria, botón de subir archivos, a veces búsqueda web. El motor, abajo, sigue siendo el mismo predictor de texto.

Y una consecuencia práctica que vale oro: si la máquina continúa textos, entonces lo que tú escribes es el comienzo del texto que ella va a continuar. Por eso el mismo modelo te da una respuesta boba con una pregunta boba, y una respuesta excelente cuando le das rol, contexto y formato. No es magia ni "trucos de prompt": le estás dando un mejor comienzo para continuar.

Ejemplo
Compara estos dos comienzos y fíjate en qué tan distinta es la continuación probable:

1) `Háblame de la papa criolla.`

2) `Eres profesor de agronomía en la Universidad Nacional. Explícale a un estudiante de primer semestre, en 5 viñetas y en lenguaje sencillo, por qué la papa criolla se cultiva en tierra fría en Colombia.`

Tokens: la IA no ve letras ni palabras, ve pedacitos

El modelo no procesa letras sueltas ni palabras completas. Procesa tokens: pedacitos de texto que pueden ser una palabra entera, un trozo de palabra, un signo de puntuación o incluso un espacio. Antes de que el modelo vea algo, un programa llamado tokenizador parte tu texto en esos pedacitos y los convierte en números.

Una palabra común como casa suele ser un solo token. Una palabra rara o propia como Bucaramanga normalmente se parte en varios pedazos (algo como Buc + aram + anga). Los números también se parten, y ahí está una de las claves de por qué los modelos de lenguaje han sido históricamente flojos con la aritmética: para el modelo, 1.847 no es una cantidad, es una secuencia de pedacitos de texto que hay que continuar.

Hay un detalle que nos afecta directamente en Colombia: los tokenizadores más usados fueron optimizados sobre todo con texto en inglés. Por eso el mismo contenido escrito en español suele gastar más tokens que en inglés. ¿Y eso qué importa si estás usando el plan gratis? Importa por dos razones: los límites de uso y los límites de longitud se miden en tokens, no en palabras. Un documento en español "llena" más rápido de lo que uno esperaría.

No te aprendas ninguna cifra de memoria. Lo útil es la intuición: el texto se mide en pedacitos, no en palabras, y tú puedes medirlo tú mismo en un tokenizador gratis (busca en Google "OpenAI tokenizer"). Pegar tres frases tuyas ahí y ver cómo se parten cambia para siempre la forma en que piensas sobre estas herramientas.

Ejemplo
Pega estas dos frases en un tokenizador y compara el número de tokens: `El estudiante viajó de Cúcuta a Ibagué.` y `The student traveled from Cucuta to Ibague.` Casi siempre la versión en español gasta más.

Predecir la siguiente palabra: por qué nunca responde igual dos veces

Ya sabes que el modelo continúa texto y que trabaja con tokens. Ahora juntemos las dos cosas. Cuando tú escribes algo, el modelo calcula una probabilidad para todos los tokens posibles que podrían venir después. Si el texto es La capital de Colombia es, quizás Bogotá sale con una probabilidad altísima, la con una probabilidad media (porque podría seguir "la ciudad de...") y banano con una probabilidad casi cero.

Entonces el sistema escoge un token, lo pega al final del texto, y vuelve a empezar: ahora predice el siguiente, con el token nuevo ya incluido. Y otra vez, y otra vez, hasta que decide parar. Esa respuesta de tres párrafos que te llega no se planeó completa desde el principio: se armó pedacito por pedacito, como cuando escribes en el celular y le vas dando a la palabra sugerida del teclado predictivo. Solo que este "teclado" leyó media internet.

Detalle clave: el sistema no siempre elige el token más probable. Introduce algo de azar al escoger entre los candidatos más probables. Ese parámetro se llama temperatura: baja significa más predecible y repetitivo; alta significa más variado y creativo (y más propenso a irse por las ramas). Por eso, si le haces la misma pregunta dos veces, te responde distinto. No es que "cambió de opinión": es que sacó otro camino del sombrero.

Y aquí está el punto que le faltaba a Camila: el modelo optimiza que el texto suene probable, no que sea verdadero. Una frase falsa bien redactada es, para el modelo, una continuación perfectamente probable. La fluidez y la seguridad del tono no son señales de que el contenido esté bien.

Ejemplo
Prueba esto en cualquier chat gratis, dos o tres veces seguidas en chats distintos: `Completa esta frase con lo primero que te salga, en una sola línea: "El bus de Bogotá a Villavicencio pasa por..."` Vas a ver respuestas distintas cada vez. Esa variación *es* el azar del que hablamos.

El contexto: la única "memoria" que tiene mientras te responde

Para predecir el siguiente token, el modelo mira el texto que tiene delante. A todo ese texto se le llama contexto, y al espacio máximo que cabe ahí se le llama ventana de contexto. Dentro de la ventana va todo: las instrucciones ocultas que le puso la empresa, tu primer mensaje, la respuesta de la IA, tu segundo mensaje, el documento que pegaste, todo.

Esto tiene una consecuencia que sorprende a mucha gente: el modelo no recuerda la conversación. En cada turno, la aplicación le vuelve a mandar toda la conversación desde el principio, y el modelo la lee otra vez como si fuera la primera. Es como un profesor brillantísimo con amnesia total, al que le entregas la transcripción completa antes de cada pregunta.

De ahí salen tres comportamientos que seguro ya viste:

  • Empiezas un chat nuevo y no se acuerda de nada. Correcto: el contexto empezó vacío. (Algunos productos tienen una función aparte de "memoria" que guarda datos tuyos y los reinyecta; eso es una función del producto, no del modelo.)
  • En conversaciones muy largas, se le olvida lo del principio. Cuando la ventana se llena, lo viejo se recorta o se resume.
  • Se pone terco con un error. Si el error ya quedó escrito arriba en el chat, sigue estando en el contexto y sigue influyendo en cada predicción.

¿Cómo se trabaja con esto? Abre un chat nuevo por cada tema. Si algo importa, repítelo o vuélvelo a pegar; no des por hecho que "ya te lo dije". Y cuando la conversación se enrede, no pelees: copia lo que sirve, abre un chat limpio y arranca de nuevo con el contexto ordenado.

Ejemplo
Truco práctico: cuando un chat se vuelva un enredo, pídele `Resume en 10 viñetas todo lo que hemos acordado hasta ahora, incluyendo datos, decisiones y el formato de salida.` Copia ese resumen y pégalo como primer mensaje de un chat nuevo.

Por qué no "sabe" cosas y por qué inventa

Hay que separar dos momentos. El entrenamiento pasó antes, una sola vez, en centros de datos gigantes: el modelo leyó cantidades enormes de texto y ajustó sus parámetros para predecir mejor. La consulta es lo que pasa cuando tú escribes: los parámetros ya están congelados y solo se usan para calcular probabilidades. El modelo no está aprendiendo de ti en ese momento.

Lo que quedó guardado en esos parámetros no son los textos. Son patrones estadísticos: qué palabras acompañan a qué palabras, cómo se estructura una carta formal, cómo suele seguir una explicación de biología. Es más parecido a un músico que tocó miles de canciones y quedó con el estilo en los dedos, que a un archivo donde puedas buscar la canción original. Por eso el modelo no puede "consultar" un dato: lo reconstruye, y a veces lo reconstruye mal.

A eso se le llama alucinación: la IA genera información falsa con total naturalidad, porque su objetivo era producir texto probable. Nombres de autores, artículos de leyes, cifras, URLs y bibliografía son las zonas de mayor riesgo, porque son datos precisos y arbitrarios que no se deducen de patrones. Súmale que hay una fecha de corte de entrenamiento: lo posterior a esa fecha simplemente no está.

Muchos productos hoy conectan el modelo a búsqueda web o a tus documentos, y eso ayuda muchísimo: el dato entra por el contexto en vez de salir de la memoria. Pero no lo vuelve infalible; puede leer mal la fuente o citar una fuente mala.

Dos cosas más que vienen del entrenamiento: sesgos, porque el texto de internet trae los prejuicios humanos, y privacidad, porque lo que escribes puede quedar guardado. Nunca pegues cédulas, historias clínicas ni datos de terceros.

Ejemplo
Regla de oro para cualquier respuesta con datos: `¿En qué te basas para eso? Si no estás seguro, dilo explícitamente y no inventes fuentes.` Y aun así, verifica tú mismo cualquier cifra, ley o autor antes de usarlo.

Práctica: Desármale el motor: tokens, azar y contexto en 20 minutos

  1. Busca en Google "OpenAI tokenizer" y abre la herramienta gratuita. Pega esta frase: Mi prima Valentina estudia ingeniería en la Universidad de Antioquia. Anota cuántos tokens dio y fíjate cuáles palabras se partieron en pedazos.

  2. En el mismo tokenizador, pega la misma idea traducida al inglés y anota los tokens. Escribe en tu cuaderno u hoja de cálculo cuál de los dos gastó más y por qué crees que pasa.

  3. Abre un chat gratis (ChatGPT, Gemini o DeepSeek). Escribe: Completa en una sola línea: "El mejor plan un domingo en Medellín es...". Repite exactamente lo mismo en tres chats nuevos distintos y anota las tres respuestas.

  4. Compara las tres respuestas: si el modelo "supiera" una respuesta, serían idénticas. Escribe una frase explicando qué demuestra esa diferencia sobre la temperatura y el azar.

  5. Prueba el contexto: en un chat nuevo dile Recuerda este dato: mi materia favorita es estadística. Luego pregúntale ¿Cuál es mi materia favorita? (debe acertar). Ahora abre otro chat nuevo y haz solo la segunda pregunta. Anota qué pasó.

  6. Prueba la alucinación de forma segura: pídele Dame tres artículos académicos, con autor y año, sobre transporte público en Barranquilla. Toma UNO de los títulos y búscalo tal cual en Google. Anota si existe o no.

  7. Repite el paso anterior pero agregando: Solo dame títulos que puedas verificar; si no estás seguro, di que no sabes. Compara las dos respuestas y anota si cambió el comportamiento.

  8. Cierra con un párrafo de tu puño y letra: "Le voy a creer a la IA cuando... y voy a verificar siempre cuando...".

Al terminar tienes: Una hoja con tus propias mediciones de tokens, tres respuestas distintas a la misma pregunta, la prueba de que el contexto no viaja entre chats y al menos una fuente inventada que detectaste tú mismo.

Dónde se equivoca la gente

  • Creer que si la respuesta está bien redactada y suena segura, entonces es correcta.Recuerda que el modelo optimiza texto probable, no texto verdadero. La fluidez no es evidencia. Verifica siempre cifras, leyes, autores y enlaces en la fuente original antes de usarlos.
  • Pensar que la IA "se acuerda" de ti o que aprende de tu conversación en tiempo real.En cada turno se le reenvía todo el chat y lo lee de nuevo; sus parámetros están congelados. Si algo importa, repítelo o pégalo otra vez. Si un chat se enredó, resume y arranca uno nuevo.
  • Alargar un chat eterno para un solo trabajo y no entender por qué la IA "se pone tonta" al final.La ventana de contexto se llena y lo del principio se recorta. Usa un chat por tema, y cuando se ponga largo, pide un resumen de lo acordado y llévalo a un chat limpio.
  • Pegar datos personales, cédulas, historias clínicas o información de terceros para que la IA "los organice".Lo que escribes puede quedar almacenado y no lo controlas tú. Anonimiza antes de pegar: cambia nombres por "Persona A", borra números de documento y usa datos de ejemplo.

Lo que te llevas

  • Un modelo de lenguaje es una máquina que continúa textos calculando qué tan probable es cada pedacito siguiente; no busca ni consulta nada mientras responde.
  • El texto se mide en tokens (pedacitos), no en palabras, y el español suele gastar más tokens que el inglés para decir lo mismo.
  • La respuesta se arma token por token con algo de azar (temperatura), por eso la misma pregunta da respuestas distintas cada vez.
  • El contexto es todo el texto que el modelo alcanza a leer en ese turno; es su única memoria, tiene un tamaño máximo y no viaja entre chats.
  • El entrenamiento guardó patrones, no textos: por eso el modelo reconstruye datos en vez de consultarlos, y a veces los inventa (alucinación).
  • Tu prompt es el comienzo del texto que la máquina va a continuar; mejorar el comienzo es la forma más directa de mejorar la salida.

Palabras nuevas

Token
El pedacito de texto con el que trabaja el modelo: puede ser una palabra, un trozo de palabra, un signo o un espacio. Todos los límites de longitud y de uso se miden en tokens.
Ventana de contexto
La cantidad máxima de tokens que el modelo puede leer de una sola vez, incluyendo instrucciones, tu conversación completa y los archivos que pegaste. Cuando se llena, lo más viejo se recorta o se resume.
Parámetros
Los millones o miles de millones de números internos que el modelo ajustó durante el entrenamiento. Guardan patrones estadísticos del lenguaje, no copias de los textos que leyó.
Temperatura
Qué tanto azar se mete al escoger el siguiente token. Baja da respuestas más predecibles y repetitivas; alta da respuestas más variadas y creativas, con más riesgo de irse por las ramas.
Alucinación
Cuando la IA genera información falsa con tono seguro (fuentes, cifras, leyes o enlaces que no existen), porque su objetivo es producir texto probable, no verificado.

Quiz de la lección

Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.

Pregunta 1 de 6¿Qué está haciendo realmente un modelo de lenguaje cuando te responde?
Pregunta 2 de 6Le haces la misma pregunta a ChatGPT en tres chats nuevos y te da tres respuestas distintas. ¿Qué explica mejor eso?
Pregunta 3 de 6Estás en un chat larguísimo y la IA empieza a olvidar instrucciones que le diste al principio. ¿Qué está pasando?
Pregunta 4 de 6¿Por qué el mismo texto en español suele gastar más tokens que en inglés?
Pregunta 5 de 6La IA te da tres fuentes académicas con autor, título y año, y ninguna existe. ¿Cuál es la causa de fondo?
Pregunta 6 de 6Según lo visto en esta lección, ¿por qué un prompt con rol, contexto y formato suele dar mejores resultados?

Ya sabes cómo funciona el motor por dentro; en la siguiente lección vamos a ver, con ejemplos concretos, qué tareas hace hoy la IA mejor que tú, cuáles hace peor y en cuáles definitivamente no deberías confiarle el volante.