Saltar al contenido
Aprende IA

Lección 5 de 5 · 40 minutos

El mapa de herramientas: chat, imagen, voz, código, búsqueda y agentes

Nacho

Al terminar esta lección
podrás reconocer las seis grandes familias de herramientas de IA que existen hoy, saber qué hace cada una, cuáles tienen plan gratis usable desde Colombia y elegir la correcta según la tarea que tengas enfrente.

Camila estudia noveno semestre en Bucaramanga y tiene esta semana: un resumen de veinte páginas en inglés para una materia, la portada de un trabajo grupal, una entrevista de una hora que grabó en el celular y que le toca transcribir, un script en Python que no le corre, y una duda concreta sobre cuánto tiempo de cotización pide una entidad para cierto trámite. Abre ChatGPT y le tira las cinco cosas al mismo chat. El resumen le sale bien, la portada no la puede hacer, la transcripción no la puede hacer, el script mejora a medias, y la respuesta del trámite le sale con una cifra que suena razonable pero que nadie verificó. Camila concluye que "la IA no sirve para tanto". El problema no era la IA: era que estaba usando un destornillador para cinco tornillos distintos.

En las cuatro lecciones anteriores viste qué es la IA, cómo aprende de datos, qué pasa por dentro de un modelo de lenguaje y dónde están sus límites reales. Esta lección es el mapa: las familias de herramientas que existen hoy, para qué sirve cada una y cómo escoger en treinta segundos. No vas a memorizar nombres de marcas —esos cambian cada seis meses—, vas a aprender a clasificar tu tarea. Cuando sepas decir "esto es un problema de transcripción de voz, no de chat", encontrar la herramienta correcta se vuelve fácil, así el nombre de moda cambie el año entrante.

Las seis familias: qué entra y qué sale de cada una

La forma más útil de ordenar el mundo de la IA no es por marca sino por qué recibe y qué devuelve la herramienta. A eso se le llama entrada y salida. Con ese criterio, casi todo lo que existe hoy cae en seis familias:

  • Chat (texto → texto). Le escribes y te responde escribiendo. Sirve para redactar, resumir, explicar, traducir, reformular, ordenar ideas. Es la familia más general y por eso la más usada.
  • Imagen (texto → imagen, o imagen → imagen). Describes una escena y te la dibuja, o le pasas una foto y te la edita. Sirve para ilustraciones, portadas, bocetos, íconos.
  • Voz (audio → texto, y texto → audio). En un sentido, transcribe lo que se dijo; en el otro, lee un texto en voz alta. Son dos cosas distintas dentro de la misma familia.
  • Código (texto → código). Escribe, corrige y explica programas. Vive dentro del editor donde programas, no solo en un chat.
  • Búsqueda con IA (pregunta → respuesta con fuentes). Consulta internet en el momento y te responde citando de dónde sacó cada cosa.
  • Agentes (objetivo → acciones). No solo te responden: ejecutan pasos. Abren páginas, llenan campos, corren programas, encadenan tareas.

Hay una diferencia de fondo entre las primeras cinco y la última. Las cinco primeras producen un resultado que tú revisas antes de usarlo. Un agente actúa en el mundo mientras tú no estás mirando. Eso cambia por completo el nivel de cuidado que necesitas, y volveremos a ello.

Muchas herramientas ya combinan familias en una sola ventana: le pegas una foto y hablas de ella, o le dictas y te responde escrito. A eso se le dice multimodal (que maneja varios tipos de contenido: texto, imagen, audio). Que estén juntas no significa que sean lo mismo: por dentro siguen siendo capacidades distintas, con calidades distintas. Una herramienta puede ser excelente en chat y mediocre en imagen.

Ejemplo
Prueba de clasificación en 10 segundos: pregúntate "¿qué le entrego y qué necesito que me devuelva?". Tengo un audio y necesito texto → familia voz. Tengo una idea y necesito un dibujo → familia imagen. Tengo una pregunta sobre algo que pasó esta semana → búsqueda con IA. Necesito que algo se haga solo, no que me lo expliquen → agente.

Chat y búsqueda: parecidas, pero no sirven para lo mismo

Esta es la confusión que más caro le sale a la gente, y la que dejó a Camila con una cifra inventada.

Un chat responde desde lo que aprendió durante su entrenamiento. Como viste en la lección 3, eso significa que está prediciendo texto plausible: tiene una fecha de corte de conocimiento y no está mirando internet mientras te responde. Si le preguntas por un requisito de un trámite, un precio actual o una noticia reciente, puede devolverte algo que suena perfecto y es falso. Eso es una alucinación: una respuesta inventada con tono seguro.

Una herramienta de búsqueda con IA hace otra cosa: primero busca páginas en internet, las lee, y luego redacta una respuesta pegando enlaces a las fuentes. Sigue pudiendo equivocarse —puede citar una página mala o resumirla torcido—, pero te da algo decisivo: puedes ir a verificar. Si un dato no tiene enlace, trátalo como no verificado.

Regla práctica para escoger:

  • ¿La respuesta depende de un hecho del mundo, con fecha, cifra, norma o nombre propio? → búsqueda con fuentes, y abre al menos un enlace.
  • ¿La respuesta depende de tu propio material o de una habilidad de redacción? → chat.

Resumir un texto que tú le pegas es chat: el material ya está ahí, no hay nada que buscar. Explicarte qué es la fotosíntesis es chat: es conocimiento estable. Decirte el requisito vigente de un trámite en 2026 es búsqueda, y aun así lo confirmas en la página oficial de la entidad.

Hoy la línea se está borrando: varios chats populares hacen búsqueda cuando detectan que la necesitan, o cuando activas la opción. Por eso, más que elegir producto, elige modo: si la respuesta trae enlaces, estás en modo búsqueda; si no trae ninguno, estás en modo memoria del modelo. Mirar si hay enlaces es el hábito que te protege.

Ejemplo
Mismo tema, dos preguntas distintas:

Chat: "Explícame en lenguaje sencillo qué es una cotización a pensión y por qué se cuentan semanas."

Búsqueda: "¿Cuántas semanas de cotización se exigen hoy en Colombia para pensión de vejez? Cítame la fuente oficial con enlace." — y luego abres el enlace.

Voz, imagen y código: las tres que resuelven trabajo real

Voz. Tiene dos direcciones que conviene no mezclar. La primera es transcripción (audio → texto): le das una grabación y te devuelve lo dicho, escrito. Sirve para clases grabadas, entrevistas de trabajo de campo, reuniones, notas de voz de WhatsApp. Es de lo más rentable que existe: una hora de audio que te tomaría tres horas transcribir a mano sale en minutos, y después le pides a un chat que te la resuma. Ojo: con acento colombiano funciona bien, pero se equivoca con nombres propios, siglas y palabras muy locales, así que siempre se revisa. La segunda dirección es síntesis de voz (texto → audio): convierte un texto en alguien leyéndolo. Sirve para escuchar tus apuntes en el bus o para narrar un video.

Imagen. Le describes lo que quieres y te lo genera. Funciona muy bien para ilustración, ambiente, bocetos y conceptos; funciona mal cuando necesitas precisión literal: texto dentro de la imagen suele salir deformado, y los datos de un gráfico se los inventa. Un generador de imágenes no es la herramienta para hacer una gráfica de tus datos —eso se hace con una hoja de cálculo o pidiéndole código a un chat. Y hay un punto ético que no se puede saltar: estos modelos se entrenaron con obra de personas reales, y generar la cara de alguien identificable o imitar el estilo de un artista vivo para publicarlo es terreno delicado. Para trabajos académicos, declara siempre que la imagen fue generada con IA.

Código. Un chat general ya escribe y corrige código bastante bien; las herramientas especializadas viven dentro del editor, ven todos tus archivos y completan mientras escribes. Lo importante no es cuál usas sino cómo lo usas: pega el mensaje de error completo, no lo resumas; cuenta qué esperabas y qué pasó; y ejecuta siempre lo que te dé antes de creerle. El código con errores tiene una ventaja enorme sobre el texto con errores: el computador te avisa cuando está mal.

Ejemplo
Prompt de transcripción bien pedido: "Te paso la transcripción de una entrevista de 40 minutos. Devuélveme: (1) resumen de 10 líneas, (2) las 5 citas textuales más importantes con el minuto aproximado, (3) los temas que se repiten. Si algo no está claro en la transcripción, dilo en vez de completarlo."

Agentes: la familia que actúa (y por qué exige más cuidado)

Un agente es una IA a la que le das un objetivo, no una pregunta, y que ejecuta pasos por su cuenta para lograrlo: navega páginas, llena formularios, lee y escribe archivos, corre programas, y decide sobre la marcha cuál es el siguiente paso. La diferencia con un chat es la misma que hay entre pedirle a alguien una receta y pedirle que te haga el almuerzo.

Por dentro no hay magia nueva: es el mismo modelo de lenguaje de la lección 3, pero conectado a herramientas que puede invocar, y metido en un ciclo de "piensa → actúa → mira el resultado → vuelve a pensar". Eso lo hace potente para tareas de varios pasos aburridas y repetitivas. También lo hace más frágil: si en el paso 3 se equivoca, los pasos 4 a 10 se construyen sobre el error, y el error final puede quedar muy lejos del original. Es lo que a veces se llama acumulación de errores.

Tres reglas antes de soltar un agente:

  • Ámbito acotado. Dale una tarea concreta y verificable, no "organízame la vida". Entre más abierto el objetivo, más se pierde.
  • Nada irreversible sin ti. Enviar correos, publicar, pagar, borrar archivos, aceptar términos: esos pasos los confirmas tú. Un agente no debería tener tus contraseñas ni tu tarjeta.
  • Revisa el rastro, no solo el resultado. Estas herramientas muestran los pasos que dieron. Léelos: ahí se ve si buscó donde debía o si se inventó el camino.

Un caso donde sí valen la pena: recopilar información de varias páginas y armar una tabla comparativa; reorganizar y renombrar un montón de archivos con una regla clara; probar un programa y reportar qué falló. Un caso donde no: cualquier cosa que involucre tu plata, tus datos personales o un trámite oficial. Ahí el ahorro de tiempo no compensa el riesgo, y además muchas entidades exigen que el trámite lo haga la persona.

A 2026 los agentes están en su etapa de promesas grandes y resultados desparejos. Úsalos, pero con la mano cerca del freno.

Ejemplo
Objetivo mal planteado para un agente: "Consígueme prácticas." Objetivo bien planteado: "Entra a estas 4 páginas de empleo que te doy, busca ofertas de práctica en análisis de datos en Bogotá publicadas en los últimos 15 días, y ármame una tabla con: empresa, cargo, fecha, enlace. No apliques a ninguna."

Cómo elegir, qué es gratis de verdad y qué no le puedes contar

El árbol de decisión. Cuatro preguntas en orden y ya sabes qué abrir:

1. ¿Qué formato necesito de salida? Texto → chat. Imagen → generador de imágenes. Audio → voz. Programa que corra → código. 2. ¿La respuesta depende de hechos actuales o verificables? Sí → búsqueda con fuentes. No → chat. 3. ¿Necesito que se haga algo, no que me lo digan? Sí → agente, acotado. 4. ¿Lo que voy a subir es sensible? Si sí, cambia de plan (ver abajo) antes de subir nada.

Qué significa "gratis". En 2026 casi todas las familias tienen plan gratis usable desde Colombia, pero "gratis" viene en tres sabores y conviene distinguirlos:

  • Gratis con límite de uso: te dan cierta cantidad de mensajes, imágenes o minutos por día o por mes; al pasarte, te bajan a un modelo más flojo o te toca esperar. Es lo más común.
  • Gratis con tus datos: el plan gratuito puede usar tus conversaciones para entrenar. Casi siempre hay una opción para desactivarlo en la configuración de privacidad; búscala el primer día.
  • Gratis de verdad: herramientas abiertas que corren en tu propio computador. No dependen de nadie y nada sale de tu máquina, pero necesitan un equipo decente y más trabajo de instalación.

Si eres estudiante, revisa si tu universidad ya tiene convenio: varias instituciones colombianas dan acceso institucional a suites con IA. Vale la pena preguntar en la biblioteca o en sistemas antes de pagar algo.

Lo que no se sube, en ninguna herramienta. Cédulas, historias clínicas, datos de terceros que no autorizaron, resultados de investigación sin publicar, contraseñas, información laboral confidencial. En Colombia el manejo de datos personales está regulado y subir datos de otras personas a un servicio extranjero puede meterte en problemas legales, no solo éticos. La regla mental es simple: si no lo pegarías en un grupo de WhatsApp de 200 desconocidos, no lo pegues en un chat de IA. Si necesitas trabajar con datos sensibles, anonimízalos antes: reemplaza nombres y números por etiquetas como PERSONA_1, CC_1.

Ejemplo
Caso Camila, resuelto: resumen del PDF → chat (pegando el texto). Portada → generador de imágenes. Entrevista de una hora → transcripción de voz y luego chat para resumir. Script que no corre → chat de código con el error completo pegado. Requisito del trámite → búsqueda con fuentes, y confirmación en la página oficial de la entidad. Cinco tornillos, cinco herramientas.

Práctica: Arma tu propio mapa de herramientas (y pruébalo con una tarea real)

  1. Abre una hoja de cálculo gratis (Google Sheets, LibreOffice Calc o la app de notas del celular) y crea seis filas: Chat, Imagen, Voz, Código, Búsqueda, Agentes. Y cuatro columnas: Herramienta que probé / ¿Tiene plan gratis? / ¿Qué le sale bien? / ¿Qué le sale mal?

  2. Escribe tres tareas reales que tengas esta semana (universidad, trabajo, casa). Al lado de cada una, clasifícala usando el árbol de decisión: formato de salida, ¿depende de hechos actuales?, ¿necesito que se haga o que me lo digan?, ¿hay datos sensibles?

  3. Haz la prueba del contraste con la misma pregunta. Escoge algo verificable sobre Colombia (una cifra, un requisito, una fecha). Pregúntaselo primero a un chat sin búsqueda y guarda la respuesta. Luego actívale la búsqueda o usa una herramienta de búsqueda con IA y pide enlaces.

  4. Abre al menos uno de los enlaces que te dio la búsqueda y verifica el dato en la fuente. Anota en tu hoja si el chat sin búsqueda acertó, falló, o inventó algo que sonaba bien.

  5. Prueba la familia voz: graba una nota de voz de 2 minutos explicando un tema de una de tus materias, pásala por una herramienta de transcripción gratuita, y cuenta cuántos errores tiene (sobre todo en nombres propios y siglas).

  6. Pásale esa transcripción a un chat y pídele: resumen en 5 puntos, y una lista de lo que quedó confuso en tu explicación. Eso te sirve para estudiar y de paso ves cómo se encadenan dos familias.

  7. Entra a la configuración de privacidad de la herramienta de chat que más uses y busca la opción de entrenamiento con tus conversaciones. Decide si la dejas activada o no, y anota tu decisión en la hoja.

  8. Termina llenando las columnas '¿qué le sale bien / mal?' con lo que observaste hoy, no con lo que leíste aquí. Ese es tu mapa, y vale más que cualquier lista de marcas.

Al terminar tienes: Una hoja con tu propio mapa de las seis familias, tres tareas ya clasificadas, y evidencia de primera mano de la diferencia entre un chat que recuerda y una búsqueda que verifica.

Dónde se equivoca la gente

  • Usar el chat como si fuera un buscador y creerle cifras, fechas o requisitos que da sin ningún enlace.Si la respuesta depende de un hecho del mundo, exige fuentes y ábrelas. Sin enlace, el dato queda marcado como no verificado hasta que lo confirmes tú en la página oficial.
  • Pedirle a un generador de imágenes que haga una gráfica con tus datos, un diagrama exacto o un cartel con texto.Los generadores de imagen dibujan ambiente, no precisión. Para gráficas usa una hoja de cálculo o pídele a un chat el código que las genere; para carteles, genera el fondo y pon el texto tú en cualquier editor.
  • Soltar un agente con acceso a tus cuentas y un objetivo amplio, tipo 'organízame todo', y dejarlo correr sin mirar.Acota la tarea, prohíbele explícitamente los pasos irreversibles (enviar, pagar, publicar, borrar), y lee el rastro de pasos que muestra, no solo el resultado final.
  • Casarse con una sola herramienta 'porque ya me acostumbré' y forzar con ella tareas de otra familia.Clasifica primero la tarea y después escoge. Tener una herramienta gratis identificada por familia toma una tarde y te ahorra semanas de resultados mediocres.

Lo que te llevas

  • Las herramientas de IA se ordenan mejor por entrada y salida que por marca: chat, imagen, voz, código, búsqueda y agentes.
  • Un chat responde desde lo que aprendió; una búsqueda con IA consulta internet y cita fuentes. Si el dato depende del mundo real, necesitas la segunda y necesitas abrir los enlaces.
  • La familia voz tiene dos direcciones —transcribir audio y leer texto en voz alta— y transcribir es probablemente el mayor ahorro de tiempo disponible hoy gratis.
  • Los generadores de imagen sirven para ilustrar, no para ser precisos: texto y datos dentro de la imagen salen mal.
  • Un agente actúa en el mundo, no solo responde; por eso se acota, se le prohíben los pasos irreversibles y se le revisa el rastro de pasos.
  • 'Gratis' puede significar límite de uso, uso de tus datos para entrenar, o software abierto en tu propio equipo: revisa cuál te tocó y ajusta la privacidad el primer día.

Palabras nuevas

Multimodal
Herramienta que maneja varios tipos de contenido a la vez —texto, imagen, audio— en la misma conversación. Que los junte no significa que sea igual de buena en todos.
Transcripción automática
Conversión de un audio grabado en texto escrito hecha por una IA. Muy útil para clases y entrevistas; falla sobre todo con nombres propios, siglas y palabras muy locales.
Agente de IA
Sistema que recibe un objetivo y ejecuta pasos por su cuenta (navegar, llenar formularios, correr programas) hasta cumplirlo, en vez de limitarse a responderte.
Alucinación
Respuesta inventada por la IA que se presenta con tono seguro y coherente. Es el riesgo principal al usar un chat para preguntas sobre hechos verificables.
Anonimizar
Quitar o reemplazar los datos que identifican a una persona (nombre, cédula, dirección) antes de subir un texto a una herramienta, para no exponer información de terceros.

Quiz de la lección

Seis preguntas. Nadie te califica: sirven para que sepas si entendiste. Con cuatro buenas vas bien.

Pregunta 1 de 6Necesitas saber el requisito vigente de un trámite en Colombia en 2026. ¿Cuál es la ruta correcta?
Pregunta 2 de 6Tienes que entregar una gráfica de barras con las ventas mensuales de tu proyecto. ¿Qué familia de herramientas es la adecuada?
Pregunta 3 de 6¿Cuál es la diferencia de fondo entre un agente y las otras cinco familias?
Pregunta 4 de 6Grabaste una entrevista de una hora para un trabajo de campo y necesitas las ideas principales. ¿Cuál es la secuencia más eficiente?
Pregunta 5 de 6Vas a analizar una base con nombres y cédulas de participantes de un estudio. ¿Qué haces antes de subirla?
Pregunta 6 de 6En 2026, ¿qué es lo más razonable esperar de un plan gratuito de una herramienta de IA?

Con el mapa completo —qué es la IA, cómo aprende, cómo funciona por dentro, qué puede y qué no, y qué herramienta usar cuándo— llegaste al final del curso: sigue el examen final, donde pones todo esto a prueba con casos reales.