Módulo 02
¿Por qué importa? Una sola llamada a un LLM tiene un techo duro: no puede buscar lo que no sabe, no puede comprobar lo que ha escrito y no puede corregirse. La diferencia entre un chatbot que decepciona y un sistema que resuelve tareas complejas casi nunca es el modelo; es la estructura del proceso que lo rodea. Antes de escribir código conviene saber qué convierte a un flujo en agéntico, cuánta autonomía tiene y cuándo no merece la pena.
Intuición
Un flujo agéntico es un proceso en el que una aplicación basada en LLM ejecuta varios pasos para completar una tarea. La diferencia con un prompt único (zero-shot) no está en el modelo ni en el tamaño del contexto: está en que el modelo participa en varias decisiones encadenadas en vez de en una sola.
La forma más sencilla de verlo es pedir un ensayo. En modo no agéntico se pide «escribe un ensayo sobre el tema X de principio a fin». El modelo genera una respuesta en una sola pasada. En modo agéntico se pide «escribe un esquema», después «¿necesitas buscar en la web?», después «escribe un primer borrador», después «¿qué partes habría que revisar?» y por último «reescribe esas partes». El mismo modelo, la misma temperatura, incluso el mismo prompt base; el resultado no es comparable.
Cada paso del flujo puede ir acompañado de una herramienta: una búsqueda web, una consulta a base de datos, un intérprete de código. La herramienta no la ejecuta el LLM por sí solo; el flujo la invoca, le pasa la petición del modelo y devuelve el resultado al contexto. Los tres patrones que aparecen una y otra vez son reflexión (el modelo revisa su propia salida), uso de herramientas (delegar en código lo que el modelo no debe calcular) y planificación (descomponer la tarea antes de resolverla). A partir de ahí, encadenar varios pasos da lugar a sistemas multiagente donde cada rol lo desempeña una instancia distinta del modelo.
Ejemplo
Retomemos el ensayo sobre «agujeros negros». En modo no agéntico, una única llamada devuelve algo superficial: hechos obvios, poca profundidad. En modo agéntico se construye un flujo de cinco pasos: (1) escribir un esquema; (2) buscar en la web las fuentes que mejor cubran cada apartado; (3) redactar un primer borrador; (4) identificar qué partes son débiles o están sin respaldar; (5) reescribir esas partes. El ensayo resultante ya no es una variante del prompt; es un artefacto que ha pasado por investigación y crítica.
El mismo esqueleto resuelve tareas empresariales. Procesar una factura PDF es un flujo de tres pasos (extraer los cuatro campos obligatorios, consultar la base de datos, registrar la entrada). Responder a un correo de cliente quejándose de un pedido equivocado es un flujo de tres pasos con dos herramientas (buscar el pedido, redactar la respuesta, pedir revisión humana antes de enviar). En ambos casos, lo que distingue al flujo agéntico del simple prompt es que el modelo decide y ejecuta pasos, no solo genera texto.
Un flujo agéntico no es gratis. Cada paso añade latencia, coste por token y, sobre todo, puntos de fallo. Si un paso intermedio produce una salida mala, los siguientes trabajan sobre esa salida y el error se amplifica. En tareas simples —clasificar correos en tres categorías fijas, extraer un campo de un formulario— un flujo no agéntico suele ser más barato, más rápido y más fiable que cualquier variante agéntica.
Error común
Llamar «agente» a cualquier aplicación que tenga un bucle. Un flujo es agéntico cuando el modelo participa en las decisiones sobre qué hacer a continuación; no lo es cuando las decisiones están codificadas de antemano y el LLM solo rellena texto. La diferencia importa porque determina cuánta autonomía tiene el sistema, cuánta superficie de error introduce y cuánta supervisión necesita. La escala razonable va de poco autónomo (todos los pasos y herramientas fijados en código; la única libertad del modelo es redactar) a semiautónomo (el modelo elige qué herramienta usar de entre un conjunto predefinido) a muy autónomo (el modelo decide el plan completo y puede incluso crear herramientas nuevas sobre la marcha). Más autonomía no es más calidad: es más flexibilidad a cambio de más coste, más variabilidad y más difícil de auditar.
| No agéntico (zero-shot) | Agéntico (multipaso) | |
|---|---|---|
| Llamadas al modelo | Una | Varias encadenadas |
| Decisiones del modelo | La respuesta | El plan y las herramientas |
| Uso de herramientas | No | Sí (búsqueda, BD, código) |
| Latencia y coste | Bajos y predecibles | Altos y variables |
| Calidad en tareas complejas | Limitada por el modelo | Amplificada por el flujo |
| Tolerancia a errores | Baja: se ven en la salida | Baja: se amplifican entre pasos |
Sabes distinguir un flujo agéntico de uno que no lo es, situarlo en la escala de autonomía y justificar cuándo no merece la pena.
1. ¿Qué convierte un flujo con LLM en agéntico?
El criterio es estructural: cuántos pasos hay y cuántas decisiones toma el modelo dentro de ellos. El tamaño del modelo es independiente.
2. ¿Qué caracteriza al extremo «poco autónomo» de la escala?
Poca autonomía significa flujo determinista con el LLM como generador de texto. Es la variante más fácil de auditar y la que mejor funciona en tareas repetitivas.
3. ¿Por qué un flujo agéntico puede superar a un modelo más potente en modo one-shot?
No hay entrenamiento oculto. Lo que cambia es la estructura: dividir, consultar fuentes externas y revisar son tres fuentes de mejora que no dependen del tamaño del modelo.
Ejercicio 1
Una versión agéntica de una tarea hace 6 llamadas al LLM (2 s cada una), 2 búsquedas web (1 s cada una) y 1 consulta a base de datos (0,3 s). La versión no agéntica hace una sola llamada al LLM. Calcula la latencia total de las dos versiones y el factor de penalización de la agéntica.
La latencia total es la suma de los tiempos de cada componente, suponiendo que los pasos se ejecutan en serie.
La penalización es de más de siete veces. Si la tarea se puede resolver con una sola llamada, ese factor no se justifica por sí solo: el flujo agéntico tiene que aportar calidad que la versión no agéntica no puede alcanzar.
Ejercicio 2
Tienes que clasificar 10 000 correos al día en tres categorías fijas (soporte, facturación, comercial). No hay subcategorías, no hace falta consultar sistemas externos y cada correo pesa menos de 2 000 tokens. ¿Empezarías por un flujo no agéntico, semiautónomo o muy autónomo? Justifica la decisión y describe cómo medirías si el sistema funciona.