Módulo 02

Del prompt único al flujo agéntico

¿Por qué importa? Una sola llamada a un LLM tiene un techo duro: no puede buscar lo que no sabe, no puede comprobar lo que ha escrito y no puede corregirse. La diferencia entre un chatbot que decepciona y un sistema que resuelve tareas complejas casi nunca es el modelo; es la estructura del proceso que lo rodea. Antes de escribir código conviene saber qué convierte a un flujo en agéntico, cuánta autonomía tiene y cuándo no merece la pena.

Intuición

Un flujo agéntico es un proceso en el que una aplicación basada en LLM ejecuta varios pasos para completar una tarea. La diferencia con un prompt único (zero-shot) no está en el modelo ni en el tamaño del contexto: está en que el modelo participa en varias decisiones encadenadas en vez de en una sola.

La forma más sencilla de verlo es pedir un ensayo. En modo no agéntico se pide «escribe un ensayo sobre el tema X de principio a fin». El modelo genera una respuesta en una sola pasada. En modo agéntico se pide «escribe un esquema», después «¿necesitas buscar en la web?», después «escribe un primer borrador», después «¿qué partes habría que revisar?» y por último «reescribe esas partes». El mismo modelo, la misma temperatura, incluso el mismo prompt base; el resultado no es comparable.

Cada paso del flujo puede ir acompañado de una herramienta: una búsqueda web, una consulta a base de datos, un intérprete de código. La herramienta no la ejecuta el LLM por sí solo; el flujo la invoca, le pasa la petición del modelo y devuelve el resultado al contexto. Los tres patrones que aparecen una y otra vez son reflexión (el modelo revisa su propia salida), uso de herramientas (delegar en código lo que el modelo no debe calcular) y planificación (descomponer la tarea antes de resolverla). A partir de ahí, encadenar varios pasos da lugar a sistemas multiagente donde cada rol lo desempeña una instancia distinta del modelo.

No agéntico (una sola pasada) pregunta LLM respuesta sin herramientas, sin ciclos, sin decisiones Agéntico (razona, usa herramientas, itera) LLM herramienta LLM respuesta final iterar si faltan datos
Un flujo agéntico encadena llamadas al modelo, herramientas y comprobaciones intermedias antes de entregar la respuesta.

Ejemplo

Retomemos el ensayo sobre «agujeros negros». En modo no agéntico, una única llamada devuelve algo superficial: hechos obvios, poca profundidad. En modo agéntico se construye un flujo de cinco pasos: (1) escribir un esquema; (2) buscar en la web las fuentes que mejor cubran cada apartado; (3) redactar un primer borrador; (4) identificar qué partes son débiles o están sin respaldar; (5) reescribir esas partes. El ensayo resultante ya no es una variante del prompt; es un artefacto que ha pasado por investigación y crítica.

El mismo esqueleto resuelve tareas empresariales. Procesar una factura PDF es un flujo de tres pasos (extraer los cuatro campos obligatorios, consultar la base de datos, registrar la entrada). Responder a un correo de cliente quejándose de un pedido equivocado es un flujo de tres pasos con dos herramientas (buscar el pedido, redactar la respuesta, pedir revisión humana antes de enviar). En ambos casos, lo que distingue al flujo agéntico del simple prompt es que el modelo decide y ejecuta pasos, no solo genera texto.

Un flujo agéntico no es gratis. Cada paso añade latencia, coste por token y, sobre todo, puntos de fallo. Si un paso intermedio produce una salida mala, los siguientes trabajan sobre esa salida y el error se amplifica. En tareas simples —clasificar correos en tres categorías fijas, extraer un campo de un formulario— un flujo no agéntico suele ser más barato, más rápido y más fiable que cualquier variante agéntica.

Error común

Llamar «agente» a cualquier aplicación que tenga un bucle. Un flujo es agéntico cuando el modelo participa en las decisiones sobre qué hacer a continuación; no lo es cuando las decisiones están codificadas de antemano y el LLM solo rellena texto. La diferencia importa porque determina cuánta autonomía tiene el sistema, cuánta superficie de error introduce y cuánta supervisión necesita. La escala razonable va de poco autónomo (todos los pasos y herramientas fijados en código; la única libertad del modelo es redactar) a semiautónomo (el modelo elige qué herramienta usar de entre un conjunto predefinido) a muy autónomo (el modelo decide el plan completo y puede incluso crear herramientas nuevas sobre la marcha). Más autonomía no es más calidad: es más flexibilidad a cambio de más coste, más variabilidad y más difícil de auditar.

No agéntico (zero-shot) Agéntico (multipaso)
Llamadas al modelo Una Varias encadenadas
Decisiones del modelo La respuesta El plan y las herramientas
Uso de herramientas No Sí (búsqueda, BD, código)
Latencia y coste Bajos y predecibles Altos y variables
Calidad en tareas complejas Limitada por el modelo Amplificada por el flujo
Tolerancia a errores Baja: se ven en la salida Baja: se amplifican entre pasos
What's next for AI agentic workflowsAndrew Ng · Sequoia Ascent 2024abrir búsqueda

Sabes distinguir un flujo agéntico de uno que no lo es, situarlo en la escala de autonomía y justificar cuándo no merece la pena.

Comprueba lo aprendido

1. ¿Qué convierte un flujo con LLM en agéntico?

2. ¿Qué caracteriza al extremo «poco autónomo» de la escala?

3. ¿Por qué un flujo agéntico puede superar a un modelo más potente en modo one-shot?

Ejercicio 1

Una versión agéntica de una tarea hace 6 llamadas al LLM (2 s cada una), 2 búsquedas web (1 s cada una) y 1 consulta a base de datos (0,3 s). La versión no agéntica hace una sola llamada al LLM. Calcula la latencia total de las dos versiones y el factor de penalización de la agéntica.

Solución

La latencia total es la suma de los tiempos de cada componente, suponiendo que los pasos se ejecutan en serie.

L no ag. = 2  s L ag. = 6 ⋅ 2 + 2 ⋅ 1 + 0,3 = 12 + 2 + 0,3 = 14,3  s penalización = 14,3 2 = 7,15 × \begin{aligned} L_{\text{no ag.}} &= 2 \ \text{s} \\ L_{\text{ag.}} &= 6 \cdot 2 + 2 \cdot 1 + 0{,}3 \\ &= 12 + 2 + 0{,}3 \\ &= 14{,}3 \ \text{s} \\ \text{penalización} &= \frac{14{,}3}{2} = 7{,}15\times \end{aligned}

La penalización es de más de siete veces. Si la tarea se puede resolver con una sola llamada, ese factor no se justifica por sí solo: el flujo agéntico tiene que aportar calidad que la versión no agéntica no puede alcanzar.

Ejercicio 2

Tienes que clasificar 10 000 correos al día en tres categorías fijas (soporte, facturación, comercial). No hay subcategorías, no hace falta consultar sistemas externos y cada correo pesa menos de 2 000 tokens. ¿Empezarías por un flujo no agéntico, semiautónomo o muy autónomo? Justifica la decisión y describe cómo medirías si el sistema funciona.

Solución
Con categorías fijas, sin dependencias externas y a ese volumen, el punto de partida correcto es no agéntico: una sola llamada por correo que devuelva la etiqueta. La razón es económica y operativa: a 10 000 correos al día, cada paso añadido multiplica el coste y la latencia media, y un flujo semiautónomo o muy autónomo introduce variabilidad que no aporta ningún valor cuando las decisiones posibles ya están enumeradas.

La decisión cambia en dos escenarios concretos. Primero, si aparece la necesidad de consultar el histórico del cliente o su pedido: entonces conviene un flujo semiautónomo de dos pasos donde el modelo pueda invocar una consulta a base de datos. Segundo, si aparecen correos ambiguos que requieren varios criterios combinados: conviene una reflexión mínima, es decir, una segunda llamada que revise la etiqueta propuesta.

Para medir: separar unas 500 etiquetas manuales como referencia, calcular la matriz de confusión entre las tres categorías y vigilar dos números. Uno, la exactitud global. Dos, el coste por correo en tokens. Si la exactitud objetivo no se alcanza con una sola llamada, se prueba a añadir un paso (reflexión o consulta) y se comprueba si la mejora justifica el coste añadido. Este ciclo —empezar simple, medir, complejizar solo si hace falta— es la disciplina central de los flujos agénticos.