Agentes AI en Producción: Más Allá del Demo · Daniel Tinizaray

Agentes AI en Producción: Más Allá del Demo · Daniel Tinizaray

Todos hemos visto el demo: un agente AI que investiga, escribe código, ejecuta herramientas y responde preguntas complejas. Parece magia. Y lo es — hasta que intentas correrlo en producción con usuarios reales, datos sensibles y un SLA que cumplir.

El salto de demo a producción en agentes AI no es trivial. No se trata solo de mejorar el prompt — es un problema de ingeniería de sistemas distribuidos con nuevas dimensiones de complejidad.

En los últimos meses he trabajado llevando arquitecturas agenticas a producción. Esto es lo que funciona (y lo que no).

El Problema Fundamental: Los LLM No Son Deterministas

Un agente AI no es un microservicio tradicional. Una API REST devuelve la misma respuesta para el mismo input (o debería). Un agente con LLM puede devolver resultados diferentes cada vez — y peor, puede desviarse completamente del plan original.

🔴 Realidad de producción En una arquitectura agentica con 3+ herramientas y 2 saltos de razonamiento, la tasa de derailment (desviación del objetivo) puede alcanzar 15-30% en prompts no supervisados. Las técnicas de prompting estándar no escalan.

La solución no es "mejor prompting". Es ingeniería de confiabilidad: circuit breakers, validación de salidas, reintentos con estrategia, y —lo más importante— acoplamiento flexible entre el agente y las herramientas que ejecuta.

Arquitectura: Del Monolito Agentico al Supervisor Distribuido

El error más común en 2025-2026 fue construir el "agente monolito": un solo loop de razonamiento-acción con acceso a todas las herramientas. Esto funciona en demos, pero en producción colapsa por:

  • Acoplamiento: Una herramienta que falla arrastra todo el agente.
  • Contexto gigante: El historial de decisiones pasadas infla el contexto exponencialmente.
  • Depuración imposible: No sabes si el error fue del LLM, de la herramienta, o del plan original.

La alternativa que está ganando tracción: arquitectura de supervisión con agentes especializados.

# Arquitectura Supervisor + Especialistas
#
# ┌─────────────────────────────────┐
# │        Supervisor Agent         │ ← orquesta, no ejecuta
# │  (planifica + delega + valida)  │
# └──────┬──────┬──────┬────────────┘
#         │      │      │
#    ┌────┘ ┌────┘ ┌────┘
#    ▼      ▼      ▼
# ┌────┐ ┌────┐ ┌────┐
# │Inv │ │Code│ │ QA │  ← agentes especialistas
# │est.│ │Gen │ │    │     con scope reducido
# └────┘ └────┘ └────┘
#    │      │      │
#    ▼      ▼      ▼
#  Tools  Tools  Tools  ← herramientas acotadas

Cada agente especialista tiene un scope definido (una responsabilidad, un conjunto de herramientas) y el supervisor decide qué delegar, valida resultados, y maneja excepciones. Esto reduce drásticamente la tasa de derailment y hace el sistema debugeable.

Manejo de Errores: Circuit Breakers para LLM

En sistemas tradicionales, un circuit breaker abre cuando una dependencia falla repetidamente. En sistemas agenticos, necesitas algo similar pero adaptado:

  • Timeouts por paso: Un agente no debe divagar 5 minutos. Timeout por paso de razonamiento (ej: 30s) + timeout total (ej: 5min).
  • Contador de reintentos con backoff: Si una tool falla, reintentar con backoff exponencial. Si falla 3 veces, escalar al supervisor.
  • Validation gate: Cada salida del LLM pasa por un validador (schema check, regex, rango de valores). Si no pasa, se rechaza y se pide regenerar.
  • Dead letter queue: Request que no pudieron completarse después de N reintentos van a una DLQ para revisión manual o reprocesamiento.
📊 Dato de campo Sistema agentico con validation gate + circuit breakers: tasa de completitud exitosa del 94% vs. 68% sin controles. Fuente: implementación propia en producción, Q1 2026.

Observabilidad: El Talón de Aquiles

Debuggear un agente AI es como debuggear código que cambia solo. Necesitas una estrategia de observabilidad en tres capas:

Capa 1 — Trazas de decisión

Cada "paso de pensamiento" del agente debe loguearse: qué razonamiento hizo, qué tool eligió, qué resultado obtuvo. LangFuse y LangSmith son las herramientas más maduras hoy, aunque el espacio está evolucionando rápido.

Capa 2 — Costo por ejecución

Cada ejecución agentica consume tokens de múltiples llamadas LLM. Sin tracking, es imposible saber cuánto cuesta cada tarea. Implementa tagging por sesión, usuario y tarea desde el día 1.

Capa 3 — Evaluaciones offline

No puedes monitorear calidad en producción sin un ground truth. Mantén un dataset de evaluación con pares (input → output esperado). Cada deploy de un nuevo prompt o modelo debe pasar por esta evaluación antes de llegar a producción.

# Pipeline de evaluación offline
# 1. Ejecutar N casos de prueba contra el agente
# 2. Comparar outputs vs. ground truth
# 3. Métricas: exactitud, tasa de derailment, costo promedio
# 4. Si métricas empeoran → bloquear deploy

Seguridad: El Riesgo Silencioso

Un agente con acceso a herramientas (base de datos, APIs, sistema de archivos) es un vector de ataque enorme si no se protege correctamente:

  • Tool permissions mínimas: Cada tool debe tener el menor privilegio posible. Un agente de soporte no necesita DELETE en la DB.
  • Rate limiting por usuario: Un usuario malicioso puede hacer miles de llamadas para extraer información o agotar tu presupuesto de AI.
  • Sanitización de inputs: Prompt injection sigue siendo el vector #1. Filtra caracteres sospechosos y limita longitud de inputs.
  • Human-in-the-loop: Acciones destructivas (ejecutar código, modificar datos) deben requerir confirmación humana.

Costos: El Modelo de Negocio Importa

Un agente autónomo puede consumir fácilmente 10-50K tokens por tarea completa (múltiples llamadas LLM + razonamiento + tool calls). A escala, esto se vuelve el componente de costo dominante.

Estrategias para mantener costos bajo control:

  • Máximo de pasos: Limitar el número de iteraciones agente-herramienta (ej: max 5 pasos antes de responder o escalar).
  • Modelo progresivo: El supervisor usa un modelo mediano (Claude Sonnet, GPT-4o-mini). Solo tareas que requieren razonamiento profundo escalan al modelo grande.
  • Caché de razonamiento: Si dos usuarios preguntan lo mismo, el plan de acción puede reutilizarse aunque la ejecución varíe.
  • Presupuesto por sesión: Definir un budget máximo de tokens por sesión de usuario. Si se excede, escalar a humano.

TL;DR — Lo Que Funciona Hoy

  1. No construyas un agente monolito. Supervisor + especialistas con scope acotado.
  2. Circuit breakers y validation gates no son opcionales. Reducen derailment de ~30% a ~6%.
  3. Observabilidad desde el día 1. Trazas de decisión, costos por ejecución, evaluaciones offline.
  4. Seguridad por diseño: Mínimo privilegio en tools, rate limiting, human-in-the-loop para acciones destructivas.
  5. Costos controlados: Modelo progresivo, límite de pasos, caché de razonamiento, presupuesto por sesión.

Los agentes AI no son el futuro — son el presente. Pero la diferencia entre un demo impresionante y un sistema productivo confiable está en la ingeniería que no se ve. ¿Estás listo para esa conversación?


¿Te gustó este artículo?

Si estás lidiando con estos desafíos en tu empresa, hablemos. Sin compromiso. 30 minutos para entender tu situación.

Agenda una llamada gratuita →