Tu equipo acaba de deployar el primer feature con AI generativa en producción. El producto funciona. Los usuarios lo aman. Y luego llega la factura de OpenAI/GCP/AWS del mes.
Bienvenido al problema #1 de infraestructura en 2026: los costos de inferencia AI se comen tu presupuesto cloud.
Según la FinOps Foundation 2026, el 98% de los equipos de ingeniería ya gestionan costos de AI — frente al 31% en 2024. No es casualidad: el gasto global en infraestructura AI alcanzará los $600,000 millones este año, y la inferencia representa la porción de más rápido crecimiento.
Si ya implementaste FinOps clásico (tagging, reservadas, right-sizing), este artículo es tu siguiente nivel: FinOps para AI. Porque optimizar instancias EC2 no te prepara para una factura de $50K en tokens de LLM.
Por qué la inferencia AI es diferente
A diferencia de una base de datos o un servidor web, los costos de inferencia son variables, no-lineales y difíciles de auditar. No pagas por hora de cómputo — pagas por token, por llamada API, o por segundo de GPU. Y la relación entre uso y costo no siempre es obvia.
Hay tres capas de costo en cualquier sistema AI productivo:
- Capa 1 — Proveedor API: OpenAI, Anthropic, Google, Mistral. Costo por token (input + output). Es la más visible pero no siempre la más cara.
- Capa 2 — Infraestructura Self-hosted: GPUs, instancias inferencia, cola de requests, almacenamiento de vectores. Costo fijo + variable. La que más optimizaciones permite.
- Capa 3 — Costos ocultos: Embeddings, re-embeddings, caché de vectores mal dimensionada, logging de prompts (sí, almacenar cada request AI cuesta), rate limiting mal configurado, fallback costs.
Estrategia 1: Caching Semántico en Capas
La estrategia más infravalorada (y más efectiva) para reducir costos de inferencia es no llamar al LLM si no es necesario. Un cache semántico bien implementado puede reducir las llamadas a tu API de AI en un 40-60%.
A diferencia del caching HTTP tradicional (URL + params exactos), el caching semántico usa embeddings y similitud coseno: si un usuario pregunta "¿cuál es el precio del plan premium?" y otro pregunta "¿cuánto cuesta premium?", el cache responde sin llamar al LLM.
# Arquitectura de caché semántico
# 1. Generar embedding de la query entrante
# 2. Buscar en vector DB por similitud > threshold (ej: 0.92)
# 3. Si hay match → devolver respuesta cachead
# 4. Si no hay match → llamar al LLM → cachear respuesta + embedding Implementaciones ligeras: Redis Stack con módulo de búsqueda de vectores, o Cloudflare Workers AI + KV para caché distribuido sin servidor dedicado.
Caché de dos niveles
Para producción, implementa dos niveles:
- Nivel 1 — Caché exacto: Redis o Cloudflare KV. Requests idénticas (hash del prompt). TTL corto (minutos). Hit rate ~15-20%.
- Nivel 2 — Caché semántico: Vector DB (Pinecone, PGVector, Cloudflare Vectorize). Threshold configurable por caso de uso. Hit rate adicional 30-40%.
Estrategia 2: Routing Inteligente de Modelos
No todas las queries merecen GPT-4 o Claude Opus. Un AI gateway o router de modelos clasifica cada request entrante y lo dirige al modelo más barato que pueda resolverlo adecuadamente.
# Reglas de routing típicas
# - Consultas simples ("¿qué día es hoy?") → modelo pequeño (~$0.15/1M tokens)
# - Análisis de sentimiento → modelo mediano (~$0.50/1M tokens)
# - Generación de código complejo → modelo grande (~$15/1M tokens)
# - RAG con contexto largo → modelo mediano + ventana extendida Herramientas: OpenRouter, Portkey, LiteLLM con fallbacks automáticos. Un router bien configurado típicamente envía 40-50% de requests a modelos económicos sin degradar la experiencia del usuario.
Estrategia 3: Right-Sizing de Modelos Self-hosted
Si corres modelos open-source (Llama, Mistral, Qwen) en tu infraestructura, el error más común es sobredimensionar. Una instancia GPU A100 de $32,000/año puede ser innecesaria si tu carga es intermitente.
- Cuantización: Un modelo cuantizado a 4-bit ocupa ~75% menos VRAM con pérdida mínima de precisión. Ejemplo: Llama 3 70B de 140GB → 35GB con cuantización 4-bit.
- Serverless inference: Cloudflare Workers AI, AWS Bedrock Serverless, GCP Vertex AI — pagas solo por uso, no por GPU ociosa.
- Batch vs. Real-time: Separar workloads batch (procesamiento nocturno) de los interactivos permite usar spot instances para inferencia batch con 70-90% descuento.
Estrategia 4: Monitoreo de Costos por Feature
El equivalente al tagging en FinOps clásico es el tracking de costos por feature AI. Cada prompt, cada embedding, cada llamada a API debe estar etiquetada con:
Tags obligatorios en toda llamada AI:
- feature: [chat-support, content-gen, moderation, search-rag]
- model: [gpt-4o, claude-3-opus, llama-3-70b]
- user-tier: [free, pro, enterprise]
- environment: [production, staging, ab-test]
- latency-budget: [fast, normal, batch] Con estos tags puedes responder preguntas como:
- "¿Cuánto cuesta el feature de chat por usuario free vs. pro?"
- "¿Cuál es el ROI del modelo grande vs. el mediano en moderación de contenido?"
- "¿Qué features están consumiendo el 80% del budget de AI?"
Estrategia 5: Gestión de Contexto y Ventanas
El costo de los LLM escala con el número de tokens de entrada. En aplicaciones RAG, el contexto puede inflarse fácilmente: documento + historial + instrucciones del sistema pueden sumar 20K+ tokens por request.
- Chunking inteligente: No envías el documento completo al LLM. Solo los chunks relevantes (top-k). Validar que k no esté sobredimensionado.
- Sumarización de historial: En lugar de enviar 50 mensajes de historial, envía un resumen del historial anterior + los últimos 5 mensajes.
- System prompts comprimidos: Un system prompt de 2,000 tokens cuesta $0.03/request en GPT-4o. En 100K requests/día son $3,000/día solo en system prompt.
TL;DR — Implementa esta semana
- Mide: Implementa tags de feature + modelo en todas las llamadas AI. Sin datos no hay optimización.
- Cachea: Caché semántico con threshold >0.90. 40-60% reducción de llamadas.
- Rutea: Dirige 40-50% de requests a modelos económicos sin perder calidad.
- Comprime: Reduce system prompts e historial. Cada token cuenta.
- Audita: Revisa semanalmente costos por feature. Lo que no se mide no se optimiza.
¿Tu factura de AI crece más rápido que tu revenue? Agenda una llamada y auditamos tu pipeline de inferencia en 30 minutos. Sin costo, sin buzzwords, sin compromiso.