Saltar al contenido
YYefrixLab

Caso de estudio · IA y automatización

Smart AI Gateway: una API, seis proveedores

Gateway LLM compatible con OpenAI, con failover automático entre seis proveedores, modelos por niveles según la ruta y observabilidad completa.

Sector
Infraestructura para desarrolladores
Duración
3 semanas
Año
2026
Servicios
Integración de IA, DevOps, Observabilidad

El problema

Cada app de una flota en crecimiento quería llamadas LLM: categorización, resúmenes, chat, scoring. Cablear cada app a un proveedor concreto significaba seis API keys repartidas por archivos env, ningún manejo compartido de rate limits, cero visibilidad de costos, y una caída total de la app cada vez que un proveedor limitaba el tráfico o se caía. Multiplica eso por cada proyecto nuevo y obtienes deuda de integración que se acumula cada mes.

Qué construimos

Un gateway self-hosted compatible con OpenAI que se sienta entre todas las aplicaciones y todos los proveedores. Las apps hablan la API estándar de chat completions contra un único endpoint interno. El gateway se encarga del resto:

  • Failover entre proveedores. Las peticiones caen en cascada por una cadena priorizada de proveedores (Groq, OpenRouter, Cerebras, Gemini, Cohere, Cloudflare). Un proveedor limitado o caído se salta automáticamente; quien llama nunca lo nota.
  • Modelos por niveles. Las rutas mapean nombres lógicos de modelo a modelos concretos de cada proveedor: una app pide “fast” o “smart” y el gateway elige la mejor variante disponible. Cambiar de proveedor es un cambio de config, no de código.
  • Gestión de keys en un solo lugar. Las keys de los proveedores viven en un único archivo env en un solo host, no esparcidas por cada repo consumidor.
  • Observabilidad. Prometheus recolecta latencia, tasas de error y conteo de tokens por proveedor; los dashboards de Grafana muestran exactamente qué proveedor sirvió qué y cuándo se disparó una cadena de fallback.

Arquitectura

nginx al frente, núcleo de enrutamiento en Python, deployment con Docker compose. Las apps consumidoras se unen a la red del gateway y llaman a un hostname interno, así que el tráfico LLM nunca sale de la red del host. Internet solo ve llamadas salientes hacia los proveedores.

Resultado

Seis proveedores, un endpoint, costo de inferencia casi nulo aprovechando free tiers con degradación controlada. Desde el lanzamiento, varios proveedores han tenido caídas y reseteos de cuota; ninguna aplicación downstream notó ninguna. Cada proyecto nuevo obtiene plomería LLM de nivel producción añadiendo dos líneas a su archivo compose.

¿Tienes un proyecto que "ya debería estar en producción"?

Cuéntame qué estás construyendo, qué lo está frenando y cuándo lo necesitas funcionando. En 24 horas tendrás una respuesta honesta sobre alcance, precio y plazos. Sin teatro de discovery calls.