Case Study · AI & Automatisierung
Smart AI Gateway: eine API, sechs Provider
OpenAI-kompatibles LLM-Gateway mit automatischem Failover über sechs Provider, Modell-Tiering pro Route und voller Observability.
- Branche
- Developer-Infrastruktur
- Zeitraum
- 3 Wochen
- Jahr
- 2026
- Leistungen
- KI-Integration, DevOps, Observability
Das Problem
Jede App einer wachsenden Flotte wollte LLM-Calls: Kategorisierung, Zusammenfassung, Chat, Scoring. Jede App direkt an einen bestimmten Provider zu verdrahten hieß: sechs API-Keys verstreut über Env-Files, kein gemeinsames Rate-Limit-Handling, keine Kostensicht, und ein kompletter App-Ausfall, sobald ein Provider drosselte oder wegbrach. Multipliziert mit jedem neuen Projekt entsteht Integrationsschuld, die monatlich Zinsen kassiert.
Was wir gebaut haben
Ein self-hosted, OpenAI-kompatibles Gateway zwischen allen Anwendungen und allen Providern. Apps sprechen die Standard-Chat-Completions-API gegen einen internen Endpunkt. Den Rest übernimmt das Gateway:
- Provider-Failover. Requests kaskadieren durch eine priorisierte Provider-Kette (Groq, OpenRouter, Cerebras, Gemini, Cohere, Cloudflare). Ein gedrosselter oder ausgefallener Provider wird automatisch übersprungen, der Aufrufer merkt nichts davon.
- Modell-Tiering. Routen mappen logische Modellnamen auf konkrete Provider-Modelle: Eine App fragt nach “fast” oder “smart”, das Gateway wählt die beste verfügbare Variante. Ein Provider-Wechsel ist eine Config-Änderung, keine Code-Änderung.
- Key-Management an einem Ort. Provider-Keys liegen in einem einzigen Env-File auf einem Host, nicht verstreut über jedes Consumer-Repo.
- Observability. Prometheus erfasst Latenz, Fehlerraten und Token-Zähler pro Provider; Grafana-Dashboards zeigen exakt, welcher Provider was bedient hat und wann eine Fallback-Kette gegriffen hat.
Architektur
nginx vorne, Python-Routing-Core, Deployment per Docker Compose. Consumer-Apps treten dem Gateway-Netzwerk bei und rufen einen internen Hostnamen auf: LLM-Traffic verlässt das Host-Netzwerk nie. Das öffentliche Internet sieht ausschließlich ausgehende Calls zu den Providern.
Ergebnis
Sechs Provider, ein Endpunkt, Inferenzkosten nahe null durch Free Tiers mit sauberer Degradation. Seit dem Launch gab es bei einzelnen Providern Ausfälle und Quota-Resets; keine nachgelagerte Anwendung hat davon irgendetwas bemerkt. Jedes neue Projekt bekommt produktionsreifes LLM-Plumbing durch zwei Zeilen in seinem Compose-File.