Zum Inhalt springen
YYefrixLab

Case Study · AI & Automatisierung

Smart AI Gateway: eine API, sechs Provider

OpenAI-kompatibles LLM-Gateway mit automatischem Failover über sechs Provider, Modell-Tiering pro Route und voller Observability.

Branche
Developer-Infrastruktur
Zeitraum
3 Wochen
Jahr
2026
Leistungen
KI-Integration, DevOps, Observability

Das Problem

Jede App einer wachsenden Flotte wollte LLM-Calls: Kategorisierung, Zusammenfassung, Chat, Scoring. Jede App direkt an einen bestimmten Provider zu verdrahten hieß: sechs API-Keys verstreut über Env-Files, kein gemeinsames Rate-Limit-Handling, keine Kostensicht, und ein kompletter App-Ausfall, sobald ein Provider drosselte oder wegbrach. Multipliziert mit jedem neuen Projekt entsteht Integrationsschuld, die monatlich Zinsen kassiert.

Was wir gebaut haben

Ein self-hosted, OpenAI-kompatibles Gateway zwischen allen Anwendungen und allen Providern. Apps sprechen die Standard-Chat-Completions-API gegen einen internen Endpunkt. Den Rest übernimmt das Gateway:

  • Provider-Failover. Requests kaskadieren durch eine priorisierte Provider-Kette (Groq, OpenRouter, Cerebras, Gemini, Cohere, Cloudflare). Ein gedrosselter oder ausgefallener Provider wird automatisch übersprungen, der Aufrufer merkt nichts davon.
  • Modell-Tiering. Routen mappen logische Modellnamen auf konkrete Provider-Modelle: Eine App fragt nach “fast” oder “smart”, das Gateway wählt die beste verfügbare Variante. Ein Provider-Wechsel ist eine Config-Änderung, keine Code-Änderung.
  • Key-Management an einem Ort. Provider-Keys liegen in einem einzigen Env-File auf einem Host, nicht verstreut über jedes Consumer-Repo.
  • Observability. Prometheus erfasst Latenz, Fehlerraten und Token-Zähler pro Provider; Grafana-Dashboards zeigen exakt, welcher Provider was bedient hat und wann eine Fallback-Kette gegriffen hat.

Architektur

nginx vorne, Python-Routing-Core, Deployment per Docker Compose. Consumer-Apps treten dem Gateway-Netzwerk bei und rufen einen internen Hostnamen auf: LLM-Traffic verlässt das Host-Netzwerk nie. Das öffentliche Internet sieht ausschließlich ausgehende Calls zu den Providern.

Ergebnis

Sechs Provider, ein Endpunkt, Inferenzkosten nahe null durch Free Tiers mit sauberer Degradation. Seit dem Launch gab es bei einzelnen Providern Ausfälle und Quota-Resets; keine nachgelagerte Anwendung hat davon irgendetwas bemerkt. Jedes neue Projekt bekommt produktionsreifes LLM-Plumbing durch zwei Zeilen in seinem Compose-File.

Ein Projekt, das „einfach nur live gehen muss“?

Sagen Sie uns, was Sie bauen, was es blockiert und wann es live sein muss. Innerhalb von 24 Stunden bekommen Sie eine ehrliche Antwort zu Scope, Kosten und Zeitplan. Ohne Discovery-Call-Theater.