Przejdź do treści
YYefrixLab

Case study · AI i automatyzacja

Smart AI Gateway: jedno API, sześciu providerów

Zgodny z OpenAI gateway LLM z automatycznym failoverem między sześcioma providerami, tieringiem modeli per route i pełną obserwowalnością.

Branża
Infrastruktura deweloperska
Czas realizacji
3 tygodnie
Rok
2026
Usługi
Integracja AI, DevOps, Observability

Problem

Każda aplikacja w rosnącej flocie chciała wywołań LLM: kategoryzacja, streszczenia, czat, scoring. Wpinanie każdej apki na sztywno w konkretnego providera oznaczało sześć kluczy API rozsianych po plikach env, brak wspólnej obsługi rate limitów, zero widoczności kosztów i pełną awarię aplikacji za każdym razem, gdy provider dławił ruch albo padał. Pomnóż to przez każdy nowy projekt i dostajesz dług integracyjny, który kumuluje się co miesiąc.

Co zbudowaliśmy

Self-hosted gateway zgodny z API OpenAI, który staje pomiędzy wszystkimi aplikacjami a wszystkimi providerami. Aplikacje mówią standardowym API chat completions do jednego wewnętrznego endpointu. Resztą zajmuje się gateway:

  • Failover providerów. Żądania kaskadowo schodzą po spriorytetyzowanym łańcuchu providerów (Groq, OpenRouter, Cerebras, Gemini, Cohere, Cloudflare). Zdławiony albo padnięty provider jest pomijany automatycznie, a wołający niczego nie zauważa.
  • Tiering modeli. Route’y mapują logiczne nazwy modeli na konkretne modele providerów, więc aplikacja prosi o “fast” albo “smart”, a gateway wybiera najlepszy dostępny wariant. Zmiana providera to zmiana konfiguracji, nie kodu.
  • Klucze w jednym miejscu. Klucze providerów żyją w jednym pliku env na jednym hoście, a nie porozrzucane po repo każdego konsumenta.
  • Obserwowalność. Prometheus zbiera latencję, error rate i liczbę tokenów per provider; dashboardy w Grafanie pokazują dokładnie, który provider co obsłużył i kiedy odpalił się łańcuch fallbacków.

Architektura

nginx z przodu, rdzeń routingu w Pythonie, deployment przez Docker Compose. Aplikacje-konsumenci dołączają do sieci gatewaya i wołają wewnętrzny hostname, więc ruch LLM nigdy nie opuszcza sieci hosta. Publiczny internet widzi wyłącznie wychodzące wywołania do providerów.

Efekt

Sześciu providerów, jeden endpoint, koszt inferencji bliski zera dzięki jeździe na darmowych tierach z łagodną degradacją. Od startu poszczególni providerzy zaliczali awarie i resety limitów; żadna aplikacja niżej w stacku tego nie odczuła. Każdy nowy projekt dostaje produkcyjną instalację LLM, dopisując dwie linijki do swojego pliku compose.

Masz projekt, który „po prostu musi wyjść”?

Napisz, co budujesz, co cię blokuje i kiedy ma działać na produkcji. W 24 godziny dostaniesz uczciwą odpowiedź: zakres, koszt, termin. Bez teatru discovery calli.