APIMart
APIMart

Multi-Modell-KI-Apps bauen: Routing & Fallbacks

Praxisnahes Tutorial für Multi-Model-KI-Apps: ein OpenAI-kompatibler Client, OpenRouter-Modell-Routing, automatische Fallbacks, Preislimits und Kostentracking.

Tutorial

Eine produktive KI-App sollte einen Modellausfall überstehen, ohne dass jemand nachts geweckt wird. Das Muster, das dich dorthin bringt, ist unspektakulär und zuverlässig: ein OpenAI-kompatibler Client, eine priorisierte Modellliste, Routing-Regeln, die günstige, aber gesunde Provider bevorzugen, und harte Preislimits.

Was du in diesem Tutorial baust:

  • Einen einzigen Client, der GPT, Claude, Gemini, DeepSeek und andere aufrufen kann — durch Ändern eines einzigen Strings

  • Automatische Fallbacks — wenn das primäre Modell fehlschlägt oder in einen Timeout läuft, wird die Anfrage mit dem nächsten Modell deiner Liste wiederholt

  • Kostenkontrolle — Cheapest-First-Routing und max_price-Limits, damit eine Trafficspitze dein Budget nicht verbrennen kann

  • Ausgabentransparenz — Kostenerfassung pro Anfrage, die du loggen und für Alerts nutzen kannst

Alles Folgende nutzt OpenRouter als Routing-Schicht; dieselbe Architektur funktioniert mit jedem OpenAI-kompatiblen Gateway, einschließlich APIMart, wenn du Bild-, Video- oder Audiomodelle in derselben App brauchst.

APIMart
Der Request-Pfad: erst der Router, dann die Fallback-Kette, Preislimits immer aktiv

Warum Multi-Model besser ist als Single-Model

Ausfälle sind eine Frage des Wann, nicht des Ob

Jeder große Provider hat sichtbare Incidents. Wenn deine App einen einzigen Anbieter hartkodiert, ist jeder dieser Vorfälle dein Vorfall. Eine Fallback-Kette verwandelt „Provider down“ in einen kurzen Latenz-Blip.

Modelle haben unterschiedliche Stärken

Günstige, schnelle Modelle übernehmen Klassifikation und Extraktion; Frontier-Modelle übernehmen reasoning-lastige Generierung. Wer Tiers pro Aufgabe mischt, halbiert seine Inferenzrechnung regelmäßig — oder spart noch mehr.

Preise ändern sich monatlich

Modellpreise fallen ständig. Wenn der Modellwechsel eine Ein-Zeilen-Änderung ist, kannst du jedes Quartal dem besten Preis-Leistungs-Verhältnis folgen — ganz ohne Migrationsprojekt.

Schritt 1: ein Client, viele Modelle

Richte das offizielle OpenAI SDK auf das Gateway — kein eigener HTTP-Code nötig:

from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="sk-or-..."
)

resp = client.chat.completions.create(
    model="anthropic/claude-sonnet-4.5",
    messages=[{"role": "user", "content": "Summarize this contract clause..."}],
)
print(resp.choices[0].message.content)

Der Wechsel zu deepseek/deepseek-chat oder google/gemini-2.5-pro ist nur ein anderer model-String. Halte Modellnamen in der Config, nicht im Code.

TypeScript-Version

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://openrouter.ai/api/v1",
  apiKey: process.env.OPENROUTER_API_KEY,
});

const resp = await client.chat.completions.create({
  model: "deepseek/deepseek-chat",
  messages: [{ role: "user", content: "Classify this ticket: ..." }],
});

Eine Modell-Registry statt verstreuter Strings

Zentralisiere das Mapping von Aufgabe → Modell-Tier an genau einer Stelle:

{
  "extract": "deepseek/deepseek-chat",
  "chat": "anthropic/claude-sonnet-4.5",
  "reason": "openai/gpt-5.2"
}

Schritt 2: Fallbacks, die automatisch greifen

Das models-Array

OpenRouter wiederholt die Anfrage serverseitig entlang einer priorisierten Liste, wenn das primäre Modell einen Fehler liefert, rate-limited ist oder in einen Timeout läuft [1]:

{
  "model": "openai/gpt-5.2",
  "models": ["anthropic/claude-sonnet-4.5", "deepseek/deepseek-chat"],
  "messages": [{ "role": "user", "content": "..." }]
}

Die Response verrät dir, welches Modell die Anfrage tatsächlich bedient hat — logge es.

Failover auf Provider-Ebene

Unterhalb der Modell-Fallbacks kann jedes Modell von mehreren Providern bedient werden. Routing-Präferenzen pinnen oder exkludieren bestimmte Upstreams [2]:

{
  "model": "meta-llama/llama-3.3-70b-instruct",
  "provider": {
    "order": ["deepinfra", "together"],
    "allow_fallbacks": true
  }
}

Clientseitiger letzter Ausweg

Umhülle den Aufruf mit genau einem Retry gegen ein anderes Gateway (oder eine gecachte Antwort) für den seltenen Fall, dass der Router selbst nicht erreichbar ist. Bleib bei einem Retry — Retry-Stürme sind selbstverschuldete Ausfälle.

Schritt 3: Kostenkontrolle, die sich nicht umgehen lässt

Cheapest-First-Routing

Sortiere Provider nach Preis, wenn Latenz zweitrangig ist — entweder pro Anfrage ("provider": {"sort": "price"}) oder über das :floor-Modellsuffix für Batch-Jobs.

Harte Preislimits

max_price lehnt jeden Provider ab, der über deiner Obergrenze liegt (Dollar pro 1M Tokens):

{
  "model": "openai/gpt-5.2",
  "max_price": { "prompt": 1.5, "completion": 10 },
  "messages": [{ "role": "user", "content": "..." }]
}

Das ist eine Garantie, keine Präferenz — Anfragen, die unter dem Limit nicht bedient werden können, schlagen sofort fehl, statt still mehr zu kosten.

Kosten pro Anfrage tracken

Responses enthalten Usage-Daten; multipliziere sie mit den Raten des bedienenden Modells und emittiere das Ergebnis als Metrik. Alarmiere auf Drift der Kosten pro Aufgabe, nicht nur auf die Gesamtausgaben — Drift ist die Art, wie sich ein stiller Fallback auf ein teureres Modell bemerkbar macht.

Über Text hinaus: dasselbe Muster für Bild, Video und Audio

LLM-Router enden bei Sprachmodellen. Echte Produkte generieren auch Bilder, Video und Sprache — und fünf weitere Vendor-SDKs zu jonglieren bringt genau das Problem zurück, das du gerade gelöst hast.

Ein Gateway für alle Modalitäten

APIMart stellt 500+ Modelle bereit — Chat plus GPT-Image-2, Sora 2, Kling, Veo, Suno — hinter einer OpenAI-kompatiblen API und einem gemeinsamen Guthaben.

Vertraute Integration, rabattierte Preise

Das Client-Setup ist identisch mit Schritt 1, nur mit anderer Base-URL, und die Preise pro Modell liegen rund 20% unter der offiziellen Liste — die genauen Raten pro Modell findest du auf der Preisseite.

Router mischen ist völlig in Ordnung

Ein verbreitetes Produktions-Layout: OpenRouter oder direkte APIs für Text, APIMart für Mediengenerierung — beide hinter derselben Abstraktion in deinem Code, beide per Config austauschbar.

Bild-, Video- & Audiomodelle zu deiner App hinzufügen

Behalte die Multi-Model-Architektur, die du gerade gebaut hast, und erweitere sie über Text hinaus — 500+ Modelle, eine OpenAI-kompatible API, Pay-as-you-go rund 20% unter Listenpreis.

API-Key holen

Produktions-Checkliste

Shippe mit allen fünf: config-getriebene Modell-Registry, serverseitige Fallback-Kette, Cheapest-First-Routing wo die Latenz es erlaubt, max_price-Limits bei jedem Aufruf und Kostenmetriken pro Anfrage mit Drift-Alerts. Diese Kombination erlaubt es einem Zwei-Personen-Team, eine Multi-Model-App ohne dedizierte Ops-Rotation zu betreiben.

Bereit zum Ausprobieren?

Wählen Sie Ihr gewünschtes Modell im Marktplatz

Testen Sie Chat-, Bild- und Videomodelle im APIMart-Marktplatz und erleben Sie Modellfunktionen schnell über eine einheitliche API.

Chat-ModelleBildmodelleVideomodelle
Modellmarktplatz öffnen