Zum Inhalt

Rate Limiting

Es besteht die Möglichkeit, Rate Limits für Modelle zu definieren. Diese können entweder global für alle API-Keys oder individuell pro API-Key festgelegt werden.

Das Rate Limit bestimmt, wie viele Tokens innerhalb eines Zeitraums verarbeitet werden dürfen. Der Zeitraum kann in Stunden angegeben werden. Wird ein globales Rate Limit definiert, gilt dieses automatisch auch für neu erstellte API-Keys.

Globales Rate Limit setzen

Zunächst muss zum Reiter Global Rate Limits navigiert werden.

Um das Rate Limit zu aktivieren, muss die entsprechende Checkbox ausgewählt werden. Anschließend können für das Modell Qwen3.8-27B sowohl das Input- als auch das Output-Token-Limit festgelegt werden.

Für das Embedding-Modell bge-m3 kann ausschließlich ein Input-Token-Limit definiert werden, da dieses Modell keine Output-Tokens generiert.

Für bge-reranker-v2-m3 gibt es kein Rate Limit.

Abschließend müssen die Einstellungen gespeichert werden. Nach kurzer Zeit sind die definierten Limits aktiv.

Pricing AI Model

Rate Limit pro API-Key setzen

Um ein Rate Limit für einen einzelnen API-Key zu konfigurieren, muss auf den API-Key geklickt werden und anschließend Rate Limits setzen ausgewählt werden.

Der Zeitraum kann in Stunden angegeben werden.

Hinweis

Ein globales Rate Limit überschreibt bestehende Rate Limits für einzelne API-Keys!

Pricing AI Model

Anschließend können für das Modell Qwen3.8-27B sowohl das Input- als auch das Output-Token-Limit festgelegt werden.

Für das Embedding-Modell bge-m3 kann ausschließlich ein Input-Token-Limit definiert werden, da keine Output-Tokens erzeugt werden.

Für bge-reranker-v2-m3 gibt es kein Rate Limit.

Nach dem Speichern der Einstellungen werden die Limits nach kurzer Zeit wirksam.

Pricing AI Model