Rate Limiting
Es besteht die Möglichkeit, Rate Limits für Modelle zu definieren. Diese können entweder global für alle API-Keys oder individuell pro API-Key festgelegt werden.
Das Rate Limit bestimmt, wie viele Tokens innerhalb eines Zeitraums verarbeitet werden dürfen. Der Zeitraum kann in Stunden angegeben werden. Wird ein globales Rate Limit definiert, gilt dieses automatisch auch für neu erstellte API-Keys.
Globales Rate Limit setzen
Zunächst muss zum Reiter Global Rate Limits navigiert werden.
Um das Rate Limit zu aktivieren, muss die entsprechende Checkbox ausgewählt werden.
Anschließend können für das Modell Qwen3.8-27B sowohl das Input- als auch das Output-Token-Limit festgelegt werden.
Für das Embedding-Modell bge-m3 kann ausschließlich ein Input-Token-Limit definiert werden, da dieses Modell keine Output-Tokens generiert.
Für bge-reranker-v2-m3 gibt es kein Rate Limit.
Abschließend müssen die Einstellungen gespeichert werden. Nach kurzer Zeit sind die definierten Limits aktiv.

Rate Limit pro API-Key setzen
Um ein Rate Limit für einen einzelnen API-Key zu konfigurieren, muss auf den API-Key geklickt werden und anschließend Rate Limits setzen ausgewählt werden.
Der Zeitraum kann in Stunden angegeben werden.
Hinweis
Ein globales Rate Limit überschreibt bestehende Rate Limits für einzelne API-Keys!

Anschließend können für das Modell Qwen3.8-27B sowohl das Input- als auch das Output-Token-Limit festgelegt werden.
Für das Embedding-Modell bge-m3 kann ausschließlich ein Input-Token-Limit definiert werden, da keine Output-Tokens erzeugt werden.
Für bge-reranker-v2-m3 gibt es kein Rate Limit.
Nach dem Speichern der Einstellungen werden die Limits nach kurzer Zeit wirksam.
