Paritok: 74 % weniger Tokens für Coding-Agenten?
Paritok komprimiert Dateilesen und Tool-Ausgaben vor der Model API. Erfahren Sie, wie das Gateway arbeitet und wann sich die behaupteten 74 % Tokenersparnis rechnen.
Was Paritok mit einer Anfrage macht
Paritok ist ein Token-Gateway: ein Proxy, der zwischen Ihrem Coding-Agent und der Model API sitzt und jede Anfrage vor der Weiterleitung komprimiert. Ihr Agent kommuniziert mit http://127.0.0.1:8080 statt direkt mit dem Anbieter. Der Proxy schreibt die Tool-Schemas, die Dateilesevorgänge, die Tool-Ausgabe und die älteren Gesprächsrunden um, sendet die kleinere Nutzlast an den Upstream-Dienst und gibt die Antwort unverändert zurück.
Der Anbieter stellt Ihnen die Daten in Rechnung, die ihn erreichen. Eine kleinere Nutzlast führt daher zu einer kleineren Rechnung. Das ist die gesamte Idee. Diese Aussage unterscheidet sich von der Aussage, dass Ihr Kontext länger erhalten bleibt. Genau deshalb ist dieses Tool interessant und nicht nur aufgeräumter.
Das Projekt ist jung. Die ersten öffentlichen Tags stammen aus dem Juli 2026. Der aktuelle Tag ist v1.3.0 vom 5. August 2026. Die Gewichte und der Gateway-Code stehen unter der Apache-2.0-Lizenz. Das Kompressionsmodell ist ein LoRA-Adapter (Low-Rank Adaptation) für Qwen3-4B-Instruct-2507. Es wurde mit 45,000 durch einen Lehrer destillierten Beispielen trainiert, die aus realen Coding-Agent-Trajektorien stammen.
Warum dies kein Trimming des Kontexts ist
Beim Trimming werden Inhalte gelöscht. Wenn sich ein Agent dem Kontextlimit nähert und die ältesten Turns entfernt, ist die Datei, die er in Turn 3 gelesen hat, nicht mehr vorhanden. Benötigt er diese Datei in Turn 20 erneut, liest er sie noch einmal ein. Für diese Tokens zahlen Sie dann ein zweites Mal. Die Einsparung war nur geliehen.
Paritok ersetzt ein Segment durch eine kürzere Form mit einem Tag, [REF:id], und hält den vollständigen Text auf dem Proxy vor. Das Modell stellt ein Segment wieder her, indem es read_original oder expand_context aufruft. Dadurch ändert sich das Fehlerbild. Ein Trimmer scheitert durch Vergessen und teilt Ihnen das nie mit. Ein Kompressor scheitert, indem er dem Modell eine verlustbehaftete Zusammenfassung übergibt. Wenn diese Zusammenfassung nicht ausreicht, kann das Modell das Original anfordern.
Der Tool-Filter verhält sich genauso. Gefilterte Tool-Schemas werden durch Stub-Einträge ersetzt, nicht entfernt. Das Modell stellt ein Schema wieder her, indem es gateway_search_tools aufruft. Das ist wichtig, weil ein Filter, der ein Tool dauerhaft ausblendet, die Fähigkeiten Ihres Agents verändert. Sie würden dies erst an einer Aufgabe bemerken, die unbemerkt fehlschlägt.
Die drei Stellschrauben und welche davon kostenlos ist
Die erste Stellschraube ist der Tool-Schema-Filter. Jede Anfrage enthält das vollständige tools-Array. Bei einer Claude-Code-Runde mit mehreren angebundenen MCP-Servern (Model Context Protocol) umfasst dieser Block laut Projekt ungefähr 29,000 Tokens. Der Filter erstellt mit BAAI/bge-small-en-v1.5, einem 130 MB großen Embedding-Modell, Embeddings für die Benutzeranfrage und jede Toolbeschreibung, behält passende Tools bei und ersetzt die übrigen durch Platzhalter. Dadurch sinkt der Block auf ungefähr 8,000 Tokens. Das Embedding-Modell läuft auf der CPU.
Die zweite Stellschraube ist die Inhaltskomprimierung. Dafür wird das 4B-Modell auf einer GPU benötigt. Dateiinhalte, Toolausgaben und der Verlauf werden auf 25.7% ihrer ursprünglichen Größe reduziert. Daher stammt die Angabe von 74%. Lesen Sie sie genau: 74% ist die Komprimierungsrate für die komprimierten Inhalte und nicht die Reduzierung Ihrer Rechnung.
Die dritte Stellschraube ist die Zusammenfassung des Verlaufs. Sobald das Kontextbudget ausgeschöpft ist, werden ältere Runden außerhalb des aktuellen Fensters zusammengefasst. Dadurch kann eine lange Sitzung weiterlaufen, anstatt das Limit zu erreichen.
Nur die zweite Stellschraube benötigt eine GPU. Das ist der wichtigste Satz auf dieser Seite. pip install "paritok[toolselect]" stellt den Tool-Filter auf einem gewöhnlichen CPU-VPS bereit. Dieser Teil des Produkts verursacht keine monatlichen Kosten. Probieren Sie ihn aus, bevor Sie eine GPU-Instanz mieten.
Was das Projekt gemessen hat und auf welchem Testaufbau
The data behind this chart
[
{
"label": "Paritok-4B-v1",
"compressed_to_pct": 25.7,
"quality_retained_pct": 86.5
},
{
"label": "gpt-4.1-mini",
"compressed_to_pct": 50.2,
"quality_retained_pct": 85.6
},
{
"label": "gpt-5",
"compressed_to_pct": 61.9,
"quality_retained_pct": 93.6
}
]Dies sind die vom Projekt selbst veröffentlichten Werte. Gemessen wurde auf dem eigenen Testaufbau mit SWE-bench Lite. Paritok-4B-v1 komprimiert den Inhalt auf 25.7% der ursprünglichen Größe und erhält dabei 86.5% der unkomprimierten Lösungsrate. Bei Verwendung von gpt-5 als Kompressor bleibt mehr Qualität erhalten, nämlich 93.6%. Die Komprimierung reduziert den Inhalt jedoch nur auf 61.9%. Sie würden also Frontier-Preise zahlen, um Frontier-Preise einzusparen.
Lesen Sie die Qualitätsspalte sachlich. Wenn 86.5% der Lösungsrate erhalten bleiben, bedeutet das, dass die komprimierten Durchläufe Probleme nicht lösen konnten, die die unkomprimierten Durchläufe gelöst haben. Das betrifft fast eine von sieben Lösungen. Auf einem Benchmark ist das eine Zahl in einer Tabelle. In Ihrem Repository ist es eine Aufgabe, die Sie zweimal ausführen.
The data behind this chart
[
{
"label": "Turn 1",
"saved_pct": 25
},
{
"label": "Turn 5",
"saved_pct": 39
},
{
"label": "Turn 12",
"saved_pct": 57
},
{
"label": "Turn 20",
"saved_pct": 63
}
]Die Einsparung von Anfang bis Ende steigt mit der Dauer einer Sitzung, weil sich der Verlauf ansammelt und genau dieser Verlauf komprimiert wird. Das Projekt berichtet von etwa 25% bei einem einzelnen Durchlauf, 39% bis zum 5. Durchlauf und 63% bis zum 20. Durchlauf. Es gibt außerdem an, wann das Wachstum endet: Bei einem Budget von 200,000 Tokens flacht die absolute Einsparung bei etwa 48,000 Tokens pro Durchlauf ab, ungefähr zwischen dem 8. und 12. Durchlauf. Sobald der Kontext vollständig belegt ist, wächst der Verlauf nicht weiter. Der häufig zitierte Wert von „mehr als 85%“ beschreibt Sitzungen, deren Kontext bereits gesättigt ist. Das ist der Bestfall. Planen Sie daher nicht mit diesem Wert.
Rechnet sich eine 24-GB-GPU für Paritok?
Eine Karte mit 24 GB ist die übliche Mietgröße für ein Modell dieser Größe. Am 7. August 2026 lag der veröffentlichte Medianpreis für eine RTX 4090 mit 24 GB im On-Demand-Betrieb bei $0.44 pro Stunde; die günstigsten Angebote lagen bei etwa $0.20. Rechnen Sie mit $0.44. Wenn die Instanz den ganzen Monat läuft, sind das 730 Stunden und damit $321. Wenn sie nur während der Arbeitszeit läuft, also 8 Stunden täglich an 22 Tagen, sind es 176 Stunden und damit $77.
Übertragen Sie nun die Token-Einsparung auf eine Einsparung in Dollar. Die Reduzierung betrifft die Input-Tokens. Output-Tokens durchlaufen den Proxy unverändert und ändern sich daher überhaupt nicht. Nehmen Sie an, dass Input-Tokens 80% Ihrer Gesamtkosten ausmachen. Das ist für einen Coding-Agent üblich. Prüfen Sie diese Annahme anhand Ihrer eigenen Abrechnung. Ihre Einsparung in Dollar ergibt sich dann aus der Token-Reduzierung multipliziert mit 0.8.
The data behind this chart
[
{
"label": "Turn 5 (39% saved)",
"bill_always_on_usd": "1,030",
"bill_workday_only_usd": 248
},
{
"label": "Turn 20 (63% saved)",
"bill_always_on_usd": 637,
"bill_workday_only_usd": 154
},
{
"label": "Saturated (85% saved)",
"bill_always_on_usd": 472,
"bill_workday_only_usd": 114
}
]Bei der Auslastungszahl von 85% behalten Sie 68% der Rechnung. Eine durchgehend laufende Karte amortisiert sich daher, sobald Ihre monatlichen Agent-Kosten etwa $472 erreichen. Wenn Sie die Instanz außerhalb der Arbeitszeit stoppen, liegt der entsprechende Wert bei etwa $114. Bei der Zahl für Turn 20 von 63% liegen die Werte bei $637 beziehungsweise $154. Bei der Zahl für Turn 5 von 39%, die dem tatsächlichen Verhalten kurzer Sitzungen entspricht, benötigen Sie etwa $1,030 pro Monat, bevor sich die Anmietung der Karte überhaupt lohnt.
Zwei Faktoren verbessern das Ergebnis gegenüber der Tabelle. Das Modell benötigt keine 24 GB: Der q4-Build ist etwa 2.5 GB groß, der bf16-Build etwa 8 GB. Eine kleinere Karte oder ein GPU-Server, den Sie bereits für einen anderen Zweck betreiben, senkt daher alle Werte in dieser Grafik. Außerdem ist das Stoppen der Instanz, wenn niemand programmiert, der größte Stellhebel. Dadurch sinken die Mietkosten um etwa drei Viertel.
Ein Faktor verschlechtert das Ergebnis. Der Komprimierungsvorgang verursacht tatsächlich Rechenaufwand. Jedes Token, das das 4B-Modell komprimiert, muss es zunächst lesen und anschließend schreiben. Dadurch steigt die Latenz jedes Agent-Turns. Bei einer stundenweise gemieteten Karte zeigt sich dieser Aufwand als Wartezeit und nicht als Position auf der Rechnung. Deshalb wird er leicht übersehen, bis er sich bemerkbar macht.
Wenn Sie allgemein gemietete GPU-Stunden gegen API-Tokens abwägen, berechnet der Break-even zwischen einem GPU-VPS und API-Tokens die gleichen Werte für die Inferenz selbst.
Paritok-Gateway auf einem VPS ausführen
Python 3.10 oder neuer ist erforderlich. Ubuntu 24.04 wird mit Python 3.12 ausgeliefert. Für den CPU-only-Teil reicht daher ein unverändertes VPS-Image aus.
sudo apt update && sudo apt install -y python3-venv curl
python3 -m venv /opt/paritok/venv
source /opt/paritok/venv/bin/activate
pip install "paritok[proxy]==1.3.0"
pip install "paritok[toolselect]==1.3.0"Fixieren Sie die Version. Das Repository hat am 29. July 2026 v1.2.8 und am 5. August 2026 v1.3.0 getaggt. Ein Projekt mit diesem Entwicklungstempo benennt Konfigurationsschlüssel zwischen Releases um. Ein einfaches pip install paritok oder ein git clone von main liefert Ihnen nächste Woche ein anderes Gateway. Außerdem ist nicht dokumentiert, welches Gateway die von Ihnen gemessenen Werte erzeugt hat.
Das Standard-Backend ist Ollama. Laden Sie das Modell herunter und geben Sie ihm anschließend den Kurznamen, nach dem der Proxy sucht.
ollama pull paritok/paritok-4b-v1
ollama cp paritok/paritok-4b-v1 paritok-4b-v1Da das lokale Modell für jedes komprimierte Segment eine Umschreibung erzeugt, zeigt sich ein zu lange laufender Komprimierungsvorgang als blockierter Agent-Schritt. Ollamas num_predict-Begrenzung für die Ausgabelänge ist der Parameter, der diese Dauer begrenzt.
Schreiben Sie paritok.yaml daneben. use_gpu_server: false sorgt dafür, dass die Komprimierung auf Ihrer eigenen Hardware ausgeführt wird.
use_gpu_server: false
local_model:
base_url: http://localhost:11434paritok proxy --port 8080 --config-file paritok.yamlparitok up ist die Kurzform für alle oben genannten Schritte: Der Befehl lädt das Modell herunter, falls es fehlt, und startet den Proxy auf Port 8080. Prüfen Sie den Proxy, bevor Sie einen Agenten darauf verweisen.
curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/stats/health gibt ein kleines JSON-Objekt mit "status":"ok" und einer Versionszeichenfolge zurück. /stats gibt die Komprimierungssummen und die eigene Schätzung des Proxys zu den eingesparten Werten zurück. Behandeln Sie diese Schätzung als Bewertung des Proxys über seine eigene Arbeit und vergleichen Sie sie mit der Nutzungsseite Ihres Providers.
Für höheren Durchsatz statt für einfache Einrichtung stellt vLLM den Adapter auf dem Basismodell bereit.
vllm serve Qwen/Qwen3-4B-Instruct-2507 \
--enable-lora \
--lora-modules paritok-4b-v1=paritok/paritok-4b-v1 \
--port 8000Ollama ist schneller eingerichtet. vLLM verarbeitet gleichzeitige Anfragen deutlich besser. Das wird relevant, sobald mehr als ein Agent denselben Server verwendet. Der praktische Unterschied zwischen Ollama und vLLM entscheidet in diesem Fall.
Verweisen Sie den Agenten über die Umgebungsvariablen für die Basis-URL auf den Proxy.
export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export OPENAI_BASE_URL=http://127.0.0.1:8080Codex CLI ignoriert OPENAI_BASE_URL. Daher legt das Projekt ~/.codex/config.toml für Sie an, wenn codex.enabled: true in paritok.yaml gesetzt ist. Wenn Sie die Variable allein exportieren, kommuniziert Codex weiterhin direkt mit dem Provider. Erkennbar ist das daran, dass sich der /stats-Zähler während Ihrer Arbeit nicht verändert.
Binden Sie den Listener an 127.0.0.1, niemals an 0.0.0.0. Der Proxy leitet Ihren Provider-API-Schlüssel an den Upstream weiter. Ein aus dem Internet erreichbarer Proxy ist daher ein offenes Relay für diesen Schlüssel: Wer den Port findet, kann Ihr Guthaben verwenden, ohne den Schlüssel selbst zu sehen. Greifen Sie stattdessen von einem Laptop über einen SSH-Tunnel oder ein VPN darauf zu.
Führen Sie den Proxy unter systemd aus, damit er einen Reboot übersteht. Passen Sie die Pfade an Ihre Installation an.
[Unit]
Description=Paritok compression proxy
After=network-online.target
[Service]
User=paritok
WorkingDirectory=/opt/paritok
ExecStart=/opt/paritok/venv/bin/paritok proxy --port 8080 --config-file /opt/paritok/paritok.yaml
Restart=on-failure
[Install]
WantedBy=multi-user.targetAktivieren Sie den Dienst mit sudo systemctl enable --now paritok und führen Sie anschließend erneut curl /health aus. Wenn eine Unit startet und sofort beendet wird, ist normalerweise der Pfad zur Konfigurationsdatei falsch. journalctl -u paritok -n 50 gibt den Grund aus.
Die gehostete Option und ihre Kosten
Das Projekt bietet die Komprimierung auch als Dienst an. Setzen Sie use_gpu_server: true mit einem API-Schlüssel, und das 4B-Modell läuft auf der Hardware des Anbieters. Laut eigener Dokumentation kostet dies $0.30 pro Million verarbeiteter Tokens und ist bis Ende August 2026 kostenlos. Dadurch entfallen die GPU-Miete und der gesamte zuvor beschriebene Betriebsaufwand.
Das bedeutet außerdem, dass Ihre Prompts und die Dateien, die Ihr Agent liest, Ihren Rechner verlassen und einen Drittanbieter erreichen, bevor sie Ihren Modellanbieter erreichen. Self-Hosting soll genau diesen Umweg vermeiden. Entscheiden Sie vor dem Setzen dieses Flags, welches dieser beiden Ziele für Sie wichtiger ist. Das Flag lässt sich in einer Zeile ändern, die Konsequenz jedoch nicht.
So messen Sie Ihre eigenen Werte im Vorher-Nachher-Vergleich
Die veröffentlichten Werte stammen aus dem Projekt und wurden mit dem projektspezifischen Harness auf SWE-bench Lite ermittelt. Ihr Repository ist nicht SWE-bench Lite. Messen Sie Ihre eigenen Werte.
- Arbeiten Sie eine normale Woche ohne Proxy im Pfad. Erfassen Sie Input-Tokens, Cache-Read-Tokens und Output-Tokens auf separaten Zeilen aus der Nutzungsübersicht Ihres Providers, nicht als eine einzige Summe in Dollar.
- Arbeiten Sie in der folgenden Woche mit dem Proxy davor und führen Sie dieselbe Art von Aufgaben aus.
- Vergleichen Sie die Zeilen für Input- und Cache-Read-Tokens. Die Output-Tokens sollten ungefähr gleich bleiben, weil nichts sie komprimiert. Wenn sich die Output-Tokens stark verändert haben, wurde außer dem Proxy noch etwas anderes geändert.
- Zählen Sie die Aufgaben, die Sie erneut bearbeiten mussten. Das ist die Qualitätsseite des Vergleichs, und kein Dashboard erfasst sie.
- Rechnen Sie die GPU-Stunden zur zweiten Woche hinzu, bevor Sie die Gesamtsummen vergleichen.
Die Trennung von Input und Output ist wichtig, weil beide sehr unterschiedlich bepreist werden und ein Kompressor nur einen dieser Werte beeinflusst. Im August 2026 kostet Claude Sonnet 4.6 3 $ pro 1 Million Input-Tokens und 15 $ pro 1 Million Output-Tokens. Ein Prompt-Cache-Read kostet 10 % des Input-Preises, also 0,30 $ pro 1 Million. Die Differenz zwischen den Kosten für Input- und Output-Tokens entscheidet darüber, ob sich ein Kompressor für die Eingabeseite für Sie lohnt. Wohin die Tokens von Claude Code tatsächlich gehen zeigt Ihnen, welcher Teil Ihres Kontexts groß genug ist, um eine Komprimierung zu rechtfertigen.
Prompt-Caching erschwert insbesondere die Berechnung für Tool-Filter. Der Tool-Block steht am Anfang der Anfrage. Nach dem ersten Turn ist er daher normalerweise ein Cache-Treffer zum Preis von 10 % des Input-Tarifs. Wenn Sie 21,000 Tokens aus einem gecachten Block entfernen, sparen Sie pro Turn bei 0,30 $ pro 1 Million etwa 0,006 $, nicht die 0,063 $, die der Tarif ohne Cache nahelegen würde. Das Projekt hält den gefilterten Block während der Sitzung unverändert, damit sich das gecachte Präfix nicht ändert. Ein Filter, der in jedem Turn neue Tools auswählen würde, würde dieses Präfix ungültig machen und mehr kosten, als er einspart.
Was noch nicht verifiziert ist
Alle oben genannten Leistungswerte stammen aus dem Projekt selbst. Es gibt keine unabhängige Reproduktion der Ergebnisse von SWE-bench Lite. Außerdem gibt es hinter dem Code nur sehr wenig Betriebserfahrung, da die ersten Tags auf Juli 2026 datiert sind. Die Kompressionsrate und der Wert für die erhaltene Qualität wurden beide von der Partei gemessen, die von guten Ergebnissen profitiert. Das bedeutet nicht, dass die Werte falsch sind. Sie sind jedoch unbestätigt. Sie sollten sie daher anders bewerten als einen Wert, den Sie selbst ermittelt haben.
Ein dokumentiertes Verhalten sollten Sie kennen, bevor Sie Ihre Konfiguration verantwortlich machen. Das vom Tool-Filter verwendete Embedding-Modell wird erst bei der ersten Anfrage und nicht beim Start geladen. Das Projekt dokumentiert deshalb eine Aufwärmzeit von 10 bis 15 Sekunden und anschließend etwa 15 ms pro Aufruf. Senden Sie nach dem Start des Proxy eine einmalige Anfrage, die Sie nicht weiterverwenden. Dann wirkt der erste echte Agenten-Durchlauf nicht so, als würde er hängen.
Vier Dinge können Sie an einem Nachmittag selbst klären: ob der Proxy startet und aktiv bleibt, ob sich /stats während Ihrer Arbeit verändert, ob die Input-Token-Zeile Ihres Providers tatsächlich sinkt und ob der Agent die Aufgabe weiterhin abschließt. Diese Punkte entscheiden für Ihre Umgebung weitaus besser als jeder veröffentlichte Benchmark.
Zur Einordnung neben Ihren anderen Tools: Ein selbst gehostetes LiteLLM-Gateway leitet Anfragen weiter und erfasst deren Nutzung, ohne ihren Inhalt zu verändern. Beide Lösungen behandeln daher unterschiedliche Probleme und können miteinander verkettet werden, wobei Paritok dem Agenten am nächsten sitzt. Wenn es Ihnen in erster Linie um eine niedrigere Rechnung und nicht um dieses konkrete Tool geht, umfasst die größere Auswahl an Kostenkontrollen für einen Agenten auf einem VPS mehrere Änderungen, die Sie zunächst kostenlos ausprobieren können.
FAQ
Senkt Paritok meine API-Kosten oder nur meinen Kontextverbrauch?
Die Kosten sinken, weil der Proxy die Anfrage umschreibt, bevor sie den Anbieter erreicht, und der Anbieter die empfangenen Daten abrechnet. Das Ausmaß der Einsparung ist jedoch geringer, als die Schlagzeile vermuten lässt. Der Wert von 74% bezeichnet die Kompressionsrate für die komprimierten Inhalte. Über den gesamten Ablauf hinweg meldet das Projekt etwa 25% bei einer einzelnen Runde und 63% bis zur 20. Runde. Nur die Eingabe-Tokens ändern sich. Ausgabe-Tokens werden unverändert weitergeleitet.
Wie viel GPU benötige ich für das Self-Hosting des Kompressionsmodells?
Der q4-Build ist etwa 2.5 GB groß, der bf16-Build etwa 8 GB. Das Modell passt daher mit viel freiem Speicher auf eine 24-GB-Karte. Eine kleinere Karte reicht ebenfalls aus und verbessert die Kosten-Nutzen-Rechnung. Der Tool-Schema-Filter benötigt überhaupt keine GPU. Er verwendet BAAI/bge-small-en-v1.5, ein 130 MB großes Embedding-Modell, das auf der CPU ausgeführt wird. Installieren Sie paritok[toolselect] auf einem gewöhnlichen VPS. Damit erhalten Sie die Reduzierung der Tool-Blöcke für den Preis von etwas zusätzlichem RAM.
Was passiert, wenn der Kompressor etwas entfernt, das der Agent benötigt?
Es wird nichts entfernt. Komprimierte Segmente enthalten ein [REF:id]-Tag, und das Modell stellt den vollständigen Text mit read_original oder expand_context wieder her. Gefilterte Tool-Schemas werden durch Platzhalter ersetzt, nicht gelöscht. Das Modell stellt ein solches Schema mit gateway_search_tools wieder her. Das eigentliche Risiko ist unauffälliger als eine fehlende Datei: Das Modell arbeitet mit einer verlustbehafteten Zusammenfassung und erkennt nie, dass es nach dem Original fragen sollte. Genau das misst der Wert von 86.5% erhaltener Qualität auf SWE-bench Lite.
Warum benötigt meine erste Anfrage fünfzehn Sekunden?
Das Embedding-Modell hinter dem Tool-Filter wird erst bei der ersten Anfrage und nicht beim Start geladen. Das Projekt dokumentiert eine Aufwärmphase von 10 bis 15 Sekunden. Danach dauert ein Aufruf ungefähr 15 ms. Senden Sie nach dem Start des Proxys eine einmalige Testanfrage mit curl. Dann wird die erste echte Agentenrunde nicht blockiert.
Sollte ich statt des Self-Hostings den gehosteten GPU-Server verwenden?
Damit entfallen die GPU-Miete und der Wartungsaufwand. Stand August 2026 kostet der Dienst $0.30 pro verarbeiteten Millionen Tokens. Ihre Prompts und die Dateien, die Ihr Agent liest, werden jedoch an einen Drittanbieter gesendet, bevor sie den Modellanbieter erreichen. Wenn Sie Self-Hosting einsetzen, damit der Code auf einer von Ihnen kontrollierten Infrastruktur bleibt, hebt diese Einstellung den Grund für Ihre Entscheidung wieder auf. Beim Self-Hosting verbleiben sowohl der Kontext als auch der API-Schlüssel des Anbieters auf Ihrem eigenen Server.