SSD Nodes Learn 🎉 VPS $5.50/నెల నుండి
మార్గదర్శకాలు Matt Connorద్వారా Matt Connor · అప్‌డేట్ చేయబడింది 2026-08-13

Paritok టోకెన్ గేట్‌వే: ఏజెంట్ బిల్లులను తగ్గించడం ఎలా?

Paritok మీ కోడింగ్ ఏజెంట్ పంపే ఫైల్ రీడ్స్ మరియు టూల్ అవుట్‌పుట్‌లను కంప్రెస్ చేస్తుంది. ఇది టోకెన్ వినియోగాన్ని 74% వరకు తగ్గిస్తుంది. ఈ ప్రాక్సీ పనితీరు మరియు ఖర్చు ఆదా గణనలను చూడండి.

Paritok ఒక అభ్యర్థనను ఎలా ప్రాసెస్ చేస్తుంది

Paritok ఒక టోకెన్ గేట్‌వే: ఇది మీ కోడింగ్ ఏజెంట్‌కు మరియు మోడల్ APIకి మధ్య ఉండి, ప్రతి అభ్యర్థనను ఫార్వార్డ్ చేసే ముందు కంప్రెస్ చేసే ప్రాక్సీ. మీ ఏజెంట్ ప్రొవైడర్‌కు బదులుగా http://127.0.0.1:8080 తో కమ్యూనికేట్ చేస్తుంది. ఈ ప్రాక్సీ టూల్ స్కీమాలు, ఫైల్ రీడ్స్, టూల్ అవుట్‌పుట్ మరియు పాత సంభాషణలను రీరైట్ చేసి, చిన్న పరిమాణంలో ఉన్న పేలోడ్‌ను అప్‌స్ట్రీమ్‌కు పంపుతుంది, ఆపై వచ్చిన సమాధానాన్ని ఎటువంటి మార్పులు లేకుండా తిరిగి అందిస్తుంది.

ప్రొవైడర్ వద్దకు చేరిన డేటా ఆధారంగానే మీకు బిల్లు పడుతుంది, కాబట్టి చిన్న పేలోడ్ అంటే తక్కువ బిల్లు అని అర్థం. ఇదొక్కటే దీని ప్రధాన ఉద్దేశ్యం. ఇది "మీ కాంటెక్స్ట్ ఎక్కువ కాలం ఉంటుంది" అనే వాదన కంటే భిన్నమైనది, అందుకే ఈ సాధనం కేవలం శుభ్రంగా ఉండటమే కాకుండా ఆసక్తికరంగా కూడా ఉంటుంది.

ఈ ప్రాజెక్ట్ కొత్తది. దీని మొదటి పబ్లిక్ ట్యాగ్‌లు జూలై 2026 నాటివి మరియు ప్రస్తుత ట్యాగ్ v1.3.0, ఇది 5 ఆగస్టు 2026 నాటిది. వెయిట్స్ మరియు గేట్‌వే కోడ్ Apache 2.0 లైసెన్స్ కింద ఉన్నాయి. ఈ కంప్రెషన్ మోడల్ Qwen3-4B-Instruct-2507 పై ఉన్న LoRA (low-rank adaptation) అడాప్టర్. దీనిని నిజమైన కోడింగ్-ఏజెంట్ ట్రాజెక్టరీల నుండి సేకరించిన 45,000 టీచర్-డిస్టిల్డ్ శాంపిల్స్‌తో ట్రైన్ చేశారు.

ఇది కాంటెక్స్ట్ ట్రిమ్మింగ్ ఎందుకు కాదు

ట్రిమ్మింగ్ సమాచారాన్ని తొలగిస్తుంది. ఒక ఏజెంట్ తన కాంటెక్స్ట్ పరిమితికి చేరువైనప్పుడు పాత సంభాషణలను తొలగిస్తే, మూడవ టర్న్‌లో అది చదివిన ఫైల్ మాయమవుతుంది. ఒకవేళ 20వ టర్న్‌లో ఆ ఫైల్ అవసరమైతే, అది మళ్ళీ ఆ ఫైల్‌ను చదవాల్సి వస్తుంది, కాబట్టి మీరు ఆ టోకెన్ల కోసం రెండోసారి చెల్లించాల్సి ఉంటుంది. ఆ పొదుపు కేవలం తాత్కాలికం మాత్రమే.

Paritok ఒక విభాగాన్ని చిన్న రూపంతో మరియు ఒక ట్యాగ్‌తో భర్తీ చేస్తుంది, [REF:id], మరియు పూర్తి పాఠ్యాన్ని ప్రాక్సీ వద్ద భద్రపరుస్తుంది. మోడల్ read_original లేదా expand_contextని పిలవడం ద్వారా ఆ విభాగాన్ని తిరిగి పొందుతుంది. ఇది వైఫల్య విధానాన్ని మారుస్తుంది. ట్రిమ్మర్ సమాచారాన్ని మర్చిపోవడం ద్వారా విఫలమవుతుంది, మరియు అది మీకు ఎప్పటికీ తెలియజేయదు. కంప్రెసర్ మోడల్‌కు ఒక నష్టదాయకమైన (lossy) సారాంశాన్ని అందించడం ద్వారా విఫలమవుతుంది, మరియు సారాంశం సరిపోనప్పుడు మోడల్ అసలు సమాచారాన్ని అడగగలదు.

టూల్ ఫిల్టర్ కూడా ఇదే విధంగా పనిచేస్తుంది. ఫిల్టర్ చేయబడిన టూల్ స్కీమాలు తొలగించబడవు, కేవలం స్టబ్ చేయబడతాయి, మరియు మోడల్ gateway_search_toolsని పిలవడం ద్వారా ఒకదాన్ని తిరిగి పొందుతుంది. ఇది చాలా ముఖ్యం, ఎందుకంటే ఒక టూల్‌ను శాశ్వతంగా దాచిపెట్టే ఫిల్టర్ మీ ఏజెంట్ చేయగలిగే పనులను మారుస్తుంది, మరియు అటువంటి సందర్భంలో ఏదైనా పని నిశ్శబ్దంగా విఫలమైనప్పుడు మాత్రమే మీకు ఆ విషయం తెలుస్తుంది.

మూడు నియంత్రణలు, మరియు ఉచితంగా లభించేది ఏది

మొదటి నియంత్రణ tool-schema ఫిల్టర్. ప్రతి అభ్యర్థన మొత్తం tools అర్రేను కలిగి ఉంటుంది. కొన్ని MCP (model context protocol) సర్వర్లు అనుసంధానించబడిన Claude Code టర్న్‌లో, ఈ బ్లాక్ సుమారు 29,000 టోకెన్ల పరిమాణంలో ఉంటుంది. ఈ ఫిల్టర్ వినియోగదారుని అభ్యర్థనను మరియు ప్రతి టూల్ వివరణను BAAI/bge-small-en-v1.5 (ఇది 130 MB ఎంబెడ్డింగ్ మోడల్) తో ఎంబెడ్ చేస్తుంది, సరిపోయే టూల్స్‌ను ఉంచి మిగిలిన వాటిని స్టబ్ చేస్తుంది. దీనితో ఆ బ్లాక్ సుమారు 8,000 టోకెన్లకు తగ్గుతుంది. ఈ ఎంబెడ్డింగ్ మోడల్ CPUపై నడుస్తుంది.

రెండవ నియంత్రణ కంటెంట్ కంప్రెషన్, దీనికి GPUపై 4B మోడల్ అవసరం. ఫైల్ రీడ్స్, టూల్ అవుట్‌పుట్ మరియు హిస్టరీని వాటి అసలు పరిమాణంలో 25.7%కి కుదిస్తారు. 74% అనే గణాంకం ఇక్కడి నుంచే వస్తుంది. దీన్ని జాగ్రత్తగా గమనించండి: 74% అనేది కంప్రెస్ చేయబడిన కంటెంట్‌పై కంప్రెషన్ రేటు, మీ బిల్లులో తగ్గే మొత్తం కాదు.

మూడవ నియంత్రణ హిస్టరీ సమ్మరైజేషన్. కాంటెక్స్ట్ బడ్జెట్ నిండిన తర్వాత, ఇటీవలి విండోకు ఆవల ఉన్న టర్న్‌లను సమ్మరైజ్ చేస్తారు, తద్వారా పరిమితిని చేరుకోకుండా సుదీర్ఘ సెషన్ కొనసాగుతుంది.

రెండవ నియంత్రణకు మాత్రమే GPU అవసరం. ఈ పేజీలో ఇదే అత్యంత ఉపయోగకరమైన వాక్యం. pip install "paritok[toolselect]" మీకు సాధారణ CPU VPSపై టూల్ ఫిల్టర్‌ను అందిస్తుంది, మరియు ఇది మీకు నెలకు ఎటువంటి ఖర్చు లేని ఉత్పత్తిలో సగం భాగం. మీరు GPU కార్డ్‌ను అద్దెకు తీసుకునే ముందు దీన్ని ప్రయత్నించండి.

ఈ ప్రాజెక్ట్ దేనిని కొలిచింది మరియు ఏ హార్నెస్‌పై కొలిచింది

ChartSWE-bench Lite: compression rate against solve quality retained (project's published figures)
The data behind this chart
[
  {
    "label": "Paritok-4B-v1",
    "compressed_to_pct": 25.7,
    "quality_retained_pct": 86.5
  },
  {
    "label": "gpt-4.1-mini",
    "compressed_to_pct": 50.2,
    "quality_retained_pct": 85.6
  },
  {
    "label": "gpt-5",
    "compressed_to_pct": 61.9,
    "quality_retained_pct": 93.6
  }
]

ఇవి SWE-bench Lite పై ప్రాజెక్ట్ స్వయంగా ప్రచురించిన గణాంకాలు, వీటిని దాని స్వంత హార్నెస్‌పై కొలిచారు. Paritok-4B-v1 కంటెంట్‌ను అసలు పరిమాణంలో 25.7% కి కుదిస్తుంది, అదే సమయంలో కంప్రెస్ చేయని solve rate లో 86.5% ని నిలుపుకుంటుంది. కంప్రెసర్‌గా gpt-5 ని ఉపయోగించడం వల్ల 93.6% నాణ్యత నిలుస్తుంది, కానీ ఇది కేవలం 61.9% కి మాత్రమే కుదిస్తుంది. అంతేకాకుండా, frontier ధరలను ఆదా చేయడానికి మీరు frontier ధరలనే చెల్లించాల్సి ఉంటుంది.

నాణ్యత కాలమ్‌ను నిశితంగా గమనించండి. 86.5% solve rate ని నిలుపుకోవడం అంటే, కంప్రెస్ చేయని రన్‌లలో పరిష్కరించబడిన సమస్యలు కంప్రెస్ చేసిన రన్‌లలో విఫలమయ్యాయని అర్థం; అంటే దాదాపు ఏడు సమస్యలలో ఒకటి విఫలమవుతుంది. ఒక బెంచ్‌మార్క్‌లో ఇది కేవలం టేబుల్‌లోని ఒక సంఖ్య మాత్రమే. కానీ మీ రిపోజిటరీలో ఇది మీరు రెండుసార్లు రన్ చేసే ఒక టాస్క్.

ChartReported input-token saving as a session grows (project's own harness)
The data behind this chart
[
  {
    "label": "Turn 1",
    "saved_pct": 25
  },
  {
    "label": "Turn 5",
    "saved_pct": 39
  },
  {
    "label": "Turn 12",
    "saved_pct": 57
  },
  {
    "label": "Turn 20",
    "saved_pct": 63
  }
]

సెషన్ కొనసాగుతున్న కొద్దీ ఎండ్-టు-ఎండ్ ఆదా పెరుగుతుంది, ఎందుకంటే హిస్టరీ పేరుకుపోతుంది మరియు ఆ హిస్టరీనే ఇక్కడ కంప్రెస్ చేయబడుతోంది. ఒకే టర్న్‌లో సుమారు 25%, 5వ టర్న్ నాటికి 39%, మరియు 20వ టర్న్ నాటికి 63% ఆదా అవుతుందని ప్రాజెక్ట్ నివేదిస్తోంది. ఈ వృద్ధి ఎక్కడ ఆగిపోతుందో కూడా ఇది పేర్కొంది: 200,000 టోకెన్ల బడ్జెట్‌పై, టర్న్ 8 నుండి 12 మధ్యలో, ప్రతి టర్న్‌కు సుమారు 48,000 టోకెన్ల వద్ద ఆదా స్థిరపడుతుంది. ఎందుకంటే కాంటెక్స్ట్ నిండిపోయిన తర్వాత హిస్టరీ పెరగడం ఆగిపోతుంది. విస్తృతంగా ప్రచారంలో ఉన్న "85% కంటే ఎక్కువ" అనే గణాంకం కాంటెక్స్ట్ నిండిన సెషన్లను సూచిస్తుంది. ఇది అత్యుత్తమ పరిస్థితి మాత్రమే, కాబట్టి దీనిపై ఆధారపడి ప్లాన్ చేసుకోవద్దు.

24GB GPU, Paritok కోసం ఖర్చుకు తగినదేనా?

ఈ పరిమాణంలో ఉన్న మోడల్ కోసం 24 GB కార్డ్ సాధారణంగా అద్దెకు తీసుకునే యూనిట్. 7 ఆగస్టు 2026 నాటికి, 24 GB కలిగిన RTX 4090 కోసం ప్రచురించబడిన సగటు ఆన్-డిమాండ్ ధర గంటకు $0.44, అత్యంత తక్కువ ధరలు $0.20 దగ్గర ఉన్నాయి. $0.44 ధరను పరిగణనలోకి తీసుకుందాం. నెలంతా రన్ చేస్తే, అది 730 గంటలు, అంటే $321 అవుతుంది. కేవలం పని వేళల్లో, రోజుకు 8 గంటల చొప్పున 22 రోజులు రన్ చేస్తే, అది 176 గంటలు, అంటే $77 అవుతుంది.

ఇప్పుడు టోకెన్ తగ్గింపును డాలర్ల తగ్గింపుగా మార్చుదాం. ఈ తగ్గింపు ఇన్‌పుట్ టోకెన్లకు వర్తిస్తుంది. అవుట్‌పుట్ టోకెన్లు ప్రాక్సీ ద్వారా ఎటువంటి మార్పు లేకుండా వెళ్తాయి, కాబట్టి వాటిలో ఎటువంటి మార్పు ఉండదు. కోడింగ్ ఏజెంట్లకు సాధారణంగా ఉండే విధంగా, ఇన్‌పుట్ టోకెన్లు మీ మొత్తం డాలర్ ఖర్చులో 80% అని భావించి, మీ స్వంత బిల్లుతో ఆ అంచనాను సరిచూసుకోండి. అప్పుడు మీ డాలర్ ఆదా అనేది టోకెన్ తగ్గింపును 0.8 తో గుణించగా వచ్చే విలువ అవుతుంది.

ChartMonthly agent bill needed before a $0.44/hour 24GB card pays for itself
The data behind this chart
[
  {
    "label": "Turn 5 (39% saved)",
    "bill_always_on_usd": "1,030",
    "bill_workday_only_usd": 248
  },
  {
    "label": "Turn 20 (63% saved)",
    "bill_always_on_usd": 637,
    "bill_workday_only_usd": 154
  },
  {
    "label": "Saturated (85% saved)",
    "bill_always_on_usd": 472,
    "bill_workday_only_usd": 114
  }
]

85% సంతృప్త సెషన్ (saturated-session) గణాంకం వద్ద, మీరు బిల్లులో 68% ఆదా చేస్తారు. కాబట్టి, మీ నెలవారీ ఏజెంట్ ఖర్చు సుమారు $472 దాటినప్పుడు, లేదా మీరు పని వేళలు కాని సమయంలో ఇన్‌స్టాన్స్‌ను ఆపివేస్తే సుమారు $114 దాటినప్పుడు, రన్ అవుతున్న కార్డ్ తన ఖర్చును తానే భరిస్తుంది. 63% టర్న్-20 గణాంకం వద్ద, అవి $637 మరియు $154 అవుతాయి. తక్కువ సెషన్లు వాస్తవానికి ఎలా ఉంటాయో తెలిపే 39% టర్న్-5 గణాంకం వద్ద, కార్డ్‌ను అద్దెకు తీసుకోవడం లాభదాయకం కావాలంటే మీకు నెలకు సుమారు $1,030 ఖర్చు అవసరం.

ఈ పట్టిక సూచించే దానికంటే రెండు అంశాలు దీనిని మెరుగ్గా చేస్తాయి. మోడల్‌కు 24 GB అవసరం లేదు: q4 బిల్డ్ సుమారు 2.5 GB మరియు bf16 బిల్డ్ సుమారు 8 GB ఉంటుంది, కాబట్టి చిన్న కార్డ్ లేదా మీరు ఇప్పటికే ఇతర పనుల కోసం వాడుతున్న GPU బాక్స్ ఈ చార్ట్‌లోని ప్రతి సంఖ్యను తగ్గిస్తుంది. ఎవరూ కోడింగ్ చేయనప్పుడు ఇన్‌స్టాన్స్‌ను ఆపివేయడం అనేది ఇక్కడ అతిపెద్ద ఆదా మార్గం, ఎందుకంటే ఇది అద్దెను సుమారు నాలుగింట మూడు వంతులు తగ్గిస్తుంది.

ఒక అంశం దీనిని ప్రతికూలంగా మారుస్తుంది. కంప్రెషన్ ప్రక్రియ నిజమైన పనిని కలిగి ఉంటుంది. 4B మోడల్ కంప్రెస్ చేసే ప్రతి టోకెన్, అది చదివి ఆపై రాయాల్సిన టోకెన్, ఇది ప్రతి ఏజెంట్ టర్న్‌కు లాటెన్సీని (latency) పెంచుతుంది. మీరు గంటల ప్రాతిపదికన అద్దెకు తీసుకునే కార్డ్‌పై, ఆ ఖర్చు వేచి ఉండే సమయంగా కనిపిస్తుంది, ఇన్‌వాయిస్‌లో లైన్ ఐటెమ్‌గా కనిపించదు, కాబట్టి మీరు దానిని అనుభవించే వరకు గుర్తించడం కష్టం.

మీరు సాధారణంగా అద్దె GPU గంటలను API టోకెన్లతో పోల్చి చూస్తుంటే, GPU VPS మరియు API టోకెన్ల మధ్య బ్రేక్-ఈవెన్ ఇన్ఫరెన్స్ కోసం ఇదే గణితాన్ని అనుసరిస్తుంది.

VPS పై Paritok gateway ను రన్ చేయడం

Python 3.10 లేదా అంతకంటే కొత్త వెర్షన్ అవసరం. Ubuntu 24.04 లో Python 3.12 ఉంటుంది, కాబట్టి CPU-మాత్రమే ఉండే సెటప్ కోసం సాధారణ VPS image సరిపోతుంది.

sudo apt update && sudo apt install -y python3-venv curl
python3 -m venv /opt/paritok/venv
source /opt/paritok/venv/bin/activate
pip install "paritok[proxy]==1.3.0"
pip install "paritok[toolselect]==1.3.0"

వెర్షన్‌ను స్థిరపరచండి (pin). ఈ రిపోజిటరీ 29 July 2026 న v1.2.8 గా, 5 August 2026 న v1.3.0 గా ట్యాగ్ చేయబడింది. ఇంత వేగంగా అభివృద్ధి చెందే ప్రాజెక్టులలో ప్రతి release మధ్య config keys మారుతుంటాయి. కేవలం pip install paritok వాడటం లేదా main యొక్క git clone వాడటం వల్ల వచ్చే వారం మీకు వేరే gateway రావచ్చు, దీనివల్ల మీరు కొలిచిన గణాంకాలు ఏ వెర్షన్‌కు చెందినవో రికార్డు ఉండదు.

డిఫాల్ట్ బ్యాకెండ్ Ollama. ముందుగా మోడల్‌ను pull చేయండి, ఆపై proxy వెతికే చిన్న పేరును (short name) దానికి ఇవ్వండి.

ollama pull paritok/paritok-4b-v1
ollama cp paritok/paritok-4b-v1 paritok-4b-v1

దాని పక్కన paritok.yaml రాయండి. మీ హార్డ్‌వేర్‌పై కంప్రెషన్‌ను ఉంచేది use_gpu_server: false మాత్రమే.

use_gpu_server: false
local_model:
  base_url: http://localhost:11434
paritok proxy --port 8080 --config-file paritok.yaml

పైన పేర్కొన్న వాటన్నింటికీ paritok up ఒక షార్ట్‌కట్: ఇది మోడల్ లేకపోతే pull చేస్తుంది మరియు 8080 పోర్ట్‌పై proxy ని ప్రారంభిస్తుంది. ఏజెంట్‌ను దీనికి అనుసంధానించే ముందు proxy ని ఒకసారి తనిఖీ చేయండి.

curl http://127.0.0.1:8080/health
curl http://127.0.0.1:8080/stats

/health ఒక చిన్న JSON ఆబ్జెక్ట్‌ను ఇస్తుంది, అందులో "status":"ok" మరియు వెర్షన్ స్ట్రింగ్ ఉంటాయి. /stats కంప్రెషన్ వివరాలను మరియు proxy అంచనా వేసిన ఆదాను చూపుతుంది. ఆ అంచనాను proxy తన పనితీరుకు ఇచ్చుకున్న గ్రేడ్‌గా భావించండి, మరియు మీ సర్వీస్ ప్రొవైడర్ usage పేజీతో సరిచూసుకోండి.

సౌలభ్యం కంటే throughput ముఖ్యం అనుకుంటే, vLLM బేస్ మోడల్ పైన అడాప్టర్‌ను అందిస్తుంది.

vllm serve Qwen/Qwen3-4B-Instruct-2507 \
  --enable-lora \
  --lora-modules paritok-4b-v1=paritok/paritok-4b-v1 \
  --port 8000

Ollama ను సెటప్ చేయడం సులభం. vLLM ఏకకాలంలో వచ్చే అభ్యర్థనలను (concurrent requests) చాలా మెరుగ్గా నిర్వహిస్తుంది; ఒకటి కంటే ఎక్కువ ఏజెంట్లు ఒకే సర్వర్‌ను వాడుతున్నప్పుడు ఇది కీలకం అవుతుంది. Ollama మరియు vLLM మధ్య ఆచరణాత్మక వ్యత్యాసం ఆధారంగా మీరు దేనిని ఎంచుకోవాలో నిర్ణయించుకోవచ్చు.

బేస్ URL environment variables ఉపయోగించి ఏజెంట్‌ను proxy కి పాయింట్ చేయండి.

export ANTHROPIC_BASE_URL=http://127.0.0.1:8080
export OPENAI_BASE_URL=http://127.0.0.1:8080

Codex CLI OPENAI_BASE_URL ని పట్టించుకోదు, కాబట్టి paritok.yaml లో codex.enabled: true సెట్ చేసినప్పుడు ప్రాజెక్ట్ మీ కోసం ~/.codex/config.toml ని రాస్తుంది. కేవలం variable ను export చేస్తే Codex నేరుగా ప్రొవైడర్‌తో మాట్లాడుతుంది; మీరు పని చేస్తున్నప్పుడు /stats కౌంటర్ పెరగకపోవడమే దీనికి సంకేతం.

listener ను ఎప్పుడూ 127.0.0.1 పైనే ఉంచండి, 0.0.0.0 పై వద్దు. Proxy మీ ప్రొవైడర్ API కీని upstream కి పంపుతుంది, కాబట్టి ఇంటర్నెట్ నుండి యాక్సెస్ చేయగల proxy ఉంటే అది మీ కీకి ఓపెన్ రిలేగా మారుతుంది: ఎవరైనా ఆ పోర్ట్‌ను కనుగొంటే, కీని చూడకుండానే మీ డబ్బును ఖర్చు చేయగలరు. పోర్ట్‌ను ఓపెన్ చేసే బదులు SSH tunnel లేదా VPN ద్వారా ల్యాప్‌టాప్ నుండి దీనిని యాక్సెస్ చేయండి.

Reboot తర్వాత కూడా ఇది పనిచేసేలా systemd కింద రన్ చేయండి. మీ ఇన్‌స్టాలేషన్‌కు అనుగుణంగా paths ను మార్చుకోండి.

[Unit]
Description=Paritok compression proxy
After=network-online.target

[Service]
User=paritok
WorkingDirectory=/opt/paritok
ExecStart=/opt/paritok/venv/bin/paritok proxy --port 8080 --config-file /opt/paritok/paritok.yaml
Restart=on-failure

[Install]
WantedBy=multi-user.target

sudo systemctl enable --now paritok తో దీనిని enable చేయండి, ఆపై మళ్ళీ /health ని curl చేయండి. ఒక unit ప్రారంభమై వెంటనే ఆగిపోతుందంటే, సాధారణంగా config file path తప్పుగా ఉందని అర్థం; అప్పుడు journalctl -u paritok -n 50 ద్వారా కారణాన్ని తెలుసుకోవచ్చు.

హోస్ట్ చేసిన ఆప్షన్ మరియు దాని ఖర్చు

ఈ ప్రాజెక్ట్ కంప్రెషన్‌ను ఒక సర్వీసుగా కూడా విక్రయిస్తుంది. use_gpu_server: true ను API key తో సెట్ చేస్తే, 4B మోడల్ వారి హార్డ్‌వేర్‌పై రన్ అవుతుంది. దీని ధర ప్రాసెస్ చేయబడిన ప్రతి మిలియన్ టోకెన్లకు $0.30 గా నిర్ణయించబడింది. వారి డాక్యుమెంటేషన్ ప్రకారం, ఆగస్టు 2026 చివరి వరకు ఇది ఉచితం. దీనివల్ల GPU అద్దె మరియు పైన పేర్కొన్న అన్ని నిర్వహణ పనులు ఉండవు.

దీని అర్థం, మీ ప్రాంప్ట్‌లు మరియు మీ ఏజెంట్ చదివే ఫైళ్లు మీ మెషీన్ నుండి బయటకు వెళ్లి, మీ మోడల్ ప్రొవైడర్‌కు చేరకముందే థర్డ్ పార్టీకి చేరుతాయి. సరిగ్గా ఈ అదనపు దశను నివారించడానికే self-hosting ఉపయోగపడుతుంది. మీరు ఆ ఫ్లాగ్‌ను సెట్ చేసే ముందు, ఈ రెండింటిలో దేనికి ప్రాధాన్యత ఇస్తున్నారో నిర్ణయించుకోండి. ఎందుకంటే ఫ్లాగ్‌ను మార్చడం ఒక లైన్ పని మాత్రమే, కానీ దాని పరిణామాలు అలా ఉండవు.

మీ స్వంత ఫలితాలను ఎలా అంచనా వేయాలి

ప్రచురించబడిన సంఖ్యలు SWE-bench Liteలో ప్రాజెక్ట్ యొక్క హార్నెస్‌పై వచ్చినవి. మీ రిపోజిటరీ SWE-bench Lite కాదు. కాబట్టి మీ స్వంత ఫలితాలను మీరే అంచనా వేసుకోండి.

  • ప్రాక్సీ లేకుండా ఒక సాధారణ వారం పాటు పని చేయండి. మీ ప్రొవైడర్ యొక్క usage పేజీ నుండి ఇన్‌పుట్ టోకెన్లు, క్యాష్-రీడ్ టోకెన్లు మరియు అవుట్‌పుట్ టోకెన్లను విడివిడి లైన్లుగా నమోదు చేయండి; మొత్తం డాలర్ విలువను మాత్రమే చూడకండి.
  • తర్వాతి వారం ప్రాక్సీని ముందు ఉంచి, అదే రకమైన పనిని చేయండి.
  • ఇన్‌పుట్ మరియు క్యాష్-రీడ్ లైన్లను పోల్చండి. అవుట్‌పుట్ దాదాపు సమానంగా ఉండాలి, ఎందుకంటే దేనినీ కంప్రెస్ చేయలేదు. ఒకవేళ అవుట్‌పుట్ గణనీయంగా మారితే, ప్రాక్సీ కాకుండా వేరే ఏదో అంశం మారినట్లు అర్థం.
  • మీరు తిరిగి చేయాల్సి వచ్చిన పనులను లెక్కించండి. ఇది నాణ్యతకు సంబంధించిన అంశం, దీనిని ఏ డాష్‌బోర్డ్ చూపించదు.
  • మొత్తాలను పోల్చే ముందు రెండవ వారం యొక్క GPU గంటలను కూడా పరిగణనలోకి తీసుకోండి.

ఇన్‌పుట్ మరియు అవుట్‌పుట్‌లను వేరు చేయడం ముఖ్యం, ఎందుకంటే రెండింటి ధరలు చాలా భిన్నంగా ఉంటాయి మరియు కంప్రెసర్ వాటిలో ఒకదానిపైనే పనిచేస్తుంది. ఆగస్టు 2026 నాటికి, Claude Sonnet 4.6 ధర మిలియన్ ఇన్‌పుట్ టోకెన్లకు $3 మరియు మిలియన్ అవుట్‌పుట్ టోకెన్లకు $15. ప్రాంప్ట్-క్యాష్ రీడ్ ధర ఇన్‌పుట్ రేటులో 10%, అంటే మిలియన్ టోకెన్లకు $0.30. ఇన్‌పుట్ మరియు అవుట్‌పుట్ టోకెన్ ధరల మధ్య వ్యత్యాసం ఇన్‌పుట్-సైడ్ కంప్రెసర్ మీకు లాభదాయకమా కాదా అని నిర్ణయిస్తుంది. Claude Code టోకెన్లు వాస్తవానికి ఎక్కడికి వెళ్తాయి అనే అంశం మీ కాంటెక్స్ట్‌లో ఏ భాగం కంప్రెస్ చేయడానికి తగినంత పెద్దదిగా ఉందో తెలియజేస్తుంది.

ప్రాంప్ట్ క్యాషింగ్ ముఖ్యంగా టూల్-ఫిల్టర్ గణనలను క్లిష్టతరం చేస్తుంది. టూల్ బ్లాక్ అభ్యర్థన ప్రారంభంలో ఉంటుంది, కాబట్టి మొదటి టర్న్ తర్వాత ఇది సాధారణంగా 10% ఇన్‌పుట్ ధరతో క్యాష్ హిట్ అవుతుంది. క్యాష్ చేసిన బ్లాక్ నుండి 21,000 టోకెన్లను తొలగించడం వల్ల మిలియన్ టోకెన్లకు $0.30 చొప్పున సుమారు $0.006 ఆదా అవుతుంది, ఇది క్యాష్ చేయని రేటు ప్రకారం వచ్చే $0.063 కంటే తక్కువ. ప్రాజెక్ట్ ఫిల్టర్ చేసిన బ్లాక్‌ను సెషన్ కోసం అలాగే ఉంచుతుంది, తద్వారా క్యాష్ చేసిన ప్రిఫిక్స్ మారదు. ప్రతి టర్న్‌లో టూల్స్‌ను తిరిగి ఎంచుకునే ఫిల్టర్ ఆ ప్రిఫిక్స్‌ను చెల్లుబాటు కాకుండా చేస్తుంది మరియు ఆదా చేసే దానికంటే ఎక్కువ ఖర్చు అవుతుంది.

ఇంకా ధృవీకరించబడని అంశాలు

పైన పేర్కొన్న ప్రతి పనితీరు సంఖ్య ప్రాజెక్ట్ నుండే సేకరించబడింది. SWE-bench Lite ఫలితాలను స్వతంత్రంగా ఎవరూ పునరుత్పత్తి చేయలేదు. జూలై 2026 నాటి మొదటి ట్యాగ్‌లను బట్టి చూస్తే, ఈ కోడ్‌కు చాలా తక్కువ కార్యాచరణ చరిత్ర మాత్రమే ఉంది. కంప్రెషన్ రేటు మరియు నాణ్యత నిలుపుదల గణాంకాలు రెండింటినీ వాటి వల్ల ప్రయోజనం పొందే వారే కొలిచారు. ఇది ఆ గణాంకాలు తప్పు అని చెప్పదు, కానీ అవి ఇంకా ధృవీకరించబడలేదని అర్థం. మీరు స్వయంగా రూపొందించుకున్న సంఖ్యల కంటే వీటిని భిన్నంగా చూడాలి.

మీ సెటప్‌ను నిందించే ముందు ఒక డాక్యుమెంట్ చేయబడిన ప్రవర్తన గురించి తెలుసుకోవడం మంచిది. ఈ టూల్ ఫిల్టర్ ఉపయోగించే ఎంబెడ్డింగ్ మోడల్ స్టార్టప్‌లో కాకుండా, మొదటి అభ్యర్థన (request) వచ్చినప్పుడు లోడ్ అవుతుంది. కాబట్టి, ప్రాజెక్ట్ డాక్యుమెంటేషన్ ప్రకారం 10 నుండి 15 సెకన్ల వార్మ్-అప్ సమయం పడుతుంది, ఆ తర్వాత ప్రతి కాల్‌కు సుమారు 15 ms సమయం పడుతుంది. ప్రాక్సీ ప్రారంభమైన తర్వాత ఒక డమ్మీ అభ్యర్థనను పంపండి, దీనివల్ల మీ మొదటి అసలు ఏజెంట్ టర్న్ హ్యాంగ్ అయినట్లు అనిపించదు.

ఒక మధ్యాహ్న సమయంలో మీరు స్వయంగా నిర్ధారించుకోగల నాలుగు విషయాలు ఇవి: ప్రాక్సీ ప్రారంభమై స్థిరంగా ఉందా, మీరు పని చేస్తున్నప్పుడు /stats మారుతుందా, మీ ప్రొవైడర్ యొక్క ఇన్‌పుట్-టోకెన్ లైన్ నిజంగా తగ్గుతుందా, మరియు ఏజెంట్ పనిని పూర్తి చేయగలదా? ప్రచురించబడిన ఏ బెంచ్‌మార్క్ కంటే కూడా ఇవే మీ సెటప్‌కు సరైన నిర్ణయాన్ని అందిస్తాయి.

ఇది మీ ఇతర టూలింగ్‌తో ఎక్కడ సరిపోతుందంటే: self-hosted LiteLLM gateway అభ్యర్థనలను వాటి కంటెంట్‌ను మార్చకుండా రూట్ చేస్తుంది మరియు లెక్కిస్తుంది. కాబట్టి ఈ రెండూ వేర్వేరు సమస్యలను పరిష్కరిస్తాయి మరియు వీటిని ఒకదాని తర్వాత ఒకటి వాడవచ్చు, ఇందులో Paritok ఏజెంట్‌కు అత్యంత దగ్గరగా ఉంటుంది. ఒకవేళ మీ అసలు లక్ష్యం ఈ నిర్దిష్ట టూల్ కంటే బిల్లును తగ్గించుకోవడమే అయితే, VPSపై ఏజెంట్ కోసం విస్తృతమైన ఖర్చు నియంత్రణలు అనే విభాగంలో ఖర్చు లేని అనేక మార్పులు ఉన్నాయి, వాటిని ముందుగా ప్రయత్నించవచ్చు.

FAQ

Paritok నా API బిల్లును తగ్గిస్తుందా లేదా కేవలం context వినియోగాన్ని మాత్రమేనా?

ఇది బిల్లును తగ్గిస్తుంది, ఎందుకంటే proxy అభ్యర్థనను provider కి చేరకముందే తిరిగి రాస్తుంది (rewrite చేస్తుంది) మరియు provider తనకు అందిన దానికే ఛార్జ్ చేస్తుంది. ఆ తగ్గింపు పరిమాణం మీరు అనుకున్న దానికంటే తక్కువగా ఉండవచ్చు. 74% అనేది కంప్రెస్ చేయబడిన కంటెంట్ యొక్క కంప్రెషన్ రేటు మాత్రమే. ఎండ్-టు-ఎండ్ లెక్కల ప్రకారం, ఈ ప్రాజెక్ట్ ఒకే turn లో సుమారు 25% మరియు 20వ turn నాటికి 63% తగ్గింపును చూపుతుంది, మరియు కేవలం input tokens మాత్రమే ప్రభావితమవుతాయి. Output tokens ఏ మార్పు లేకుండానే వెళ్ళిపోతాయి.

కంప్రెషన్ మోడల్‌ను self-host చేయడానికి నాకు ఎంత GPU అవసరం?

q4 బిల్డ్ సుమారు 2.5 GB మరియు bf16 బిల్డ్ సుమారు 8 GB ఉంటుంది, కాబట్టి ఈ మోడల్ 24 GB కార్డులో చాలా ఖాళీ స్థలంతో సరిపోతుంది. చిన్న కార్డు కూడా పనిచేస్తుంది, ఇది మీ ఖర్చుల లెక్కలను మీకు అనుకూలంగా మారుస్తుంది. Tool-schema ఫిల్టర్‌కు అసలు GPU అవసరం లేదు: ఇది BAAI/bge-small-en-v1.5 ను ఉపయోగిస్తుంది, ఇది 130 MB పరిమాణం గల embedding మోడల్ మరియు CPU పైనే నడుస్తుంది. సాధారణ VPS పై paritok[toolselect] ని ఇన్‌స్టాల్ చేయండి, తక్కువ RAM ఖర్చుతోనే మీరు tool-block తగ్గింపును పొందవచ్చు.

కంప్రెసర్ ఏజెంట్‌కు అవసరమైన ఏదైనా సమాచారాన్ని తొలగిస్తే ఏమవుతుంది?

ఏదీ తొలగించబడదు. కంప్రెస్ చేయబడిన విభాగాలు [REF:id] ట్యాగ్‌ను కలిగి ఉంటాయి మరియు మోడల్ read_original లేదా expand_context తో పూర్తి వచనాన్ని తిరిగి పొందుతుంది. ఫిల్టర్ చేయబడిన tool schemas తొలగించబడవు, కేవలం stub చేయబడతాయి మరియు మోడల్ gateway_search_tools తో వాటిని తిరిగి పొందుతుంది. అసలైన ప్రమాదం ఏమిటంటే: మోడల్ ఒక lossy summary నుండి పనిచేస్తుంది మరియు అసలు సమాచారం కోసం అడగాలని దానికి తెలియకపోవచ్చు. SWE-bench Lite లోని 86.5% quality-retained గణాంకం దీనినే కొలుస్తుంది.

నా మొదటి అభ్యర్థన ఎందుకు పదిహేను సెకన్ల సమయం తీసుకుంటుంది?

Tool ఫిల్టర్ వెనుక ఉన్న embedding మోడల్ ప్రారంభంలో కాకుండా, మొదటి అభ్యర్థన వచ్చినప్పుడు లోడ్ అవుతుంది. ఈ ప్రాజెక్ట్ డాక్యుమెంటేషన్ ప్రకారం 10 నుండి 15 సెకన్ల warm-up సమయం పడుతుంది, ఆ తర్వాత ప్రతి కాల్‌కు సుమారు 15 ms సమయం పడుతుంది. Proxy ని ప్రారంభించిన తర్వాత curl తో ఒక చిన్న అభ్యర్థనను పంపండి, దీనివల్ల మొదటి అసలైన ఏజెంట్ turn ఆలస్యం అవ్వదు.

నేను self-hosting కు బదులుగా hosted GPU సర్వర్‌ను ఉపయోగించాలా?

ఇది GPU అద్దె మరియు నిర్వహణ భారాన్ని తగ్గిస్తుంది, ఆగస్టు 2026 నాటికి దీని ధర ప్రతి మిలియన్ tokens కు $0.30 గా ఉంది. అయితే ఇది మీ prompts మరియు మీ ఏజెంట్ చదివే ఫైళ్లను మీ మోడల్ provider కి చేరకముందే మూడవ పక్షానికి పంపుతుంది. మీరు మీ నియంత్రణలో ఉన్న మౌలిక సదుపాయాలపై కోడ్‌ను ఉంచడానికి self-hosting చేస్తున్నట్లయితే, ఈ సెట్టింగ్ మీరు ప్రారంభించిన ఉద్దేశాన్ని దెబ్బతీస్తుంది. Self-hosting ద్వారా context మరియు provider API key రెండూ మీ సొంత సర్వర్‌లోనే సురక్షితంగా ఉంటాయి.