GPU VPS au API tokens: ni ipi nafuu zaidi?
Gundua fomula ya kukokotoa gharama kati ya kukodisha GPU VPS na malipo ya API kwa kila token. Jifunze kiwango cha matumizi ambapo GPU VPS inakuwa nafuu zaidi kuliko API.
Mahali ambapo gharama inalingana
GPU VPS inashinda mfumo wa malipo ya API kwa kila token katika hatua moja: wakati kodi ya kila mwezi isiyobadilika, ikigawanywa kwa idadi ya token unazozalisha mwezi huo, inaposhuka chini ya gharama inayotozwa na API kwa token hizo hizo. Kodi haibadiliki. Bili ya API hubadilika kwa kila ombi. Kwa hivyo, jibu ni kiasi cha matumizi ya kila mwezi, si jibu la ndiyo au hapana.
Fanya hesabu kwa GPU VPS ya kiwango cha kati kwa $0.50 kwa saa, ambayo ni $365 kwa mwezi wa saa 730. Ukilinganisha na API ya mfano wa hali ya juu (frontier model), utafikia usawa wa gharama kwa 24.3 milioni ya token za matokeo kwa mwezi. Ukilinganisha na mfano mdogo wa kibiashara, ni 73 milioni. Ukilinganisha na mfano wa open-weight uliopangishwa wa ukubwa uleule, hutafikia usawa kamwe, kwa sababu kadi moja haiwezi kuzalisha token za kutosha kwa mwezi ili kufikia hatua hiyo ya makutano.
Utafiti uliochapishwa kuhusu usawa wa gharama haujibu swali hili. Utafiti mbili kutoka mapema mwaka 2026 unaweka hatua ya makutano karibu na 72% ya matumizi endelevu kwenye H200, na kati ya 22% na 48% ya mzunguko wa kazi (duty cycle) kwenye MI300X. Zote mbili zinalinganisha na bidhaa ya serverless ya muuzaji yuleyule, na zote mbili zinapiga bei ya vichapuzi (accelerators) vinavyogharimu zaidi kwa saa kuliko kile ambacho wasomaji wengi hapa hutumia kwa mwezi. Hesabu ni ileile. Yafuatayo yanafanya upya hesabu hiyo kwa kadi moja, mfano mmoja wa wazi (open model) katika kiwango cha 7B hadi 30B, na malipo ya kawaida ya API.
Kila namba hapa chini ni ingizo, si matokeo. Badilisha yote na namba zako mwenyewe.
The formula, so you can substitute your own numbers
cost_per_million = (hourly_rate * 1000000) / (tokens_per_second * 3600 * duty_cycle)
breakeven_millions_per_month = (hourly_rate * hours_per_month) / api_price_per_million
capacity_millions_per_month = (tokens_per_second * 3600 * hours_per_month) / 1000000
required_duty_cycle = breakeven_millions_per_month / capacity_millions_per_monthFour inputs, and you can measure or look up all four.
hourly_rateis what the GPU VPS costs per hour, counting the hours it sits idle. If you pay monthly, divide the monthly price by 730.tokens_per_secondis the aggregate output rate your server sustains under your real concurrency. It is not the single-stream number from a vendor chart.duty_cycleis the fraction of the month the GPU spends generating tokens. A box you rent all month and use for two hours a day sits at 8.3%.api_price_per_millionis the metered price you are comparing against, for output tokens.
The example prices output tokens on both sides, because output dominates the bill for chat and agent work. If your prompts are long, add input to both sides. On the API side that is a separate line on the invoice. On your own card, prefill consumes GPU time, so it already shows up as a lower measured tokens_per_second.
Jinsi ya kupima tokens kwa sekunde kabla ya kuamini hesabu
Kila kitu hapo juu kinategemea namba moja iliyopimwa. Ukiikosea kwa mara tatu, jibu litakosewa kwa mara tatu. Ipime kwenye kadi unayokodisha, ukitumia model na quantisation utakayotumia kihalisi.
Ollama inakupa takwimu ya single-stream kwa amri moja:
ollama run qwen3:8b --verbose "Write 400 words about disk latency."--verbose huchapisha block ya muda baada ya jibu. Laini inayohitajika ni eval rate, katika tokens kwa sekunde, ambayo huhesabu uzalishaji pekee. prompt eval rate ni kasi ya prefill na kwa kawaida huwa juu zaidi. Namba zako zitatofautiana na hizi:
eval count: 412 token(s)
eval duration: 9.612s
eval rate: 42.86 tokens/sSingle stream si namba sahihi kwa ajili ya mfumo wa gharama, kwa sababu hupima ombi moja kwa wakati kwenye kadi inayoweza kuhudumia mengi kwa mara moja. Kwa takwimu ya jumla, hudumia model hiyo kwa vLLM na usome throughput ambayo seva inajiripoti yenyewe:
pip install vllm
vllm serve Qwen/Qwen3-8B --max-model-len 8192Wakati maombi yakiwa yanaendelea, seva hurekodi laini ya hali katika kila muda wa kuripoti. Sehemu kamili hubadilika kati ya releases za vLLM, kwa hivyo soma za kwako badala ya zangu:
Avg prompt throughput: 812.4 tokens/s, Avg generation throughput: 396.1 tokens/s, Running: 16 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.7%Avg generation throughput ndiyo namba inayotakiwa na fomula. Hupanda kadiri unavyoongeza maombi ya wakati mmoja hadi KV cache (key-value cache, hali ya attention ya kila ombi ambayo vLLM huihifadhi kwenye VRAM) imejaa, kisha huacha kupanda. Ukizidisha hapo, maombi hupanga foleni badala ya kwenda haraka, jambo unaloliona kama ongezeko la hesabu ya Waiting. vLLM pia husafirisha load generator, vllm bench serve. Flags zake hubadilika kati ya versions, kwa hivyo endesha vllm bench serve --help kwenye version uliyoiweka badala ya kunakili amri kutoka kwenye blog post.
Angalia kadi wakati jaribio likiendelea:
nvidia-smi --query-gpu=utilization.gpu,memory.used,power.draw --format=csv -l 5Kama utilization.gpu inakaa karibu na 100% wakati wa uzalishaji, una kikomo cha throughput na namba uliyopima ndiyo ukomo halisi. Kama inakaa chini, kitu kingine ndicho kikomo: maombi machache ya wakati mmoja, client ya polepole, au model isiyotoshea kwenye VRAM na inayohamishiwa sehemu kwenye system RAM. Ollama na vLLM hufanya trade-offs tofauti sana hapa, na pengo kati yao kwenye kadi moja ni kubwa kutosha kubadili break-even yako kwa mara kadhaa.
Muonekano wa bili kwa mwezi mzima
Mfano huu unatumia VPS ya GPU ya 24 GB kwa $0.50 kwa saa, ikitumia modeli ya 8B iliyofunguliwa kupitia vLLM, inayozalisha token 400 kwa sekunde kwa jumla na maombi 16 yanayofanyika kwa wakati mmoja. Kodi ni ya kudumu bila kujali kama unaitumia kadi hiyo au la. Uwezo wa kiwango hicho ni token milioni 1,051 kwa mwezi, kiasi ambacho kadi huzalisha ikiwa haitasimama hata kidogo.
The data behind this chart
[
{
"output_tokens_millions": 5,
"gpu_vps_usd": 365,
"open_api_usd": 1,
"small_api_usd": 25,
"frontier_api_usd": 75
},
{
"output_tokens_millions": 10,
"gpu_vps_usd": 365,
"open_api_usd": 2,
"small_api_usd": 50,
"frontier_api_usd": 150
},
{
"output_tokens_millions": 25,
"gpu_vps_usd": 365,
"open_api_usd": 5,
"small_api_usd": 125,
"frontier_api_usd": 375
},
{
"output_tokens_millions": 50,
"gpu_vps_usd": 365,
"open_api_usd": 10,
"small_api_usd": 250,
"frontier_api_usd": 750
},
{
"output_tokens_millions": 100,
"gpu_vps_usd": 365,
"open_api_usd": 20,
"small_api_usd": 500,
"frontier_api_usd": 1500
},
{
"output_tokens_millions": 250,
"gpu_vps_usd": 365,
"open_api_usd": 50,
"small_api_usd": 1250,
"frontier_api_usd": 3750
},
{
"output_tokens_millions": 500,
"gpu_vps_usd": 365,
"open_api_usd": 100,
"small_api_usd": 2500,
"frontier_api_usd": 7500
},
{
"output_tokens_millions": 1000,
"gpu_vps_usd": 365,
"open_api_usd": 200,
"small_api_usd": 5000,
"frontier_api_usd": 15000
}
]Mstari wa GPU ni tambarare kwenye 365 dola kwa sababu kodi haijali unachofanya na kadi hiyo. Kila mstari wa API ni mstari ulionyooka kupitia sifuri. Kila jozi hukutana mara moja tu.
Katika token milioni 25 kwa mwezi, API ya frontier inatoza 375 dola, hivyo pande zote mbili zinatofautiana kwa chini ya dola kumi. Katika milioni 50, modeli ndogo ya kibiashara inatoza 250 dola na bado ndiyo chaguo nafuu zaidi. Katika token milioni 1000, ambazo zinahitaji kadi iwe na shughuli kwa 95% ya mwezi, API ya open-weight inayohudumiwa inatoza 200 dola dhidi ya kodi hiyo hiyo. Kadi inashindwa kwa karibu mara mbili katika kiwango hicho ambapo inafanya kazi kwa bidii zaidi.
Matokeo hayo ya mwisho huwashangaza watu, na si bahati mbaya. Endpoint ya open-weight inayohudumiwa ni kundi la GPU linaloendeshwa kwa matumizi ya juu, hivyo bei yake inakaribia gharama ya kadi iliyojaa kazi. Huwezi kushinda kundi lililojaa kazi kwa kukodisha kadi moja na kuiendesha kwa mzigo mdogo. Unachoweza kushinda ni bei za frontier, ambazo hupangwa kulingana na uwezo badala ya muda wa silicon.
Gharama kwa kila milioni ya tokeni za pato katika kila mzunguko wa utendaji
Kiasi cha matumizi na mzunguko wa utendaji ni ukweli mmoja unaoonekana kwa mitazamo miwili. Kukodisha kunanunua saa. Saa za kutofanya kazi hazizalishi chochote na bado zinagharimu pesa.
The data behind this chart
[
{
"label": "100% duty",
"self_host_usd_per_million": "0.35",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "50% duty",
"self_host_usd_per_million": "0.69",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "25% duty",
"self_host_usd_per_million": "1.39",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "10% duty",
"self_host_usd_per_million": "3.47",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "5% duty",
"self_host_usd_per_million": "6.94",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "2% duty",
"self_host_usd_per_million": "17.36",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
}
]Safu wima tatu za API ni bei za kawaida zilizochapishwa kufikia Agosti 2026: 0.20 dola kwa kila milioni ya tokeni za pato kwa modeli ya 8B ya uzito wazi inayohudumiwa, 5.00 dola kwa modeli ndogo ya kibiashara, na 15.00 dola kwa modeli ya kiwango cha juu. Hizi ni kwa ajili ya kutoa mfano. Angalia ukurasa wa bei wa leo kabla ya kufanya uamuzi wowote, na ikiwa ulinganisho wako ni dhidi ya mpango wa kila mwezi wa bei isiyobadilika badala ya tokeni zinazopimwa, hesabu za usajili hufanya kazi kwa njia tofauti na hatua ya makutano hubadilika tena.
Endesha kadi kwa uwezo wake wote na milioni ya tokeni za pato itagharimu 0.35 dola, ambayo ni nafuu kweli. Katika mzunguko wa utendaji wa 10%, milioni hiyo hiyo inagharimu 3.47 dola. Katika mzunguko wa utendaji wa 2%, inagharimu 17.36 dola, ambayo haiko katika kiwango sawa na 0.20 dola ambazo modeli ya wazi inayohudumiwa inatoza kwa pato linalofanana.
Chini ya takriban 10% ya mzunguko wa utendaji, kukodisha GPU ndilo chaguo la gharama kubwa. Unalipa 3.47 dola kwa kila milioni ya tokeni kwa pato linalouzwa kwa 0.20 dola, na unachonunua kwa tofauti hiyo ni faragha na bili isiyobadilika. Hivyo vinaweza kuwa na thamani ya pesa halisi. Sio ushindi wa bei, kwa hivyo usiviweke kwenye kategoria hiyo.
Kiwango cha mapato kinacholingana na gharama (break-even volume) kwa kila ngazi ya API
The data behind this chart
[
{
"label": "Hosted open 8B API",
"breakeven_tokens_millions": 1825,
"required_duty_pct": 174
},
{
"label": "Small commercial model",
"breakeven_tokens_millions": 73,
"required_duty_pct": 6.9
},
{
"label": "Frontier model",
"breakeven_tokens_millions": 24.3,
"required_duty_pct": 2.3
}
]Kwa ngazi ya frontier, unahitaji 24.3 milioni za output tokens kwa mwezi, ambazo ni 2.3% tu ya uwezo wa kadi hiyo. Hili ni sharti dogo. Timu ndogo inayoendesha coding agents wakati wa saa za kazi inafikia kiwango hiki.
Kwa ngazi ya small commercial, unahitaji 73 milioni za tokens kwa mwezi, au 6.9% ya duty cycle. Kwa ngazi ya hosted open-weight, duty cycle inayohitajika ni 174%. Kila kitu kilicho juu ya 100% hakiwezekani kwa ufafanuzi: kadi ingelazimika kufanya kazi kwa saa nyingi zaidi kuliko zilizopo ndani ya mwezi. Kadi moja ya kiwango cha kati kwa bei hii ya saa haiwezi kushinda kulinganisho huo, kwa hivyo njia pekee za kubadilisha matokeo ni kutumia kadi ya bei nafuu, kadi ya haraka zaidi, au sababu nyingine isiyo ya bei.
Mambo ambayo fomula haionyeshi
Fomula hii hupiga hesabu ya gharama za saa za GPU na tokeni. Kuna gharama nyingine kadhaa ambazo hazimo kwenye fomula hiyo.
Cold starts. Model ya 8B yenye uzito wa 16-bit ina ukubwa wa takriban 16 GB, na kuipakia kutoka kwenye diski ya ndani kwenda kwenye VRAM huchukua makumi ya sekunde. Ukizima seva kati ya matumizi ili kuokoa kodi, utalazimika kusubiri muda huo kila unapotuma ombi la kwanza. Ukiacha seva ikiwaka ili kuepuka kusubiri, muda wa matumizi (duty cycle) hupungua, jambo linalopandisha gharama kwa kila tokeni. Biashara hiyo ndiyo sababu kuu ya kuwepo kwa serverless inference.
Hifadhi na upakuaji. Uzito wa model ni mkubwa. Model ya 8B ya 16-bit ni takriban 16 GB, model ya 30B iliyopunguzwa ubora (quantised) hadi 4-bit ni takriban 18 GB, na model ya 30B ya 16-bit haitoshi kabisa kwenye kadi ya 24 GB. Kikomo hufikiwa haraka sana, ambapo kuendesha model ya wazi yenye parameta trilioni kama Kimi K3 inamaanisha kuwa uzito wake pekee unazidi uwezo wa kadi yoyote unayoweza kukodisha kwa saa. Unalipia diski hiyo kila mwezi, na unalipia kwa muda kila unapoijenga upya. Tekeleza du -sh ~/.cache/huggingface/hub baada ya wiki moja ya majaribio. Inakua kwa kasi kuliko unavyotarajia, kwa sababu kila quantisation uliyojaribu mara moja bado ipo hapo.
Muda wako binafsi. Matoleo ya driver na CUDA, makosa ya out-of-memory kwenye urefu wa muktadha (context length) uliokuwa ukifanya kazi jana, sasisho la model linalobadilisha chat template. Hakuna hata moja kati ya haya linaloonekana kwenye takwimu ya gharama kwa kila tokeni, na yote hayo yanagharimu muda wako wa jioni. Ikiwa hujawahi kukadiria ukubwa wa seva hizi hapo awali, kile ambacho GPU VPS inakupa kihalisi ni vyema kusoma kabla ya kujifunga na mkataba wa kodi ya mwezi mzima.
Pengo la ubora. Hii ndiyo gharama kubwa zaidi iliyofichika na iliyo ngumu zaidi kupangiwa bei. Model ya wazi ya 8B si model ya kiwango cha juu (frontier model). Ikiwa inahitaji majaribio matatu ambapo model ya kiwango cha juu inahitaji moja, bei yake halisi kwa kila jibu sahihi ni mara tatu ya thamani ya kwenye chati, na inaweza kushindwa kutekeleza kazi hiyo hata hivyo. Linganisha kwa kutumia prompts zako mwenyewe kabla ya kulinganisha kwa bei. Kwa kazi za wakala (agent workloads), jibu la kawaida ni kuelekeza kazi kulingana na ugumu na kutumia tokeni za bei nafuu za ndani kwa kazi nyingi, jambo ambalo ndilo kiini cha kudhibiti matumizi ya wakala kwenye VPS.
Bili ulizosahau. Instance ya GPU ya saa ambayo umezima mara nyingi huendelea kutoza ada kwa ajili ya hifadhi iliyounganishwa na anwani ya IP iliyotengwa. Soma ankara (invoice), si ukurasa wa bei.
Wakati self-hosting inaposhinda kwa sababu nyingine isiyo ya bei
Visa vinne ambavyo hesabu ya gharama si kigezo cha uamuzi.
- Data ambayo haiwezi kutoka chini ya udhibiti wako. Ikiwa kanuni ya utiifu inakataza kutuma maandishi kwa wahusika wengine, bei kwa kila token si swali linaloulizwa.
- Kiasi kikubwa cha kazi kwa ratiba maalum. Kazi ya batch classification inayofanya kazi kwa saa sita kila usiku inatumia 25% ya muda wa seva kwa mpangilio wake, na haikushangazi kamwe na ankara ya malipo.
- Vikomo vya kasi (Rate limits). Kadi yako ina foleni moja na ni mali yako pekee.
- Model ambayo hakuna API inayotoa. Ikiwa unahitaji fine-tune maalum, hakuna kitu cha kulinganisha nacho.
Ikiwa unataka kujaribu toleo la bei nafuu kwanza, kuendesha model ndogo kwenye VPS kwa kutumia Ollama inachukua mchana mmoja tu, na kupima model ya wazi dhidi ya kadi unayoweza kukodisha inakuonyesha ni GPU ipi unayohitaji kihalisi. Pima hapo kabla ya kujisajili kwa mwezi mzima wa kukodisha GPU.
FAQ
Je, ni kiasi gani cha token kwa mwezi kinachofanya GPU VPS kuwa nafuu kuliko bei za API?
Gawanya gharama ya kila mwezi ya GPU kwa bei ya API kwa kila milioni ya token zinazozalishwa. Kadi inayokodishwa kwa $365 kwa mwezi, ikilinganishwa na API ya kiwango cha juu kwa 15.00 dola kwa kila milioni, inafikia uwiano wa gharama sawa katika 24.3 milioni ya token kwa mwezi. Ikilinganishwa na modeli ndogo ya kibiashara kwa 5.00 dola, ni 73 milioni. Ikilinganishwa na modeli ya open-weight inayohudumiwa kwa 0.20 dola, kadi moja ya kiwango cha kati haiwezi kuzalisha token za kutosha kwa mwezi ili kufikia uwiano huo.
Kwa nini API ya open-weight inayohudumiwa inagharimu kidogo kuliko GPU yangu binafsi?
Kwa sababu bei yake imepangwa karibu na gharama ya GPU inayotumika kikamilifu, na kadi yako haitumiki kikamilifu. Mtoa huduma anayehudumia maelfu ya maombi kwa wakati mmoja huweka vifaa vyake karibu na uwezo wa juu, hivyo anaweza kuuza token karibu na gharama halisi ya uzalishaji. Kadi yako haifanyi kazi kwa sehemu kubwa ya siku na unalipia saa hizo za kutofanya kazi. Katika kiwango cha matumizi cha 10%, gharama yako ni 3.47 dola kwa kila milioni ya token zinazozalishwa dhidi ya 0.20 dola zao.
Je, nihesabu token za kuingiza (input) pamoja na token za kutoa (output)?
Zihesabu ikiwa maelekezo (prompts) yako ni marefu. Ulinganisho huu unatumia token za kutoa pekee, ambazo ndizo msingi mkuu wa kazi za chat na wakala. Kuongeza token za kuingiza kunabadilisha pande zote mbili. Kwa upande wa API, ni mstari tofauti na wa bei ya chini kwenye ankara. Kwenye kadi yako, prefill hutumia muda wa GPU, kwa hivyo gharama tayari imo ndani ya jumla ya token kwa sekunde uliyopima. Pima kwa kutumia urefu halisi wa maelekezo yako ili pande hizo mbili zilinganike.
Ninawezaje kupima token kwa sekunde ambazo fomula inahitaji?
Hudumia modeli kwa njia utakayoitumia, kisha soma kiwango cha jumla cha uzalishaji chini ya matumizi halisi ya wakati mmoja. Ukiwa na Ollama, ollama run <model> --verbose huchapisha eval rate katika token kwa sekunde, lakini huo ni mtiririko mmoja na hauwakilishi seva inayofanya kazi kwa makundi (batched). Ukiwa na vLLM, seva inayofanya kazi hurekodi Avg generation throughput wakati maombi yanashughulikiwa, na hiyo ndiyo takwimu ya kutumia. Fuatilia nvidia-smi wakati huo huo. Ikiwa matumizi ya GPU hayako karibu na 100% wakati wa uzalishaji, bado hujafikia uwezo wa juu wa kadi hiyo.
Je, inafaa kukodisha GPU VPS ikiwa matumizi ni chini ya 10%?
Si kwa gharama. Katika kiwango cha matumizi cha 10% unalipa 3.47 dola kwa kila milioni ya token zinazozalishwa, na kwa 2% unalipa 17.36 dola. Vyote viko juu ya kila API inayotozwa kwa matumizi katika ulinganisho huu isipokuwa kiwango cha juu (frontier tier). Kodisha chini ya kiwango hicho tu ikiwa faragha au modeli ambayo hakuna API inayotoa ndiyo unayolipa.