VPS Yenye GPU: Unaihitaji Lini?
GPU huongeza kasi ya batch na nafasi kwa model kubwa, lakini chat za 7B hadi 27B zenye quantization, embeddings na Whisper small mara nyingi zinaweza kuanza kwenye CPU.
Je, unahitaji VPS yenye GPU, au CPU inatosha?
VPS yenye GPU hubadilisha mambo mawili kuhusu kuendesha model mwenyewe: kasi ya tokeni kuzalishwa na ukubwa wa model unaoweza kutoshea kwenye kumbukumbu. Haibadilishi jambo lingine lolote. Ikiwa mzigo wako ni wa chat model yenye quantization ya 7B hadi 27B inayomjibu mtu mmoja kwa wakati mmoja, kazi ya embedding yenye ujazo mdogo, au unukuzi wa sauti kwa Whisper small, VPS ya kawaida yenye CPU na RAM ya kutosha tayari inaweza kufanya kazi hiyo. Anza kwa CPU, pima namba inayokusumbua, kisha boresha mfumo.
Sababu ni bandwidth ya kumbukumbu. Language model inapozalisha tokeni moja, husoma kila weight inayohitaji kutoka kwenye kumbukumbu. Model ya 8B iliyo na quantization ya biti 4 ina ukubwa wa takriban 4.7 GB kwenye diski na karibu ukubwa huo huo kwenye kumbukumbu. Kwa hiyo, kuzalisha tokeni moja kunamaanisha kuhamisha takriban 4.7 GB. Gawanya bandwidth ya kumbukumbu ya mashine kwa namba hiyo, na utapata kiwango cha juu cha tokeni kwa sekunde. Mgawanyo huo mmoja unaeleza karibu kila benchmark utakayosoma.
GPU inakupatia nini hasa
Kipimo data. DDR5 ya seva kwenye hosti ya kisasa huhamisha makumi ya gigabaiti kwa sekunde. Kumbukumbu ya GPU (VRAM, video RAM) huhamisha mamia hadi zaidi ya gigabaiti 1,000 kwa sekunde. Uwiano huo ndio ongezeko la kasi, na ni mkubwa.
Uwezo pamoja na kasi. Kompyuta yenye CPU na RAM ya GB 64 inaweza kupakia modeli ya 70B kwa biti 4. Itaendesha modeli hiyo, lakini kwa kasi iliyo karibu zaidi na kusoma kuliko mazungumzo. GPU husaidia hapa tu ikiwa modeli inatoshea kwenye VRAM, kwa sababu tabaka zinapoanza kuhamishiwa kwenye RAM ya mfumo, njia ya polepole hutawala tena.
Uzalishaji wa batch. Hili ndilo jambo ambalo watu hulidharau. GPU inapozalisha majibu kwa mtumiaji mmoja, sehemu kubwa ya uwezo wake wa ukokotoaji hubaki bila kutumika kwa sababu inasubiri kumbukumbu. Ukihudumia maombi 20 kwa wakati mmoja, usomaji huo wa uzani hutumiwa na yote 20. Jumla ya tokeni kwa sekunde huongezeka mara kadhaa, huku kasi ya kila mtumiaji ikipungua kidogo tu. CPU haifanyi hivi. Watumiaji wawili wanaofanya maombi kwa wakati mmoja kwenye kompyuta yenye CPU hupunguza kasi ya kila mmoja kwa takriban nusu. Ikiwa unaunda API inayotumiwa na wateja wengi, batching ndio hoja kuu ya kutumia GPU, zaidi ya kasi ghafi ya mkondo mmoja.
Uchakataji wa prompt. Kusoma prompt ndefu hutegemea uwezo wa ukokotoaji, si kipimo cha kumbukumbu, na hapa GPU hushinda kwa tofauti kubwa zaidi. Muktadha wa tokeni 30,000 ambao CPU huuchakata kwa dakika moja huchukua sekunde chache kwenye GPU. Mipangilio ya retrieval inayoweka hati kwenye kila ombi hukumbana na hali hii kila mara.
Makadirio ya takriban, na jinsi ya kuyasoma
Kizuizi kilicho hapa chini kina takwimu za kawaida zilizochapishwa za mtiririko mmoja kwa modeli ya 8B yenye quantization ya biti 4, kufikia Julai 2026. Hizi ni mwongozo wa kiwango cha ukubwa, si ahadi. Quantization yako, urefu wa muktadha na injini ya inference vitazibadilisha.
The data behind this chart
[
{
"label": "8 vCPU, DDR4",
"mem_bandwidth_gbs": 40,
"tokens_per_sec": 6
},
{
"label": "16 vCPU, DDR5",
"mem_bandwidth_gbs": 75,
"tokens_per_sec": 11
},
{
"label": "24GB GPU",
"mem_bandwidth_gbs": 300,
"tokens_per_sec": 50
},
{
"label": "40GB data-centre GPU",
"mem_bandwidth_gbs": 1555,
"tokens_per_sec": 130
}
]Mstari wa GPU ya 24 GB unaonyesha 50 tokens kwa sekunde, ikilinganishwa na 11 kwa kompyuta yenye CPU ya DDR5. Hiyo ni takriban mara tano, hali inayoendana na uwiano wa bandwidth badala ya tofauti yoyote katika uwezo ghafi wa computation. Throughput halisi pia huwa chini ya bandwidth iliyogawanywa kwa ukubwa wa modeli, kwa sababu attention kwenye muktadha unaokua huongeza kazi ambayo mgawanyo huo rahisi hauizingatii.
Kwa kulinganisha, mtu husoma takriban maneno 5 hadi 10 kwa sekunde. Kiwango chochote cha tokens 15 kwa sekunde au zaidi tayari huhisi kama uandishi wa kawaida kwa msomaji mmoja. Ndiyo sababu mipangilio mingi inayotumia CPU pekee inatosha bila kuleta usumbufu.
Kupima VRAM kabla ya kununua
Ukubwa wa faili ya model ni kiwango cha chini, si mahitaji kamili. Panga nafasi ya weights, pamoja na KV cache (key-value cache, kumbukumbu ya kila token inayotunzwa na attention), na takriban GB 1 ya nafasi ya ziada.
Kanuni inayotumika kwa vitendo kufikia Julai 2026: chukua ukubwa wa faili ya model kwa gigabaiti na uongeze asilimia 20 kwa context ya kawaida ya 8k hadi 16k. Model ya 4.7 GB yenye 8B inahitaji takriban GB 6 za VRAM. Model ya 27B yenye bits 4 ina ukubwa wa karibu GB 16 na inahitaji takriban GB 20. Model ya 70B yenye bits 4 ina ukubwa wa karibu GB 40 na inahitaji kadi ya GB 48, au kadi mbili ndogo.
Context ndefu huvunja kanuni hii. KV cache hukua kwa uwiano wa moja kwa moja na urefu wa context, na katika token 128k inaweza kuzidi weights yenyewe. Ikiwa unapanga kutumia context ndefu, pima mahitaji kwa kuanza na cache na uangalie chaguo ambazo engine yako inatoa kwa cache quantization.
Kagua kile mashine ilicho nacho kwa hakika
Kwenye GPU instance, thibitisha kwanza kwamba driver inalitambua kadi kabla ya kufanya jambo lingine.
nvidia-smiUnapaswa kuona jedwali linaloorodhesha jina la GPU, toleo la driver, na memory iliyotumika kati ya jumla. NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver inamaanisha driver haipo, au kernel module haikujengwa upya baada ya kernel upgrade. Kwenye stock Ubuntu image, marekebisho kwa kawaida ni sudo apt install -y ubuntu-drivers-common && sudo ubuntu-drivers install, kisha uanze upya ili module mpya ipakie.
Kwa containers, driver pekee haitoshi. Docker inahitaji NVIDIA Container Toolkit ili kupitisha kifaa.
sudo apt-get update && sudo apt-get install -y --no-install-recommends ca-certificates curl gnupg2
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart dockerKisha thibitisha kwamba upitishaji unafanya kazi ukiwa ndani ya container:
sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smiJedwali hilohilo linapaswa kuonekana. Mstari wa docker: Error response from daemon: could not select device driver, unaotaja gpu capability ambayo haiwezi kutimizwa, unamaanisha kwamba toolkit imesakinishwa lakini Docker haikusanidiwa upya au kuanzishwa upya. Kwa hiyo, endesha tena mstari wa nvidia-ctk na restart. Katika Compose, sawa na hilo ni ingizo la deploy.resources.reservations.devices ambalo driver chake ni nvidia na orodha yake ya capabilities ina gpu. Ingizo hilo huwekwa kwenye service definitions za kawaida zilizofafanuliwa katika Docker Compose kwenye VPS.
Pima kabla ya kuboresha
Endesha modeli unayokusudia kutumia kwenye kompyuta ya CPU uliyo nayo tayari, kisha urekodi nambari hizo. Ukiwa na kujiendeshea mwenyewe Ollama na LLM kwenye VPS, unahitaji bendera moja tu:
ollama run llama3.1:8b --verbose "Summarise the causes of the 1929 crash in 200 words."Matokeo yanaishia kwa vipimo vya muda. eval rate ni kasi ya uzalishaji kwa tokeni kwa sekunde. prompt eval rate ni kasi ambayo mashine ilisoma ingizo lako. Nambari hizo mbili zinaonyesha ni uboreshaji upi utakaoleta faida: eval rate ikiwa ya chini huonyesha tatizo la kipimo data cha kumbukumbu, na prompt eval rate ikiwa ya chini kwenye maingizo marefu huonyesha tatizo la uwezo wa ukokotoaji.
Kwenye mashine yenye GPU, thibitisha kwamba modeli iliwekwa kwenye GPU:
ollama psSafu ya PROCESSOR huonyesha 100% GPU kila kitu kinapotoshea, au kitu kama 43%/57% CPU/GPU ikiwa hakikutoshea. Mgawanyo wa sehemu kwa kawaida huwa mbaya kuliko unavyotarajia, kwa sababu kila tokeni bado husubiri upande wa polepole.
Swali la gharama
Instance za GPU hugharimu mara kadhaa zaidi ya instance ya CPU yenye uwezo unaolingana, na hutoza kwa kila saa zinapokuwepo, si kwa idadi ya tokeni zinazozalishwa. GPU inayofanya kazi muda wote na kuhudumia maombi machache kwa siku ndiyo njia ghali zaidi ya kuendesha inference. Usawa wa gharama hupatikana kupitia kiwango cha matumizi: GPU inayotumika sana huwa na gharama ndogo kwa kila tokeni, lakini GPU isiyotumika ni upotevu mtupu.
Kuna mifumo mitatu inayotekelezeka. Weka kazi za kawaida zenye ujazo mdogo kwenye CPU VPS. Tuma ombi gumu linalotokea mara chache kwenye API inayopangishwa na ulipe kwa kila tokeni. Kodisha GPU kwa saa kwa kazi za batch, fine-tuning, au uundaji wa embeddings nyingi, kisha izime na kuiondoa. Kuchanganya mifumo hiyo ni jambo la kawaida, na nidhamu ya kupanga bajeti iliyoelezwa katika udhibiti wa gharama za wakala wa AI kwenye VPS inayofanya kazi muda wote inatumika pia hapa, isipokuwa kwamba muda wa kutotumika ndio uvujaji wa gharama badala ya idadi ya tokeni.
Kinachofanya kazi vizuri bila GPU
Embeddings kwa ujazo mdogo. Modeli ndogo ya embedding huchakata mamia ya hati fupi kwa dakika kwenye core chache za CPU. Indeksi unayoijenga mara moja haihitaji kuwa ya haraka.
Whisper small na base kwa unukuzi. Faster-whisper kwenye CPU hunukuu kwa kasi inayokaribia muda halisi kwa modeli small. Hii inatosha kwa pipeline inayofanya kazi usiku kucha.
Modeli za mazungumzo zilizopunguzwa usahihi hadi takriban 27B, kwa mtumiaji mmoja au wawili. Ni za polepole, lakini majibu yanasomeka na zinaweza kutumika.
Kazi yoyote unayoweza kuiita batch job. Ikiwa hakuna mtu anayefuatilia skrini, muda wa ukutani ni suala la upangaji ratiba, si hitaji la lazima.
Kinachohitaji GPU kwa kweli: kufunza au kufanya fine-tuning zaidi ya adapter ndogo, kuhudumia watumiaji wengi kwa wakati mmoja, kutengeneza picha na video, pamoja na hotuba ya muda halisi ambapo muda wa kusubiri ndio bidhaa.
FAQ
Ninahitaji VRAM kiasi gani kwa modeli ya 7B au 8B?
Takriban 6 GB kwa modeli ya 8B iliyopunguzwa kwa quantization ya biti 4, yenye muktadha wa kawaida wa 8k hadi 16k. Uzito wa modeli ni takriban 4.7 GB, na iliyobaki ni akiba ya KV pamoja na takriban 1 GB ya matumizi ya ziada. Kadi ya 12 GB huacha nafasi nzuri kwa miktadha mirefu. Ikiwa unapanga kutumia muktadha wa 128k, panga nafasi ya akiba hiyo kando, kwa sababu inaweza kuwa kubwa kuliko uzito wa modeli.
Je, ninaweza kuendesha Ollama bila GPU?
Ndiyo. Ollama hutumia CPU kiotomatiki na inahitaji RAM ya kutosha tu kuhifadhi modeli. Tarajia takriban tokeni 5 hadi 12 kwa sekunde kwa modeli ya 8B ya biti 4, kutegemea kasi ya kumbukumbu. Hii inakaribia kasi ya kusoma kwa mtumiaji mmoja. Maagizo marefu ndiyo changamoto kubwa kwenye CPU, kwa sababu kusoma tokeni 30,000 za muktadha hutegemea sana uwezo wa kuchakata na huchukua muda mrefu zaidi kuliko kutengeneza jibu.
Kwa nini GPU yangu ina kasi kidogo tu kuliko CPU?
Sababu ya kawaida ni kwamba modeli haikutoshea kabisa katika VRAM. Kwa hiyo, baadhi ya tabaka huendeshwa kwenye CPU, na kila token husubiri sehemu hiyo yenye kasi ndogo. Tekeleza ollama ps na uhakikishe kuwa safu ya PROCESSOR inasoma 100% GPU. Ikiwa inaonyesha mgawanyo, tumia quantization ndogo au modeli ndogo. Sababu nyingine ya kawaida ni kipimo kifupi ambacho muda wa kupakia modeli hutawala matokeo.
Je, VPS yenye GPU inafaa kwa mtumiaji mmoja?
Kwa kawaida, hapana. Mtu mmoja husoma kwa kasi ya maneno 5 hadi 10 kwa sekunde, na kompyuta yenye CPU tayari hutengeneza tokeni kwa kasi inayozidi hiyo kwa modeli hadi takriban 13B. Hali zinazoweza kuhalalisha gharama kwa mtumiaji mmoja ni maagizo marefu, utengenezaji wa picha, na fine-tuning. Kuhudumia watumiaji wengi kwa wakati mmoja ndiyo sababu kuu, kwa sababu batching huwezesha GPU moja kujibu maombi ishirini kwa gharama inayokaribia ya kujibu ombi moja.
Je, nikodishe GPU kwa saa au niiendeshe muda wote?
Kodisha kwa saa ikiwa kazi hutokea kwa vipindi: fine-tuning, uchakataji wa embeddings nyingi, au kazi ya batch transcription. Iendeshe muda wote ikiwa tu kadi inatumika kwa kiwango kikubwa, kwa sababu huduma ya GPU hutoza kwa muda ambao instance ipo, si kwa tokeni zinazozalishwa. Msaidizi mwenye trafiki ndogo huwa nafuu zaidi kwenye CPU VPS au kwenye API iliyopangishwa inayolipiwa kwa kila tokeni kuliko kwenye GPU isiyotumika.