VPSలో Meta Muse Glimmer 30B నడపడానికి RAM ఎంత?
Muse Glimmer tags పరిమాణం 17GB నుంచి 59GB వరకు ఉంటుంది. Linux VPSలో pull చేయడానికి RAM, disk ఎంత కావాలి, CPU-only inference ఖర్చు ఎంత తెలుసుకోండి.
VPSలో Muse Glimmer కు అవసరమైనవి
Muse Glimmer GPU లేని సాధారణ Linux VPSపై నడుస్తుంది. మీరు pull చేసే tag అది memoryలో సరిపోతుందో లేదో నిర్ణయిస్తుంది. Meta Superintelligence Labs ఈ modelను 10 August 2026న Apache 2.0 కింద ప్రచురించింది. ఇందులో 30 billion parameters, 128K context window, అలాగే 1.8B parameters కలిగిన ప్రత్యేక perception encoder ఉన్నాయి. అందువల్ల ఇది textతో పాటు imagesను కూడా చదవగలదు. Meta దీన్ని chat కోసం కాకుండా ఎల్లప్పుడూ నడిచే local agents కోసం రూపొందించినట్లు చెబుతోంది. ప్రతి requestకు reasoning strengthను మీరు సెట్ చేయవచ్చు.
16 August 2026న పరిశీలించిన published Ollama tags పరిమాణం 17 GB నుంచి 59 GB వరకు ఉంది. మొత్తం sizing సమస్య ఈ పరిధిపైనే ఆధారపడి ఉంటుంది. Default tag పరిమాణం సుమారు 18 GBగా చూపబడుతోంది. అందువల్ల కనీసంగా ఉపయోగించదగిన boxలో 18 GB కంటే స్పష్టంగా ఎక్కువ free RAM ఉండాలి. Download కోసం disk స్థలం, అలాగే context window కోసం memory కూడా దీనికి అదనంగా అవసరం.
మీరు ఏ muse-glimmer tag ను pull చేయాలి?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Ollama ఈ model కోసం Apple builds కాని 11 tags ను చూపించింది. వీటిలో ఒకే 30 billion weights వేర్వేరు numeric precisions లో నిల్వ చేయబడ్డాయి. కనిపించే size మీరు download చేయాల్సిన పరిమాణం. Context జోడించే ముందు memoryలో ఉంచాల్సిన పరిమాణం కూడా దాదాపు ఇదే.
రెండు 4-bit builds చిన్నవి: 30b-nvfp4 పరిమాణం 17 GB, 30b-q4_K_M పరిమాణం 18 GB. Default 30b tag, q4_K_M build తో సమానమైన sizeగా జాబితా చేయబడింది. 8-bit builds అయిన 30b-q8_0 మరియు 30b-mxfp8 సుమారు 31 GB పరిమాణంలో ఉన్నాయి. 30b-bf16 అనేది 57 GB పరిమాణం గల unquantised 16-bit release. Side project కోసం ఎవరైనా చెల్లించగల ధరలో అద్దెకు తీసుకునే చాలా servers అందించే RAM కంటే ఇది ఎక్కువ.
-dflash tags, DFlash support కలిగిన అదే builds. ప్రతి tag దాని plain twin కంటే పెద్దదిగా జాబితా చేయబడింది. Ollama, DFlash ను speed featureగా వివరిస్తుంది. Apple Silicon మరియు desktop GPUsపై దీనిని ప్రదర్శిస్తుంది. CPU మాత్రమే ఉన్న VPSలో, ఇతర hardwareపై కొలిచిన feature కోసం ఆ అదనపు sizeను నిజమైన memoryలో భరించాలి. అందువల్ల plain tagతో ప్రారంభించి, ఒకేసారి ఒక్క మార్పు మాత్రమే చేయండి.
ప్రత్యేక కారణం లేకపోతే 4-bitతో ప్రారంభించండి. 4-bit నుంచి 8-bitకు మారితే, CPU ప్రతి tokenను generate చేయడానికి చదవాల్సిన bytes దాదాపు రెండింతలు అవుతాయి. అందువల్ల memory use పెరుగుతున్నప్పుడు throughput తగ్గుతుంది. ఈ trade గురించి q4, q8 మరియు fp16 quantisation వల్ల మీకు నిజంగా ఎంత ఖర్చవుతుంది లో వివరించాం. CPU boxలో సంక్షిప్త సమాధానం ఏమిటంటే, ప్రారంభించడానికి విలువైనది 4-bit build మాత్రమే.
Linux సర్వర్లో MLX tags ఎందుకు పనిచేయవు
MLX అనేది Apple యొక్క array framework. Ollama యొక్క MLX engine, Apple Silicon కోసం రూపొందించిన backend. పేరులో mlx ఉన్న ప్రతి tag ఆ engine మరియు ఆ hardware కోసం నిర్మించబడింది. x86 Linux VPSలో అది మీరు అమలు చేయలేని పదుల gigabytes పరిమాణంలోని download. అది మీ diskలో ఖాళీని ఆక్రమించి, ఏ పనీ చేయదు. ప్రకటనలోని speed figures Macలో కొలిచినవి. అవి ఆ tagsకు మాత్రమే వర్తిస్తాయి. అందువల్ల అవి మీ server పనితీరును సూచించవు. Model pageలో tag list చదివేటప్పుడు ముందుగా ప్రతి mlx nameను తొలగించండి. తరువాత మిగిలిన tags ఆధారంగా పరిమాణాన్ని అంచనా వేయండి.
అసలు ఎంత RAM, డిస్క్ అవసరం?
మెమరీని ఆక్రమించే అంశాలు రెండు ఉన్నాయి. వాటిలో tag size ఒక్కటే కాదు. మీరు pull చేసే tag నిర్ణయించే weights స్థిరంగా ఉంటాయి. సంభాషణ కోసం model నిల్వచేసే ప్రతి token state అయిన KV cache, మీరు configure చేసే context length పెరిగే కొద్దీ పెరుగుతుంది. ఒకేసారి వచ్చే parallel requests సంఖ్యతో context పరిమాణం కూడా గుణించబడుతుందని Ollama documentation పేర్కొంటుంది. అందువల్ల ఒకేసారి ఇద్దరు agents కు సమాధానం ఇచ్చే server కు, ఒక్క agent కు మాత్రమే సమాధానం ఇచ్చే అదే server కంటే ఎక్కువ memory అవసరం.
ఏ guide నుంచైనా RAM అంచనాను, ఈ guide నుంచైనా, నేరుగా స్వీకరించవద్దు. ముందుగా tag ను pull చేసి, దానికి ఒక prompt పంపండి. Model ఇంకా memoryలో ఉన్న సమయంలో ఈ రెండు commands నడపండి.
ollama ps
free -hప్రస్తుతం ఏమి load అయిందో, CPU మరియు GPU మధ్య పని ఎలా విభజించబడిందో ollama ps చూపిస్తుంది. ఇంకా ఎంత memory మిగిలి ఉందో free -h చూపిస్తుంది. మీ స్వంత serverలో వచ్చిన ఈ రెండు outputs ఏ published table కంటే విశ్వసనీయమైనవి. ఎందుకంటే వాటిలో మీ context setting, మీ quantisation, అలాగే server నడుపుతున్న ఇతర అంశాలన్నీ ఇప్పటికే పరిగణనలో ఉంటాయి.
డిస్క్ విషయంలో లెక్క సులభం. Linuxలో Ollama models ను /usr/share/ollama/.ollama/models కింద నిల్వ చేస్తుంది. చాలా VPS imagesలో ఇది root filesystemలో ఉంటుంది. 57 GB పరిమాణం ఉన్న bf16 build ను 40GB root volumeలో ఉంచలేరు. అలాగే రెండు 8-bit tags ను కూడా పక్కపక్కన ఉంచలేరు. ఏదైనా pull చేయకముందే store ను mounted volumeకు తరలించండి.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaఆ directoryకి ollama user యజమానిగా ఉండాలి. Service ollama userగా నడుస్తుంది, కాబట్టి blobs ను అదే userగా అక్కడ రాస్తుంది. Permissions కారణంగా pull విఫలమైతే కారణం journalctl -u ollama -n 50 లో కనిపిస్తుంది.
Swap గురించి ఒక విషయం స్పష్టంగా గుర్తుంచుకోండి: swap ఉపయోగించడం వల్ల పెద్ద tag ను నడపలేరు. Model ఉత్పత్తి చేసే ప్రతి token కోసం weights ను access చేస్తుంది. అందువల్ల swapలో ఉన్న weights ను మళ్లీ మళ్లీ డిస్క్ నుంచి చదవాలి. vmstat 1 లోని si, so columns నిరంతరం busyగా కనిపిస్తాయి. Output వేగం tokenకు కొన్ని seconds వరకు తగ్గుతుంది. Out of memory killer నుంచి రక్షణ కోసం చిన్న swap file ఉంచండి. మీరు నిజంగా నడపాలనుకునే tag ఆధారంగా RAM పరిమాణాన్ని నిర్ణయించండి.
పేరు గల tag ను నిర్దిష్టంగా ఎంచుకుని Ollama ఇన్స్టాల్ చేయడం
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaఇన్స్టాల్ స్క్రిప్ట్ systemd సేవను ఏర్పాటు చేస్తుంది. అందువల్ల server reboot తర్వాత మళ్లీ ప్రారంభమవుతుంది. root నిర్వహించే system service గా దీన్ని అమలు చేయకూడదనుకుంటే, Podman కింద Ollama ను rootless గా అమలు చేయడం ఆ విధానాన్ని వివరిస్తుంది. తరువాత స్పష్టమైన tag ను pull చేయండి.
ollama pull muse-glimmer:30b
ollama listollama list లోని size column ను మీరే చదివి, model page లోని ప్రస్తుత tag list తో పోల్చండి. Published tags జోడించబడవచ్చు, పేరు మార్చబడవచ్చు లేదా తొలగించబడవచ్చు. Guide లో చూపిన size ఒక నిర్దిష్ట రోజు నాటి snapshot మాత్రమే.
మీరు ఆధారపడే server పై ఎప్పుడూ ollama pull muse-glimmer ను రాయకండి. Bare model name latest tag కు resolve అవుతుంది. latest అనేది publisher వేరే build కు మార్చగల pointer. సాధారణ pull సమయంలో మీ agent ఉపయోగిస్తున్న model దాని స్థానంలో వేరే model కు మారవచ్చు. దానికి వేర్వేరు memory అవసరాలు, వేర్వేరు ప్రవర్తన ఉండవచ్చు. ఈ మార్పు జరిగిందని మీ logs లో ఎలాంటి సమాచారం కనిపించకపోవచ్చు. మీ scripts, unit files మరియు agent config లో tag ను స్పష్టంగా రాయండి. VPS పై Ollama తో LLM ను self-host చేయడం లో మిగిలిన server setup వివరించబడింది.
GPU లేకుండా Muse Glimmer ను నడపగలరా?
అవును. అయితే దాని పరిమితిని స్పష్టంగా అర్థం చేసుకోవాలి. ఒక్క token ను రూపొందించాలంటే model weights ను memory నుంచి చదవాలి. అందువల్ల వేగాన్ని ఎన్ని vCPUs అందిస్తున్నారన్నదికంటే memory bandwidth ఎక్కువగా నిర్ణయిస్తుంది. కొన్ని cores దాటిన తర్వాత అదనపు cores వల్ల ప్రయోజనం చాలా తక్కువగా ఉంటుంది. Shared VPSలో host పై ఉన్న ఇతర tenants అందరితో bandwidth పంచుకోవాలి. అందువల్ల 4-bitలో 30B model సెకనుకు తక్కువ సంఖ్యలో tokens మాత్రమే ఉత్పత్తి చేస్తుంది.
దీనిపై ఎవరు చెప్పిన సంఖ్యనైనా, నాది కూడా కలిపి, నమ్మకండి. మీ స్వంత boxలో సెకనుకు tokens ను కొలవండి; మీరు చూసిన ఫలితాల ఆధారంగా నిర్ణయం తీసుకోండి.
దీంతో ఈ model ఏ పనులకు బాగా సరిపోతుందో స్పష్టమైన తేడా కనిపిస్తుంది. Interactive chat ఇబ్బందికరంగా ఉంటుంది. ఎందుకంటే మీరు server రాస్తున్నదానికంటే వేగంగా చదువుతారు, అలాగే ప్రతి reply ప్రారంభానికి ముందు ఎక్కువసేపు వేచి ఉండాలి. Background agent పనులకు ఇది సరిపోతుంది. ఎందుకంటే పది నిమిషాలు unattendedగా నడిచే task నెమ్మదిగా ఉన్నా సమస్య కాదు. ఈ model కోసం Meta వివరించిన workload కూడా ఇదే.
మీకు interactive speed అవసరమైతే, నిజాయితీగా చెప్పగల రెండు మార్గాలు GPU లేదా hosted API. ఏదైనా rent చేయడానికి ముందు GPU VPS మరియు API tokens మధ్య break-even point ను లెక్కించండి. మీరు వాస్తవంగా ఏమి కొనుగోలు చేస్తున్నారో GPU VPS మీకు నిజంగా ఏమి అందిస్తుందో తెలుసుకోండి వివరిస్తుంది. ఒక నిర్దిష్ట boxలో ఏ model ను ఉంచవచ్చో తెలుసుకోవాలంటే మీరు self-host చేయగల models ఏవో చూడండి వద్ద ప్రారంభించండి. ఇదే size classలో VPSలో ఇలాంటి పరిమాణం ఉన్న Qwen model ను నడపడం అత్యంత సమీప పోలిక.
128K tokens కంటే చాలా ముందే ఇది విషయాలను ఎందుకు మర్చిపోతుంది?
Ollama యొక్క default context window 4096 tokens గా ఉంటుంది. Model మద్దతు ఇచ్చే పరిమాణం ఎంతైనా, ఈ default వర్తిస్తుంది. August 2026 నాటికి ఈ default Ollama యొక్క స్వంత FAQలో కూడా ఉంది. Tag 128K అని చూపిస్తుంది, కానీ మీరు వేరే విలువ ఇవ్వకపోతే server modelకు 4096 మాత్రమే అందిస్తుంది. అందువల్ల పొడవైన agent transcriptలోని ప్రారంభ turns తొలగిపోతాయి. Modelకు amnesia ఉన్నట్లు కనిపిస్తుంది.
ప్రతి request కోసం serverలో దీన్ని పెంచండి:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Interactive sessionలో /set parameter num_ctx 32768 ఉపయోగిస్తే, అది ఆ sessionకు మాత్రమే మారుతుంది. API ద్వారా request optionsలో num_ctx పంపండి.
Contextలోని ప్రతి అదనపు tokenకు weightsకు అదనంగా memory అవసరం. Weights కోసం మాత్రమే సరిపడే boxలో పూర్తి 128Kను అడిగితే load విఫలమవుతుంది లేదా మరింత నెమ్మదైన విధానానికి fallback అవుతుంది. దీన్ని దశలవారీగా పెంచండి. ప్రతి దశ తర్వాత ollama ps అమలు చేయండి. Ollamaలో num_ctx మరియు context length ఎలా పనిచేస్తాయి లో ఈ లెక్కలను వివరించారు.
Reasoning strength: low, medium, high and xhigh
Muse Glimmer కోసం Meta నాలుగు reasoning strength స్థాయిలను అందిస్తుంది: low నుంచి xhigh వరకు. క్లిష్టమైన coding మరియు agent పనులకు చివరి రెండు స్థాయిలను ఉపయోగించాలని సూచిస్తుంది. Ollamaలో ఇది think parameter ద్వారా నియంత్రించబడుతుంది. Command lineలో --think= ఉపయోగించండి లేదా API bodyలో think పంపండి.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Interactive sessionలో /set think మరియు /set nothink ఉపయోగించి ఈ settingను మార్చవచ్చు. Ollama documentation ప్రకారం, చాలా models boolean విలువను లేదా low, medium, high వంటి స్థాయిని అంగీకరిస్తాయి. కొన్ని models అత్యధికంగా అందుబాటులో ఉన్న స్థాయికి max ను కూడా అంగీకరిస్తాయి. ఈ model అంగీకరించే ఖచ్చితమైన strings దాని model pageలో ఉంటాయి. అందువల్ల ఊహించకుండా ఆ pageను చదవండి. Agentలో అనుసంధానించే ముందు ఒకసారి చేతితో పరీక్షించండి.
CPU మాత్రమే ఉన్న systemలో ఈ setting ప్రభావం స్పష్టంగా కనిపిస్తుంది. ఎక్కువ strength ఎంచుకుంటే, సమాధానంలోని మొదటి పదం కనిపించే ముందు ఎక్కువ thinking tokens ఉత్పత్తి అవుతాయి. Thinking tokenకు answer tokenతో సమానమైన wall-clock time పడుతుంది. సాధారణ పనులకు low settingనే ఉంచండి.
ఎల్లప్పుడూ నడిచే agent కోసం model ను loaded స్థితిలో ఉంచడం
Ollama idle model ను default గా ఐదు నిమిషాల తర్వాత unload చేస్తుంది. ప్రతి పది నిమిషాలకు అమలయ్యే agent కు, ప్రతి run లోనూ disk నుంచి పూర్తి 18 GB model ను load చేయాల్సి వస్తుంది. Network-attached storage కలిగిన VPS లో ఈ load వేగంగా పూర్తికాదు. అందువల్ల model ను memory లోనే pin చేయండి.
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"Negative value ఇస్తే, ఏదైనా unload చేసే వరకు model memory లోనే resident గా ఉంటుంది. API request లోని keep_alive ఆ ఒక్క call కోసం server default ను override చేస్తుంది. దీని వ్యయం స్పష్టమే: ఏ పని జరగనప్పటికీ RAM ఆక్రమించబడి ఉంటుంది. కాబట్టి agent కోసం ప్రత్యేకంగా కేటాయించిన box లోనే ఈ setting ను ఉపయోగించాలి. Ollama model ను loaded స్థితిలో ఉంచడం వివిధ మార్పులను వివరిస్తుంది.
కోడింగ్ agent ను దానికి అనుసంధానించండి
Ollama, http://127.0.0.1:11434/v1 వద్ద OpenAI-compatible API ను అందిస్తుంది. అందువల్ల చాలా agent tools base URL మరియు ఖాళీ కాని API key తో అనుసంధానమవుతాయి. Ollama యొక్క Muse Glimmer పేజీలో, ఒకే command తో supported agent ను local model కు అనుసంధానించే launch shortcut కూడా వివరించబడింది. అక్కడ tag ను కూడా నిర్దిష్టంగా pin చేయాలి.
ollama launch claude --model muse-glimmer:30bAgents పెద్ద prompts ను పంపుతాయి. File contents, tool output మరియు పెరుగుతున్న transcript అన్నీ input tokens గా వస్తాయి. CPU box పై generation ప్రారంభం కాకముందే prompt processing ఎక్కువ సమయం తీసుకుంటుంది. Task కు అనుమతించేంత చిన్నదిగా context setting ను ఉంచండి. Ollama కు coding agent ను అనుసంధానించడం client వైపు వివరాలను కవర్ చేస్తుంది. VPS పై coding agent ను నడపడం అది నడిచే box గురించి వివరిస్తుంది. VPS పై agent ఖర్చులను నియంత్రించడం అది రోజంతా నడిచినప్పుడు జరిగేదాన్ని వివరిస్తుంది.
Image input కూడా ఇదే విధంగా పనిచేస్తుంది. Ollama API, message లోని images field ద్వారా images ను స్వీకరిస్తుంది. అందువల్ల perception encoder ఎంత సామర్థ్యవంతమైనదైనా text-only client image ను ఎప్పటికీ పంపదు.
port 11434 ను తెరవవద్దు
Ollama APIలో authentication లేదు. మీ laptop నుంచి దాన్ని చేరుకోడానికి OLLAMA_HOST=0.0.0.0:11434 ను సెట్ చేస్తే, authentication లేని model runner public internetలో అందుబాటులోకి వస్తుంది. దాన్ని కనుగొన్న ఎవరైనా మీ diskలోకి models ను load చేయగలరు. మీ agent దాని ద్వారా పంపే సమాచారాన్ని కూడా చదవగలరు. దాన్ని localhostకు bound గానే ఉంచి, బదులుగా tunnel ఉపయోగించండి.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API endpointను సురక్షితం చేయడంలో సరైన మార్గాలు వివరించబడ్డాయి. credentials అడిగే reverse proxy కూడా వాటిలో ఉంది.
ఏవి విఫలమవుతాయి, మీరు ఏమి చూస్తారు
Pull మధ్యలో ఆగిపోతుంది. కారణం disk స్థలం. Model directory పై df -h ను అమలు చేయండి. 57 GB bf16 build 40GB root volume లో సరిపోదు. పక్కపక్కన రెండు 8-bit tags కూడా సరిపోవు.
Model load అయిన తర్వాత process ఆగిపోతుంది. కారణం out of memory. Kernel out of memory killer ఒక process ను ఎంచుకున్న విషయాన్ని dmesg -T నమోదు చేస్తుంది. అదే సంఘటనను service వైపు నుంచి journalctl -u ollama -n 100 చూపిస్తుంది. దీనికి పరిష్కారం చిన్న tag లేదా చిన్న num_ctx. మరింత swap జోడించడం పరిష్కారం కాదు.
ప్రతి token కు కొన్ని seconds పడుతుంది. vmstat 1 ను అమలు చేసి si, so columns ను monitor చేయండి. నిరంతర swap activity ఉంటే weights RAM లో సరిపోలేదని అర్థం. Process పనిచేస్తున్నప్పుడు వాటిని disk నుంచి మళ్లీ చదువుతోంది.
గత వారం పనిచేసిన tag ఇప్పుడు కనిపించదు. Tag lists మారుతుంటాయి. Model page ను మళ్లీ చదవండి. ప్రస్తుత tag ను pin చేసి, tag name ను మళ్లీ పరిశీలించే చోట నమోదు చేయండి.
Pull చేయడానికి ముందు sizes ను మీరే మళ్లీ తనిఖీ చేయండి
Chart లోని sizes ను 16 August 2026 న model యొక్క tag page నుంచి తీసుకున్నారు. Published tag list హామీ కాదు. Model page లో ప్రస్తుత list ను చదివి, మీ disk పై వాస్తవంగా చేరినదాన్ని నిర్ధారించండి:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama model layers ను shared blobs గా నిల్వ చేస్తుంది. అందువల్ల ఒకే layer ను పంచుకునే రెండు tags కు disk పై రెండింతల స్థలం అవసరం లేదు. du చూపించే విలువను published size తో పోల్చండి. ఈ రెండింటిలో పెద్దదాని ఆధారంగా disk కోసం ప్రణాళిక రూపొందించండి.
FAQ
VPSలో Muse Glimmer కు ఎంత RAM అవసరం?
Tag పరిమాణంతో ప్రారంభించి, context window పరిమాణాన్ని జోడించండి. 16 August 2026 నాటికి default tag సుమారు 18 GBగా ఉంది. అందువల్ల 16GB box దాన్ని పూర్తిగా ఉంచుకోలదు. 24GB boxలో tag ఉంచిన తర్వాత context కోసం చాలా తక్కువ స్థలం మాత్రమే మిగులుతుంది. దీన్ని తుది సమాధానంగా కాకుండా ప్రారంభ అంచనాగా పరిగణించండి. మీ boxలో tagను pull చేసి, ఒకసారి load చేయండి. తరువాత ollama ps మరియు free -h అమలు చేసి, మీ స్వంత కొలతలను పరిశీలించండి. ఎక్కువ context మరియు సమాంతర requests రెండూ weights కు అదనంగా memoryని వినియోగిస్తాయి.
GPU లేకుండా Muse Glimmerను నడపవచ్చా?
అవును. CPU మాత్రమే ఉన్న VPSలో ఇది load అయి సమాధానాలు ఇస్తుంది. Generation speed core count కంటే memory bandwidthపై ఎక్కువగా ఆధారపడి ఉంటుంది. Shared hostలో ఆ bandwidth ఇతర వినియోగదారులతో పంచబడుతుంది. అందువల్ల 4-bit వద్ద సెకనుకు తక్కువ సంఖ్యలో tokens మాత్రమే వస్తాయని అంచనా వేయండి. unattendedగా నడిచే background agent పనులకు ఇది ఉపయోగకరం. Interactive chatకు మాత్రం ఇది నెమ్మదిగా అనిపిస్తుంది. Request సమయంలో ollama ps అమలు చేసి, పని ఎక్కడ జరుగుతోందో నిర్ధారించడానికి processor columnను పరిశీలించండి.
Linux VPSలో MLX tags ఉపయోగపడతాయా?
లేదు. పేరులో mlx ఉన్న ప్రతి tag Ollama యొక్క MLX engine కోసం నిర్మించబడింది. ఇది Apple Silicon backend. x86 Linux serverలో ఆ tags పెద్ద download మాత్రమే; వాటిని అమలు చేయలేరు. plain 30b tagను లేదా ఇతర non MLX tagsలో ఒకదాన్ని ఉపయోగించండి. MLX buildsతో ఇచ్చే Apple hardware benchmarksను పరిగణనలోకి తీసుకోకండి.
128K tokens కంటే చాలా ముందే model విషయాలను ఎందుకు మర్చిపోతుంది?
Ollama యొక్క default context window model మద్దతు ఇచ్చే పరిమాణంతో సంబంధం లేకుండా 4096 tokens మాత్రమే ఉంటుంది. అందువల్ల modelకు కనిపించే ముందు server దీర్ఘమైన conversationsను truncate చేస్తుంది. Serverలో OLLAMA_CONTEXT_LENGTHను సెట్ చేయండి. ఒక session కోసం /set parameter num_ctxను ఉపయోగించండి. లేదా API request optionsలో num_ctxను పంపండి. Context window పెంచినప్పుడు memory వినియోగం కూడా పెరుగుతుంది. కాబట్టి దాన్ని దశలవారీగా పెంచి, ప్రతి మార్పు తర్వాత ollama psను పరిశీలించండి.
Tagను pin చేయాలా, లేక latestను ఉపయోగించాలా?
దాన్ని pin చేయండి. Tag లేకుండా muse-glimmerను ఉపయోగిస్తే అది latestకు resolve అవుతుంది. ఇది publisher ఎప్పుడైనా వేరే buildకు మార్చగల pointer. అందువల్ల సాధారణ pull వల్ల మీ agent నడిపే model మారవచ్చు. Scripts, unit files మరియు agent configలో muse-glimmer:30bను రాయండి. Pin చేసే ముందు model pageలో tag listను పరిశీలించండి. Published tags మారవచ్చు.