Meta Muse Glimmer 30B-ஐ Linux VPS-ல் இயக்குவது எப்படி?
Meta Muse Glimmer 30B மாடலை இயக்கத் தேவையான RAM மற்றும் Disk அளவுகளைக் கண்டறியவும். 17GB முதல் 59GB வரையிலான tags-க்கு ஏற்ற VPS கட்டமைப்பு மற்றும் CPU inference செலவுகளை அறியுங்கள்.
Muse Glimmer-க்கு VPS-ல் தேவைப்படுபவை
Muse Glimmer எந்தவொரு GPU-வும் இல்லாத சாதாரண Linux VPS-ல் இயங்கும். நீங்கள் பதிவிறக்கும் tag-ஐப் பொறுத்தே அது நினைவகத்தில் (memory) அடங்குமா என்பது தீர்மானிக்கப்படும். Meta Superintelligence Labs இந்த மாதிரியை 10 August 2026 அன்று Apache 2.0 உரிமத்தின் கீழ் வெளியிட்டது: இதில் 30 billion parameters, 128K context window மற்றும் 1.8B parameter கொண்ட பிரத்யேக perception encoder உள்ளன; இது உரையுடன் சேர்த்து படங்களையும் வாசிக்கும் திறன் கொண்டது. Meta இதை chat-க்காக அல்லாமல், எப்போதும் இயங்கக்கூடிய local agents-க்காக வடிவமைத்துள்ளது; இதன் பகுத்தறியும் திறனை (reasoning strength) ஒவ்வொரு கோரிக்கையின் போதும் நீங்கள் மாற்றியமைக்கலாம்.
16 August 2026 அன்று பார்க்கப்பட்ட Ollama tags, 17 GB முதல் 59 GB வரை உள்ளன. இந்த அளவீட்டு வரம்பே ஒட்டுமொத்த தேவையைத் தீர்மானிக்கிறது. இயல்புநிலை (default) tag சுமார் 18 GB அளவில் பட்டியலிடப்பட்டுள்ளது, எனவே மிகச்சிறிய அளவிலான server-ல் கூட 18 GB-க்கும் அதிகமான free RAM இருப்பது அவசியம். பதிவிறக்கத்திற்கான வட்டு இடமும் (disk space), context window-க்கான நினைவகமும் இதற்கு மேலதிகமாகத் தேவைப்படும்.
எந்த muse-glimmer tag-ஐ நீங்கள் pull செய்ய வேண்டும்?
The data behind this chart
[
{
"label": "30b-nvfp4",
"size_gb": 17
},
{
"label": "30b (default)",
"size_gb": 18
},
{
"label": "30b-q4_K_M",
"size_gb": 18
},
{
"label": "30b-q4_K_M-dflash",
"size_gb": 20
},
{
"label": "30b-nvfp4-dflash",
"size_gb": 21
},
{
"label": "30b-q8_0",
"size_gb": 31
},
{
"label": "30b-mxfp8",
"size_gb": 33
},
{
"label": "30b-q8_0-dflash",
"size_gb": 33
},
{
"label": "30b-mxfp8-dflash",
"size_gb": 35
},
{
"label": "30b-bf16",
"size_gb": 57
},
{
"label": "30b-bf16-dflash",
"size_gb": 59
}
]Apple build-கள் அல்லாத இந்த model-க்கான 11 tag-களை Ollama பட்டியலிட்டுள்ளது. இவை அனைத்தும் ஒரே 30 billion weights-ஐக் கொண்டுள்ளன, ஆனால் வெவ்வேறு numeric precision-களில் சேமிக்கப்பட்டுள்ளன. நீங்கள் பார்க்கும் அளவுதான் நீங்கள் download செய்யும் அளவு; மேலும், எந்தவொரு context-ஐயும் சேர்ப்பதற்கு முன்பே, இந்த அளவுதான் உங்கள் memory-யில் இருக்க வேண்டும்.
இரண்டு 4-bit build-களே சிறியவை: 30b-nvfp4 அளவு 17 GB மற்றும் 30b-q4_K_M அளவு 18 GB. இயல்புநிலை 30b tag, q4_K_M build-ன் அதே அளவில் பட்டியலிடப்பட்டுள்ளது. 8-bit build-களான 30b-q8_0 மற்றும் 30b-mxfp8 ஆகியவை 31 GB அளவில் உள்ளன. 30b-bf16 என்பது unquantised 16-bit release ஆகும், இதன் அளவு 57 GB. இது பெரும்பாலான வாடகை server-கள் வழங்கும் RAM-ஐ விட அதிகம், மேலும் ஒரு side project-க்கு இவ்வளவு செலவு செய்வது நியாயமற்றது.
-dflash tag-கள் DFlash ஆதரவு கொண்ட அதே build-கள் ஆகும். இவை ஒவ்வொன்றும் அதன் சாதாரண பதிப்பை விட அதிக அளவு கொண்டவை. DFlash-ஐ ஒரு வேகத்தை அதிகரிக்கும் அம்சம் என்று Ollama விவரிக்கிறது; இது Apple Silicon மற்றும் desktop GPU-களில் சிறப்பாகச் செயல்படும். CPU-மட்டும் கொண்ட VPS-ல், பிற hardware-களுக்காக வடிவமைக்கப்பட்ட இந்த அம்சத்திற்காக நீங்கள் கூடுதல் memory-ஐச் செலவிட வேண்டியிருக்கும். எனவே, சாதாரண tag-ல் தொடங்கி, ஒவ்வொன்றாக மாற்றங்களைச் செய்யவும்.
உங்களிடம் குறிப்பிட்ட காரணம் ஏதும் இல்லையென்றால், 4-bit-ல் தொடங்கவும். 4-bit-லிருந்து 8-bit-க்கு மாறும்போது, ஒவ்வொரு token-ஐ உருவாக்கும்போதும் CPU வாசிக்க வேண்டிய bytes-ன் அளவு ஏறக்குறைய இருமடங்காகிறது. இதனால் throughput குறையும், memory பயன்பாடு அதிகரிக்கும். இந்த trade-off குறித்த கூடுதல் தகவலுக்கு q4, q8 மற்றும் fp16 quantisation உண்மையில் உங்களுக்கு என்ன செலவை ஏற்படுத்துகிறது என்பதைப் பார்க்கவும். ஒரு CPU server-ல், தொடங்குவதற்கு 4-bit build மட்டுமே சிறந்தது என்பது சுருக்கமான பதில்.
Linux server-ல் MLX tags ஏன் செயல்படுவதில்லை
MLX என்பது Apple-ன் array framework ஆகும், மேலும் Ollama-வின் MLX engine அதன் Apple Silicon backend-ஆகும். mlx என்று பெயரில் உள்ள எந்தவொரு tag-ம் அந்த engine மற்றும் வன்பொருளுக்காகவே உருவாக்கப்பட்டது. x86 Linux VPS-ல், இது பல gigabytes அளவிலான தேவையற்ற பதிவிறக்கமாகும்; இதை உங்களால் இயக்க முடியாது, இது உங்கள் வட்டில் எந்தப் பயனும் இன்றி இடத்தைப் பிடிக்கும். Mac-ல் அளவிடப்பட்ட வேகத் தரவுகள் அந்த tags-க்கு உரியவை, எனவே அவை உங்கள் server-ன் செயல்திறனைக் குறிக்காது. model பக்கத்தில் உள்ள tag பட்டியலைப் பார்க்கும்போது, முதலில் mlx என்றுள்ள அனைத்தையும் நீக்கிவிட்டு, மீதமுள்ளவற்றிலிருந்து அளவின் அடிப்படையில் தேர்வு செய்யவும்.
இதற்கு உண்மையில் எவ்வளவு RAM மற்றும் disk தேவை?
நினைவகத்தை இரண்டு விஷயங்கள் பயன்படுத்துகின்றன, அதில் ஒன்று மட்டுமே tag அளவு. நீங்கள் பதிவிறக்கும் tag-ஐப் பொறுத்தே weights-ன் அளவு தீர்மானிக்கப்படுகிறது. உரையாடலுக்காக model வைத்திருக்கும் per-token state-ஆன KV cache, நீங்கள் அமைக்கும் context length-க்கு ஏற்ப அதிகரிக்கும். ஒரே நேரத்தில் பல கோரிக்கைகளை (parallel requests) கையாளும்போது, context அளவு அந்த கோரிக்கைகளின் எண்ணிக்கையைப் பொறுத்து பலமடங்கு பெருகும் என்று Ollama-வின் ஆவணங்கள் குறிப்பிடுகின்றன. எனவே, ஒரே நேரத்தில் இரண்டு agents-க்கு பதிலளிக்கும் ஒரு server-க்கு, ஒரு agent-க்கு பதிலளிக்கும் server-ஐ விட அதிக நினைவகம் தேவைப்படும்.
இந்த வழிகாட்டி உட்பட எந்தவொரு வழிகாட்டியிலும் உள்ள RAM அளவை அப்படியே எடுத்துக்கொள்ளாதீர்கள். ஒரு tag-ஐப் பதிவிறக்கி, அதற்கு ஒரு prompt அனுப்பி, model நினைவகத்தில் இருக்கும்போதே இந்த இரண்டு கட்டளைகளை இயக்கவும்.
ollama ps
free -hollama ps தற்போது என்ன ஏற்றப்பட்டுள்ளது என்பதையும், வேலை எவ்வாறு CPU மற்றும் GPU இடையே பிரிக்கப்பட்டுள்ளது என்பதையும் காட்டும். free -h மீதமுள்ள நினைவகத்தைக் காட்டும். உங்கள் server-ல் கிடைக்கும் இந்த இரண்டு வெளியீடுகளும் எந்தவொரு அட்டவணையை விடவும் துல்லியமானவை, ஏனெனில் இவை உங்கள் context setting, quantization மற்றும் server-ல் இயங்கும் பிற அனைத்தையும் உள்ளடக்கியவை.
Disk தேவையைத் தீர்மானிப்பது எளிது. Ollama தனது model-களை Linux-ல் /usr/share/ollama/.ollama/models என்ற பாதையில் சேமிக்கிறது, இது பெரும்பாலான VPS images-ல் root filesystem-ல் இருக்கும். 40GB root volume-ல் 57 GB அளவுள்ள bf16 build-ஐச் சேமிக்க முடியாது, மேலும் இரண்டு 8-bit tag-களை அருகருகே வைத்திருக்கவும் முடியாது. எதையும் பதிவிறக்கும் முன், இந்தச் சேமிப்பகத்தை ஒரு mounted volume-க்கு மாற்றவும்.
sudo systemctl edit ollama[Service]
Environment="OLLAMA_MODELS=/mnt/models"sudo mkdir -p /mnt/models
sudo chown -R ollama:ollama /mnt/models
sudo systemctl daemon-reload
sudo systemctl restart ollamaollama பயனர் அந்த directory-க்கு உரிமையாளராக இருக்க வேண்டும், ஏனெனில் இந்தச் service ollama என்ற பயனர் கணக்கிலேயே இயங்குகிறது மற்றும் தனது blobs-ஐ அங்கேயே எழுதுகிறது. அனுமதி (permissions) தொடர்பான சிக்கலால் பதிவிறக்கம் தோல்வியுற்றால், journalctl -u ollama -n 50 என்ற கோப்பில் அதற்கான காரணத்தைக் காணலாம்.
Swap பற்றி ஒரு தெளிவான விஷயம்: swap-ஐப் பயன்படுத்தி பெரிய tag-ஐ இயக்க முடியாது. ஒவ்வொரு token-ஐ உருவாக்கும்போதும் model weights-ஐ அணுக வேண்டியிருக்கும். எனவே, swap-ல் இருக்கும் weights மீண்டும் மீண்டும் disk-லிருந்து வாசிக்கப்படும். vmstat 1-ல் si மற்றும் so columns பிஸியாக இருப்பதைக் காணலாம், மேலும் output வேகம் ஒரு token-க்கு பல நொடிகள் என மிக மெதுவாகிவிடும். Out of memory killer-லிருந்து தற்காத்துக்கொள்ள ஒரு சிறிய swap file-ஐ மட்டும் வைத்திருங்கள். உங்களுக்குத் தேவையான tag-க்கு ஏற்ப RAM அளவை முடிவு செய்யுங்கள்.
Ollama-ஐ நிறுவுதல் மற்றும் ஒரு குறிப்பிட்ட tag-ஐ pin செய்தல்
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollamaஇந்த நிறுவல் script ஒரு systemd service-ஐ அமைக்கிறது, எனவே reboot செய்த பிறகு server தானாகவே மீண்டும் இயங்கத் தொடங்கும். நீங்கள் இதை root மூலம் நிர்வகிக்கப்படும் system service-ஆக இயக்க விரும்பவில்லை என்றால், Ollama-ஐ Podman-ன் கீழ் rootless-ஆக இயக்குதல் என்ற பகுதி அந்த முறையை விளக்குகிறது. அதன் பிறகு, ஒரு குறிப்பிட்ட tag-ஐ pull செய்யவும்.
ollama pull muse-glimmer:30b
ollama listollama list-ல் உள்ள size column-ஐ நீங்களே படித்து, model பக்கத்தில் உள்ள தற்போதைய tag பட்டியலுடன் ஒப்பிட்டுப் பார்க்கவும். வெளியிடப்படும் tags அவ்வப்போது சேர்க்கப்படுகின்றன, பெயர் மாற்றப்படுகின்றன அல்லது நீக்கப்படுகின்றன; எனவே ஒரு வழிகாட்டியில் உள்ள அளவு என்பது ஒரு குறிப்பிட்ட நாளின் நிலையை மட்டுமே குறிக்கும்.
நீங்கள் சார்ந்திருக்கும் ஒரு server-ல் ஒருபோதும் ollama pull muse-glimmer-ஐ எழுத வேண்டாம். ஒரு பொதுவான model பெயர் latest tag-ஐயே குறிக்கும், மேலும் latest என்பது வெளியீட்டாளர் எந்த நேரத்திலும் மாற்றக்கூடிய ஒரு pointer ஆகும். அவ்வாறு செய்தால், ஒரு routine pull உங்கள் agent-ன் கீழ் உள்ள model-ஐ மாற்றிவிடும்; இதனால் நினைவகத் தேவை (memory needs) மற்றும் செயல்பாட்டில் மாற்றம் ஏற்படும், ஆனால் உங்கள் logs-ல் இது குறித்து எந்த அறிவிப்பும் இருக்காது. உங்கள் scripts, unit files மற்றும் agent config ஆகியவற்றில் எப்போதும் tag-ஐக் குறிப்பிடவும். VPS-ல் Ollama மூலம் LLM-ஐ self-hosting செய்தல் என்ற பகுதி server அமைப்பின் மீதமுள்ள விவரங்களை விளக்குகிறது.
GPU இல்லாமல் Muse Glimmer-ஐ இயக்க முடியுமா?
ஆம், ஆனால் இதன் செயல்திறன் வரம்பைப் பற்றி வெளிப்படையாக இருப்பது அவசியம். ஒரு token-ஐ உருவாக்குவது என்பது model weights-ஐ memory-யிலிருந்து வாசிப்பதாகும்; எனவே, உங்கள் plan-ல் எத்தனை vCPU-கள் இருந்தாலும், வேகம் என்பது memory bandwidth-ஐப் பொறுத்தே அமையும். சில cores-க்கு மேல், கூடுதல் cores-ஆல் பெரிய பயன் ஏதும் இல்லை. பகிரப்பட்ட VPS-ல் அந்த bandwidth மற்ற பயனர்களுடன் பகிரப்படுவதால், 4-bit-ல் உள்ள 30B model வினாடிக்கு மிகக் குறைந்த எண்ணிக்கையிலான tokens-ஐயே உருவாக்கும்.
எனது கருத்து உட்பட, எவருடைய மதிப்பீட்டையும் அப்படியே ஏற்காதீர்கள். உங்கள் கணினியில் tokens per second-ஐ நீங்களே அளவிடுங்கள் மற்றும் முடிவுகளைப் பார்த்து நீங்களே தீர்மானியுங்கள்.
இதன் விளைவாக, இந்த model எதற்குப் பயன்படும் என்பதில் ஒரு தெளிவான வேறுபாடு உள்ளது. Interactive chat-க்கு இது கடினமானது, ஏனெனில் server எழுதும் வேகத்தை விட நீங்கள் வேகமாக வாசிப்பீர்கள், மேலும் ஒவ்வொரு பதிலும் நீண்ட தாமதத்திற்குப் பிறகே தொடங்கும். பின்னணியில் இயங்கும் agent பணிகளுக்கு இது சிறந்தது, ஏனெனில் பத்து நிமிடங்கள் கவனிக்கப்படாமல் இயங்கும் ஒரு பணிக்கு, வேகம் குறைவாக இருப்பது ஒரு பொருட்டல்ல. அந்த இரண்டாவது வகை பணிச்சுமைதான் Meta இந்த model-க்காகக் குறிப்பிடும் பயன்பாடாகும்.
உங்களுக்கு interactive வேகம் தேவைப்பட்டால், GPU அல்லது hosted API ஆகிய இரண்டில் ஒன்றை மட்டுமே தேர்வு செய்ய முடியும். எதையும் வாடகைக்கு எடுக்கும் முன் GPU VPS மற்றும் API tokens-க்கு இடையிலான break even point-ஐக் கணக்கிடுங்கள், மேலும் GPU VPS உங்களுக்கு உண்மையில் என்ன வழங்குகிறது என்பதைப் படித்து நீங்கள் எதற்காகப் பணம் செலுத்துகிறீர்கள் என்பதைப் புரிந்துகொள்ளுங்கள். ஒரு குறிப்பிட்ட கணினியில் எந்தெந்த model-களை இயக்கலாம் என்ற பொதுவான கேள்விக்கு, நீங்கள் self-host செய்யக்கூடிய model-கள் என்பதிலிருந்து தொடங்குங்கள்; இதே அளவுள்ள Qwen model-ஐ VPS-ல் இயக்குவது இந்த வகை அளவில் மிக நெருக்கமான ஒப்பீடாக இருக்கும்.
128K tokens-க்கு முன்பே தகவல்களை ஏன் மறந்துவிடுகிறது?
Ollama-வின் default context window 4096 tokens மட்டுமே என்பதால் இவ்வாறு நிகழ்கிறது, அந்த model எவ்வளவு ஆதரித்தாலும் இதுவே நிலை. ஆகஸ்ட் 2026 நிலவரப்படி, Ollama-வின் சொந்த FAQ-வில் இந்த default அளவு குறிப்பிடப்பட்டுள்ளது. அந்த tag 128K என்று விளம்பரப்படுத்தினாலும், நீங்கள் மாற்றும் வரை server அந்த model-க்கு 4096 tokens-ஐயே வழங்குகிறது. இதனால், நீண்ட agent உரையாடல்களில் ஆரம்பக்கட்ட தகவல்கள் மறைந்து, model-க்கு மறதி இருப்பது போன்ற தோற்றம் ஏற்படுகிறது.
ஒவ்வொரு request-க்கும் server-ல் இதை அதிகரிக்கவும்:
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=32768"Interactive session-க்குள், /set parameter num_ctx 32768 அந்த session-க்கு மட்டும் இதை மாற்றும். API வழியாக, request options-ல் num_ctx-ஐ அனுப்பவும்.
ஒவ்வொரு கூடுதல் context token-ம் model weights-க்கு மேலதிகமாக memory-ஐ எடுத்துக்கொள்ளும். வெறும் weights-க்கு மட்டுமே போதுமான வசதி கொண்ட server-ல் முழு 128K-ஐக் கேட்டால், அந்த load தோல்வியடையும் அல்லது மெதுவான செயல்பாட்டிற்குத் தள்ளப்படும். இதைச் சிறு சிறு அளவுகளாக உயர்த்தி, ஒவ்வொரு முறை மாற்றிய பிறகும் ollama ps-ஐ இயக்கவும். Ollama-வில் num_ctx மற்றும் context length எவ்வாறு செயல்படுகின்றன என்ற கட்டுரை இதற்கான கணக்கீடுகளை விளக்குகிறது.
Reasoning strength: low, medium, high மற்றும் xhigh
Muse Glimmer-க்கான நான்கு reasoning strengths-ஐ Meta ஆவணப்படுத்தியுள்ளது. இவை low முதல் xhigh வரை உள்ளன. சிக்கலான coding மற்றும் agent பணிகளுக்கு உயர் மட்டத்திலான இரண்டையும் பயன்படுத்த பரிந்துரைக்கப்படுகிறது. Ollama-வில் இது think parameter மூலம் செயல்படுகிறது. Command line-ல் --think=-ஐப் பயன்படுத்தவும், அல்லது API body-ல் think-ஐ அனுப்பவும்.
ollama run muse-glimmer:30b --think=high "Summarise the changes in /tmp/patch.diff"Interactive session-க்குள், /set think மற்றும் /set nothink மூலம் இதை மாற்றிக்கொள்ளலாம். பெரும்பாலான மாதிரிகள் boolean அல்லது low, medium, high போன்ற நிலைகளை ஏற்கும் என்றும், சில மாதிரிகள் மிக உயர்ந்த நிலைக்கு max-ஐ ஏற்கும் என்றும் Ollama-வின் ஆவணங்கள் கூறுகின்றன. இந்த மாதிரி எந்தெந்த strings-ஐ ஏற்கும் என்பது அதன் model page-ல் இருக்கும். எனவே, ஊகிப்பதற்குப் பதிலாக அதை வாசித்துப் பார்க்கவும். ஒரு agent-ல் இணைப்பதற்கு முன், கைமுறையாக ஒன்றைச் சோதித்துப் பார்க்கவும்.
CPU மட்டுமே உள்ள கணினியில் இந்த அமைப்பு அதிக தாக்கத்தை ஏற்படுத்தும். அதிக strength என்பது, பதிலின் முதல் வார்த்தை தோன்றுவதற்கு முன்பே அதிகப்படியான thinking tokens உருவாக்கப்படும் என்பதாகும். ஒரு thinking token-க்கு ஆகும் நேரம், ஒரு answer token-க்கு ஆகும் நேரத்திற்குச் சமமானது. வழக்கமான பணிகளுக்கு low அமைப்பிலேயே வைத்திருக்கவும்.
எப்போதும் இயங்கும் முகவருக்காக (agent) மாதிரியை (model) நினைவகத்தில் வைத்திருத்தல்
Ollama இயல்பாகவே ஐந்து நிமிடங்களுக்குப் பிறகு செயலற்ற நிலையில் உள்ள மாதிரியை நினைவகத்திலிருந்து நீக்கிவிடும். பத்து நிமிடங்களுக்கு ஒருமுறை இயங்கும் ஒரு முகவருக்கு, ஒவ்வொரு முறையும் 18 GB அளவிலான தரவை வட்டில் (disk) இருந்து ஏற்றுவது தேவையற்ற சுமையாகும். நெட்வொர்க் இணைக்கப்பட்ட சேமிப்பகத்தைக் கொண்ட VPS-களில் இந்த ஏற்றுதல் செயல்முறை மெதுவாக இருக்கும். அதற்குப் பதிலாக, மாதிரியை நினைவகத்திலேயே (RAM) நிலைநிறுத்தவும் (pin).
[Service]
Environment="OLLAMA_KEEP_ALIVE=-1"எதிர்மறை மதிப்பை (negative value) அமைப்பதன் மூலம், வேறொரு செயல்முறை அதை நீக்கும் வரை மாதிரி நினைவகத்திலேயே இருக்கும். API கோரிக்கையில் keep_alive-ஐப் பயன்படுத்துவது, அந்த ஒரு குறிப்பிட்ட அழைப்பிற்கு மட்டும் சர்வரின் இயல்புநிலை அமைப்பை மாற்றியமைக்கும். இதற்கான விலை வெளிப்படையானது: எந்தச் செயல்பாடும் இல்லாதபோதும் RAM ஆக்கிரமிக்கப்பட்டிருக்கும். எனவே, இந்த அமைப்பை முகவருக்காக மட்டுமே பிரத்யேகமாக ஒதுக்கப்பட்ட சர்வரில் பயன்படுத்தவும். Ollama மாதிரியை நினைவகத்தில் வைத்திருத்தல் என்ற பகுதி இதிலுள்ள பல்வேறு முறைகளை விளக்குகிறது.
Coding agent-ஐ இதனுடன் இணைத்தல்
Ollama, http://127.0.0.1:11434/v1-ல் OpenAI-க்கு இணக்கமான API-ஐ வழங்குகிறது. எனவே, பெரும்பாலான agent கருவிகள் ஒரு base URL மற்றும் ஏதேனும் ஒரு non-empty API key மூலம் இதனுடன் இணையும். Ollama-வின் Muse Glimmer பக்கத்தில், ஆதரிக்கப்படும் agent-ஐ உள்ளூர் model-உடன் ஒரே கட்டளையில் இணைக்கும் launch shortcut-ம் ஆவணப்படுத்தப்பட்டுள்ளது; அங்கும் நீங்கள் tag-ஐ pin செய்ய வேண்டும்.
ollama launch claude --model muse-glimmer:30bAgents பெரிய அளவிலான prompts-ஐ அனுப்பும். கோப்புகளின் உள்ளடக்கம், tool output மற்றும் வளர்ந்து வரும் transcript ஆகிய அனைத்தும் input tokens-ஆக வந்து சேரும். CPU-வை மட்டும் கொண்ட கணினிகளில், generation தொடங்குவதற்கு முன்பே prompt processing அதிக சுமையை ஏற்படுத்தும். பணியின் தேவைக்கு ஏற்ப context setting-ஐ முடிந்தவரை சிறியதாக வைத்திருக்கவும். Ollama-வுடன் coding agent-ஐ இணைத்தல் பகுதி client பக்கத்தை விளக்குகிறது, VPS-ல் coding agent-ஐ இயக்குதல் அது இயங்கும் கணினியைப் பற்றியது, மற்றும் VPS-ல் agent செலவுகளைக் கட்டுப்படுத்துதல் அது நாள் முழுவதும் இயங்கும்போது என்ன நடக்கும் என்பதை விளக்குகிறது.
Image input-ம் இதே முறையில் செயல்படுகிறது. Ollama API ஒரு செய்தியின் images field-ல் படங்களை எடுத்துக்கொள்ளும். எனவே, perception encoder எவ்வளவு திறன் கொண்டதாக இருந்தாலும், text-only client-ஆல் ஒருபோதும் படத்தை அனுப்ப முடியாது.
port 11434-ஐ திறக்க வேண்டாம்
Ollama API-ல் authentication வசதி இல்லை. OLLAMA_HOST=0.0.0.0:11434-ஐ அமைப்பதன் மூலம் உங்கள் laptop-லிருந்து அதை அணுக முடியும் என்றாலும், அது authentication இல்லாத ஒரு model runner-ஐ பொது இணையத்தில் (public internet) வெளிப்படுத்திவிடும். இதைக் கண்டறியும் எவரும் உங்கள் disk-ல் மாதிரிகளை (models) ஏற்ற முடியும், மேலும் உங்கள் agent அதன் வழியாக அனுப்பும் தகவல்களைப் படிக்க முடியும். இதை localhost-ல் மட்டும் இயங்க விட்டு, அதற்குப் பதிலாக tunnel-ஐப் பயன்படுத்தவும்.
ssh -N -L 11434:127.0.0.1:11434 user@your-vpsOllama API endpoint-ஐ பாதுகாத்தல் பகுதியில் இதற்கான சரியான வழிமுறைகள் உள்ளன. இதில் credentials கேட்கும் reverse proxy-ஐ அமைப்பதும் அடங்கும்.
எவை செயலிழக்கும், நீங்கள் எதைக் காண்பீர்கள்
பதிவிறக்கம் பாதியிலேயே நிற்கிறது. வட்டு (Disk) இடப்பற்றாக்குறை. மாதிரி (model) கோப்பகத்திற்கு எதிராக df -h கட்டளையை இயக்கவும். 9 GB அளவுள்ள bf16 build, 40GB root volume-ல் பொருந்தாது; அதேபோல் இரண்டு 8-bit tags-களும் அருகருகே பொருந்தாது.
மாதிரி ஏற்றப்பட்ட பிறகு செயல்முறை நின்றுவிடுகிறது. நினைவகப் பற்றாக்குறை (Out of memory). dmesg -T, kernel-ன் out of memory killer ஒரு செயல்முறையைத் தேர்ந்தெடுப்பதைப் பதிவு செய்கிறது, மேலும் journalctl -u ollama -n 100 அதே நிகழ்வை service பக்கத்தில் காட்டுகிறது. இதற்குத் தீர்வாக சிறிய tag அல்லது சிறிய num_ctx-ஐப் பயன்படுத்தவும். swap-ஐ அதிகரிப்பது இதற்குத் தீர்வாகாது.
இது ஒரு token-க்கு பல நொடிகள் என்ற வேகத்தில் இயங்குகிறது. vmstat 1 கட்டளையை இயக்கி, si மற்றும் so நெடுவரிசைகளைக் கவனிக்கவும். சீரான swap செயல்பாடு என்பது, weights நினைவகத்தில் (RAM) பொருந்தவில்லை என்பதையும், அது வேலை செய்யும்போது வட்டில் இருந்து மீண்டும் வாசிக்கிறது என்பதையும் குறிக்கிறது.
கடந்த வாரம் வேலை செய்த tag இப்போது இல்லை. Tag பட்டியல்கள் மாறக்கூடும். மாதிரிப் பக்கத்தை மீண்டும் வாசிக்கவும், தற்போதைய பதிப்பை pin செய்யவும், மேலும் tag பெயரை நீங்கள் மீண்டும் பார்க்கும் இடத்தில் குறித்து வைக்கவும்.
பதிவிறக்கும் முன் அளவுகளை நீங்களே மீண்டும் சரிபார்க்கவும்
அட்டவணையில் உள்ள அளவுகள் 16 August 2026 அன்று மாதிரியின் tag பக்கத்திலிருந்து வாசிக்கப்பட்டன, வெளியிடப்பட்ட tag பட்டியல் ஒரு வாக்குறுதி அல்ல. மாதிரிப் பக்கத்தில் தற்போதைய பட்டியலை வாசிக்கவும், பின்னர் உங்கள் வட்டில் உண்மையில் எவ்வளவு இடம் பதிவாகியுள்ளது என்பதை உறுதிப்படுத்தவும்:
ollama pull muse-glimmer:30b
ollama list
sudo du -sh /usr/share/ollama/.ollama/modelsOllama மாதிரி அடுக்குகளை (model layers) பகிரப்பட்ட blobs-ஆகச் சேமிக்கிறது, எனவே ஒரு அடுக்கைப் பகிர்ந்து கொள்ளும் இரண்டு tags-களுக்கு வட்டில் இருமடங்கு இடம் தேவைப்படாது. du தெரிவிக்கும் அளவை வெளியிடப்பட்ட அளவோடு ஒப்பிட்டு, இரண்டில் பெரிய அளவைக் கொண்டு உங்கள் வட்டுத் திட்டத்தை வகுக்கவும்.
FAQ
Muse Glimmer-க்கு ஒரு VPS-ல் எவ்வளவு RAM தேவைப்படும்?
Tag அளவிலிருந்து தொடங்கி, அதனுடன் context window-ஐயும் சேர்த்துக்கொள்ளுங்கள். 16 August 2026 நிலவரப்படி, default tag-ன் அளவு சுமார் 18 GB ஆகும். எனவே, 16GB கொண்ட server-ல் இதை இயக்கவே முடியாது; 24GB கொண்ட server-ல் context-க்கு மிகக் குறைந்த இடமே இருக்கும். இதை ஒரு தொடக்கப்புள்ளியாகக் கருதுங்கள், இறுதி விடையாக அல்ல. Tag-ஐ pull செய்து, ஒருமுறை load செய்து, பின் உங்கள் server-ல் ollama ps மற்றும் free -h ஆகியவற்றை இயக்கி, உங்கள் கணினியின் தரவுகளை நீங்களே சரிபார்க்கவும். நீண்ட context மற்றும் ஒரே நேரத்தில் வரும் parallel requests ஆகியவை model weights-க்கு மேலதிகமாக memory-ஐப் பயன்படுத்தும்.
GPU இல்லாமல் Muse Glimmer-ஐ இயக்க முடியுமா?
ஆம். CPU மட்டுமே உள்ள VPS-ல் இதை load செய்து பதில்களைப் பெற முடியும். Generation வேகம் core எண்ணிக்கையை விட memory bandwidth-ஐப் பொறுத்தே அமையும். Shared host-ல் இந்த bandwidth பகிரப்படுவதால், 4-bit அளவில் ஒரு வினாடிக்கு மிகக் குறைந்த எண்ணிக்கையிலான tokens மட்டுமே கிடைக்கும். இது பின்னணியில் தானாக இயங்கும் agent பணிகளுக்குப் போதுமானது, ஆனால் நேரடி உரையாடலுக்கு (interactive chat) மிகவும் மெதுவாக இருக்கும். ஒரு request-ன் போது ollama ps-ஐ இயக்கி, processor column-ஐப் பார்த்து பணி எங்கு நடைபெறுகிறது என்பதை உறுதிப்படுத்தவும்.
Linux VPS-ல் MLX tags பயனுள்ளதா?
இல்லை. mlx என்று பெயரில் உள்ள அனைத்து tags-ம் Ollama-வின் MLX engine-க்காக உருவாக்கப்பட்டவை; இது Apple Silicon-க்கான backend ஆகும். x86 Linux server-ல் இந்த tags-ஐப் பதிவிறக்கம் செய்வது வீண், ஏனெனில் அவற்றை இயக்க முடியாது. சாதாரண 30b tag-ஐ அல்லது MLX அல்லாத பிற tags-ஐப் பயன்படுத்தவும். MLX builds-உடன் கொடுக்கப்படும் Apple hardware benchmarks-ஐக் கவனத்தில் கொள்ள வேண்டாம்.
128K tokens-க்கு முன்பே model ஏன் தகவல்களை மறந்துவிடுகிறது?
Model எவ்வளவு ஆதரித்தாலும், Ollama-வின் default context window 4096 tokens மட்டுமே. எனவே, நீண்ட உரையாடல்களை model பார்ப்பதற்கு முன்பே server அவற்றை வெட்டிவிடுகிறது (truncate). Server-ல் OLLAMA_CONTEXT_LENGTH-ஐ அமைக்கவும், அல்லது ஒரு session-க்கு மட்டும் /set parameter num_ctx-ஐப் பயன்படுத்தவும், அல்லது API request options-ல் num_ctx-ஐ அனுப்பவும். Context window அதிகரிக்க அதிகரிக்க memory பயன்பாடும் அதிகரிக்கும், எனவே படிப்படியாக உயர்த்தி ஒவ்வொரு முறையும் ollama ps-ஐச் சரிபார்க்கவும்.
Tag-ஐ pin செய்ய வேண்டுமா அல்லது latest-ஐப் பயன்படுத்தலாமா?
Pin செய்யவும். Tag குறிப்பிடப்படாத muse-glimmer என்பது latest-ஐக் குறிக்கும். இது ஒரு pointer என்பதால், வெளியீட்டாளர் எந்த நேரத்திலும் இதை வேறொரு build-க்கு மாற்றலாம். இதனால், வழக்கமான pull செய்யும் போது உங்கள் agent இயங்கும் model மாறக்கூடும். Scripts, unit files மற்றும் agent config-ல் muse-glimmer:30b-ஐக் குறிப்பிடவும். Pin செய்வதற்கு முன் model பக்கத்தில் உள்ள tag பட்டியலைச் சரிபார்க்கவும், ஏனெனில் வெளியிடப்பட்ட tags அவ்வப்போது மாறலாம்.