SSD Nodes Learn 🎉 VPS $5.50/மாதம் முதல்
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-08-13

Ollama மாடலை நினைவகத்தில் நிரந்தரமாக வைத்திருப்பது எப்படி?

Ollama 5 நிமிடங்களில் மாடலை நீக்குவதால் ஏற்படும் தாமதத்தைத் தவிர்க்க keep_alive அமைப்பை எவ்வாறு பயன்படுத்துவது என்பதை அறியுங்கள். Systemd மூலம் இதை நிரந்தரமாக மாற்றும் முறை.

Ollama ஏன் சில நிமிடங்களுக்குப் பிறகு மாடலை நீக்குகிறது?

கடைசி கோரிக்கைக்குப் பிறகு ஐந்து நிமிடங்கள் வரை Ollama ஒரு மாடலை நினைவகத்தில் (memory) வைத்திருக்கும், அதன் பிறகு அதை நீக்கிவிடும். அடுத்த கோரிக்கை வரும்போது, அது மீண்டும் disk-லிருந்து weights-ஐப் படித்து RAM அல்லது VRAM-க்கு மாற்ற வேண்டும். இதனால் முதல் token வருவதற்கு முன்பு தாமதம் ஏற்படுகிறது. இதனால்தான் ஒரு chat UI அல்லது coding agent வேகமாகச் செயல்பட்டு, சிறிது நேரம் அமைதியாக இருந்து, அடுத்த செய்தியின் போது மீண்டும் மெதுவாகச் செயல்படுவது போன்ற உணர்வைத் தருகிறது. இதில் எந்தப் பிழையும் இல்லை. idle timer முடிந்துவிட்டது என்பதே காரணம்.

இந்த டைமர் keep_alive என்று அழைக்கப்படுகிறது. இது ஒவ்வொரு மாடலுக்கும் தனிப்பட்டது, மேலும் ஒவ்வொரு கோரிக்கை முடிவடையும் போதும் இது மீண்டும் தொடங்கும். தற்போது ஒரு கோரிக்கைக்குப் பதிலளித்துக் கொண்டிருக்கும் மாடல் ஒருபோதும் நீக்கப்படாது, ஏனெனில் செயலில் உள்ள கோரிக்கை இல்லாத மாடல்களை மட்டுமே server நீக்கும். ஆகஸ்ட் 2026 நிலவரப்படி, இயல்புநிலை ஐந்து நிமிடங்கள் ஆகும், இது இந்த server ஏற்றும் அனைத்து மாடல்களுக்கும் பொருந்தும்.

keep_alive-ஐ அமைக்க இரண்டு இடங்கள் உள்ளன: தனிப்பட்ட கோரிக்கையில் அல்லது server-ன் இயல்புநிலை அமைப்பாக. ஒரு systemd drop-in கோப்புதான் server-ன் இயல்புநிலை அமைப்பை மறுதொடக்கம் (restart) செய்த பிறகும் நிலைத்திருக்கச் செய்கிறது. Ollama ஏற்கனவே ஒரு service-ஆக இயங்கிக்கொண்டிருக்கிறது என்று இந்த வழிகாட்டி கருதுகிறது. அவ்வாறு இல்லையெனில், Ollama-வை VPS-ல் நிறுவுதல் என்பதிலிருந்து தொடங்கிவிட்டு மீண்டும் இங்கே வரவும்.

தற்போது எந்தெந்த மாதிரிகள் (models) நினைவகத்தில் உள்ளன, அவை எப்போது காலாவதியாகும்?

ollama ps
NAME        ID              SIZE      PROCESSOR    CONTEXT    UNTIL
qwen3:8b    500a1f067a9f    6.6 GB    100% GPU     4096       4 minutes from now

வெற்று வெளியீடு (Empty output) என்பது எந்த மாதிரியும் ஏற்றப்படவில்லை என்பதைக் குறிக்கிறது, எனவே அடுத்த கோரிக்கையின் போது முழுமையாக ஏற்றும் செயல்முறை நடைபெறும். PROCESSOR என்பது எடைகள் (weights) எங்கு சேமிக்கப்பட்டுள்ளன என்பதைக் காட்டுகிறது. 100% GPU மற்றும் 100% CPU ஆகியவை தெளிவான நிலைகளைக் குறிக்கின்றன. 25%/75% CPU/GPU போன்ற பிரிப்பு, மாதிரி VRAM-ல் முழுமையாகப் பொருந்தவில்லை என்பதைக் குறிக்கிறது; எனவே அதன் ஒரு பகுதி செயலியிலும் (processor) இயங்குகிறது, இதனால் உருவாக்கம் (generation) மெதுவாக இருக்கும்.

UNTIL என்பது காலக்கெடுவைக் குறிக்கும் கவுண்ட்டவுன் ஆகும், இது 4 minutes from now போன்ற சார்பு நேரத்தை (relative time) அச்சிடும். மாதிரி எதிர்மறையான keep_alive உடன் ஏற்றப்பட்டிருந்தால், அது Forever என்று அச்சிடும். சர்வர் மாதிரியை நீக்கும் (unloading) குறுகிய கால இடைவெளியில், அது Stopping... என்று அச்சிடும்.

வெவ்வேறு பதிப்புகளுக்கு இடையே நெடுவரிசைத் தொகுப்பு (column set) மாறியுள்ளதால், ஸ்கிரிப்ட்களில் புலங்களை எண்ணுவதற்குப் பதிலாக தலைப்பைப் (header) படிக்கவும். தானியங்கி செயல்பாடுகளுக்கு, API-ஐ அணுகவும்:

curl -s http://localhost:11434/api/ps

ஒவ்வொரு பதிவும் expires_at, 2026-08-09T14:38:31.83753Z போன்ற ஒரு முழுமையான நேர முத்திரை (absolute timestamp) மற்றும் அந்த மாதிரியின் GPU நினைவகத்தில் உள்ள பகுதியான size_vram ஆகியவற்றைக் கொண்டுள்ளது. size_vram என்பது 0 எனில், அந்த மாதிரி CPU-வில் இயங்குகிறது என்று பொருள்.

Reload உண்மையில் ஏற்படுத்தும் தாக்கம்

இதை ஊகிக்க வேண்டாம். Ollama ஒவ்வொரு பதிலிலும் load time-ஐ load_duration என நானோ-செகண்டுகளில் (nanoseconds) குறிப்பிடுகிறது.

sudo apt install -y jq
ollama stop qwen3:8b
curl -s http://localhost:11434/api/generate -d '{"model": "qwen3:8b", "prompt": "hi", "stream": false}' | jq '{load_duration, total_duration}'
curl -s http://localhost:11434/api/generate -d '{"model": "qwen3:8b", "prompt": "hi", "stream": false}' | jq '{load_duration, total_duration}'

முதல் அழைப்பு (call) model-ஐ load செய்வதால், அதன் load_duration அதிகமாக இருக்கும். இதை வினாடிகளாக மாற்ற 1000000000-ஆல் வகுக்கவும். இரண்டாவது அழைப்பு model நினைவகத்தில் (resident) இருக்கும்போது இயங்குவதால், மிகச்சிறிய எண்ணையே காட்டும். அந்த இரண்டு எண்களுக்கும் இடையே உள்ள வித்தியாசமே, timer முடிந்த பிறகு ஒவ்வொரு பயனரும் செலுத்தும் விலையாகும்; இதுவே keep_alive-ஐ மாற்றுவதற்கான முழுமையான காரணமாகும். அந்த இடைவெளிக்கு முன்னும் பின்னும் உள்ள generation வேகத்தைப் பார்க்க, உங்கள் கணினியில் tokens per second-ஐ அளவிடுவது எப்படி என்பதைப் பார்க்கவும்.

Ollama model-ஐ நினைவகத்தில் (memory) தொடர்ந்து வைத்திருக்கச் செய்தல்

கோரிக்கையுடன் (request) keep_alive-ஐ அனுப்பவும். கோரிக்கை முடிந்த தருணத்திலிருந்து அந்த model-க்கு இது பொருந்தும்.

curl -s http://localhost:11434/api/chat -d '{
  "model": "qwen3:8b",
  "messages": [{"role": "user", "content": "hello"}],
  "keep_alive": "30m"
}'

நான்கு வகையான மதிப்புகள் ஏற்றுக்கொள்ளப்படும்:

  • கால அளவு string: "30m", "24h", "90s"
  • சாதாரண எண், இது வினாடிகளாகக் கருதப்படும்: 3600
  • எதிர்மறை மதிப்பு, -1 அல்லது "-1m", அதாவது idle timeout கிடையாது என்று பொருள்
  • 0, அதாவது இந்த கோரிக்கை முடிந்தவுடன் model-ஐ நினைவகத்திலிருந்து நீக்கிவிடு என்று பொருள்

கோரிக்கையில் உள்ள மதிப்பு, server-ன் இயல்புநிலை அமைப்பை (default) மீறிச் செயல்படும். இது கேட்பதை விட முக்கியமானது: ஒரு client தனது சொந்த keep_alive-ஐ அனுப்பினால், server-ல் நீங்கள் அமைத்த எதையும் விட அதுவே முன்னுரிமை பெறும்.

எதையும் உருவாக்காமல் (generate) ஒரு model-ஐ மட்டும் நினைவகத்தில் ஏற்றலாம். model பெயரை மட்டும் அனுப்பவும். server அதை ஏற்றிவிட்டு, "done": true உடன் காலியான பதிலை அனுப்பும்.

curl -s http://localhost:11434/api/generate -d '{"model": "qwen3:8b", "keep_alive": "30m"}'

reboot செய்த பிறகோ அல்லது புதிய model-ஐ pull செய்த பிறகோ இந்த கட்டளையை இயக்க வேண்டும். அப்போதுதான் முதல் பயனர் கோரிக்கையின் போது model-ஐ ஏற்றும் தாமதம் இருக்காது. CLI-லும் இதற்கான flag உள்ளது:

ollama run --keepalive 30m qwen3:8b "hello"

OLLAMA_KEEP_ALIVE மூலம் இயல்பாகவே லோடில் வைத்திருத்தல்

Server தொடங்கும் போது OLLAMA_KEEP_ALIVE-ஐ வாசித்து, தனக்கென பிரத்யேக மதிப்பு இல்லாத அனைத்து மாடல்களுக்கும் அதையே பயன்படுத்துகிறது. இது request field-ல் உள்ள அதே வடிவங்களை ஏற்கும், எனவே 30m, 3600 மற்றும் -1 ஆகிய அனைத்தும் வேலை செய்யும்.

இதில் உள்ள சிக்கல் என்னவென்றால், இந்த environment variable எந்த இடத்தில் இருக்க வேண்டும் என்பதுதான். உங்கள் SSH session-ல் export OLLAMA_KEEP_ALIVE=30m-ஐ இயக்குவதால் எந்த மாற்றமும் ஏற்படாது. ஏனெனில், தொகுக்கப்பட்ட நிறுவல் (packaged install), server-ஐ ஒரு systemd service-ஆக அதன் சொந்த user மற்றும் environment-ல் இயக்குகிறது. உங்கள் login shell-க்கும் அந்த service-க்கும் எந்தத் தொடர்பும் இல்லை. இந்த setting புறக்கணிக்கப்படுவது போலத் தெரிவதற்கு இதுவே மிக முக்கியமான காரணம்.

systemd drop-in மூலம் மறுதொடக்கம் (restart) செய்த பிறகும் இயங்க வைத்தல்

sudo systemctl edit ollama.service

இந்த editor இரண்டு comment markers-உடன் திறக்கும். அவற்றுக்கு இடையில் தட்டச்சு செய்யவும்: இரண்டாவது marker-க்கு கீழே நீங்கள் எழுதுவதை systemd நிராகரித்துவிடும்.

[Service]
Environment="OLLAMA_KEEP_ALIVE=30m"

கோப்பைச் சேமிப்பது /etc/systemd/system/ollama.service.d/override.conf-ஐ உருவாக்கும். இது வழங்கப்பட்ட unit கோப்பை நேரடியாகத் திருத்துவதற்குப் பதிலாக, ஒரு drop-in கோப்பை உருவாக்குகிறது. எனவே, ollama.service-ஐ மாற்றும் ஒரு Ollama package upgrade உங்கள் அமைப்புகளைப் பாதிக்காது. drop-ins மற்றும் unit கோப்புகள் உங்களுக்குப் புதியவை என்றால், systemd service மற்றும் timer வழிகாட்டி அதன் செயல்பாடுகளை விளக்குகிறது.

sudo systemctl daemon-reload
sudo systemctl restart ollama
systemctl show ollama --property=Environment

கடைசி command, அந்த service உண்மையில் இயங்கப்போகும் environment-ஐக் காட்டும். அந்த வரியில் OLLAMA_KEEP_ALIVE=30m விடுபட்டிருந்தால், drop-in சரியாகச் செயல்படவில்லை என்று அர்த்தம். இதற்கு பெரும்பாலும் [Service] header விடுபட்டிருப்பது அல்லது marker-க்கு கீழே தட்டச்சு செய்திருப்பதுதான் காரணமாக இருக்கும். மறுதொடக்கம் (restart) செய்யும்போது ஏற்கனவே load செய்யப்பட்ட அனைத்து model-களும் நீக்கப்படும், எனவே அடுத்த கோரிக்கை (request) ஒரு cold load-ஆக இருக்கும். மேலே உள்ள preload அழைப்பைப் பயன்படுத்தி அதை warm up செய்யவும்.

ஒரு மாதிரியை (model) தொடர்ந்து நினைவகத்தில் வைத்திருப்பதற்கான செலவு

ollama ps-ல் உள்ள SIZE நெடுவரிசை, ஒரு கோரிக்கையின் போது மட்டுமல்லாமல், முழு idle window காலத்திற்கும் ஒதுக்கப்படும் நினைவகத்தைக் குறிக்கிறது. 4-bit quantisation செய்யப்பட்ட 8B மாதிரி சுமார் 5 முதல் 6 GB நினைவகத்தை எடுத்துக்கொள்ளும். 27B மாதிரி என்பது முற்றிலும் மாறுபட்டது, மேலும் CPU-மட்டும் கொண்ட VPS-ல் இதை இயக்குவதற்கான நினைவகக் கணக்கீடுகளை நீங்கள் ஒரு மாதிரியைத் தொடர்ந்து நினைவகத்தில் வைத்திருக்கும் முடிவை எடுப்பதற்கு முன்பே சரிபார்ப்பது அவசியம். keep_alive-ஐ -1 என அமைப்பதன் மூலம், அந்த சர்வரில் உள்ள மற்ற அனைத்தையும் விட இந்த மாதிரிக்கு முன்னுரிமை அளிக்கிறீர்கள் என்று அர்த்தம். சிறிய VPS-ல், இது உங்கள் database, web app மற்றும் build jobs ஆகியவற்றிற்கு எதிராக நீங்கள் செய்யும் ஒரு நேரடி சமரசமாகும்.

மதிப்பீடுகளை நம்புவதை விட, உண்மையான எண்களைக் கவனியுங்கள். ஒரு மாதிரி ஏற்றப்பட்டிருக்கும்போது இதை இயக்கவும், பின்னர் ollama stop-க்கு பிறகு மீண்டும் இயக்கவும்:

free -h

available நெடுவரிசை என்பது kernel ஒரு புதிய process-க்கு ஒதுக்கக்கூடிய மீதமுள்ள நினைவகத்தைக் குறிக்கிறது. NVIDIA GPU உள்ள சர்வரில், nvidia-smi இதே தகவலை VRAM-ல் காட்டுகிறது. சர்வரில் நினைவகம் தீர்ந்துவிட்டால், அதை மீட்டெடுக்க kernel ஒரு process-ஐ நிறுத்திவிடும் (kill):

sudo dmesg -T | grep -i "out of memory"

ollama என்று பெயரிடப்பட்ட ஒரு வரி இருந்தால், அந்த மாதிரி சர்வர் (model server) பாதிக்கப்பட்டிருக்கிறது என்று அர்த்தம். உங்கள் database என்று பெயரிடப்பட்ட வரி இருந்தால், மாதிரி வெற்றி பெற்று, உங்களுக்குத் தேவையான மற்றொன்று தோல்வியடைந்துள்ளது என்று அர்த்தம். இரண்டுமே போதிய இடவசதி இல்லாத சர்வரில் நீண்ட keep-alive window-வை வைத்திருப்பதன் விளைவே ஆகும்.

இங்கு கவனிக்கத் தவறும் இரண்டு செலவுகள் உள்ளன. நீண்ட context length என்பது பெரிய KV cache-ஐ (key value cache, மாதிரி உருவாக்கும்போது ஒவ்வொரு token-க்கும் பராமரிக்கும் attention state) ஒதுக்குகிறது, மேலும் அந்த cache-ம் resident size-ன் ஒரு பகுதியாகும். 1-க்கு மேல் உள்ள OLLAMA_NUM_PARALLEL, ஒவ்வொரு parallel slot-க்கும் அந்த cache-ஐ ஒருமுறை ஒதுக்கும். நீங்கள் ஒரே மாதிரியைப் பலருக்கு வழங்க திட்டமிட்டால், weights-க்கு மட்டும் கணக்கிடாமல், slots-க்கும் சேர்த்து நினைவகத்தை ஒதுக்க வேண்டும்.

ஒரு நியாயமான இயல்புநிலை (default): போதிய இடவசதி கொண்ட சர்வரில் ஒரு மாதிரி -1-ஐப் பயன்படுத்தலாம். பகிரப்பட்ட சர்வரில், உங்கள் கோரிக்கைகளுக்கு இடைப்பட்ட நேரத்தை ஈடுசெய்யும் வகையில் 30m போன்ற ஒரு window-வைப் பயன்படுத்த வேண்டும், அப்போதுதான் நீங்கள் வேலை செய்வதை நிறுத்தியதும் நினைவகம் மீண்டும் கிடைக்கும்.

ஒரு மாடலை உடனடியாக நீக்குதல் (Unload)

ollama stop qwen3:8b

இது எந்த வெளியீடும் இன்றி திரும்பும், மேலும் அந்த மாடல் ollama ps-லிருந்து மறைந்துவிடும். ஏற்றப்படாத (not loaded) ஒரு பெயரை வழங்கினால் couldn't find model "qwen3:8b" to stop கிடைக்கும். API வடிவம் என்பது prompt இல்லாத ஒரு கோரிக்கையாகும், இதில் keep_alive என்பது 0 என அமைக்கப்படும்:

curl -s http://localhost:11434/api/chat -d '{"model": "qwen3:8b", "messages": [], "keep_alive": 0}'

இதற்கான பதில் "done_reason": "unload"-ஐக் கொண்டிருக்கும். சேவையை (service) மறுதொடக்கம் செய்வதற்குப் பதிலாக இதைப் பயன்படுத்தவும். systemctl restart ollama நினைவகத்தையும் (memory) விடுவிக்கும், ஆனால் இது ஏற்றப்பட்டுள்ள மற்ற அனைத்து மாடல்களையும் நீக்கிவிடும் மற்றும் இயங்கிக்கொண்டிருக்கும் எந்தவொரு கோரிக்கையையும் நிறுத்திவிடும்.

ஒரே server-ல் ஒன்றுக்கும் மேற்பட்ட மாதிரிகளை இயக்குதல்

OLLAMA_MAX_LOADED_MODELS ஒரே நேரத்தில் எத்தனை மாதிரிகள் ஏற்றப்பட்டிருக்க வேண்டும் என்பதற்கான வரம்பை நிர்ணயிக்கிறது. ஆகஸ்ட் 2026 நிலவரப்படி, ஒரு GPU-க்கு மூன்று மாதிரிகள் அல்லது CPU-மட்டும் கொண்ட கணினியில் மூன்று மாதிரிகள் என்பது இயல்புநிலை (default) ஆகும். இந்த வரம்பு மாதிரிகளின் எண்ணிக்கையை அடிப்படையாகக் கொண்டது, ஆனால் உண்மையான கட்டுப்பாடு நினைவகத்தின் (memory) அளவே ஆகும். எனவே, மூன்று மாதிரிகள் என்ற வரம்பை எட்டுவதற்கு முன்பே, இரண்டாவது பெரிய மாதிரிக்கு இடமில்லாமல் போகலாம்.

புதிய மாதிரி ஒன்று கோரப்படும்போது, அதற்குத் தேவையான நினைவகம் இல்லையெனில், scheduler ஏற்கனவே உள்ள மாதிரிகளில் ஒன்றை நீக்கிவிட்டு இடவசதியை ஏற்படுத்தும். எந்தவொரு செயலில் உள்ள கோரிக்கையும் இல்லாத மாதிரியை இது முன்னுரிமை அடிப்படையில் நீக்கும். -1 மூலம் ஏற்றப்பட்ட மாதிரி உட்பட, அதன் காலாவதி நேரம் (timer) முடியாத மாதிரியையும் இது நீக்கக்கூடும். எனவே, keep_alive-ல் எதிர்மறை மதிப்பு (negative value) இருந்தால், அது செயலற்ற நிலையில் (idle) இருக்கும் மாதிரியை நீக்காது என்று அர்த்தம். இது மற்ற மாதிரிகளின் கோரிக்கைகளுக்கு எதிராக மாதிரியின் எடைகளை (weights) நிலைநிறுத்தாது (pin).

இந்த முடிவு debug நிலையில் பதிவு செய்யப்படும். அதே drop-in கோப்பில் இரண்டாவது Environment="OLLAMA_DEBUG=1" வரியைச் சேர்த்து, restart செய்து கவனிக்கவும்:

sudo journalctl -u ollama -f

ஒரு மாதிரியை நீக்கிவிட்டு புதிய மாதிரிக்கு இடம் ஒதுக்கியது குறித்த பதிவு, அந்த கோரிக்கைக்கு அருகிலேயே இருக்கும். இதன் மூலம், இந்த இரண்டு மாதிரிகளும் இந்த கணினியில் ஒன்றாக இயங்க முடியாது என்பதை நீங்கள் அறியலாம். இதற்குத் தீர்வாக, இந்த கணினியில் குறைவான மாதிரிகளை இயக்க வேண்டும், அல்லது விரைவாகப் பதிலளிக்க வேண்டிய மாதிரிக்கு நீண்ட கால அவகாசத்தையும், அரிதாகப் பயன்படுத்தும் மாதிரிக்கு 0-ஐயும் அமைக்க வேண்டும்.

அடுத்தடுத்த release-களுக்குப் பிறகும் பயன்படும் வழிகாட்டுதல்

Ollama அடிக்கடி புதிய release-களை வெளியிடுகிறது, அதன் default அமைப்புகளும் மாறக்கூடும். எனவே, எண்களை மனப்பாடம் செய்வதற்குப் பதிலாக, உங்கள் முன்னால் உள்ள build-ஐச் சரிபார்க்கவும்:

ollama --version
ollama serve --help

ollama serve --help அந்த build உண்மையில் வாசிக்கும் environment variables-களைப் பட்டியலிடுகிறது, அவற்றில் OLLAMA_KEEP_ALIVE-ம் அடங்கும். இரண்டு விதிகள் அனைத்து release-களிலும் மாறாமல் இருப்பதால், அவற்றை நீங்கள் நம்பலாம். Request-ல் உள்ள ஒரு மதிப்பு, server-ன் default மதிப்பை விட முன்னுரிமை பெறும். மேலும், ஒரு config file என்ன சொல்லியிருந்தாலும், உண்மையில் எது load செய்யப்பட்டுள்ளது என்பதை ollama ps உறுதிப்படுத்தும்.

ஒரு editor அல்லது agent உங்கள் server-ஐ இயக்குகிறது என்றால், server-ஐக் குறை கூறுவதற்கு முன் அந்த client என்ன அனுப்புகிறது என்பதைச் சரிபார்க்கவும். உங்கள் Ollama server-ஐ coding agent-க்குக் காட்டுதல் பகுதியில் அந்த request அமைப்புகள் எங்கு உள்ளன என்பது விளக்கப்பட்டுள்ளது.

FAQ

Ollama ஏன் 5 நிமிடங்களுக்குப் பிறகு எனது model-ஐ நீக்குகிறது?

5 நிமிடங்கள் என்பது இயல்பான keep_alive ஆகும்; இது ஒரு கோரிக்கை (request) முடிந்ததும் Ollama தொடங்கும் idle timer ஆகும். இந்த நேரம் முடிந்ததும், server அதன் weights-ஐ நீக்கிவிடும். எனவே, அடுத்த கோரிக்கை வரும்போது disk-லிருந்து மீண்டும் ஏற்றப்படும்; அந்த நேரமே நீங்கள் உணரும் தாமதம். ஒரு கோரிக்கைக்கு மட்டும் இதை அதிகரிக்க JSON body-ல் "keep_alive": "30m"-ஐ அனுப்பவும், அல்லது முழு server-க்கும் மாற்ற OLLAMA_KEEP_ALIVE environment variable-ஐப் பயன்படுத்தவும்.

Ollama model-ஐ நிரந்தரமாக memory-ல் வைத்திருப்பது எப்படி?

எதிர்மறை மதிப்பை (negative value) பயன்படுத்தவும்: கோரிக்கைக்கு "keep_alive": -1 அல்லது server-க்கு OLLAMA_KEEP_ALIVE=-1. அப்போது ollama ps கட்டளையானது UNTIL column-ல் Forever என்று காட்டும். இது idle timer-ஐ நீக்குமே தவிர, வேறு எதையும் செய்யாது. மற்றொரு model கோரப்பட்டு memory குறைவாக இருந்தால், இடவசதிக்காக scheduler இந்த model-ஐ நீக்கக்கூடும்.

OLLAMA_KEEP_ALIVE ஏன் புறக்கணிக்கப்படுகிறது?

நீங்கள் அதை எங்கே அமைத்தீர்கள் என்று சரிபார்க்கவும். systemctl show ollama --property=Environment கட்டளையை இயக்கவும்; அந்த வெளியீட்டில் variable இல்லை என்றால், server அதை கவனிக்கவில்லை என்று அர்த்தம். ஏனெனில், உங்கள் shell-ல் export செய்யப்படும் variable, systemd service-க்குச் சென்றடையாது. அதை sudo systemctl edit ollama.service மூலம் அமைக்கவும், பின் sudo systemctl daemon-reload மற்றும் sudo systemctl restart ollama கட்டளைகளை இயக்கவும். மற்றொரு காரணம், client தனது சொந்த keep_alive-ஐ கோரிக்கையில் அனுப்புவது; இது server-ன் இயல்பான அமைப்பை மீறிச் செயல்படும்.

Ollama-வை restart செய்யாமல் memory-ஐ விடுவிப்பது எப்படி?

ollama stop qwen3:8b அந்த குறிப்பிட்ட model-ஐ உடனடியாக நீக்கும்; server மற்றும் பிற loaded models தொடர்ந்து இயங்கும். API வழியாக, prompt இல்லாமல் "keep_alive": 0 உடன் ஒரு கோரிக்கையை அனுப்பவும்; பதில் "done_reason": "unload" என்று வரும். ollama ps மூலம் உறுதிப்படுத்தவும்; அதில் அந்த model பட்டியல் இருக்கக்கூடாது.