SSD Nodes Learn Hosting plans →
गाइड Matt Connorलेखक: Matt Connor

Ollama क्या है, किस काम आता है और कितनी RAM चाहिए?

Ollama ओपन मॉडल डाउनलोड करके चलाने वाला मुफ़्त टूल है। जानिए यह किन चार कामों में आता है और 8 से 16 GB RAM वाले बिना GPU के लैपटॉप पर इससे असल में क्या चल पाएगा।

Ollama क्या है? सीधा जवाब

Ollama का इस्तेमाल ओपन-वेट AI (artificial intelligence) मॉडल को अपने लैपटॉप या अपने सर्वर पर चलाने के लिए होता है। यह एक मुफ़्त और ओपन-सोर्स प्रोग्राम है। यह मॉडल डाउनलोड करता है और उसे मेमोरी में लोड करता है। फिर आपको उससे बात करने के दो रास्ते देता है: टर्मिनल में चैट, और पोर्ट 11434 पर एक लोकल API (application programming interface), जिसे दूसरे ऐप और कोडिंग एजेंट बुलाते हैं।

जिन मॉडलों की बात हो रही है, वे LLM (large language model) हैं, यानी बड़े भाषा मॉडल जो टेक्स्ट पढ़कर टेक्स्ट लिखते हैं। ओपन-वेट मॉडल वह है जिसकी फ़ाइल, यानी उसके वज़न (weights), कोई भी डाउनलोड कर सकता है। ChatGPT और Claude के पीछे वाले मॉडल ऐसे नहीं हैं। उनके वज़न कंपनी के सर्वर से बाहर नहीं आते, इसलिए Ollama उन्हें नहीं चला सकता। इस पर पूरी बात क्या Claude को अपने सर्वर पर चलाया जा सकता है वाली पोस्ट में है।

कॉलेज के ग्रुप में या किसी वीडियो में आपने "Ollama पर Llama चलाया" जैसी बात सुनी होगी। सुनने में Ollama और Llama एक जैसे लगते हैं। भ्रम यहीं से शुरू होता है, और यह आगे के दो बड़े फ़ैसलों पर असर डालता है: कितनी RAM चाहिए, और पैसा कहाँ लगेगा। इसलिए पहले इन चीज़ों को अलग-अलग समझ लेते हैं।

Ollama, Llama, Qwen और Gemma में क्या फ़र्क़ है?

Ollama एक रनर है, यानी मॉडल चलाने और संभालने वाला प्रोग्राम। Llama, Qwen, Gemma और gpt-oss मॉडल हैं। इन्हें अलग-अलग कंपनियों ने बनाया है: Llama को Meta ने, Qwen को Alibaba की टीम ने, Gemma को Google ने और gpt-oss को OpenAI ने। Ollama इनमें से कोई मॉडल नहीं बनाता। वह इन्हें अपनी लाइब्रेरी ollama.com/library में एक तय फ़ॉर्मैट में रखता है और आपकी मशीन पर चलाता है।

नाम मिलता-जुलता है, पर Ollama Meta का प्रोजेक्ट नहीं है। वह सिर्फ़ Llama भी नहीं चलाता। एक ही Ollama से आप आज Qwen और कल Gemma चला सकते हैं, क्योंकि मॉडल बदलने के लिए कमांड में बस उसका नाम बदलना होता है।

ollama pull llama3.2
ollama run llama3.2
ollama run qwen3:4b

ollama pull सिर्फ़ मॉडल को डाउनलोड करके डिस्क पर रखता है। ollama run मॉडल को मेमोरी में लोड करता है और टर्मिनल में चैट शुरू कर देता है। अगर मॉडल पहले से डिस्क पर नहीं है, तो run पहले उसे डाउनलोड भी करता है। नाम में कोलन के बाद का हिस्सा, जैसे :4b, मॉडल का साइज़ चुनता है। चैट से बाहर आने के लिए /bye लिखें। इन दोनों कमांड का पूरा फ़र्क़, और मॉडल डिस्क पर कहाँ जमा होते हैं, यह ollama pull और ollama run के फ़र्क़ वाली गाइड में है।

तीसरी चीज़ चैट इंटरफ़ेस है। Open WebUI जैसा वेब पेज, जिसमें ChatGPT जैसी चैट विंडो दिखती है, एक अलग प्रोजेक्ट है। वह पीछे से Ollama की API को बुलाता है। Ollama बंद कर दें तो वह पेज जवाब देना बंद कर देता है, क्योंकि जवाब असल में Ollama के अंदर चल रहा मॉडल ही बनाता है। Mac और Windows पर Ollama के अपने ऐप में भी एक सादी चैट विंडो है। Linux सर्वर पर आप ज़्यादातर टर्मिनल और API से ही काम करेंगे।

Ollama अकेला रनर भी नहीं है। अगर आपको ज़्यादा कंट्रोल चाहिए, तो Ollama और llama.cpp की तुलना पढ़ें। यह पोस्ट इंस्टॉल करना नहीं सिखाती। Linux सर्वर पर Ollama लगाने और पहला मॉडल चलाने के पूरे क़दम VPS पर Ollama से अपना LLM चलाने वाली गाइड में हैं।

आपके लैपटॉप पर कितना बड़ा मॉडल चलेगा?

यह सवाल हर काम से पहले आता है, इसलिए इसे पहले समझ लेते हैं। मॉडल चलते समय उसके वज़न RAM (random access memory) में रहते हैं। अगर लैपटॉप में NVIDIA GPU (graphics processing unit) है, तो Ollama मॉडल का जितना हिस्सा फिट हो, उतना GPU की अपनी मेमोरी में रखता है। GPU न हो, तो मॉडल CPU (central processing unit) पर और आम RAM में चलता है। ज़्यादातर छात्रों के लैपटॉप में यही दूसरी स्थिति होती है।

पहला अंदाज़ा मॉडल की डाउनलोड फ़ाइल के साइज़ से मिलता है। ये आंकड़े Ollama लाइब्रेरी के मॉडल पेज से लिए गए हैं, अक्टूबर 2026 की स्थिति में:

ChartOllama मॉडल पेज पर डाउनलोड साइज़ GB में, अक्टूबर 2026
The data behind this chart
[
  {
    "label": "llama3.2:1b",
    "download_gb": 1.3
  },
  {
    "label": "llama3.2:3b",
    "download_gb": 2.0
  },
  {
    "label": "gemma3:4b",
    "download_gb": 3.3
  },
  {
    "label": "aya-expanse:8b",
    "download_gb": 5.1
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2
  },
  {
    "label": "gemma3:12b",
    "download_gb": 8.1
  }
]

सबसे छोटा llama3.2:1b 1.3 GB का है, और gemma3:12b 8.1 GB का। पर डाउनलोड साइज़ पूरी RAM की ज़रूरत नहीं है। मॉडल के साथ ऑपरेटिंग सिस्टम (OS) भी RAM लेता है, और बातचीत को याद रखने के लिए अलग जगह चाहिए। इस याद को KV कैश (key-value cache) कहते हैं। इसमें मॉडल अब तक पढ़े गए हर टोकन का हिसाब रखता है, इसलिए बातचीत जितनी लंबी होगी, KV कैश उतना बड़ा होगा।

LLM को कितनी RAM चाहिए, इसका पूरा हिसाब 8B मॉडल के लिए नीचे वाला बजट देता है। 8B का मतलब 8 अरब (billion) पैरामीटर है। Q4_K_M एक क्वांटाइज़ेशन है, यानी वज़न को 16 बिट की जगह लगभग 4 बिट में रखना। इससे फ़ाइल काफ़ी छोटी हो जाती है।

Chart8B मॉडल Q4_K_M और 8k कॉन्टेक्स्ट का RAM बजट, GiB में
The data behind this chart
[
  {
    "label": "\u092e\u0949\u0921\u0932 \u0915\u0947 \u0935\u091c\u093c\u0928",
    "gib": 4.5
  },
  {
    "label": "OS \u0914\u0930 \u092a\u0947\u091c \u0915\u0948\u0936",
    "gib": 2
  },
  {
    "label": "\u0930\u0928\u091f\u093e\u0907\u092e \u092c\u092b\u093c\u0930",
    "gib": 1
  },
  {
    "label": "KV \u0915\u0948\u0936, 8k \u0915\u0949\u0928\u094d\u091f\u0947\u0915\u094d\u0938\u094d\u091f",
    "gib": 1.13
  }
]

मॉडल के वज़न 4.5 GiB लेते हैं, OS को 2 GiB चाहिए, रनटाइम को 1 GiB और KV कैश को 1.13 GiB। इन चारों को जोड़ें तो कुल 8 GiB से ऊपर चला जाता है। इसलिए 8 GB RAM वाले लैपटॉप पर 8B मॉडल तंग पड़ता है। (1 GiB, 1 GB से थोड़ा बड़ा होता है, इसलिए 8 GB की मशीन असल में 8 GiB से भी कम है।) RAM कम पड़ने पर Ollama मॉडल लोड करने से पहले ही मना कर सकता है और model requires more system memory जैसी त्रुटि दिखाता है। या फिर सिस्टम डिस्क को swap की तरह इस्तेमाल करता है, और तब हर शब्द बहुत धीरे आता है।

व्यावहारिक नियम यह है:

  • 8 GB RAM: 1B से 4B के मॉडल, जैसे llama3.2:3b (2.0 GB) या gemma3:4b (3.3 GB)। मॉडल चलाते समय भारी ब्राउज़र टैब बंद रखें।
  • 16 GB RAM: 8B मॉडल, जैसे qwen3:8b (5.2 GB), आराम से चलते हैं। सर्वर पर Q4_K_M में 14B भी फिट हो जाता है, पर लैपटॉप पर ब्राउज़र और कोड एडिटर भी RAM लेते हैं।

फिट होना और काम का होना अलग बातें हैं। मॉडल RAM में आ जाए, तो उसके बाद ज़्यादा RAM से रफ़्तार नहीं बढ़ती। बिना GPU के रफ़्तार मेमोरी बैंडविड्थ से तय होती है, यानी RAM से CPU तक डेटा कितनी तेज़ी से पहुँचता है। Q4, Q8 और FP16 में से चुनने के लिए क्वांटाइज़ेशन Q4 बनाम Q8 बनाम FP16 वाली गाइड देखें।

Ollama किस काम आता है? चार असली काम

नीचे चार काम हैं जिनके लिए लोग सच में Ollama चलाते हैं। हर काम के साथ यह भी लिखा है कि उसे कितना हार्डवेयर चाहिए। मान कर चलें कि आपके लैपटॉप में 8 से 16 GB RAM है और NVIDIA GPU नहीं है।

1. अपनी मशीन पर निजी चैट

सबसे सीधा काम: ollama run चलाइए और टर्मिनल में सवाल पूछिए। लोकल मॉडल से बात करते समय आपका सवाल आपकी मशीन से बाहर नहीं जाता। इसलिए आप उसमें अपने नोट्स, अधूरा रिज़्यूमे या कंपनी का कोड डाल सकते हैं, और वह किसी कंपनी के सर्वर पर नहीं पहुँचता। एक बार मॉडल डाउनलोड हो जाए तो इंटरनेट की ज़रूरत भी नहीं रहती। ट्रेन में या कमज़ोर नेटवर्क वाले हॉस्टल में यह काम आता है।

हार्डवेयर: 8 GB लैपटॉप पर 3B या 4B मॉडल से चैट ठीक चलती है। सीमा भी साफ़ समझ लें। छोटा मॉडल तथ्यों में ज़्यादा ग़लती करता है, इसलिए उसके बताए तथ्य जाँचें। उसकी जानकारी उसकी ट्रेनिंग की तारीख़ पर रुकी रहती है, और वह अपने आप वेब पर नहीं खोजता। यह कमी कैसे दूर होती है, यह क्या Ollama वेब सर्च कर सकता है वाली पोस्ट में है।

2. पोर्ट 11434 पर लोकल API, जिसे ऐप और कोडिंग एजेंट बुलाते हैं

Ollama चालू होते ही http://localhost:11434 पर अनुरोध सुनने लगता है। कोई भी प्रोग्राम वहाँ HTTP अनुरोध भेजकर मॉडल से जवाब ले सकता है। Ollama की अपनी API के रास्ते /api/chat और /api/generate हैं। इसके अलावा /v1/ पर OpenAI जैसी API भी है। इसका मतलब है कि OpenAI की लाइब्रेरी के लिए लिखा गया कोड सिर्फ़ base URL बदलकर Ollama से बात कर सकता है।

इसी वजह से कोडिंग एजेंट, चैट ऐप, Telegram बॉट और आपकी अपनी Python स्क्रिप्ट, सब एक ही Ollama से जुड़ सकते हैं। एजेंट को Ollama से जोड़ने के क़दम अपने कोडिंग एजेंट के साथ Ollama इस्तेमाल करने वाली गाइड में हैं।

हार्डवेयर: API ख़ुद हल्की है। भारी हिस्सा कॉन्टेक्स्ट है, यानी एक अनुरोध में मॉडल कितने टोकन पढ़ता है। कोडिंग एजेंट हर अनुरोध में लंबे निर्देश और आपकी फ़ाइलें भेजता है, इसलिए उसे लंबा कॉन्टेक्स्ट चाहिए। उसी 8B मॉडल का KV कैश कॉन्टेक्स्ट के साथ ऐसे बढ़ता है:

Chart8B मॉडल का KV कैश, कॉन्टेक्स्ट लंबाई के हिसाब से, GiB में
The data behind this chart
[
  {
    "label": "4k \u091f\u094b\u0915\u0928",
    "kv_cache_gib": 0.56
  },
  {
    "label": "8k \u091f\u094b\u0915\u0928",
    "kv_cache_gib": 1.13
  },
  {
    "label": "32k \u091f\u094b\u0915\u0928",
    "kv_cache_gib": 4.5
  }
]

32k टोकन पर अकेला KV कैश 4.5 GiB का है। यह उतना ही है जितना Q4_K_M में ख़ुद मॉडल के वज़न। इसलिए 8 GB लैपटॉप पर लोकल मॉडल के साथ कोडिंग एजेंट चलाना मुश्किल है। ऐसे काम के लिए ज़्यादा RAM वाला VPS (virtual private server) या Ollama Cloud बेहतर बैठता है।

एक सुरक्षा बात भी याद रखें। Ollama अपने आप सिर्फ़ localhost पर सुनता है, और इसकी API में कोई पासवर्ड नहीं होता। अगर आप पोर्ट 11434 को सीधे इंटरनेट पर खोलते हैं, तो कोई भी आपके सर्वर पर मॉडल चला सकेगा और उसकी RAM और CPU इस्तेमाल करेगा।

3. अपने दस्तावेज़ों से सवाल पूछना

मान लीजिए आपके पास सेमेस्टर के नोट्स की PDF फ़ाइलें हैं, या ऑफ़िस की नीतियों के दस्तावेज़। आप चाहते हैं कि मॉडल इन्हीं के आधार पर जवाब दे। इस तरीक़े को RAG (retrieval-augmented generation) कहते हैं। इसमें पहले दस्तावेज़ों के छोटे टुकड़े बनाए जाते हैं। फिर एक embedding मॉडल हर टुकड़े को संख्याओं की एक सूची में बदलता है, ताकि मिलते-जुलते मतलब वाले टुकड़े खोजे जा सकें। सवाल आने पर सबसे मिलते टुकड़े प्रॉम्प्ट में जोड़े जाते हैं, और चैट मॉडल उन्हें पढ़कर जवाब देता है।

Ollama इसमें दो मॉडल चलाता है: embedding मॉडल, जैसे nomic-embed-text, और जवाब देने वाला चैट मॉडल। PDF पढ़ना और सही टुकड़े खोजना Ollama का काम नहीं है। वह काम Open WebUI जैसा कोई ऐप या आपकी अपनी स्क्रिप्ट करती है।

हार्डवेयर: embedding मॉडल बहुत छोटे होते हैं। nomic-embed-text की फ़ाइल एक GB से काफ़ी कम है। असली दबाव फिर से कॉन्टेक्स्ट पर है। जितने ज़्यादा टुकड़े प्रॉम्प्ट में जाएँगे, KV कैश उतना बढ़ेगा। 16 GB लैपटॉप पर 8B मॉडल और कुछ टुकड़ों वाला सेटअप ठीक चलता है। हिंदी दस्तावेज़ों के लिए एक बात और जाँचें: embedding मॉडल को हिंदी आती है या नहीं। nomic-embed-text का Ollama पेज किसी भाषा का नाम नहीं लेता, इसलिए हिंदी दस्तावेज़ों पर उसकी खोज को पहले अपने सवालों से परखें।

4. सरल वर्गीकरण (classification)

वर्गीकरण का मतलब है किसी टेक्स्ट को पहले से तय श्रेणियों में से एक में डालना। जैसे कॉलेज फ़ेस्ट के फ़ॉर्म में आए सवालों को "रजिस्ट्रेशन", "पेमेंट", "रिफ़ंड" और "बाकी" में बाँटना। या किसी छोटी दुकान के WhatsApp संदेशों को "ऑर्डर" और "शिकायत" में अलग करना। इनपुट छोटा होता है और जवाब एक शब्द का, इसलिए यह चारों में सबसे हल्का काम है। 8 GB लैपटॉप पर 1B से 3B का मॉडल भी यह कर लेता है।

दो बातें ध्यान रखें। पहली, प्रॉम्प्ट में श्रेणियों की पूरी सूची दें और लिखें कि जवाब सिर्फ़ उन्हीं में से एक शब्द हो। दूसरी, temperature कम रखें, ताकि एक ही संदेश पर लगभग हर बार एक ही जवाब आए। temperature क्या करता है, यह Ollama में temperature और sampling वाली गाइड में है। इसके बाद 50 असली संदेशों पर मॉडल के जवाब ख़ुद हाथ से जाँचें। छोटा मॉडल कुछ संदेश ग़लत श्रेणी में डालेगा, और यही जाँच बताएगी कि कितने। तस्वीरों को श्रेणियों में बाँटना हो, तो Ollama से लोकल इमेज वर्गीकरण वाली गाइड देखें।

हिंदी में Ollama कितना काम आएगा?

मॉडल हिंदी समझेगा या नहीं, यह Ollama तय नहीं करता। यह चुने गए मॉडल पर निर्भर करता है। हमने Ollama लाइब्रेरी के मॉडल पेज पढ़कर देखा कि कौन सा मॉडल हिंदी के बारे में क्या लिखता है (अक्टूबर 2026 की स्थिति):

  • llama3.2: पेज पर आधिकारिक भाषाओं की सूची में Hindi का नाम है। इसके साइज़ 1B और 3B हैं, यानी यह 8 GB लैपटॉप पर चलने लायक है।
  • aya-expanse: पेज की भाषा सूची में Hindi है। इसके साइज़ 8B और 32B हैं, और पेज पर कॉन्टेक्स्ट 8K लिखा है।
  • gemma3: पेज 140 से ज़्यादा भाषाओं का दावा करता है, पर Ollama पेज पर Hindi का नाम अलग से नहीं लिखा है।
  • qwen3: पेज 100 से ज़्यादा भाषाओं और बोलियों का दावा करता है। यहाँ भी Ollama पेज पर Hindi का नाम नहीं है।

यह सूची मॉडल बनाने वालों के दावों पर आधारित है। हमने इन मॉडलों की हिंदी गुणवत्ता नहीं मापी है, इसलिए यहाँ कोई रैंकिंग नहीं दी गई है। अपने काम के दस असली सवाल हिंदी में लिखें, और उन्हें दो-तीन मॉडलों पर चलाकर ख़ुद देखें। अगर आप हिंदी को रोमन लिपि में लिखते हैं, जैसे "mujhe batao", तो उसे भी अलग से परखें, क्योंकि मॉडल के लिए वह देवनागरी से अलग टेक्स्ट है।

हिंदी में टोकन ज़्यादा क्यों लगते हैं?

मॉडल टेक्स्ट को टोकन में पढ़ता है। टोकन कोई पूरा शब्द भी हो सकता है, या शब्द का एक टुकड़ा। मॉडल का tokenizer, यानी टेक्स्ट को टोकन में काटने वाला हिस्सा, उसी तरह के टेक्स्ट से बनता है जिस पर मॉडल ट्रेन हुआ। उस टेक्स्ट में अंग्रेज़ी बहुत ज़्यादा होती है, इसलिए अंग्रेज़ी के आम शब्द अक्सर एक-एक टोकन बन जाते हैं। हिंदी के शब्द कई टुकड़ों में कटते हैं।

एक कारण आप अपनी मशीन पर ख़ुद देख सकते हैं। कंप्यूटर टेक्स्ट को UTF-8 में बाइट के रूप में रखता है। अंग्रेज़ी का एक अक्षर 1 बाइट लेता है, और देवनागरी का एक अक्षर 3 बाइट।

printf 'a' | wc -c
printf 'क' | wc -c

पहली कमांड 1 छापेगी और दूसरी 3। जो अक्षर-जोड़ tokenizer ने ट्रेनिंग में कम देखे हैं, उन्हें वह छोटे टुकड़ों में काटता है। कई बार ये टुकड़े अलग-अलग बाइट तक छोटे हो जाते हैं।

अपने मॉडल पर यह फ़र्क़ सीधे गिनने के लिए Ollama की API से पूछिए। वह बताती है कि मॉडल ने प्रॉम्प्ट में कितने टोकन पढ़े। एक ही सवाल अंग्रेज़ी और हिंदी में भेजिए:

curl -s http://localhost:11434/api/generate -d '{"model": "llama3.2", "prompt": "What is the capital of India?", "raw": true, "stream": false}' | grep -o '"prompt_eval_count":[0-9]*'
curl -s http://localhost:11434/api/generate -d '{"model": "llama3.2", "prompt": "भारत की राजधानी क्या है?", "raw": true, "stream": false}' | grep -o '"prompt_eval_count":[0-9]*'

prompt_eval_count प्रॉम्प्ट के टोकन की गिनती है। "raw": true मॉडल का चैट टेम्पलेट हटा देता है, ताकि गिनती में सिर्फ़ आपका वाक्य हो। हिंदी वाली गिनती अंग्रेज़ी वाली से ज़्यादा आएगी। हर मॉडल का tokenizer अलग होता है, इसलिए यही जाँच हर उस मॉडल पर दोहराएँ जिसे आप चुनने की सोच रहे हैं।

इसका असर सीधा है। हर मॉडल का एक कॉन्टेक्स्ट विंडो होता है, यानी वह एक बार में ज़्यादा से ज़्यादा कितने टोकन पढ़ सकता है। हिंदी में वही बात ज़्यादा टोकन लेती है, इसलिए विंडो जल्दी भरती है। विंडो भरने पर बातचीत के पुराने हिस्से कट जाते हैं, और मॉडल शुरुआत की बातें "भूल" जाता है। छोटी विंडो वाले छोटे मॉडल पर यह जल्दी होता है। ज़्यादा टोकन का एक मतलब और है: CPU पर जवाब बनने में ज़्यादा समय लगता है, और क्लाउड पर ज़्यादा इस्तेमाल गिना जाता है।

Ollama मुफ़्त है, तो असली ख़र्च कहाँ है?

Ollama सॉफ़्टवेयर मुफ़्त है। इसका कोड ओपन-सोर्स है, और अपनी मशीन पर मॉडल चलाने का कोई शुल्क नहीं लगता। असली बिल इनमें से किसी जगह से आता है:

  • लैपटॉप का हार्डवेयर: अगर 8 GB कम पड़ता है, तो RAM बढ़ानी पड़ती है या नई मशीन लेनी पड़ती है।
  • बिजली: मॉडल चलते समय CPU पूरी ताक़त से काम करता है, इसलिए लैपटॉप ज़्यादा बिजली खींचता है।
  • VPS का किराया: सर्वर हर महीने का ख़र्च है। बदले में वह 24 घंटे चालू रहता है, और आप अपने लैपटॉप की RAM से बंधे नहीं रहते।
  • Ollama Cloud: अक्टूबर 2026 तक इसका एक मुफ़्त प्लान है जिसमें शुरुआती इस्तेमाल शामिल है, और उससे आगे पेड प्लान हैं। क्लाउड मॉडल के नाम के आख़िर में :cloud लगता है। ऐसे मॉडल Ollama के सर्वर पर चलते हैं, इसलिए आपका प्रॉम्प्ट आपकी मशीन से बाहर जाता है।

रुपयों में पूरा हिसाब यहाँ दोहराने के बजाय इन पोस्ट में है: Ollama मुफ़्त है या नहीं, लोकल बनाम क्लाउड का ख़र्च रुपयों में, और Claude के पेड प्लान की जगह ओपन मॉडल चलाना कितना सस्ता पड़ता है। अगर आप क्लाउड और अपने सर्वर के बीच तय नहीं कर पा रहे, तो Ollama Cloud बनाम अपना सर्वर वाली तुलना पढ़ें।

लैपटॉप, VPS या Ollama Cloud: शुरुआत कहाँ से करें?

  • 8 GB RAM, बिना GPU: llama3.2:3b से शुरू करें। निजी चैट और वर्गीकरण ठीक चलेंगे। दस्तावेज़ों वाला RAG और कोडिंग एजेंट तंग पड़ेंगे।
  • 16 GB RAM, बिना GPU: 8B मॉडल चलाएँ। छोटे RAG सेटअप के लिए यह काफ़ी है।
  • VPS: जब आपको API 24 घंटे चालू चाहिए, जैसे किसी बॉट या छोटी टीम के लिए। VPS पर भी GPU न हो, तो रफ़्तार मेमोरी बैंडविड्थ से ही तय होगी।
  • Ollama Cloud: जब आपको ऐसा बड़ा मॉडल चाहिए जो किसी लैपटॉप में नहीं समाता, और प्रॉम्प्ट का आपकी मशीन से बाहर जाना आपके लिए ठीक है।

एक आख़िरी बात। Ollama सिर्फ़ मॉडल चलाता है। वह ख़ुद कोई एजेंट नहीं है जो आपके लिए कई क़दमों वाले काम पूरे करे। यह फ़र्क़ AI एजेंट और LLM में अंतर वाली पोस्ट में साफ़ समझाया गया है।

FAQ

क्या Ollama और Llama एक ही चीज़ हैं?

नहीं। Ollama एक प्रोग्राम है जो ओपन-वेट मॉडल डाउनलोड करता है और आपकी मशीन पर चलाता है। Llama, Meta का बनाया एक मॉडल परिवार है। Ollama, Llama के अलावा Qwen, Gemma और कई दूसरे मॉडल भी चलाता है, और यह Meta का प्रोजेक्ट नहीं है।

8 GB RAM वाले लैपटॉप पर Ollama से क्या चल सकता है?

1B से 4B पैरामीटर वाले मॉडल, जैसे llama3.2:3b या gemma3:4b, 8 GB पर चैट और सरल वर्गीकरण के लिए ठीक चलते हैं। 8B मॉडल Q4_K_M क्वांटाइज़ेशन में भी तंग पड़ता है, क्योंकि मॉडल के वज़न के साथ ऑपरेटिंग सिस्टम और KV कैश भी RAM लेते हैं। RAM कम पड़ने पर Ollama मॉडल लोड करने से मना कर सकता है, या सिस्टम swap पर जाकर बहुत धीमा हो जाता है।

क्या Ollama हिंदी में जवाब दे सकता है?

यह चुने गए मॉडल पर निर्भर करता है। Ollama लाइब्रेरी में llama3.2 और aya-expanse के पेज अपनी भाषा सूची में Hindi का नाम लेते हैं। gemma3 और qwen3 सौ से ज़्यादा भाषाओं का दावा करते हैं, पर उनके Ollama पेज Hindi का नाम अलग से नहीं लेते। हिंदी में वही बात ज़्यादा टोकन लेती है, इसलिए छोटे मॉडल का कॉन्टेक्स्ट विंडो जल्दी भरता है। अपने असली सवालों पर परख कर ही मॉडल चुनें।

क्या Ollama चलाने के लिए NVIDIA GPU ज़रूरी है?

नहीं। GPU न होने पर Ollama मॉडल को CPU और आम RAM पर चलाता है। जवाब GPU की तुलना में धीमे आते हैं, और रफ़्तार इस पर निर्भर करती है कि RAM से CPU तक डेटा कितनी तेज़ी से पहुँचता है। 1B से 4B के छोटे मॉडल बिना GPU वाले लैपटॉप पर भी इस्तेमाल लायक चलते हैं।

Ollama मुफ़्त है, फिर ख़र्च किस बात का है?

Ollama सॉफ़्टवेयर और अपनी मशीन पर मॉडल चलाना मुफ़्त है। ख़र्च हार्डवेयर और बिजली का है, या फिर किसी VPS के मासिक किराए का। Ollama Cloud में एक मुफ़्त प्लान है जिसमें शुरुआती इस्तेमाल शामिल है, और उससे ज़्यादा के लिए पेड प्लान हैं। क्लाउड मॉडल इस्तेमाल करने पर आपका प्रॉम्प्ट Ollama के सर्वर पर जाता है।