AI Agent, LLM और AI Assistant में मुख्य अंतर क्या है?
LLM, AI Assistant और AI Agent के बीच तकनीकी अंतर समझें। जानें कि कैसे LLM को RAM, Assistant को इंटरफेस और Agent को हमेशा चालू रहने वाले सर्वर और क्रेडेंशियल्स की आवश्यकता होती है।
AI agent, LLM और AI assistant के बीच क्या अंतर है?
AI agent, LLM और AI assistant एक ही stack की तीन परतें हैं। इनके बीच अंतर समझने का तरीका यह है कि यह देखें कि प्रत्येक को सर्वर से क्या चाहिए। LLM (large language model) weights की एक फाइल है जिसे RAM और compute की आवश्यकता होती है। Assistant वह model है जिसे chat interface में लपेटा गया है, जिसमें एक account और saved history होती है, जो लगभग हमेशा किसी और के hardware पर चलता है। Agent एक ऐसा assistant है जिसके पास tools और एक loop होता है, और यह credentials रखता है, जिसके कारण इसे ऐसे machine पर चलाना पड़ता है जो हमेशा चालू रहे।
इस प्रश्न पर अधिकांश लेखन परिभाषाओं पर ही रुक जाता है। परिभाषाएँ केवल इसलिए मायने रखती हैं क्योंकि प्रत्येक परत का billing तरीका अलग है। एक के लिए RAM का खर्च आता है। दूसरे के लिए public URL और TLS (transport layer security) का खर्च आता है। अंतिम के लिए credentials का खर्च आता है, और जिस credential का उपयोग एक agent ने किया है, उसे आपको अब rotate करना होगा।
LLM का अर्थ है weights, और weights को RAM की आवश्यकता होती है
LLM संख्याओं की एक फाइल है। आप इसे डाउनलोड करते हैं, एक runtime इसे memory में load करता है, और यह एक बार में एक request का उत्तर देता है। इसका अनुबंध सीमित है: text अंदर जाता है, text बाहर आता है। model के पास calls के बीच कोई memory, कोई clock, कोई network access और कोई फाइल खोलने का तरीका नहीं होता है। LLM जो कुछ भी याद रखता है, वह उसे call करने वाले program द्वारा उसके context में paste किया गया होता है।
आपके VPS plan को निर्धारित करने वाली संख्या उस फाइल का आकार है, क्योंकि model चलते समय पूरी फाइल memory में रहती है। 4-bit quantisation पर जिसे Ollama डिफ़ॉल्ट रूप से प्रदान करता है, प्रति बिलियन parameters लगभग 0.6 GB मानकर चलें, और फिर context window तथा runtime के लिए एक या दो gigabyte और जोड़ें।
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]qwen3:8b build डिस्क पर 5.2 GB है और बिना swapping के चलने के लिए लगभग 8 GB RAM की आवश्यकता होती है। एक 4 GB का VPS qwen3:14b को load नहीं करेगा, जो कि आपके द्वारा एक भी शब्द टाइप करने से पहले ही 9.3 GB की है। यहाँ सबसे बड़ी पंक्ति, qwen3:32b, को लगभग 24 GB की आवश्यकता है, जो अधिकांश price lists में एक अलग plan और एक अलग मासिक बिल होता है।
Memory में फिट होना एक प्रश्न है। गति दूसरा प्रश्न है। केवल CPU वाले VPS पर bottleneck clock speed के बजाय memory bandwidth होता है, इसलिए जो model फिट हो जाता है वह भी कुछ tokens प्रति सेकंड की दर से उत्तर दे सकता है। यह रात भर चलने वाले काम के लिए ठीक है लेकिन chat के लिए असुविधाजनक है। एक GPU उस आंकड़े को लगभग दस गुना बढ़ा देता है, और यह आपके बिल को भी बढ़ा देता है, इसलिए माप के आधार पर निर्णय लें: जिस workload को आप चलाना चाहते हैं उसके साथ VPS को benchmark करें और पढ़ें कि GPU VPS अपनी कीमत कब वसूल करता है। Weights को चलाने के लिए, अपने स्वयं के VPS पर Ollama से शुरुआत करें।
Assistant एक LLM और एक chat surface का संयोजन है
Assistant एक model के ऊपर बनी product layer है। ChatGPT और Claude assistants हैं: इनमें एक model, एक chat window, एक account, सहेजी गई बातचीत और एक rate limit होती है। इनमें से लगभग कुछ भी आपके नियंत्रण वाले hardware पर नहीं चलता है, इसीलिए एक hosted assistant के लिए subscription शुल्क देना पड़ता है और आपके RAM का उपयोग शून्य होता है।
Self-hosted version एक front end है, जैसे कि Open WebUI, जिसे local Ollama या किसी hosted API की ओर point किया जाता है। Front end एक छोटा software है। chat surface के लिए लगभग 1 GB RAM की आवश्यकता होती है, जो model की जरूरतों के अतिरिक्त है। जिस चीज की इसे आवश्यकता होती है, और जो एक bare model को नहीं होती, वह है एक public URL और एक certificate, क्योंकि आप इसे अपने phone से access करना चाहेंगे: Certbot और Nginx के साथ certificate जारी करें, या कई apps के सामने Traefik पर TLS terminate करें। यदि आप अभी भी एक front end चुन रहे हैं, तो Open WebUI के विकल्पों की तुलना करें।
एक assistant उत्तर देता है। यह कार्य नहीं करता है। जब यह कोई shell command लिखता है, तो एक व्यक्ति उस command को पढ़ता है और तय करता है कि उसे paste करना है या नहीं। वह व्यक्ति एक safety layer है, और agent वह चीज है जो इसे हटा देती है।
एक एजेंट टूल और लूप जोड़ता है
एजेंट एक ऐसा सहायक है जो functions को कॉल कर सकता है और फिर उनके परिणामों को पढ़ सकता है। यह काम दो भागों में पूरा होता है। पहला है टूल: यह एक function का विवरण है जिसे मॉडल अनुरोध कर सकता है, साथ ही आपका कोड जो वास्तव में इसे चलाता है। दूसरा है लूप: आपका प्रोग्राम मॉडल को कॉल करता है, मॉडल एक टूल मांगता है, आपका प्रोग्राम उसे चलाता है, आउटपुट को बातचीत में जोड़ता है और फिर से मॉडल को कॉल करता है। यह तब तक दोहराया जाता है जब तक कि मॉडल यह न कह दे कि काम पूरा हो गया है या कोई सीमा इसे रोक न दे।
लूप सामान्य कोड होता है, और एक बुनियादी लूप सौ लाइनों से कम में आ जाता है। जो चीज इसे एजेंट बनाती है, वह यह है कि टूल्स के पास वास्तविक credentials होते हैं, इसलिए लूप अपने बाहर कुछ बदल सकता है। यही एकमात्र तथ्य नीचे दिए गए हर होस्टिंग निर्णय को संचालित करता है। एजेंट कौशल और MCP (मॉडल कॉन्टेक्स्ट प्रोटोकॉल) सर्वर लूप को फिर से लिखे बिना एजेंट को अधिक टूल देने के दो तरीके हैं।
- यह आपके सेशन से अधिक समय तक चलता है। जब आप टैब बंद करते हैं तो चैट समाप्त हो जाती है। एक एजेंट रन बीस मिनट ले सकता है और इसे आपके लैपटॉप के स्लीप मोड में जाने के बाद भी जीवित रहना चाहिए, इसलिए इसे ऐसे बॉक्स पर होना चाहिए जो चालू रहे, जिसे एक systemd सर्विस या टाइमर द्वारा शुरू किया गया हो जो रीबूट के बाद इसे वापस ला सके।
- यह secrets को सुरक्षित रखता है। एक API key, एक SSH key, एक database password। एजेंट जो कुछ भी पढ़ सकता है, उसके इनपुट में छिपा एक शत्रुतापूर्ण निर्देश उसे इसका उपयोग करने के लिए मजबूर कर सकता है, इसलिए secrets को एजेंट की पहुंच से दूर रखें।
- इसकी लागत लूप के साथ बढ़ती है, न कि आपके प्रश्न के साथ। हर चरण पूरी बातचीत को इनपुट के रूप में फिर से भेजता है, इसलिए दस-चरण वाले रन के लिए उस ट्रांसक्रिप्ट का दस गुना भुगतान करना पड़ता है। यही कारण है कि इनपुट टोकन एजेंट के बिल में हावी होते हैं और आप एक रन कितना खर्च कर सकता है, इस पर एक सख्त सीमा क्यों चाहते हैं।
- यह उस तरह से गलत हो सकता है जो डेटा को मिटा दे। चैट में एक गलत उत्तर आपको दोबारा पढ़ने की लागत देता है। लूप के अंदर एक गलत delete आपको पूरी डायरेक्टरी की लागत दे सकता है। इसे न्यूनतम विशेषाधिकार वाले उपयोगकर्ता के रूप में चलाएं जो इसे काम करने देता है, और कोडिंग एजेंटों के लिए, इसे अपना रिपॉजिटरी देने से पहले सैंडबॉक्स करें।
प्रत्येक लेयर को बॉक्स से क्या चाहिए
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]RAM कॉलम को ध्यान से पढ़ें, क्योंकि इसमें मॉडल शामिल नहीं है। एक चैट फ्रंट एंड और एक एजेंट रनटाइम दोनों छोटे प्रोग्राम हैं। यदि एजेंट किसी होस्टेड मॉडल को कॉल करता है, तो 2 GB RAM इसे चलाने के लिए पर्याप्त है, और एक सस्ता प्लान समझौता करने के बजाय एक वास्तविक समाधान है। यदि आप weights को उसी बॉक्स पर रखते हैं, तो 8 GB मॉडल लाइन बाकी सब पर हावी हो जाती है।
अन्य कॉलम लोगों की अपेक्षा से अधिक मायने रखते हैं। केवल मॉडल लेयर GPU के साथ तेज होती है। केवल असिस्टेंट लेयर को सामान्य तौर पर एक public URL की आवश्यकता होती है, क्योंकि ब्राउज़र को उस तक पहुँचना होता है; एक एजेंट को इसकी आवश्यकता तभी होती है जब बाहर से किसी चीज़ को कॉल करना हो, जैसे कि webhook। और एक एजेंट के पास several क्रेडेंशियल्स होते हैं, जो इसे चैट विंडो से अलग करने वाला वास्तविक अंतर है। एक चैट विंडो गलत हो सकती है। एक एजेंट गलत हो सकता है और फिर उस पर कार्रवाई भी कर सकता है।
क्या AI agent चलाने के लिए GPU की आवश्यकता होती है?
नहीं, जब तक कि आप model weights को भी उसी मशीन पर host नहीं कर रहे हों। Agent loop मुख्य रूप से HTTP requests, JSON parsing और subprocess calls का काम है, और network response का इंतज़ार करते समय CPU लगभग idle रहता है। GPU का प्रश्न वास्तव में LLM layer से संबंधित है।
इसलिए, निर्णय को दो भागों में विभाजित करें। यदि text को आपके server से बाहर नहीं जाना चाहिए, तो model को load करने के लिए पर्याप्त memory का खर्च उठाएं और उपयोग करने योग्य गति के लिए GPU का उपयोग करें। यदि आप केवल automation चाहते हैं, तो token के आधार पर model को rent करें और उस पैसे को uptime और backups में निवेश करें। 2026 में अधिकांश self-hosted agents hosted model को call करते हैं, और इस कारण उन्हें चलाना अधिक किफायती होता है।
क्या आप AI agent को self-host कर सकते हैं?
हाँ, और agent ही वह layer है जिसे self-host करना सबसे अधिक सार्थक है, क्योंकि इसी loop में आपका डेटा और आपके credentials सुरक्षित रहते हैं। 2 GB RAM, एक service manager और outbound network access वाला एक छोटा VPS एक वास्तविक agent को चलाने के लिए पर्याप्त है। यदि आप loop पर अपना नियंत्रण चाहते हैं, तो VPS पर अपना खुद का build तैयार करने का तरीका अपनाएं, या यदि आप किसी तैयार समाधान से शुरुआत करना चाहते हैं, तो उपलब्ध self-hosted agents में से किसी एक को deploy करें।
Assistant को self-host करना आसान है: यह केवल एक container और एक certificate का मामला है। Model को self-host करना महंगा हिस्सा है, और यही वह काम है जिसे लोग तब छोड़ देते हैं जब वे CPU से tokens को धीरे-धीरे निकलते हुए देखते हैं। Weights को तब self-host करें जब डेटा को box से बाहर नहीं भेजा जा सकता, या जब आपका volume इतना अधिक हो कि per-token pricing महंगी पड़ने लगे। अन्यथा, agent को API call करने दें और केवल महत्वपूर्ण हिस्सों को local रखें।
क्या ChatGPT एक AI agent है?
कोई chat product उस क्षण agent बन जाता है जब वह किसी tool को call कर सकता है और आपसे पहले पूछे बिना परिणाम पर कार्रवाई कर सकता है। इस परीक्षण के आधार पर, browsing, code execution या connectors वाले hosted assistants, agents हैं। आपके लिए अंतर यह है कि loop कहाँ चलता है और यह किसके credentials का उपयोग करता है। एक hosted product में, दोनों vendor के होते हैं। आपके अपने सर्वर पर, दोनों आपके होते हैं, साथ ही रात के 3 बजे loop जो कुछ भी करता है, उसकी जिम्मेदारी भी आपकी होती है।
Reactive, planning और multi-agent
अक्सर राउंडअप में सात प्रकार के एजेंटों की सूची दी जाती है। उनमें से अधिकांश प्रकार केवल मार्केटिंग हैं। दो अंतर आपके द्वारा लिखे जाने वाले कोड को बदलते हैं, और एक अंतर आपके खर्च (bill) को प्रभावित करता है। एक reactive एजेंट एक tool को कॉल करता है, उत्तर पढ़ता है और जवाब देता है। एक planning एजेंट पहले एक योजना लिखता है और फिर उस पर काम करता है; यह लंबे कार्यों के लिए बेहतर है, लेकिन इसमें अधिक tokens खर्च होते हैं क्योंकि योजना को हर चरण पर फिर से भेजा जाता है। एक multi-agent सेटअप एक एजेंट को दूसरों को शुरू करने की अनुमति देता है, और यह एक ही समय में token खर्च और विफलता के कारणों (failure modes) को बढ़ा देता है। इसलिए यह तभी फायदेमंद है जब उप-कार्य (sub-jobs) वास्तव में स्वतंत्र हों, जैसे कि एक साथ चार स्रोतों को खोजना। reactive से शुरुआत करें। जब कार्य लंबे हो जाएं तो planning जोड़ें। multi-agent का उपयोग सबसे अंत में करें। व्यापक जानकारी के लिए, 2026 में AI agents के बारे में क्या सीखना सार्थक है देखें।
यह कैसे पता करें कि आप वास्तव में कौन सी लेयर चला रहे हैं
सर्वर पर यह देखें कि कौन सी processes मेमोरी का उपयोग कर रही हैं।
free -h
ps -eo rss,comm --sort=-rss | head -5यदि शीर्ष पंक्ति में ollama या llama-server है जो कई gigabytes RSS (resident set size, वह मेमोरी जिसे एक process वास्तव में घेरती है) का उपयोग कर रही है, तो आप मॉडल को होस्ट कर रहे हैं। यदि कोई भी process कुछ सौ megabytes से अधिक नहीं है और आपका API बिल लगातार बढ़ रहा है, तो आप एक agent या assistant को होस्ट कर रहे हैं और मॉडल को किराए पर ले रहे हैं। यदि वह सूची खाली है क्योंकि सब कुछ ब्राउज़र टैब में हो रहा है, तो आप एक assistant के ग्राहक हैं, जो कि तब तक ठीक है जब तक आपको ऐसे सॉफ़्टवेयर की आवश्यकता न हो जो आपकी ओर से कार्य कर सके।
आप इनमें से क्या चलाना चाहते हैं?
- डेटा को निजी रखने के लिए, मॉडल चलाएं: Ollama के साथ LLM को self-host करें, फिर जब उपयोगकर्ता एक से दस हो जाएं तो Ollama बनाम vLLM के साथ रनटाइम की तुलना करें।
- लूप और टूल्स पर नियंत्रण रखने के लिए, एजेंट बनाएं: VPS पर अपना AI एजेंट बनाएं।
- यदि आप आज शाम तक कुछ तैयार करना चाहते हैं, तो उपयोगी self-hosted एजेंट में से किसी एक को deploy करें।
- यदि अभी तक कोई सर्वर तैयार नहीं है, तो शुरुआत यहां से करें: VPS वास्तव में आपको क्या देता है।
FAQ
क्या AI agent केवल एक LLM है जिसमें कुछ अतिरिक्त चरण जोड़ दिए गए हैं?
अतिरिक्त चरण ही वह उत्पाद हैं। एक LLM केवल टेक्स्ट को टेक्स्ट में बदलता है और कुछ नहीं। एक agent इसे उन टूल्स से घेरता है जिन्हें वह कॉल कर सकता है और एक लूप जो उन्हें बार-बार कॉल करता रहता है। उन टूल्स के पास क्रेडेंशियल्स होते हैं, इसलिए आउटपुट किसी फाइल, डेटाबेस या लाइव सर्विस को बदल सकता है। यही कारण है कि एक agent को ऐसी मशीन की आवश्यकता होती है जो चालू रहे, एक सर्विस मैनेजर और एक सीक्रेट्स पॉलिसी की जरूरत होती है, जबकि LLM को केवल उतनी मेमोरी चाहिए होती है जो उत्तर देते समय उसके वेट्स (weights) को संभाल सके।
क्या AI agent चलाने के लिए मुझे GPU की आवश्यकता है?
agent के लिए नहीं। लूप का काम HTTP रिक्वेस्ट, JSON हैंडलिंग और सबप्रोसेस कॉल्स है, जिसे कोई भी CPU नेटवर्क पर प्रतीक्षा करते समय आसानी से संभाल लेता है। आपको GPU की आवश्यकता केवल तब होती है जब आप मॉडल वेट्स को स्वयं होस्ट करते हैं और उनसे प्रति सेकंड कुछ टोकन से अधिक आउटपुट चाहते हैं। एक agent जो होस्ट किए गए मॉडल को कॉल करता है, वह बिना किसी GPU वाले छोटे VPS पर भी आराम से चल सकता है।
AI agent के लिए VPS को कितनी RAM चाहिए?
लगभग 2 GB, जब agent किसी होस्ट किए गए मॉडल को कॉल करता है, क्योंकि रनटाइम, उसकी डिपेंडेंसीज और एक छोटा लोकल डेटाबेस ही इसमें लोड होता है। यदि आप वेट्स को स्वयं होस्ट करते हैं तो मॉडल के लिए अतिरिक्त RAM जोड़ें: qwen3:8b को अकेले लगभग 8 GB की आवश्यकता होती है, इसलिए एक ऑल-इन-वन बॉक्स की शुरुआत उसी स्तर से होती है और आपके द्वारा चुने गए मॉडल के अनुसार बढ़ती जाती है।
क्या मैं AI assistant को खुद होस्ट कर सकता हूँ और अपनी बातचीत को निजी रख सकता हूँ?
हाँ, लेकिन एक शर्त है जो सब कुछ तय करती है। Open WebUI जैसा सेल्फ-होस्टेड फ्रंट एंड आपके सर्वर पर अकाउंट्स और हिस्ट्री रखता है। बातचीत तभी निजी रहती है जब उसके पीछे का मॉडल भी लोकल हो। यदि आप उसी फ्रंट एंड को किसी होस्ट किए गए API से जोड़ते हैं, तो हर मैसेज के साथ टेक्स्ट आपके बॉक्स से बाहर चला जाता है, इसलिए आपके पास हिस्ट्री तो रहती है लेकिन गोपनीयता नहीं।
AI agent और चैटबॉट में क्या अंतर है?
एक चैटबॉट उत्तर देता है और रुक जाता है। एक agent तय करता है कि आगे क्या करना है, एक टूल को कॉल करता है, परिणाम पढ़ता है और फिर से निर्णय लेता है, जब तक कि काम पूरा न हो जाए या कोई सीमा उसे रोक न दे। व्यावहारिक परीक्षण यह है: यदि सॉफ्टवेयर उत्तर और क्रिया के बीच किसी इंसान के बटन दबाए बिना कुछ बदल सकता है, तो वह एक agent है, और उसे उस होस्टिंग और सुरक्षा उपायों (guardrails) की आवश्यकता होती है जो इसके साथ आते हैं।