SSD Nodes Learn 🎉 VPS $5.50/महिन्यापासून
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-13

AI agent, LLM आणि AI assistant मधील फरक काय?

LLM ला RAM आणि compute लागतात, assistant मध्ये chat surface व history असते, तर agent tools, loop आणि credentials वापरतो. Agent साठी सतत सुरू असलेली machine आवश्यक असते.

AI agent, LLM आणि AI assistant यांच्यात काय फरक आहे?

AI agent, LLM आणि AI assistant हे एकाच stack चे तीन स्तर आहेत. प्रत्येक स्तराला सर्व्हरकडून काय आवश्यक असते, हे पाहिल्यास त्यांच्यातील फरक स्पष्ट होतो. LLM (large language model) म्हणजे weights असलेली फाइल. तिला RAM आणि compute आवश्यक असतात. Assistant म्हणजे chat surface मध्ये गुंडाळलेले तेच model. त्यामध्ये account आणि जतन केलेला history असतो. तो जवळजवळ नेहमीच दुसऱ्या कोणाच्या hardware वर चालतो. Agent म्हणजे tools आणि loop असलेला assistant. त्याच्याकडे credentials असतात. त्यामुळे तो सतत सुरू असलेल्या machine वर चालवावा लागतो.

या विषयावरील बहुतेक लेख definitions वरच थांबतात. मात्र प्रत्येक स्तरासाठी होणारा खर्च वेगळा असतो, म्हणून या definitions महत्त्वाच्या आहेत. एका स्तरासाठी RAM चा खर्च होतो. पुढील स्तरासाठी public URL आणि TLS (transport layer security) आवश्यक असते. शेवटच्या स्तरासाठी credentials आवश्यक असतात. Agent ने वापरलेले credential आता rotate करावे लागते.

LLM म्हणजे weights चा संच आहे आणि weights साठी RAM आवश्यक असते

LLM म्हणजे संख्यांची एक फाइल. ती download केल्यानंतर runtime ती memory मध्ये load करतो आणि एका वेळी एक request चे उत्तर देतो. त्याची कार्यमर्यादा स्पष्ट आहे: text आत जातो आणि text बाहेर येतो. प्रत्येक call दरम्यान model कडे memory, clock, network access किंवा file उघडण्याची क्षमता नसते. LLM ला काहीतरी लक्षात असल्यासारखे दिसते, ते प्रत्यक्षात त्याला call करणाऱ्या program ने त्याच्या context मध्ये paste केलेले असते.

तुमच्या VPS plan ची निवड ठरवणारा मुख्य आकडा त्या फाइलचा आकार आहे, कारण model चालू असताना संपूर्ण फाइल memory मध्ये राहते. Ollama default स्वरूपात वापरत असलेल्या 4-bit quantisation साठी, प्रत्येक billion parameters मागे साधारण 0.6 GB RAM गृहीत धरा. त्यावर context window आणि runtime साठी आणखी एक किंवा दोन gigabytes जोडा.

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

qwen3:8b build ची disk वरील size 5.2 GB आहे आणि swapping टाळून चालण्यासाठी त्याला सुमारे 8 GB RAM आवश्यक आहे. 4 GB VPS qwen3:14b load करू शकणार नाही. तुम्ही त्यात एकही शब्द type करण्यापूर्वीच त्याचा आकार 9.3 GB आहे. या यादीतील सर्वात मोठी row, qwen3:32b, सुमारे 24 GB RAM मागते. बहुतेक price lists मध्ये यासाठी वेगळा plan आणि वेगळे monthly bill लागू होते.

Memory मध्ये model बसतो का, हा एक प्रश्न आहे. Speed हा दुसरा प्रश्न आहे. केवळ CPU असलेल्या VPS वर bottleneck हा clock speed पेक्षा memory bandwidth असतो. त्यामुळे memory मध्ये बसणारा model देखील प्रति सेकंद काही tokens इतक्याच वेगाने उत्तर देऊ शकतो. रात्रभर चालणाऱ्या job साठी हा वेग योग्य आहे; chat साठी तो त्रासदायक ठरतो. GPU हा वेग साधारण एका order of magnitude ने वाढवतो आणि तुमचा bill देखील वाढवतो. त्यामुळे निर्णय measurement वर आधारित घ्या: तुम्ही चालवणार असलेल्या workload सह VPS चे benchmark करा आणि GPU VPS ची किंमत कधी योग्य ठरते ते वाचा. Weights प्रत्यक्ष चालवण्यासाठी सुरुवात तुमच्या स्वतःच्या VPS वर Ollama पासून करा.

असिस्टंट म्हणजे LLM आणि chat surface यांचे एकत्रित उत्पादन

असिस्टंट हा model भोवतीचा product layer आहे. ChatGPT आणि Claude हे असिस्टंट आहेत: एक model, chat window, account, saved conversations आणि rate limit. यापैकी जवळजवळ काहीही तुमच्या नियंत्रणातील hardware वर चालत नाही. त्यामुळे hosted assistant साठी subscription लागते आणि RAM वापर शून्य असतो.

Self-hosted आवृत्ती म्हणजे Open WebUI सारखा front end, जो local Ollama किंवा hosted API कडे निर्देशित केलेला असतो. Front end हे लहान software असते. chat surface साठी सुमारे 1 GB resident memory अपेक्षित ठेवा. ही memory model ला लागणाऱ्या memory व्यतिरिक्त आहे. मात्र bare model पेक्षा याला public URL आणि certificate आवश्यक असतात, कारण तुम्हाला ते phone वरून वापरायचे असते: Certbot आणि Nginx वापरून certificate जारी करा, किंवा अनेक अॅप्ससमोर Traefik येथे TLS termination करा. तुम्ही अजून front end निवडत असाल, तर Open WebUI च्या पर्यायांची तुलना करा.

असिस्टंट उत्तर देतो. तो कृती करत नाही. तो shell command लिहितो तेव्हा एखादी व्यक्ती तो command वाचते आणि तो paste करायचा की नाही हे ठरवते. ती व्यक्ती safety layer असते. agent ही safety layer काढून टाकणारी गोष्ट आहे.

एजंट साधने आणि loop जोडतो

एजंट हा असा assistant आहे जो functions call करू शकतो आणि त्यांचे results वाचू शकतो. हे काम दोन भाग करतात. पहिला भाग म्हणजे tool: model request करू शकणाऱ्या function चे वर्णन आणि ती प्रत्यक्ष चालवणारा तुमचा code. दुसरा भाग म्हणजे loop: तुमचा program model ला call करतो, model tool मागतो, तुमचा program ते tool चालवतो, output conversation मध्ये जोडतो आणि model ला पुन्हा call करतो. Model काम पूर्ण झाल्याचे सांगत नाही किंवा एखादी मर्यादा प्रक्रिया थांबवत नाही, तोपर्यंत हे पुन्हा होत राहते.

Loop हा साधा code असतो आणि मूलभूत loop शंभर lines पेक्षा कमी असू शकतो. Tools मध्ये प्रत्यक्ष credentials असतात आणि त्यामुळे loop स्वतःच्या बाहेर काही बदल करू शकतो; यामुळेच तो agent बनतो. खालील hosting निर्णयांमागे हेच मुख्य कारण आहे. Agent skills आणि MCP (model context protocol) servers हे loop पुन्हा लिहिल्याशिवाय agent ला अधिक tools देण्याचे दोन मार्ग आहेत.

  • तो तुमच्या session पेक्षा जास्त काळ चालतो. तुम्ही tab बंद करता तेव्हा chat संपतो. Agent run ला वीस मिनिटे लागू शकतात आणि तुमचा laptop sleep mode मध्ये गेल्यानंतरही तो टिकला पाहिजे. त्यामुळे तो सतत सुरू असलेल्या box वर ठेवावा आणि reboot नंतर पुन्हा सुरू करणाऱ्या systemd service किंवा timer ने सुरू करावा.
  • त्याच्याकडे secrets असतात. API key, SSH key किंवा database password. Agent वाचू शकणारी कोणतीही गोष्ट त्याच्या input मध्ये लपवलेल्या hostile instruction मुळे वापरली जाऊ शकते. त्यामुळे secrets agent च्या आवाक्याबाहेर ठेवा.
  • त्याचा खर्च तुमच्या प्रश्नानुसार नव्हे, तर loop नुसार वाढतो. प्रत्येक step मध्ये संपूर्ण conversation input म्हणून पुन्हा पाठवली जाते. त्यामुळे दहा-step run साठी तो transcript दहा वेळा मोजला जातो. म्हणूनच input tokens agent च्या bill मध्ये मुख्य खर्च ठरतात आणि एका run मध्ये किती खर्च होऊ शकतो यावर कठोर मर्यादा ठेवणे आवश्यक आहे.
  • तो चुकीच्या पद्धतीने बदल करू शकतो. Chat मधील चुकीच्या उत्तरासाठी तुम्हाला ते पुन्हा वाचावे लागते. Loop मधील चुकीच्या delete मुळे directory नष्ट होऊ शकते. त्यामुळे तो कार्य करू शकेल इतकाच privilege असलेल्या किमान अधिकारांच्या user म्हणून चालवा. Coding agents साठी, repository देण्यापूर्वी त्याला sandbox मध्ये चालवा.

बॉक्समधील प्रत्येक स्तराला काय आवश्यक आहे

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

RAM स्तंभ काळजीपूर्वक वाचा, कारण त्यात model समाविष्ट केलेला नाही. Chat front end आणि agent runtime हे दोन्ही लहान programs आहेत. Agent hosted model ला call करत असल्यास, तो चालवण्यासाठी 2 GB RAM पुरेशी असते आणि स्वस्त plan हा तडजोड नसून योग्य पर्याय ठरतो. Weights त्याच box वर ठेवल्यास 8 GB model ची गरज इतर सर्व बाबींवर प्रभावी ठरते.

इतर स्तंभ अपेक्षेपेक्षा अधिक महत्त्वाचे आहेत. GPU मुळे फक्त model layer वेगवान होतो. Public URL ची नियमित गरज फक्त assistant layer ला असते, कारण browser ने त्याच्यापर्यंत पोहोचणे आवश्यक असते; agent ला तो फक्त बाहेरील एखाद्या घटकाने त्याला call करायचे असल्यास आवश्यक असतो, उदाहरणार्थ webhook. तसेच agent कडे several credentials असतात. हाच chat window आणि agent यांच्यातील खरा फरक आहे. Chat window कडून चुकीचे उत्तर मिळू शकते. Agent कडून चुकीचे उत्तर मिळून त्यावर आधारित कृतीही होऊ शकते.

AI agent चालवण्यासाठी GPU आवश्यक आहे का?

नाही. मात्र त्याच मशीनवर model weights host करणार असाल, तर GPU आवश्यक ठरू शकतो. Agent loop मध्ये HTTP requests, JSON parsing आणि subprocess calls असतात. Network कडून प्रतिसादाची वाट पाहत असताना CPU जवळपास निष्क्रिय असतो. त्यामुळे GPU चा प्रश्न प्रत्यक्षात LLM layer बद्दलचा प्रश्न आहे.

म्हणून निर्णय वेगळा घ्या. मजकूर तुमच्या मशीनच्या बाहेर जाऊ शकत नसेल, तर model ठेवण्यासाठी आवश्यक memory आणि वापरण्यायोग्य वेगासाठी तो चालवण्यासाठी GPU यावर खर्च करा. तुम्हाला फक्त automation हवे असल्यास, model प्रति token भाड्याने वापरा आणि त्याऐवजी uptime आणि backups साठी खर्च करा. 2026 मधील बहुतेक self-hosted agents hosted model ला call करतात आणि त्यामुळे ते चालवणे स्वस्त पडते.

AI agent स्वतः host करता येतो का?

होय. Agent स्वतः host करणे सर्वाधिक उपयुक्त ठरते, कारण त्याच्या loop मध्ये तुमचा data आणि credentials असतात. 2 GB RAM, service manager आणि outbound network access असलेला छोटा VPS प्रत्यक्ष agent चालवू शकतो. तुम्हाला loop वर पूर्ण नियंत्रण हवे असल्यास VPS वर स्वतः तयार करण्याचा मार्ग निवडा. तयार स्वरूपापासून सुरुवात करायची असल्यास तयार self-hosted agents पैकी एक deploy करा.

Assistant स्वतः host करणे सोपे आहे: त्यासाठी एक container आणि certificate पुरेसे असतात. Model स्वतः host करणे हा खर्चिक भाग आहे. CPU वर tokens अत्यंत हळू तयार होताना पाहिल्यावर अनेक जण हा प्रयत्न सोडून देतात. Data या मशीनबाहेर जाऊ शकत नसेल किंवा तुमच्या वापराच्या प्रमाणामुळे per-token pricing महाग पडत असेल, तेव्हा weights स्वतः host करा. अन्यथा agent ला API call करू द्या आणि महत्त्वाचे भाग local ठेवा.

ChatGPT हा AI agent आहे का?

एखादे chat product tool call करून, तुमची प्रथम परवानगी न घेता त्या निकालावर कृती करू लागते, त्या क्षणी ते agent बनते. या निकषानुसार, browsing, code execution किंवा connectors असलेले hosted assistants हे agents आहेत. तुमच्यासाठी महत्त्वाचा फरक म्हणजे हा loop कुठे चालतो आणि तो कोणाची credentials वापरतो. Hosted product मध्ये या दोन्ही गोष्टी vendor च्या नियंत्रणाखाली असतात. तुमच्या स्वतःच्या server वर त्या दोन्ही तुमच्या नियंत्रणाखाली असतात. तसेच हा loop पहाटे तीन वाजता जे काही करेल, त्याची जबाबदारीही तुमची असते.

Reactive, planning आणि multi-agent

Roundups मध्ये agent चे सात प्रकार दिलेले असतात. यांपैकी बहुतेक प्रकार marketing साठी केलेले वर्गीकरण असतात. मात्र दोन भेद तुम्ही लिहिणारा code बदलतात आणि एक भेद खर्च बदलतो. Reactive agent एखादे tool call करतो, त्याचे उत्तर वाचतो आणि प्रतिसाद देतो. Planning agent आधी plan लिहितो आणि त्यानुसार पुढे काम करतो. त्यामुळे दीर्घ कामांमध्ये त्याचे परिणाम अधिक स्थिर राहतात आणि token चा खर्च वाढतो, कारण प्रत्येक step वेळी plan पुन्हा पाठवावा लागतो. Multi-agent setup मध्ये एक agent इतर agents सुरू करू शकतो. यामुळे token चा खर्च आणि failure modes एकाच वेळी वाढतात. त्यामुळे sub-jobs खरोखर स्वतंत्र असतील, उदाहरणार्थ एकाच वेळी चार sources शोधणे, तेव्हाच त्याचा उपयोग होतो. Reactive पासून सुरुवात करा. Runs दीर्घ होत असतील तेव्हा planning जोडा. Multi-agent चा पर्याय शेवटी वापरा. व्यापक आढाव्यासाठी 2026 मध्ये AI agents बद्दल काय शिकणे उपयुक्त आहे पहा.

तुम्ही प्रत्यक्षात कोणता स्तर चालवत आहात हे कसे ओळखावे

सर्व्हरवर कोणत्या processes ने memory व्यापली आहे ते तपासा.

free -h
ps -eo rss,comm --sort=-rss | head -5

जर पहिल्या ओळीत ollama किंवा llama-server असेल आणि ते अनेक gigabytes RSS (resident set size, म्हणजे process प्रत्यक्षात व्यापत असलेली memory) वापरत असेल, तर तुम्ही model host करत आहात. कोणत्याही process चा वापर काही hundred megabytes पेक्षा जास्त नसेल आणि तुमचे API bill वाढतच असेल, तर तुम्ही agent किंवा assistant host करत आहात आणि model भाड्याने घेत आहात. प्रत्येक गोष्ट browser tab मध्ये होत असल्यामुळे ही यादी रिकामी असेल, तर तुम्ही assistant चे customer आहात. तुमच्या वतीने काम करणारे software आवश्यक होईपर्यंत ही स्थिती योग्य आहे.

तुम्हाला यापैकी कोणते चालवायचे आहे?

FAQ

AI agent म्हणजे अतिरिक्त पायऱ्यांसह LLM एवढाच आहे का?

अतिरिक्त पायऱ्याच उत्पादनाचा मुख्य भाग आहेत. LLM मजकुराचे रूपांतर मजकुरात करतो आणि एवढेच करतो. Agent भोवती तो कॉल करू शकणारी tools आणि त्यांना सतत कॉल करणारा loop असतो. या tools कडे credentials असतात. त्यामुळे output मुळे file, database किंवा live service बदलू शकते. म्हणून agent साठी सतत सुरू असलेले machine, service manager आणि secrets policy आवश्यक असतात. LLM ला उत्तर देताना त्याचे weights ठेवण्यासाठी पुरेशी memory एवढीच आवश्यक असते.

AI agent चालवण्यासाठी GPU आवश्यक आहे का?

Agent साठी GPU आवश्यक नाही. Loop मध्ये HTTP requests, JSON हाताळणी आणि subprocess calls असतात. Network कडून प्रतिसादाची वाट पाहत असताना कोणताही CPU ही कामे हाताळू शकतो. तुम्ही model weights स्वतः host करत असाल आणि त्यातून प्रति सेकंद काही tokens पेक्षा जास्त output हवे असेल, तरच GPU आवश्यक आहे. Hosted model ला कॉल करणारा agent GPU नसलेल्या छोट्या VPS वरही सहज चालतो.

AI agent साठी VPS मध्ये किती RAM आवश्यक आहे?

Agent hosted model ला कॉल करत असेल, तर सुमारे 2 GB RAM आवश्यक असते. कारण runtime, त्याच्या dependencies आणि छोटा local database एवढेच त्यात ठेवले जाते. तुम्ही weights host करत असाल, तर model ची RAM त्यावर अतिरिक्त लागते: qwen3:8b साठीच सुमारे 8 GB आवश्यक असतात. त्यामुळे all-in-one box ची सुरुवात त्या क्षमतेपासून होते आणि तुम्ही निवडलेल्या model नुसार ती वाढते.

मी AI assistant self-host करून माझे संभाषण private ठेवू शकतो का?

होय, पण एक महत्त्वाची अट आहे. Open WebUI सारखा self-hosted front end accounts आणि history तुमच्या server वर ठेवतो. मात्र model देखील local असेल, तरच संभाषणे private राहतात. त्याच front end ला hosted API कडे निर्देशित केल्यास प्रत्येक message वेळी text तुमच्या box मधून बाहेर जातो. त्यामुळे history तुमच्याकडे राहते, पण privacy राहत नाही.

AI agent आणि chatbot यांच्यात काय फरक आहे?

Chatbot उत्तर देतो आणि थांबतो. Agent पुढे काय करायचे ते ठरवतो, tool कॉल करतो, result वाचतो आणि पुन्हा निर्णय घेतो. Job पूर्ण होईपर्यंत किंवा एखादी limit त्याला थांबवेपर्यंत ही प्रक्रिया सुरू राहते. व्यावहारिक चाचणी अशी आहे: उत्तर मिळाल्यानंतर आणि action होण्यापूर्वी human ने button दाबल्याशिवाय software काही बदल करू शकत असेल, तर ते agent आहे. त्यामुळे त्यासोबत येणारे hosting आणि guardrails देखील आवश्यक असतात.