SSD Nodes Learn 🎉 VPS $4.99/মাস থেকে
নির্দেশিকা Matt Connorদ্বারা Matt Connor · আপডেট করা হয়েছে 2026-08-07

AI Agent, LLM ও AI Assistant-এর পার্থক্য কী?

LLM চালাতে RAM লাগে, assistant শুধু chat surface যোগ করে, আর agent tools, loop ও credentials ধরে রাখে। তাই agent-এর জন্য সবসময় চালু machine দরকার।

AI agent, LLM এবং AI assistant-এর মধ্যে পার্থক্য কী?

AI agent, LLM এবং AI assistant একই stack-এর তিনটি স্তর। কোনটি কী, তা বোঝার একটি উপায় হলো প্রতিটি স্তরের server-এ কী প্রয়োজন তা দেখা। LLM (large language model) হলো weights-এর একটি file, যার RAM এবং compute প্রয়োজন। Assistant হলো chat surface, account এবং সংরক্ষিত history-সহ সেই model-এর একটি wrapper; এটি প্রায় সবসময় অন্য কারও hardware-এ চলে। Agent হলো এমন একটি assistant, যার tools এবং একটি loop-ও আছে। এটি credentials ধরে রাখে। এই কারণেই agent-কে এমন একটি machine-এ চালাতে হয়, যা সবসময় চালু থাকে।

এই বিষয়ে অধিকাংশ লেখা সংজ্ঞা দেওয়ার পর থেমে যায়। সংজ্ঞাগুলো গুরুত্বপূর্ণ শুধু এই কারণে যে প্রতিটি স্তরের জন্য আলাদাভাবে খরচ হয়। একটি স্তরে RAM-এর খরচ হয়। পরের স্তরে public URL এবং TLS (transport layer security)-এর খরচ হয়। শেষ স্তরে credentials-এর খরচ হয়। কোনো agent যে credential ব্যবহার করেছে, সেটি এখন আপনাকে rotate করতে হবে।

LLM হলো weights, আর weights-এর জন্য RAM প্রয়োজন

LLM হলো সংখ্যার একটি file। আপনি এটি download করেন, একটি runtime এটি memory-তে load করে, এবং এটি একবারে একটি request-এর উত্তর দেয়। এর কাজের সীমা নির্দিষ্ট: text input হিসেবে যায়, text output হিসেবে আসে। একাধিক call-এর মধ্যে model-এর কোনো memory থাকে না, clock থাকে না, network access থাকে না এবং file open করার কোনো উপায় থাকে না। LLM যা কিছু মনে রেখেছে বলে মনে হয়, তা আসলে এটিকে call করা program তার context-এ যোগ করেছে।

আপনার VPS plan নির্ধারণকারী সংখ্যা হলো ওই file-এর size, কারণ model চলার সময় পুরো file-টি memory-তে থাকে। Ollama যে 4-bit quantisation default হিসেবে ship করে, তাতে প্রতি billion parameters-এর জন্য প্রায় 0.6 GB ধরুন। এর সঙ্গে context window এবং runtime-এর জন্য আরও এক বা দুই gigabyte যোগ করুন।

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

qwen3:8b build-টি disk-এ 5.2 GB জায়গা নেয় এবং swapping ছাড়া চালাতে প্রায় 8 GB RAM চায়। 4 GB VPS qwen3:14b load করতে পারবে না। একটি শব্দও type করার আগে এর size হলো 9.3 GB। এখানকার সবচেয়ে বড় row, qwen3:32b, চালাতে প্রায় 24 GB প্রয়োজন। বেশিরভাগ price list-এ এটি আলাদা plan এবং আলাদা monthly bill।

Memory-তে fit করা একটি বিষয়। Speed আরেকটি বিষয়। CPU-only VPS-এ bottleneck হলো clock speed নয়, memory bandwidth। তাই fit করা model-ও প্রতি second-এ মাত্র কয়েকটি token-এর উত্তর দিতে পারে। রাতভর চলা job-এর জন্য এটি ঠিক আছে, কিন্তু chat-এর জন্য অস্বস্তিকর। GPU এই গতি প্রায় এক order of magnitude বাড়ায়, এবং bill-ও বাড়ায়। তাই measurement-এর ভিত্তিতে সিদ্ধান্ত নিন: যে workload চালানোর পরিকল্পনা করেছেন, তা দিয়ে VPS benchmark করুন এবং পড়ুন কখন GPU VPS-এর খরচ সার্থক হয়। weights চালু করতে প্রথমে শুরু করুন নিজের VPS-এ Ollama চালানো দিয়ে।

একটি assistant হলো একটি LLM এবং একটি chat surface

একটি assistant হলো একটি model-কে ঘিরে তৈরি product layer। ChatGPT এবং Claude হলো assistant: একটি model, একটি chat window, একটি account, সংরক্ষিত conversation এবং একটি rate limit। এর প্রায় কোনোটিই আপনার নিয়ন্ত্রণাধীন hardware-এ চলে না। তাই hosted assistant-এর জন্য subscription খরচ হয় এবং RAM প্রয়োজন হয় না।

Self-hosted সংস্করণটি Open WebUI-এর মতো একটি front end, যা স্থানীয় Ollama বা hosted API-এর সঙ্গে সংযুক্ত থাকে। Front end হলো ছোট আকারের software। Chat surface-এর জন্য resident অবস্থায় প্রায় 1 GB RAM ধরুন; এর সঙ্গে model-এর প্রয়োজনীয় RAM অতিরিক্ত যোগ হবে। Bare model-এর মতো নয়, এটির public URL এবং certificate প্রয়োজন। কারণ আপনি phone থেকে এটিতে প্রবেশ করতে চান: Certbot এবং Nginx দিয়ে certificate তৈরি করুন, অথবা একাধিক app-এর সামনে Traefik-এ TLS termination করুন। আপনি যদি এখনও front end নির্বাচন করে থাকেন, Open WebUI-এর বিকল্পগুলোর তুলনা করুন

একটি assistant উত্তর দেয়। এটি নিজে কোনো কাজ করে না। এটি shell command লিখলে একজন ব্যক্তি সেই command পড়ে paste করবেন কি না তা নির্ধারণ করেন। ওই ব্যক্তি একটি safety layer। Agent এই safety layer সরিয়ে দেয়।

একজন agent tool এবং loop যোগ করে

একজন agent এমন একটি assistant, যে function call করতে এবং ফলাফল পড়তে পারে। দুটি অংশ এই কাজ করে। প্রথমটি হলো tool: model যে function request করতে পারে তার একটি description এবং সেটি চালানোর জন্য আপনার code। দ্বিতীয়টি হলো loop: আপনার program model-কে call করে, model একটি tool চায়, আপনার program tool-টি চালায়, output conversation-এ যোগ করে এবং আবার model-কে call করে। Model কাজ শেষ হয়েছে না বলা পর্যন্ত, অথবা কোনো limit loop থামিয়ে না দেওয়া পর্যন্ত, এটি চলতে থাকে।

Loop সাধারণ code, এবং একটি মৌলিক loop একশো লাইনেরও কম হতে পারে। এটিকে agent করে তোলে tool-এর সঙ্গে থাকা বাস্তব credential, যার ফলে loop নিজস্ব সীমার বাইরে কোনো পরিবর্তন করতে পারে। এই একটি বিষয়ই নিচের সব hosting সিদ্ধান্তকে প্রভাবিত করে। Agent-এর দক্ষতা এবং MCP (model context protocol) server—loop পুনর্লিখন না করে agent-কে আরও tool দেওয়ার দুটি উপায়।

বক্সের প্রতিটি স্তরের জন্য কী প্রয়োজন

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

RAM কলামটি সতর্কতার সঙ্গে পড়ুন, কারণ এতে model-এর RAM অন্তর্ভুক্ত নয়। একটি chat front end এবং একটি agent runtime—দুটিই ছোট program। agent যদি hosted model ব্যবহার করে, তাহলে এটি চালানোর জন্য 2 GB RAM যথেষ্ট, এবং একটি সাশ্রয়ী plan বাস্তবসম্মত সমাধান, কোনো আপস নয়। একই box-এ weights রাখলে 8 GB model-এর সারির চাহিদাই অন্য সবকিছুকে ছাড়িয়ে যায়।

অন্য কলামগুলোর গুরুত্ব মানুষ যতটা মনে করে, তার চেয়ে বেশি। শুধু model layer-ই GPU পেলে দ্রুত হয়। সাধারণভাবে শুধু assistant layer-এরই public URL প্রয়োজন, কারণ browser-কে সেখানে পৌঁছাতে হয়; agent-এর public URL লাগে কেবল তখনই, যখন বাইরের কোনো কিছু থেকে সেটিকে call করতে হয়, যেমন webhook। আর একটি agent severalটি credential ধারণ করে, যা একটি chat window-এর সঙ্গে এর প্রকৃত পার্থক্য। একটি chat window ভুল করতে পারে। একটি agent ভুল করতে পারে এবং তারপর সেই ভুলের ভিত্তিতে কাজও করতে পারে।

একটি AI agent চালাতে কি GPU প্রয়োজন?

না, যদি না একই মেশিনে model weights-ও host করেন। Agent loop-এ HTTP request, JSON parsing এবং subprocess call থাকে। এটি network-এর উত্তরের জন্য অপেক্ষা করার সময় CPU প্রায় নিষ্ক্রিয় থাকে। GPU-সংক্রান্ত প্রশ্নটি আসলে LLM layer-সংক্রান্ত প্রশ্ন।

তাই সিদ্ধান্তটি আলাদা করে নিন। Text যদি আপনার machine-এর বাইরে যেতে না পারে, তাহলে model রাখার জন্য পর্যাপ্ত memory এবং ব্যবহারযোগ্য গতির জন্য সেটি চালানোর GPU-তে অর্থ ব্যয় করুন। আপনি যদি শুধু automation চান, তাহলে token অনুযায়ী model ভাড়া নিন এবং সেই অর্থ uptime ও backup-এর পেছনে ব্যয় করুন। 2026 সালে অধিকাংশ self-hosted agent hosted model ব্যবহার করে। এ কারণে সেগুলো চালানোর খরচ কম হয়।

আপনি কি একটি AI agent নিজে host করতে পারেন?

হ্যাঁ। Agent-ই নিজে host করার জন্য সবচেয়ে উপযুক্ত স্তর, কারণ loop-এর মধ্যেই আপনার data এবং credentials থাকে। 2 GB RAM, একটি service manager এবং outbound network access-সহ একটি ছোট VPS বাস্তব agent চালাতে পারে। আপনি যদি loop-এর সম্পূর্ণ নিয়ন্ত্রণ চান, তাহলে VPS-এ নিজে তৈরি করার পদ্ধতি বেছে নিন। আর যদি আগে থেকেই তৈরি কিছু দিয়ে শুরু করতে চান, তাহলে প্রস্তুত self-hosted agent deploy করুন

Assistant নিজে host করা সহজ: এর জন্য একটি container এবং একটি certificate প্রয়োজন। Model নিজে host করাই ব্যয়বহুল অংশ। CPU-তে token খুব ধীরে তৈরি হতে দেখে অনেকে এই কাজ ছেড়ে দেন। Data যদি server-এর বাইরে পাঠানো না যায়, অথবা আপনার ব্যবহারের পরিমাণে প্রতি-token pricing ব্যয়বহুল হয়ে ওঠে, তখন weights নিজে host করুন। অন্যথায় agent-কে API call করতে দিন এবং গুরুত্বপূর্ণ অংশগুলো local রাখুন।

ChatGPT কি একটি AI agent?

কোনো chat product তখনই agent হয়ে যায়, যখন এটি কোনো tool call করতে পারে এবং আগে আপনার অনুমতি না নিয়ে সেই ফলাফলের ভিত্তিতে কাজ করতে পারে। এই মানদণ্ডে browsing, code execution বা connector-সমৃদ্ধ hosted assistant-গুলো agent। আপনার জন্য পার্থক্য হলো, এই loop কোথায় চলে এবং কোন পক্ষের credentials ব্যবহার করে। hosted product-এ দুটিই vendor-এর নিয়ন্ত্রণে থাকে। নিজের server-এ দুটিই আপনার নিয়ন্ত্রণে থাকে; সেই সঙ্গে রাত 3টায় এই loop যা করে, তার দায়িত্বও আপনার।

Reactive, planning এবং multi-agent

Roundup-ধরনের লেখায় agent-এর সাতটি ধরন তালিকাভুক্ত করা হয়। এর বেশিরভাগই marketing। দুটি পার্থক্য আপনার লেখা code পরিবর্তন করে, আর একটি খরচ পরিবর্তন করে। Reactive agent একটি tool call করে, উত্তর পড়ে এবং reply দেয়। Planning agent প্রথমে একটি plan তৈরি করে, তারপর সেই plan অনুযায়ী কাজ করে। দীর্ঘ কাজের ক্ষেত্রে এই পদ্ধতি বেশি স্থিতিশীল, তবে এতে বেশি token খরচ হয়, কারণ প্রতিটি ধাপে plan আবার পাঠানো হয়। Multi-agent setup-এ একটি agent অন্য agent শুরু করতে পারে। এতে একই সঙ্গে token খরচ এবং ব্যর্থতার সম্ভাব্য কারণ বেড়ে যায়। তাই sub-job সত্যিই স্বাধীন হলে, যেমন একসঙ্গে চারটি source search করা, তখনই এটি উপযোগী। Reactive পদ্ধতি দিয়ে শুরু করুন। Run দীর্ঘ হলে planning যোগ করুন। Multi-agent সর্বশেষে ব্যবহার করুন। সামগ্রিক ধারণার জন্য দেখুন 2026 সালে AI agent সম্পর্কে কী শেখা মূল্যবান

আপনি আসলে কোন স্তর চালাচ্ছেন তা কীভাবে বুঝবেন

সার্ভারে কোন process memory ধরে রেখেছে তা পরীক্ষা করুন।

free -h
ps -eo rss,comm --sort=-rss | head -5

যদি শীর্ষ সারিতে দেখা যায় যে ollama বা llama-server কয়েক gigabyte RSS ধরে রেখেছে (resident set size, অর্থাৎ একটি process বাস্তবে যতটা memory ব্যবহার করে), তাহলে আপনি model host করছেন। কোনো process কয়েক hundred megabyte-এর বেশি memory ব্যবহার না করলে এবং আপনার API bill ক্রমাগত বাড়তে থাকলে, আপনি agent বা assistant host করছেন এবং model ভাড়া নিচ্ছেন। browser tab-এ সবকিছু ঘটায় তালিকাটি খালি থাকলে, আপনি assistant-এর customer। আপনার হয়ে কাজ করে এমন software প্রয়োজন না হওয়া পর্যন্ত এটি সম্পূর্ণ গ্রহণযোগ্য ব্যবস্থা।

কোনটি চালাতে চান?

FAQ

AI agent কি অতিরিক্ত কয়েকটি ধাপসহ একটি LLM মাত্র?

অতিরিক্ত ধাপগুলোই পণ্যটির মূল অংশ। একটি LLM শুধু text-কে text-এ রূপান্তর করে। Agent-এর চারপাশে এমন tools থাকে যেগুলো এটি call করতে পারে, এবং একটি loop থাকে যা বারবার সেগুলো call করে। এই tools-এ credentials থাকে, তাই output-এর মাধ্যমে file, database বা চলমান service পরিবর্তন করা সম্ভব। এ কারণে agent-এর জন্য চালু থাকা একটি machine, একটি service manager এবং একটি secrets policy প্রয়োজন। অন্যদিকে, উত্তর দেওয়ার সময় LLM-এর শুধু weights ধারণ করার মতো memory প্রয়োজন।

AI agent চালাতে কি GPU দরকার?

Agent-এর জন্য নয়। এই loop-এ HTTP requests, JSON handling এবং subprocess calls থাকে। Network-এর জন্য অপেক্ষা করার সময় যেকোনো CPU এগুলো পরিচালনা করতে পারে। GPU দরকার শুধু তখনই, যখন আপনি নিজে model weights host করবেন এবং সেগুলো থেকে প্রতি সেকেন্ডে কয়েকটির বেশি token পেতে চান। Hosted model call করা একটি agent GPU ছাড়াই ছোট VPS-এ স্বাচ্ছন্দ্যে চলতে পারে।

AI agent-এর জন্য VPS-এ কত RAM দরকার?

Agent hosted model call করলে প্রায় 2 GB দরকার। কারণ runtime, তার dependencies এবং একটি ছোট local database-ই তখন এতে থাকে। আপনি weights host করলে তার সঙ্গে model-এর RAM যোগ করতে হবে: qwen3:8b একাই প্রায় 8 GB চায়। তাই all-in-one box-এর শুরু ওই পরিমাণ থেকে হয় এবং আপনার নির্বাচিত model অনুযায়ী আরও বাড়ে।

আমি কি একটি AI assistant self-host করে আমার কথোপকথন ব্যক্তিগত রাখতে পারি?

হ্যাঁ, তবে একটি শর্ত আছে, যা পুরো বিষয়টি নির্ধারণ করে। Open WebUI-এর মতো একটি self-hosted front end আপনার server-এ accounts এবং history রাখে। কথোপকথন সত্যিই ব্যক্তিগত থাকবে শুধু তখনই, যখন এর পেছনের model-টিও local হবে। একই front end-কে hosted API-এর দিকে নির্দেশ করলে প্রতিটি message-এ text আপনার box ছেড়ে বাইরে যায়। ফলে history আপনার কাছে থাকে, privacy থাকে না।

AI agent এবং chatbot-এর মধ্যে পার্থক্য কী?

Chatbot উত্তর দেয় এবং থেমে যায়। Agent পরবর্তী কাজ নির্ধারণ করে, একটি tool call করে, ফলাফল পড়ে এবং আবার সিদ্ধান্ত নেয়—কাজ শেষ হওয়া পর্যন্ত অথবা কোনো limit তাকে থামানো পর্যন্ত। ব্যবহারিক পরীক্ষা হলো: উত্তর দেওয়ার পর action নেওয়ার আগে কোনো মানুষ button না চাপলেও যদি software কোনো কিছু পরিবর্তন করতে পারে, তাহলে সেটি agent। এর জন্য সংশ্লিষ্ট hosting এবং guardrails প্রয়োজন।