AI Agent, LLM மற்றும் AI Assistant: வேறுபாடுகள் என்ன?
LLM, AI Assistant மற்றும் AI Agent ஆகியவற்றின் தொழில்நுட்ப வேறுபாடுகளை அறியுங்கள். RAM தேவை, chat interface மற்றும் tool loop வசதி கொண்ட agent-களின் தேவைகளை விரிவாகப் பாருங்கள்.
AI agent, LLM மற்றும் AI assistant ஆகியவற்றிற்கு இடையிலான வேறுபாடு என்ன?
AI agent, LLM மற்றும் AI assistant ஆகிய மூன்றும் ஒரே கட்டமைப்பின் மூன்று அடுக்குகள் ஆகும். இவை ஒவ்வொன்றும் server-ல் இருந்து எதை எதிர்பார்க்கின்றன என்பதைக் கொண்டு இவற்றை வேறுபடுத்தி அறியலாம். LLM (large language model) என்பது RAM மற்றும் compute தேவைப்படும் ஒரு weights கோப்பு ஆகும். ஒரு assistant என்பது chat interface-ல் பொதிந்துள்ள அந்த model ஆகும்; இதில் பயனர் கணக்கு மற்றும் சேமிக்கப்பட்ட வரலாறு இருக்கும், இது பெரும்பாலும் பிறரது hardware-ல் இயங்கும். ஒரு agent என்பது கருவிகள் (tools) மற்றும் loop வசதி கொண்ட ஒரு assistant ஆகும்; இது credentials-ஐக் கொண்டிருக்கும், இதனால்தான் இது எப்போதும் இயங்கிக்கொண்டிருக்கும் ஒரு machine-ல் இருக்க வேண்டியது அவசியமாகிறது.
இந்தக் கேள்வி குறித்த பெரும்பாலான விளக்கங்கள் வரையறைகளுடன் நின்றுவிடுகின்றன. இந்த வரையறைகள் முக்கியமானவை, ஏனெனில் ஒவ்வொரு அடுக்கிற்கும் கட்டணம் வசூலிக்கும் முறை மாறுபடும். ஒன்றுக்கு RAM தேவைப்படும். அடுத்ததற்கு public URL மற்றும் TLS (transport layer security) தேவைப்படும். கடைசியாக உள்ளதற்கு credentials தேவைப்படும்; ஒரு agent பயன்படுத்திய credential-ஐ நீங்கள் மாற்ற வேண்டியிருக்கும் (rotate).
LLM என்பது எடைகள் (weights), அவற்றுக்கு RAM தேவை
LLM என்பது எண்களைக் கொண்ட ஒரு கோப்பு. நீங்கள் அதைத் தரவிறக்கம் செய்கிறீர்கள், ஒரு runtime அதை நினைவகத்தில் (memory) ஏற்றுகிறது, அது ஒரு நேரத்தில் ஒரு கோரிக்கைக்குப் பதிலளிக்கிறது. இதற்கான ஒப்பந்தம் மிக எளிமையானது: உரை உள்ளே செல்கிறது, உரை வெளியே வருகிறது. அழைப்புகளுக்கு இடையே இந்த மாதிரிக்கு நினைவாற்றலோ, கடிகாரமோ, பிணைய அணுகலோ (network access) அல்லது கோப்பைத் திறக்கும் வசதியோ கிடையாது. ஒரு LLM எதையாவது நினைவில் வைத்திருப்பது போலத் தெரிந்தால், அது அந்த மாதிரியை இயக்கும் நிரல் அதன் சூழலில் (context) ஒட்டியது மட்டுமே.
உங்கள் VPS திட்டத்தைத் தீர்மானிக்கும் எண் அந்த கோப்பின் அளவுதான், ஏனெனில் மாதிரி இயங்கும்போது அது முழுமையாக நினைவகத்தில் அமர்ந்திருக்கும். Ollama இயல்பாக வழங்கும் 4-bit quantisation-ல், ஒரு பில்லியன் அளவுருக்களுக்கு (parameters) சுமார் 0.6 GB என கணக்கிடுங்கள், அதனுடன் context window மற்றும் runtime-க்காக ஒன்று அல்லது இரண்டு GB சேர்த்துக்கொள்ளுங்கள்.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]qwen3:8b build வட்டில் 5.2 GB அளவு கொண்டது, மேலும் swapping இல்லாமல் இயங்க சுமார் 8 GB RAM தேவைப்படுகிறது. 4 GB VPS-ல் qwen3:14b ஏற்றப்படாது, ஏனெனில் நீங்கள் ஒரு வார்த்தையைத் தட்டச்சு செய்வதற்கு முன்பே அதன் அளவு 9.3 GB ஆக உள்ளது. இதில் மிகப்பெரிய வரிசையான qwen3:32b, சுமார் 24 GB-ஐக் கோருகிறது; இது பெரும்பாலான விலைப்பட்டியல்களில் ஒரு மாறுபட்ட திட்டம் மற்றும் மாறுபட்ட மாதாந்திரக் கட்டணத்தைக் குறிக்கும்.
நினைவகத்தில் பொருந்துவது ஒரு கேள்வி. வேகம் என்பது மற்றொன்று. CPU-மட்டும் கொண்ட VPS-ல், clock speed-ஐ விட நினைவக அலைவரிசையே (memory bandwidth) தடையாக இருக்கும், எனவே பொருந்தக்கூடிய ஒரு மாதிரி கூட வினாடிக்குச் சில tokens என்ற வேகத்திலேயே பதிலளிக்கும். இது இரவு முழுவதும் இயங்கும் வேலைக்குச் சரியாக இருக்கும், ஆனால் உரையாடலுக்குப் போதுமானதாக இருக்காது. ஒரு GPU அந்த வேகத்தை சுமார் பத்து மடங்கு அதிகரிக்கும், ஆனால் அது உங்கள் கட்டணத்தையும் உயர்த்தும், எனவே அளவீடு செய்து முடிவெடுங்கள்: நீங்கள் இயக்கத் திட்டமிட்டுள்ள பணிச்சுமையுடன் VPS-ஐ benchmark செய்யுங்கள் மற்றும் GPU VPS எப்போது அதன் விலைக்குத் தகுதியானது என்பதைப் படியுங்கள். எடைகளை (weights) இயக்கத் தொடங்க, உங்கள் சொந்த VPS-ல் Ollama என்பதைப் பாருங்கள்.
Assistant என்பது ஒரு LLM மற்றும் chat surface-ன் கலவை
Assistant என்பது ஒரு model-ஐச் சுற்றியுள்ள product layer ஆகும். ChatGPT மற்றும் Claude ஆகியவை assistants: ஒரு model, ஒரு chat window, ஒரு account, சேமிக்கப்பட்ட உரையாடல்கள் மற்றும் rate limit ஆகியவற்றைக் கொண்டவை. இதில் பெரும்பாலானவை நீங்கள் கட்டுப்படுத்தும் hardware-ல் இயங்குவதில்லை; இதனால்தான் hosted assistant-க்கு subscription கட்டணம் தேவைப்படுகிறது, ஆனால் உங்கள் RAM பயன்பாடு பூஜ்ஜியமாக இருக்கும்.
Self-hosted பதிப்பு என்பது Open WebUI போன்ற ஒரு front end ஆகும், இது உள்ளூர் Ollama அல்லது hosted API-உடன் இணைக்கப்பட்டிருக்கும். இந்த front end ஒரு சிறிய மென்பொருள். Chat surface-க்கு 1 GB RAM தேவைப்படும், இது model-க்குத் தேவையான RAM-க்கு மேலதிகமானது. ஒரு bare model-க்குத் தேவையில்லாத, ஆனால் இதற்குத் தேவையான ஒன்று public URL மற்றும் certificate ஆகும், ஏனெனில் நீங்கள் இதை உங்கள் தொலைபேசியிலிருந்து அணுக விரும்புகிறீர்கள்: Certbot மற்றும் Nginx மூலம் certificate-ஐப் பெறுதல், அல்லது பல செயலிகளுக்கு முன்னால் Traefik மூலம் TLS termination செய்தல். நீங்கள் இன்னும் ஒரு front end-ஐத் தேர்வு செய்துகொண்டிருந்தால், Open WebUI-ன் மாற்று வழிகளை ஒப்பிட்டுப் பாருங்கள்.
Assistant பதிலளிக்கும். அது செயல்படாது. அது ஒரு shell command-ஐ எழுதும்போது, ஒரு நபர் அந்தக் கட்டளையைப் படித்து, அதை paste செய்யலாமா என்று முடிவு செய்கிறார். அந்த நபர் ஒரு பாதுகாப்பு அடுக்கு (safety layer); அந்த நபரை நீக்கிவிட்டு நேரடியாகச் செயல்படும் அமைப்பே agent ஆகும்.
Agent-க்கு கருவிகளையும் சுழற்சியையும் (loop) சேர்த்தல்
Agent என்பது செயல்பாடுகளை (functions) அழைத்து, அதன் முடிவுகளைப் படிக்கக்கூடிய ஒரு உதவியாளர். இரண்டு பகுதிகள் இந்த வேலையைச் செய்கின்றன. முதலாவது கருவி (tool): இது மாதிரி (model) கோரக்கூடிய ஒரு செயல்பாட்டின் விளக்கம் மற்றும் அதை இயக்கும் உங்கள் குறியீடு. இரண்டாவது சுழற்சி (loop): உங்கள் நிரல் மாதிரியை அழைக்கும், மாதிரி ஒரு கருவியைக் கோரும், உங்கள் நிரல் அதை இயக்கும், வெளியீட்டை உரையாடலில் சேர்க்கும், மீண்டும் மாதிரியை அழைக்கும். மாதிரி முடிந்துவிட்டதாகக் கூறும் வரை அல்லது ஒரு வரம்பு அதை நிறுத்தும் வரை இது தொடரும்.
இந்தச் சுழற்சி சாதாரண குறியீடுதான், அடிப்படைச் சுழற்சி நூறு வரிகளுக்குள் அடங்கிவிடும். கருவிகள் உண்மையான நற்சான்றிதழ்களைக் (credentials) கொண்டிருப்பதே அதை ஒரு Agent-ஆக மாற்றுகிறது, எனவே அந்தச் சுழற்சியால் தனக்கு வெளியேயுள்ள எதையும் மாற்ற முடியும். இந்த ஒற்றைக் காரணமே கீழே உள்ள ஒவ்வொரு hosting முடிவையும் தீர்மானிக்கிறது. Agent திறன்கள் மற்றும் MCP (model context protocol) servers ஆகிய இரண்டும், சுழற்சியை மீண்டும் எழுதாமலேயே ஒரு Agent-க்கு கூடுதல் கருவிகளை வழங்க உதவும் வழிகளாகும்.
- இது உங்கள் session-ஐ விட நீண்ட காலம் இயங்கும். நீங்கள் tab-ஐ மூடும்போது ஒரு chat முடிந்துவிடும். ஒரு Agent-ன் செயல்பாடு இருபது நிமிடங்கள் எடுக்கலாம், உங்கள் laptop sleep mode-க்குச் சென்றாலும் அது இயங்க வேண்டும். எனவே, இது எப்போதும் இயங்கிக்கொண்டிருக்கும் ஒரு server-ல் இருக்க வேண்டும், மேலும் a systemd service or timer மூலம் reboot-க்கு பிறகு மீண்டும் தொடங்கப்பட வேண்டும்.
- இது ரகசியங்களைக் கொண்டுள்ளது. ஒரு API key, SSH key, அல்லது database password என எதுவாக இருந்தாலும், Agent-ஆல் எதைப் படிக்க முடியுமோ, அதை அதன் உள்ளீட்டில் மறைத்து வைக்கப்பட்டுள்ள ஒரு தீய அறிவுறுத்தல் மூலம் பயன்படுத்த வைக்க முடியும். எனவே, ரகசியங்களை Agent-ன் அணுகலுக்கு அப்பாற்பட்டு வைத்திருங்கள்.
- இதன் செலவு உங்கள் கேள்வியைப் பொறுத்து அல்ல, சுழற்சியைப் பொறுத்து அதிகரிக்கிறது. ஒவ்வொரு படியும் முழு உரையாடலையும் உள்ளீடாக மீண்டும் அனுப்புகிறது, எனவே பத்து படிகள் கொண்ட ஒரு செயல்பாட்டிற்கு அந்த உரையாடலுக்காக பத்து முறை கட்டணம் செலுத்த வேண்டியிருக்கும். இதனால்தான் input tokens ஒரு Agent-ன் கட்டணத்தை தீர்மானிக்கின்றன மற்றும் ஒரு செயல்பாட்டிற்கான செலவில் கடுமையான வரம்பை நீங்கள் வைக்க வேண்டும்.
- இது எழுதும் வகையில் தவறாகச் செயல்படக்கூடும். ஒரு chat-ல் தவறான பதில் கிடைத்தால் மீண்டும் படிக்க வேண்டியிருக்கும். ஆனால், ஒரு சுழற்சிக்குள் தவறான delete கட்டளை இயங்கினால், அது உங்கள் directory-யையே அழித்துவிடும். இதை குறைந்தபட்ச அதிகாரங்கள் கொண்ட பயனர் கணக்கில் இயக்குங்கள், மேலும் coding செய்யும் Agent-களுக்கு, உங்கள் repository-ஐ வழங்குவதற்கு முன்பு அதை sandbox-ல் வையுங்கள்.
ஒவ்வொரு அடுக்குக்கும் தேவையானவை
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]RAM நிரலை கவனமாகப் படிக்கவும், ஏனெனில் அதில் model-ன் அளவு சேர்க்கப்படவில்லை. Chat front end மற்றும் agent runtime ஆகிய இரண்டுமே சிறிய programs ஆகும். Agent ஒரு hosted model-ஐ அழைத்தால், 2 GB RAM அதை இயக்கப் போதுமானது; எனவே, மலிவான திட்டம் என்பது சமரசம் அல்ல, அது ஒரு சரியான தீர்வாகும். Weights-ஐ அதே box-ல் வைத்தால், 8 GB model வரிசை மற்ற அனைத்தையும் விட அதிக வளங்களை எடுத்துக்கொள்ளும்.
மற்ற நிரல்கள் மக்கள் எதிர்பார்ப்பதை விட முக்கியமானவை. Model அடுக்கு மட்டுமே GPU மூலம் வேகமடையும். Assistant அடுக்குக்கு மட்டுமே பொதுவான URL தேவைப்படுகிறது, ஏனெனில் browser அதை அணுக வேண்டியிருக்கும்; ஒரு agent-க்கு webhook போன்ற வெளிப்புற அழைப்புகள் வரும்போது மட்டுமே URL தேவைப்படும். மேலும், ஒரு agent several credentials-ஐக் கையாளுகிறது; இதுவே அதற்கும் chat window-க்கும் உள்ள உண்மையான வேறுபாடு. Chat window தவறான தகவலைத் தரலாம். ஆனால், ஒரு agent தவறான தகவலைப் பெற்று, அதன் அடிப்படையில் ஒரு செயலைச் செய்யக்கூடும்.
AI agent-ஐ இயக்க GPU தேவையா?
இல்லை, நீங்கள் அதே machine-ல் model weights-ஐ host செய்யவில்லை என்றால் இது தேவையில்லை. Agent loop என்பது HTTP requests, JSON parsing மற்றும் subprocess calls ஆகியவற்றை உள்ளடக்கியது; network-க்காகக் காத்திருக்கும்போது CPU பெரும்பாலும் சும்மாவே இருக்கும். GPU குறித்த கேள்வி உண்மையில் LLM layer-ஐப் பொறுத்தது.
எனவே, இந்த முடிவை இரண்டாகப் பிரிக்கவும். தரவுகள் உங்கள் server-ஐ விட்டு வெளியேறக்கூடாது என்றால், model-ஐச் சேமிக்கத் தேவையான memory-க்கும், பயன்பாட்டு வேகத்திற்குத் தேவையான GPU-க்கும் செலவு செய்யுங்கள். உங்களுக்கு automation மட்டுமே தேவை என்றால், token அடிப்படையில் model-ஐ வாடகைக்கு எடுத்து, அந்தப் பணத்தை uptime மற்றும் backups-க்குச் செலவிடுங்கள். 2026-ல் பெரும்பாலான self-hosted agents ஒரு hosted model-ஐயே அழைக்கின்றன, இதுவே செலவு குறைந்த முறையாகும்.
AI agent-ஐ நீங்களே self-host செய்ய முடியுமா?
ஆம், AI agent-ஐ நீங்களே host செய்வது மிகவும் பயனுள்ளது. ஏனெனில், இந்தச் செயல்பாட்டுச் சுழற்சியில்தான் (loop) உங்கள் தரவுகளும், credentials-ம் கையாளப்படுகின்றன. 2 GB RAM கொண்ட ஒரு சிறிய VPS, ஒரு service manager மற்றும் outbound network access இருந்தால், ஒரு முழுமையான agent-ஐ இயக்க முடியும். நீங்கள் இந்தச் சுழற்சியைத் முழுமையாகக் கட்டுப்படுத்த விரும்பினால் VPS-ல் நீங்களே உருவாக்கும் முறையை பின்பற்றவும். அல்லது, ஏற்கனவே தயாராக உள்ள தீர்வுகளைப் பயன்படுத்த விரும்பினால் ஏற்கனவே உள்ள self-hosted agent-களில் ஒன்றை deploy செய்யவும்.
Assistant-ஐ self-host செய்வது எளிது: இதற்கு ஒரு container மற்றும் ஒரு certificate மட்டுமே தேவை. Model-ஐ self-host செய்வதுதான் அதிக செலவு பிடிக்கும் பகுதி. CPU மூலம் tokens மெதுவாக வெளிவருவதைப் பார்த்த பிறகு, பலர் இந்த முயற்சியைக் கைவிடுகின்றனர். தரவுகள் server-ஐ விட்டு வெளியேறக்கூடாது என்ற சூழலிலோ அல்லது அதிகப்படியான பயன்பாட்டினால் per-token கட்டணம் அதிகமாகும்போதோ மட்டும் model weights-ஐ நீங்களே host செய்யுங்கள். மற்ற நேரங்களில், agent-ஐ ஒரு API-ஐ அழைக்கச் செய்து, முக்கியமான பகுதிகளை மட்டும் local-ல் வைத்துக்கொள்ளுங்கள்.
ChatGPT ஒரு AI agent-ஆ?
ஒரு chat product, உங்களிடம் அனுமதி கேட்காமலேயே ஒரு tool-ஐ இயக்கி, அதன் முடிவின் அடிப்படையில் செயல்படத் தொடங்கும் தருணத்தில் அது ஒரு agent-ஆக மாறுகிறது. இந்த அளவுகோலின்படி, browsing, code execution அல்லது connectors வசதி கொண்ட hosted assistants அனைத்தும் agent-களே. இதில் உங்களுக்கான வித்தியாசம் என்னவென்றால், அந்த loop எங்கே இயங்குகிறது மற்றும் அது யாருடைய credentials-ஐப் பயன்படுத்துகிறது என்பதுதான். ஒரு hosted product-ல் இவை இரண்டுமே vendor-க்குச் சொந்தமானவை. உங்கள் சொந்த server-ல் இவை இரண்டுமே உங்களுக்கே சொந்தம்; அத்துடன் அதிகாலை 3 மணிக்கு அந்த loop செய்யும் அனைத்துச் செயல்களுக்கும் நீங்களே பொறுப்பாவீர்கள்.
Reactive, planning மற்றும் multi-agent
ஏஜெண்டுகளை வகைப்படுத்தும் கட்டுரைகள் பெரும்பாலும் ஏழு வகைகளை பட்டியலிடுகின்றன. அவற்றில் பெரும்பாலானவை சந்தைப்படுத்தல் சார்ந்தவை. இரண்டு வகைப்பாடுகள் நீங்கள் எழுதும் code-ஐ மாற்றும், ஒன்று உங்கள் செலவை மாற்றும். ஒரு reactive agent ஒரு tool-ஐ அழைத்து, விடையைப் படித்து, பதில் அளிக்கும். ஒரு planning agent முதலில் ஒரு திட்டத்தை (plan) எழுதி, பின் அதைச் செயல்படுத்தும். இது நீண்ட பணிகளுக்குச் சிறப்பாகச் செயல்படும், ஆனால் ஒவ்வொரு நிலையிலும் திட்டம் மீண்டும் அனுப்பப்படுவதால் அதிக tokens செலவாகும். ஒரு multi-agent அமைப்பு ஒரு agent மற்றவற்றைத் தொடங்க அனுமதிக்கிறது. இது token செலவையும், தோல்விக்கான வாய்ப்புகளையும் ஒரே நேரத்தில் அதிகரிக்கிறது. எனவே, துணைப் பணிகள் (sub-jobs) முற்றிலும் சுதந்திரமாக இருக்கும்போது மட்டுமே இது பயனுள்ளது; உதாரணமாக, ஒரே நேரத்தில் நான்கு ஆதாரங்களில் தேடுவது. முதலில் reactive முறையில் தொடங்கவும். பணிகள் நீண்டதாகும்போது planning-ஐச் சேர்க்கவும். இறுதியாகவே multi-agent முறைக்குச் செல்லவும். விரிவான வரைபடத்திற்கு, 2026-ல் AI agents பற்றி எதைக் கற்றுக்கொள்வது பயனுள்ளது என்பதைப் பார்க்கவும்.
நீங்கள் எந்த அடுக்கில் (layer) இயங்குகிறீர்கள் என்பதை கண்டறிவது எப்படி
Server-ல், எந்தெந்த processes நினைவகத்தை (memory) ஆக்கிரமித்துள்ளன என்று சரிபார்க்கவும்.
free -h
ps -eo rss,comm --sort=-rss | head -5மேல் வரிசையில் உள்ள ollama அல்லது llama-server பல gigabytes RSS-ஐ (resident set size, ஒரு process உண்மையில் பயன்படுத்தும் நினைவகம்) வைத்திருந்தால், நீங்கள் அந்த மாதிரியை (model) host செய்கிறீர்கள் என்று அர்த்தம். ஒரு சில நூறு megabytes-க்கு மேல் எதுவும் இல்லை, ஆனால் உங்கள் API கட்டணம் தொடர்ந்து அதிகரித்துக்கொண்டே இருந்தால், நீங்கள் ஒரு agent அல்லது assistant-ஐ host செய்து, மாதிரியை வாடகைக்கு எடுக்கிறீர்கள் என்று பொருள். அனைத்தும் browser tab-ல் நடப்பதால் அந்தப் பட்டியல் காலியாக இருந்தால், நீங்கள் ஒரு assistant-ன் வாடிக்கையாளர் என்று அர்த்தம்; உங்களுக்குப் பதிலாகச் செயல்படும் மென்பொருள் தேவைப்படும் வரை இது ஒரு சரியான நிலையே.
எதை இயக்க விரும்புகிறீர்கள்?
- தரவுகளைத் தனிப்பட்டதாக வைத்திருக்க, இந்த மாதிரியை இயக்கவும்: Ollama மூலம் LLM-ஐ self-host செய்தல், பின்னர் ஒரு பயனர் பத்து பயனர்களாக மாறும்போது Ollama மற்றும் vLLM செயல்திறனை ஒப்பிடுதல்.
- கட்டுப்பாட்டையும் கருவிகளையும் நீங்களே வைத்திருக்க, இந்த ஏஜென்ட்டை உருவாக்கவும்: VPS-ல் உங்கள் சொந்த AI ஏஜென்ட்டை உருவாக்குதல்.
- இன்று மாலைக்குள் ஒரு பயன்பாடு தயாராக இருக்க, இதிலிருந்து முழுமையான ஒன்றை deploy செய்யவும்: இயக்கத் தகுதியான self-hosted ஏஜென்ட்கள்.
- இதற்கு இன்னும் server தயார் செய்யப்படவில்லை என்றால், இதிலிருந்து தொடங்கவும்: VPS உண்மையில் உங்களுக்கு என்ன வழங்குகிறது.
FAQ
AI agent என்பது கூடுதல் படிகளைக் கொண்ட ஒரு LLM மட்டும்தானா?
அந்த கூடுதல் படிகளே அதன் முக்கிய அம்சமாகும். ஒரு LLM உரைக்கு பதிலாக உரையை மட்டுமே வழங்கும், வேறு எதையும் செய்யாது. ஒரு agent-ஐச் சுற்றி அதற்குத் தேவையான கருவிகள் (tools) மற்றும் அவற்றை மீண்டும் மீண்டும் இயக்கும் ஒரு loop இருக்கும். இந்தக் கருவிகள் credentials-ஐக் கொண்டிருப்பதால், அவற்றின் வெளியீடு ஒரு கோப்பை, தரவுத்தளத்தை அல்லது நேரடிச் சேவையை மாற்றியமைக்க முடியும். இதனால்தான் ஒரு agent-க்கு எப்போதும் இயங்கிக்கொண்டிருக்கும் ஒரு machine, ஒரு service manager மற்றும் ஒரு secrets policy தேவைப்படுகிறது. ஆனால், ஒரு LLM-க்கு அதன் பதில்களை உருவாக்கத் தேவையான weights-ஐச் சேமிக்கப் போதுமான நினைவகம் (memory) மட்டுமே தேவை.
AI agent-ஐ இயக்க எனக்கு GPU தேவையா?
agent-க்குத் தேவையில்லை. இதன் loop என்பது HTTP கோரிக்கைகள், JSON கையாளுதல் மற்றும் subprocess அழைப்புகள் ஆகும். இவை நெட்வொர்க்கிற்காகக் காத்திருக்கும்போது எந்தவொரு CPU-வாலும் எளிதாகக் கையாள முடியும். நீங்கள் model weights-ஐ நீங்களே host செய்து, வினாடிக்கு அதிக tokens தேவைப்பட்டால் மட்டுமே GPU தேவைப்படும். ஒரு hosted model-ஐ அழைக்கும் agent, GPU இல்லாத சிறிய VPS-ல் கூட சிறப்பாக இயங்கும்.
AI agent-க்கு VPS-ல் எவ்வளவு RAM தேவை?
agent ஒரு hosted model-ஐ அழைக்கும்போது, runtime, அதன் dependencies மற்றும் ஒரு சிறிய local database ஆகியவற்றைச் சேமிக்க சுமார் 2 GB தேவைப்படும். நீங்கள் weights-ஐயும் host செய்தால், அதனுடன் model-ஐச் சேர்க்கவும்: qwen3:8b-க்கு மட்டும் சுமார் 8 GB தேவைப்படும். எனவே, அனைத்தையும் ஒரே இடத்தில் கொண்ட ஒரு server-க்கு இந்த அளவிலிருந்து தொடங்கி, நீங்கள் தேர்ந்தெடுக்கும் model-க்கு ஏற்ப RAM தேவை அதிகரிக்கும்.
நான் ஒரு AI assistant-ஐ self-host செய்து, எனது உரையாடல்களைத் தனிப்பட்டதாக வைத்திருக்க முடியுமா?
ஆம், ஆனால் அனைத்தையும் தீர்மானிக்கும் ஒரு நிபந்தனை உள்ளது. Open WebUI போன்ற self-hosted front end, கணக்குகள் மற்றும் வரலாற்றை உங்கள் server-லேயே வைத்திருக்கும். அதன் பின்னணியில் உள்ள model-ம் local-ஆக இருந்தால் மட்டுமே உரையாடல்கள் தனிப்பட்டதாக இருக்கும். அதே front end-ஐ ஒரு hosted API-க்கு இணைத்தால், ஒவ்வொரு செய்தியின்போதும் உரை உங்கள் server-ஐ விட்டு வெளியேறிவிடும். இதனால் வரலாறு உங்களிடம் இருக்கும், ஆனால் தனியுரிமை இருக்காது.
AI agent மற்றும் chatbot-க்கு இடையே உள்ள வேறுபாடு என்ன?
ஒரு chatbot பதிலளித்துவிட்டு நின்றுவிடும். ஒரு agent அடுத்து என்ன செய்ய வேண்டும் என்று தீர்மானித்து, ஒரு கருவியை அழைத்து, அதன் முடிவைப் படித்து, பணி முடியும் வரை அல்லது ஒரு வரம்பு வரும் வரை மீண்டும் மீண்டும் செயல்படும். நடைமுறைச் சோதனை இதுதான்: ஒரு பதிலுக்கும் செயலுக்கும் இடையில் மனித தலையீடு இன்றி மென்பொருளால் எதையாவது மாற்ற முடிந்தால், அது ஒரு agent ஆகும். அதற்குத் தகுந்த hosting மற்றும் பாதுகாப்பு வழிமுறைகள் (guardrails) அவசியம்.