SSD Nodes Learn 🎉 VPS $4.99/महिन्यापासून
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-13

AI agents शून्यापासून कसे शिकावे: सहा टप्प्यांचा मार्ग

AI agents शिकण्यासाठी सहा टप्प्यांचा प्रत्यक्ष मार्ग: संकल्पना, स्वतः लिहिलेला loop, tools, memory, loop design आणि safety. प्रत्येक टप्प्यात एक गोष्ट तयार करा.

सहा टप्प्यांमधील मार्ग

AI agents शून्यापासून शिकण्यासाठी हे सहा टप्पे क्रमाने पूर्ण करा: संकल्पना, तुमचा पहिला loop, tools, memory, loop design आणि safety. प्रत्येक टप्प्यात तुम्ही स्वतःच्या हाताने एक गोष्ट तयार कराल. पुढील टप्प्यावर घाईने जाणे हे लोक शिकताना थांबण्याचे सर्वात सामान्य कारण आहे, कारण framework तुम्हाला पाहणे आवश्यक असलेला नेमका भाग लपवते.

AI agent म्हणजे tools call करण्याची परवानगी असलेल्या language model भोवती चालणारा loop. हे एक वाक्यच या विषयाचा संपूर्ण गाभा सांगते. त्यानंतरचे सर्व तपशील loop मध्ये काय जाते, tools कोणत्या गोष्टींना स्पर्श करू शकतात आणि loop चुकीच्या स्थितीत गेल्यावर तो कसा थांबवायचा याबद्दल आहेत. हा loop तुम्ही दुसऱ्या व्यक्तीला समजावून सांगू शकत असाल, तर तुम्ही ही संकल्पना शिकला आहात. तुम्ही फक्त frameworks ची नावे सांगू शकत असाल, तर तुम्ही ती शिकलेली नाही.

खालील आराखडा तुम्ही प्रत्यक्ष तयार करून शिकता असे गृहीत धरतो. एक टप्पा वाचा, त्यातील छोटी गोष्ट तयार करा, ती जाणीवपूर्वक बिघडवा आणि मग पुढे जा. तुम्ही फक्त वाचलेला टप्पा म्हणजे तुम्ही प्रत्यक्ष केलेला टप्पा नाही.

stage 1 पूर्वी तुम्हाला प्रत्यक्षात काय आवश्यक आहे

खरे prerequisite यादी लहान आहे. बहुतेक course pages सुचवतात त्यापेक्षा ती आणखी लहान आहे.

  • पन्नास ओळींच्या script इतक्या पातळीवर तुम्ही Python किंवा TypeScript वाचू आणि लिहू शकता.
  • Linux shell मध्ये तुम्ही सहज काम करू शकता: package install करणे, file edit करणे आणि log वाचणे.
  • तुमच्याकडे hosted model साठी API key आहे किंवा local model चालवू शकणारे machine आहे.

एवढीच संपूर्ण यादी आहे. तुम्हाला machine learning theory ची आवश्यकता नाही. तुम्ही model train केलेला असणेही आवश्यक नाही. Agent work मध्ये gradients किंवा training data वापरले जात नाहीत. तुम्ही model स्वतः चालवण्याचा निर्णय घेतल्यासच graphics card महत्त्वाचे ठरते. ही स्वतंत्र skill आहे. ती तुम्ही नंतर VPS वर Ollama host करून LLM self-host करणे यावरून शिकू शकता.

Shell संबंधीचा भाग लोक कमी लेखतात. Permissions, paths, environment variables आणि शांतपणे बंद होणाऱ्या processes मुळे agents fail होतात. PATH किंवा file mode संबंधीचा stack trace दिसल्यावर तुम्ही terminal बंद करत असाल, तर आधी Linux basics शिकण्यासाठी एक weekend द्या. त्यामुळे पुढे तुमचा एक महिना वाचेल.

पहिला टप्पा: agent म्हणजे काय आणि तो काय नाही

एका API call ने सुरुवात करा आणि loop वापरू नका. Prompt पाठवा, reply print करा आणि response मधील token counts पाहा. आता तुम्हाला cost चे एकक आणि latency चे एकक समजले आहे.

त्यानंतर tool use शिका. संपूर्ण क्षेत्रातील हीच एक खरोखर नवीन संकल्पना आहे. Function चे name, description आणि त्याच्या inputs साठी JSON (JavaScript object notation) schema देऊन त्याचे वर्णन model ला करा. Model स्वतः काहीही run करत नाही. तो structured request देतो: या arguments सह run_command call करा. तुमचा code function run करतो, त्याचे output message म्हणून परत पाठवतो आणि model ला पुन्हा विचारतो. Model हा text वाचून text लिहिणारा planner आहे. प्रत्यक्ष कृती करणारे हात तुमचा code आहे.

Chatbot एका reply नंतर थांबतो. Agent model tools मागणे थांबवेपर्यंत हा संवाद पुन्हा पुन्हा करतो. हाच संपूर्ण फरक आहे आणि त्यामुळे failure modes देखील वेगळे असतात. Chatbot एकदा चुकीचे उत्तर देतो. कोणाच्या लक्षात येण्यापूर्वी agent चुकीच्या उत्तरावर अनेक वेळा कृती करतो.

स्टेज 2: loop स्वतः एकदा लिहा

Framework पासून सुरुवात करू नका. Python मधील सुमारे तीस ओळी स्वतः लिहा, जेणेकरून या रचनेचा आकार तुमच्या नियंत्रणात राहील.

sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-here
import subprocess
import anthropic

client = anthropic.Anthropic()

tools = [{
    "name": "run_command",
    "description": "Run a read only shell command and return its output.",
    "input_schema": {
        "type": "object",
        "properties": {"command": {"type": "string"}},
        "required": ["command"],
    },
}]

messages = [{"role": "user", "content": "How much disk space is free here?"}]

while True:
    response = client.messages.create(
        model="claude-opus-5",
        max_tokens=4096,
        tools=tools,
        messages=messages,
    )
    if response.stop_reason != "tool_use":
        break
    messages.append({"role": "assistant", "content": response.content})
    results = []
    for block in response.content:
        if block.type == "tool_use":
            done = subprocess.run(
                block.input["command"], shell=True,
                capture_output=True, text=True, timeout=10,
            )
            results.append({
                "type": "tool_result",
                "tool_use_id": block.id,
                "content": done.stdout or done.stderr,
            })
    messages.append({"role": "user", "content": results})

print(next(b.text for b in response.content if b.type == "text"))

ते python3 agent.py वापरून चालवा. यशस्वी run मध्ये तुमच्या filesystems ची नावे आणि त्यांच्यातील free space असलेला एक परिच्छेद दिसतो. कारण model ने df -h मागितले, तुमच्या code ने ते चालवले आणि दुसऱ्या pass ने त्या table चे वाक्यात रूपांतर केले. काहीही छापले गेले नाही, तर text block येण्यापूर्वी loop संपला. loop मध्ये print(response.stop_reason) जोडा आणि values कशा बदलतात ते पाहा.

आता ते मुद्दाम बिघडवा. tool_use_id line काढून error वाचा. Matching id नसलेला tool result API नाकारते आणि हा beginners कडून होणारा सर्वात सामान्य bug आहे. दोन commands आवश्यक असलेला प्रश्न विचारा आणि loop दोनदा चालताना पाहा. अशक्य प्रश्न विचारा आणि ते एकतर प्रयत्न सोडते किंवा कायमचे फिरत राहते ते पाहा.

या उदाहरणाबाबत एक सूचना. यात model output थेट shell मध्ये shell=True सह पाठवला जातो. पुन्हा तयार करता येणाऱ्या scratch machine वर हे स्वीकार्य आहे; इतर सर्व ठिकाणी ते चुकीचे आहे. स्टेज 6 मध्ये हे दुरुस्त केले आहे. loop मधील संकल्पना VPS वर स्वतःचा AI agent तयार करणे यामध्ये अधिक सविस्तर मांडल्या आहेत.

टप्पा 3: agent कडे आधीपासून नसलेली साधने

तुमचे run_command साधन कार्य करते. परंतु प्रत्यक्ष agent ला बाह्य प्रणालींशी जोडणारी साधने आवश्यक असतात: ticket system, database आणि repository. प्रत्येक सेवेसाठी आणि प्रत्येक agent साठी स्वतंत्र wrapper लिहिणे scalable नाही.

Model Context Protocol (MCP) हा उद्योगाने स्वीकारलेला उपाय आहे. MCP server standard transport द्वारे साधनांचा संच उपलब्ध करून देतो. कोणताही MCP-aware agent अतिरिक्त custom glue शिवाय तो वापरू शकतो. Reference filesystem server सुरू करण्यासाठी एकच command आहे:

npx -y @modelcontextprotocol/server-filesystem /home/you/projects

यासाठी Node install केलेले असणे आवश्यक आहे. Directory argument हाच server ज्या एकमेव path वर काम करेल तो path असतो. हे संपूर्ण security model चे संक्षिप्त उदाहरण आहे: सीमा model ठरवत नाही; server ठरवतो. Client ला त्याकडे निर्देशित केल्यावर तुम्ही स्वतः न लिहिलेली file reading आणि writing क्षमता agent ला मिळते. ही साधने service account अंतर्गत योग्य पद्धतीने कशी चालवायची आणि transport चे पर्याय कसे निवडायचे, हे AI coding agents साठी VPS वर MCP servers चालवणे येथे स्पष्ट केले आहे.

या टप्प्याचा मुख्य धडा असा आहे की tool design हेच खरे काम आहे. अस्पष्ट वर्णनामुळे model अंदाज लावतो. चाळीस हजार characters परत करणारे साधन context window दूषित करते. गोष्टी delete करू शकणारे साधन अखेरीस गोष्टी delete करेल.

टप्पा 4: memory, जी मुख्यतः files असतात

Beginners इथे vector database वापरण्याकडे वळतात. किमान आत्तातरी तसे करू नका.

एका call आणि दुसऱ्या call दरम्यान agent कडे memory नसते. प्रत्येक वेळी संपूर्ण conversation पुन्हा पाठवावी लागते. त्यामुळे short session पेक्षा long session मध्ये प्रत्येक turn साठी अधिक खर्च येतो. म्हणून memory चे दोन भाग होतात. पहिला भाग म्हणजे सध्याच्या context window मध्ये काय बसते. हे तुम्ही summarising, जुना tool output कमी करणे आणि prompt च्या स्थिर prefix चे caching करून व्यवस्थापित करता. त्यामुळे त्या prefix साठी पूर्ण किंमत न देता तिचा केवळ एक भाग खर्च होतो. दुसरा भाग म्हणजे restart नंतर काय टिकते. हे storage असते.

दुसऱ्या समस्येसाठी, agent वाचू आणि लिहू शकणारी साधी markdown file जवळजवळ प्रत्येक पहिल्या project साठी vector database पेक्षा अधिक उपयुक्त ठरते. त्याला एक file द्या आणि तिचा format सांगा. सुरू करण्यापूर्वी ती file वाचण्यास आणि काही नवीन शिकल्यावर ती update करण्यास agent ला सांगा. यामुळे बहुतेक फायदा मिळतो. तसेच file उघडून तुमचा agent काय मानतो ते पाहता येते. Notes context window मध्ये बसत नसतील तेव्हाच embeddings आणि retrieval वापरा. त्यापूर्वी वापरू नका.

टप्पा 5: लूप हेच उत्पादन आहे

आतापर्यंत तुम्ही निरीक्षण करत असताना काम करणारा agent तयार करू शकता. टप्पा 5 मध्ये तुमच्या अनुपस्थितीतही तो काम करेल याची खात्री करायची आहे.

अनअटेंडेड agent ला निरीक्षणाशिवाय सुरक्षितपणे चालू ठेवता येईल का, हे चार प्रश्न ठरवतात. तो कशामुळे सुरू होतो, त्यामुळे तो अनावश्यकपणे चालू होत नाही. तो कोणत्या मर्यादेत कार्य करतो, त्यामुळे चूक लहान परिणामांपुरती मर्यादित राहते. परिणामाची पडताळणी कशी केली जाते, कारण स्वतःचे काम स्वतः तपासणारा agent नेहमी उत्तीर्ण होतो. कोणते budget त्याला थांबवते, tokens किंवा wall clock time मध्ये. या चार बाबी जाणीवपूर्वक निश्चित करणे म्हणजे loop engineering आणि या व्याख्येत समाविष्ट असलेल्या बाबी यातील शिस्त होय.

सराव: तुमचा stage 2 agent घ्या, त्याला चार किंवा पाच पायऱ्या आवश्यक असलेले task द्या आणि hard iteration cap जोडा. त्यानंतर cap काढून टाका आणि unbounded loop मुळे तुमच्या token bill वर काय परिणाम होतो ते पाहा. हे एकदा small budget वर करा, म्हणजे मोठ्या budget वर अशी चूक तुमच्याकडून होणार नाही.

टप्पा 6: सुरक्षितता, गुप्त माहिती आणि खर्च

हा टप्पा ऐच्छिक नाही. तो शेवटी येतो कारण कार्यरत काहीतरी तयार होईपर्यंत जोखीम पूर्णपणे जाणवत नाही.

Agent स्वतंत्र unprivileged user म्हणून चालवा. तो कधीही root म्हणून किंवा तुमच्या स्वतःच्या account म्हणून चालवू नका. त्यामुळे संभाव्य हानीचे क्षेत्र संपूर्ण machine ऐवजी एका directoryपुरते मर्यादित राहते. Credentials modelच्या आवाक्याबाहेर ठेवा. Context windowमध्ये असलेली कोणतीही माहिती tool callद्वारे पुन्हा बाहेर पाठवली जाऊ शकते. यासाठी helperच्या मागे अल्पकालीन, मर्यादित scope असलेले tokens वापरा. याचे वर्णन तुमच्या AI agents पासून secrets दूर ठेवणे येथे आहे. खर्चासाठी कठोर कमाल मर्यादा ठेवा. कोणीही पाहत नसताना unattended loopच्या प्रत्येक iterationसाठी शुल्क आकारले जाते. खर्च नियंत्रणात ठेवणाऱ्या caps आणि batchingची माहिती नेहमी सुरू असलेल्या VPS वर AI agentचा खर्च नियंत्रित करणे येथे आहे.

खर्चासाठी एक ठोस आकडा पाहू. July 2026 पर्यंत, Claude Opus 5 साठी प्रत्येक million input tokensमागे $5 आणि प्रत्येक million output tokensमागे $25 आकारले जातात. वाढत जाणारा conversation पुन्हा पुन्हा पाठवणारा chatty agent एका taskमध्ये काही hundred thousand tokens वापरू शकतो. Prompt caching आणि routine stepsसाठी smaller model वापरणे, कोणत्याही prompt tweakपेक्षा या गणनेत अधिक मोठा फरक घडवते.

Prompt injectionचाही येथे विचार करावा. तुमचा agent web page, issue tracker किंवा inbox वाचत असल्यास, तो मजकूर लिहिणारी व्यक्ती तुमच्या agentसाठी instructionsदेखील लिहित असते. Web search हे दार उघडणारे साधन बहुतेक वेळा पहिले असते. agentला तुमच्या स्वतःच्या SearXNG instanceकडे निर्देशित करणे येथे wiring आणि त्यामुळे निर्माण होणारी injection surface शेजारी दाखवली आहे. यावर उपाय अधिक clever system prompt नाही. उपाय boundary आहे. एखादा agent repository delete करू शकत नसेल, तर त्याला तसे करण्यास प्रवृत्त करता येत नाही.

कोणता मार्ग अवलंबावा?

एक अभ्यासक्रम निवडा आणि सहा अभ्यासक्रमांचा थोडा-थोडा अभ्यास करण्याऐवजी तो पूर्ण करा. Microsoft ai-agents-for-beginners repository हा सर्वात व्यापक विनामूल्य पर्याय आहे. हा 18 धड्यांचा अभ्यासक्रम असून July 2026 पर्यंत त्याला 70,000 पेक्षा जास्त stars मिळाले आहेत. तो वर दिलेल्या टप्प्यांशी स्पष्टपणे जुळतो. Trending agent repositories ची roundup यादी उपलब्ध पर्याय समजून घेण्यासाठी उपयुक्त असते. मात्र syllabus म्हणून ती कमी उपयुक्त असते, कारण stars नुसार लावलेली यादी popularity नुसार क्रमबद्ध असते, teaching order नुसार नाही.

सरावासाठी प्रत्यक्ष project हवा असल्यास coding agent हा सुरुवातीसाठी सर्वोत्तम पर्याय आहे. त्याचा feedback त्वरित मिळतो, tools स्पष्ट असतात आणि चुका सहजपणे पूर्ववत करता येतात. VPS वर coding AI agent चालवणे यात संपूर्ण प्रक्रिया सुरुवातीपासून शेवटपर्यंत दाखवली आहे. शून्यातून build करण्याऐवजी कार्यरत systems चा अभ्यास करायचा असल्यास, सर्वोत्तम self-hosted AI agents मधील तुलना अनेक projects समान loop वेगवेगळ्या पद्धतीने कसे सोडवतात हे दाखवते.

हे किती वेळ घेते?

ज्यांना आधीपासून programming येते, त्यांच्यासाठी stages 1 आणि 2 एका संध्याकाळीत पूर्ण होतात. stage 3 साठी एक weekend लागतो. त्यातील बहुतेक वेळ protocol पेक्षा tool descriptions समजून घेण्यात जातो. stages 4 आणि 5 साठी प्रत्यक्ष वापराचे काही आठवडे लागतात. कारण तुमचा agent काय विसरतो हे तो विसरताना निरीक्षण केल्यावरच समजते. stage 6 कधीही पूर्णपणे संपत नाही. तुम्ही प्रत्येक नवीन capability देता तेव्हा त्याचा विस्तार पुन्हा करावा लागतो.

सलग दोन महिने संध्याकाळी वेळ दिल्यास बहुतेक लोक functional, मर्यादित आणि उपयुक्त agent तयार करू शकतात. ज्यांना एक वर्ष लागते, ते सहसा तयार करण्याऐवजी वाचतच राहतात.

FAQ

AI agent तयार करण्यासाठी मला machine learning माहिती असणे आवश्यक आहे का?

नाही. Agent तयार करणे म्हणजे API द्वारे model ला call करणे आणि त्याच्या tool requests प्रत्यक्ष functions शी जोडणे होय. हे सामान्य application programming आहे. तुम्हाला training, gradients किंवा datasets हाताळावे लागत नाहीत. तुमचा agent योग्यरीत्या काम करेल की नाही हे ठरवणारी कौशल्ये म्हणजे tools साठी schema design, error handling आणि Linux permissions. तुम्ही model fine tune करण्याचा पुढील टप्पा घेतलात तरच machine learning theory संबंधित ठरते. ते वेगळे काम आहे आणि त्यासाठी वेगळ्या पूर्वअटी आहेत.

मी LangChain किंवा CrewAI सारख्या framework पासून सुरुवात करावी का?

प्रथम एक raw loop स्वतः लिहा. त्यानंतर framework वापरा. Framework stage 2 मधील तीस ओळी एका configuration object ने बदलतो. तुम्हाला त्या ओळींच्या जागी काय आले आहे हे माहीत असल्यास ते सोयीचे ठरते. त्यापूर्वी ते गोंधळात टाकू शकते. तुमचा agent चुकीच्या पद्धतीने काम करत असल्यास message list आणि tool results यांचा थेट विचार करावा लागतो. ते आधी कधी पाहिले नसतील तर हे अधिक कठीण होते. स्वतःचा एक loop लिहिल्यानंतर framework यंत्रणा लपवण्याऐवजी तुमचा वेळ वाचवतो.

AI agents शिकण्यासाठी किती खर्च येतो?

खर्च मर्यादित ठेवला तर बहुतेकांच्या अपेक्षेपेक्षा कमी येतो. या सहा stages साठी hosted API key आणि एक छोटा VPS पुरेसा आहे. खरा धोका hourly rate नाही. तुम्ही झोपलेले असताना प्रत्येक iteration साठी billing करणारा अमर्यादित loop हा खरा धोका आहे. पहिल्याच दिवशी तुमच्या API account वर hard spend limit सेट करा. तुम्ही लिहिलेल्या प्रत्येक loop मध्ये iteration cap जोडा. नियमित steps साठी स्वस्त model वापरा. Model local पातळीवर चालवल्यास token चा खर्च राहत नाही. मात्र त्याऐवजी hardware ची आवश्यकता निर्माण होते.

AI agent आणि chatbot यांच्यात काय फरक आहे?

Chatbot एकदा उत्तर देतो. Agent एक cycle पुन्हा पुन्हा चालवतो: model एखाद्या tool ची विनंती करतो, तुमचा code ते चालवतो, result परत पाठवला जातो आणि model पुढे काय करायचे ते ठरवतो. या पुनरावृत्तीमुळे agent अनेक steps असलेले task पूर्ण करू शकतो. Chatbot ला आवश्यक नसलेल्या boundaries agent ला आवश्यक असण्याचे हेच कारण आहे. Chatbot चे चुकीचे उत्तर म्हणजे एक खराब paragraph. Agent चे चुकीचे उत्तर म्हणजे खराब paragraph आणि त्यानंतर त्याने केलेली कृती.

#ai-agents#learning#curriculum#mcp#self-hosting