SSD Nodes Learn Hosting plans →
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-08-30

AI agents शून्यापासून कसे शिकावे: सहा टप्प्यांचा मार्ग

AI agents शिकण्यासाठी सहा टप्प्यांचा कृतीशील मार्ग: संकल्पना, स्वतः लिहिलेला loop, tools, memory, loop design आणि safety. प्रत्येक टप्प्यात एक गोष्ट तयार करा.

सहा टप्प्यांतील मार्ग

AI agents शून्यापासून शिकण्यासाठी सहा टप्पे क्रमाने पूर्ण करा: संकल्पना, तुमचा पहिला loop, tools, memory, loop design आणि safety. प्रत्येक टप्प्यात तुम्ही स्वतः एक गोष्ट तयार कराल. पुढील टप्प्यांवर लवकर जाणे हे लोक मध्येच थांबण्याचे सर्वात सामान्य कारण आहे, कारण framework तुम्हाला नेमका कोणता भाग समजून घेणे आवश्यक होते तो लपवतो.

AI agent म्हणजे tools call करण्याची परवानगी असलेला language model भोवतीचा loop होय. हे वाक्यच संपूर्ण विषयाचा सारांश आहे. त्यानंतरचे सर्व तपशील loop मध्ये काय समाविष्ट होते, tools कशावर परिणाम करू शकतात आणि loop मध्ये चूक झाल्यास तो कसा थांबवायचा याबद्दल आहेत. तुम्ही हा loop दुसऱ्या व्यक्तीला समजावून सांगू शकत असाल, तर तुम्ही ही संकल्पना शिकला आहात. तुम्ही फक्त frameworks ची नावे सांगू शकत असाल, तर तुम्ही ती शिकलेली नाही.

खालील आराखडा तुम्ही प्रत्यक्ष बांधकाम करून शिकता असे गृहीत धरतो. एक टप्पा वाचा, त्यातील छोटी गोष्ट तयार करा, ती जाणीवपूर्वक बिघडवून पाहा आणि मग पुढे जा. तुम्ही फक्त वाचलेला टप्पा प्रत्यक्ष पूर्ण केलेला टप्पा नाही.

पहिल्या टप्प्यापूर्वी तुम्हाला प्रत्यक्षात काय आवश्यक आहे

प्रत्यक्ष पूर्वअट यादी लहान आहे. बहुतेक अभ्यासक्रमांच्या पानांवर सुचवलेल्या यादीपेक्षा ती आणखी लहान आहे.

  • तुम्ही पन्नास ओळींच्या script च्या पातळीवर Python किंवा TypeScript वाचू आणि लिहू शकता.
  • Linux shell मध्ये तुम्ही सहजपणे काम करू शकता: package install करणे, file edit करणे आणि log वाचणे.
  • तुमच्याकडे hosted model साठी API key आहे किंवा local model चालवू शकणारे machine आहे.

हीच संपूर्ण यादी आहे. तुम्हाला machine learning theory ची आवश्यकता नाही. तुम्ही model train केलेला असणेही आवश्यक नाही. Agent work मध्ये gradients किंवा training data यांचा समावेश नसतो. तुम्ही model स्वतः चालवण्याचे ठरवले, तरच graphics card महत्त्वाचा ठरतो. ते स्वतंत्र कौशल्य आहे. ते तुम्ही नंतर VPS वर Ollama host करून LLM self host करणे येथून शिकू शकता.

लोक shell संबंधी अर्ध्याला कमी लेखतात. Permissions, paths, environment variables आणि शांतपणे बंद होणाऱ्या processes यांमुळे agents fail होतात. PATH किंवा file mode संबंधी stack trace पाहून terminal बंद करण्याची इच्छा होत असेल, तर आधी एक weekend Linux basics साठी द्या. त्यामुळे पुढे तुमचा एक महिना वाचेल.

टप्पा 1: agent म्हणजे काय आणि काय नाही

एका API call ने आणि loop शिवाय सुरुवात करा. Prompt पाठवा, reply print करा आणि response मधील token counts पाहा. आता cost चे unit आणि latency चे unit समजले आहे.

त्यानंतर tool use शिका. संपूर्ण क्षेत्रातील हीच एक खरोखर नवीन संकल्पना आहे. Function चे name, description आणि त्याच्या inputs साठी JSON (JavaScript object notation) schema देऊन तुम्ही ते model ला समजावता. Model स्वतः काहीही चालवत नाही. तो structured request पाठवतो: या arguments सह run_command call करा. तुमचा code function चालवतो, त्याचा output message म्हणून परत पाठवतो आणि model ला पुन्हा विचारतो. Model हा text वाचून text लिहिणारा planner आहे. तुमच्या बाजूचा code म्हणजे प्रत्यक्ष कृती करणारा भाग आहे. या देवाणघेवाणीच्या रचनांची तुलना सुरू केल्यावर, तुमच्या बाजूच्या code ला एक नाव मिळते: तो agent harness असतो—म्हणजे स्वतःची कोणतीही साधने किंवा permissions नसलेल्या model भोवती गुंडाळलेला loop, tools आणि permissions यांचा संच.

Chatbot एका reply नंतर थांबतो. Model tools साठी विनंती करणे थांबवेपर्यंत agent ही देवाणघेवाण पुन्हा करत राहतो. हाच संपूर्ण फरक आहे आणि त्यामुळे failure modes देखील वेगळे असतात. Chatbot एकदा चुकीचे उत्तर देतो. Agent ची चुकीच्या उत्तरावर आधारित कृती कोणाच्या लक्षात येण्यापूर्वी अनेक वेळा होऊ शकते.

टप्पा 2: लूप स्वतः एकदा लिहा

Framework पासून सुरुवात करू नका. Python च्या सुमारे तीस ओळी लिहा, जेणेकरून या रचनेचा आकार तुमच्या नियंत्रणात राहील.

sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-here
import subprocess
import anthropic

client = anthropic.Anthropic()

tools = [{
    "name": "run_command",
    "description": "Run a read only shell command and return its output.",
    "input_schema": {
        "type": "object",
        "properties": {"command": {"type": "string"}},
        "required": ["command"],
    },
}]

messages = [{"role": "user", "content": "How much disk space is free here?"}]

while True:
    response = client.messages.create(
        model="claude-opus-5",
        max_tokens=4096,
        tools=tools,
        messages=messages,
    )
    if response.stop_reason != "tool_use":
        break
    messages.append({"role": "assistant", "content": response.content})
    results = []
    for block in response.content:
        if block.type == "tool_use":
            done = subprocess.run(
                block.input["command"], shell=True,
                capture_output=True, text=True, timeout=10,
            )
            results.append({
                "type": "tool_result",
                "tool_use_id": block.id,
                "content": done.stdout or done.stderr,
            })
    messages.append({"role": "user", "content": results})

print(next(b.text for b in response.content if b.type == "text"))

ते python3 agent.py वापरून चालवा. योग्यरीत्या चालल्यास एक परिच्छेद दिसतो. त्यात तुमच्या filesystems ची नावे आणि त्यांच्यातील मोकळी जागा असते. कारण model ने df -h मागितले, तुमच्या code ने ते चालवले आणि दुसऱ्या pass ने त्या table चे वाक्यात रूपांतर केले. काहीही दिसत नसेल, तर text block येण्यापूर्वी loop संपला आहे. Loop मध्ये print(response.stop_reason) जोडा आणि values कशा बदलतात ते पाहा.

आता जाणीवपूर्वक बिघाड घडवा. tool_use_id ही ओळ हटवा आणि error वाचा. Matching id नसलेला tool result API नाकारते. ही सुरुवातीच्या वापरकर्त्यांची सर्वात सामान्य चूक आहे. दोन commands आवश्यक असणारा प्रश्न विचारा आणि loop दोनदा चालताना पाहा. अशक्य विनंती करा आणि ते एकतर प्रयत्न सोडते किंवा अनंतकाळ चालू राहते ते पाहा.

या उदाहरणाबाबत एक इशारा. हे model output थेट shell मध्ये shell=True सह पाठवते. पुन्हा तयार करता येणाऱ्या scratch machine वर हे स्वीकार्य आहे; इतर सर्व ठिकाणी हे चुकीचे आहे. Stage 6 मध्ये याचे निराकरण केले आहे. Loop मागील concepts चे अधिक सविस्तर स्पष्टीकरण VPS वर स्वतःचा AI agent तयार करणे येथे दिले आहे.

स्टेज 3: एजंटकडे आधीपासून नसलेली साधने

तुमचे run_command टूल कार्यरत आहे. परंतु प्रत्यक्ष एजंटला बाह्य प्रणालींशी संपर्क साधणारी साधने आवश्यक असतात: तिकीट प्रणाली, database किंवा repository. प्रत्येक सेवेसाठी आणि प्रत्येक एजंटसाठी स्वतंत्र wrapper लिहिणे मोठ्या प्रमाणावर व्यवहार्य ठरत नाही.

Model Context Protocol (MCP) हा उद्योगाने स्वीकारलेला उपाय आहे. MCP server standard transport वर साधनांचा संच उपलब्ध करून देतो. कोणताही MCP-aware agent त्याचा वापर custom glue शिवाय करू शकतो. Reference filesystem server सुरू करण्यासाठी एकच command पुरेसा आहे:

npx -y @modelcontextprotocol/server-filesystem /home/you/projects

यासाठी Node स्थापित असणे आवश्यक आहे. तसेच directory argument हा server ज्या एकमेव path वर काम करेल तो path असतो. हेच या security model चे संक्षिप्त स्वरूप आहे: सीमा model ठरवत नाही; server ठरवतो. Client ला त्याकडे निर्देशित केल्यावर तुम्ही स्वतः न लिहिलेली file reading आणि writing क्षमता तुमच्या agent ला मिळते. ही साधने service account अंतर्गत योग्यरीत्या चालवणे आणि transport choices समजून घेणे याबाबत AI coding agents साठी VPS वर MCP servers चालवणे येथे माहिती दिली आहे. Scratch directory ऐवजी प्रत्यक्ष data कडे निर्देश करणाऱ्या दुसऱ्या server साठी openGym self-host करणे, workout tracker पाहा. तो read-only server उपलब्ध करून देतो. त्यामुळे agent ला बदल करता येतील असे काहीही न देता तुम्ही तुमच्या training history बद्दल प्रश्न विचारण्याचा सराव करू शकता.

या स्टेजचा मुख्य धडा असा आहे की tool design हेच खरे काम आहे. अस्पष्ट वर्णनामुळे model अंदाज लावतो. चाळीस हजार characters परत करणारे tool context window दूषित करते. गोष्टी delete करू शकणारे tool अखेरीस गोष्टी delete करेलच.

टप्पा 4: memory, जी मुख्यतः files असते

येथे beginners लगेच vector database वापरण्याचा प्रयत्न करतात. किमान आत्तातरी तसे करू नका.

एका agent कडे calls दरम्यान memory नसते. प्रत्येक वेळी संपूर्ण conversation पुन्हा पाठवावी लागते. त्यामुळे long session साठी प्रत्येक turn चा खर्च short session पेक्षा जास्त असतो. म्हणून memory दोन समस्यांमध्ये विभागली जाते. पहिली समस्या म्हणजे सध्या context window मध्ये काय मावते. यासाठी summarising करा, जुन्या tool output मधील अनावश्यक भाग काढा आणि prompt चा स्थिर prefix cache करा. त्यामुळे त्यासाठीच्या किमतीचा केवळ काही भाग द्यावा लागतो. दुसरी समस्या म्हणजे restart नंतर काय टिकून राहते. हे storage चे काम आहे.

दुसऱ्या समस्येसाठी, agent वाचू आणि लिहू शकणारी साधी markdown file जवळजवळ प्रत्येक first project साठी vector database पेक्षा अधिक उपयुक्त ठरते. त्याला एक file द्या, format सांगा, सुरू करण्यापूर्वी ती file वाचण्यास सांगा आणि काही नवीन शिकल्यावर ती update करण्यास सांगा. यामुळे बहुतेक फायदा मिळतो आणि agent च्या मते काय आहे ते file उघडून पाहता येते. Notes context window मध्ये मावेनाशा झाल्यावर embeddings आणि retrieval वापरा. त्यापूर्वी वापरू नका.

टप्पा 5: लूप हेच उत्पादन

आतापर्यंत तुम्ही निरीक्षण करत असताना कार्य करणारा agent तयार करू शकता. टप्पा 5 मध्ये तुम्ही निरीक्षण करत नसतानाही तो कार्य करेल याची व्यवस्था करायची आहे.

unattended agent सुरक्षितपणे एकट्याने चालू ठेवता येईल का हे चार प्रश्न ठरवतात. तो कशामुळे सुरू होतो, म्हणजे तो कोणत्याही कारणाशिवाय चालू होणार नाही. तो कोणत्या मर्यादेत कार्य करतो, म्हणजे चूक झाली तरी तिचा परिणाम मर्यादित राहील. परिणामाची पडताळणी कशी केली जाते, कारण स्वतःचे homework तपासणारा agent नेहमी स्वतःला उत्तीर्ण करतो. Tokens किंवा wall clock time यांपैकी कोणते budget त्याला थांबवते. या चार बाबी जाणीवपूर्वक ठरवणे हीच loop engineering आणि या व्याख्येत समाविष्ट असलेल्या बाबी मध्ये वर्णन केलेली शिस्त आहे.

हा सराव करा: तुमचा stage 2 agent घ्या, त्याला चार किंवा पाच पायऱ्या आवश्यक असलेले task द्या आणि hard iteration cap जोडा. त्यानंतर cap काढून टाका आणि unbounded loop मुळे तुमच्या token bill वर काय परिणाम होतो ते पाहा. हे एकदा लहान budget वर करा, म्हणजे मोठ्या budget वर ते चुकून कधीही होणार नाही.

टप्पा 6: सुरक्षितता, secrets आणि खर्च

हा टप्पा ऐच्छिक नाही. तो शेवटी आहे, कारण कार्यरत काहीतरी तयार होईपर्यंत जोखीम जाणवत नाही.

agent स्वतंत्र unprivileged user म्हणून चालवा. तो कधीही root किंवा तुमच्या स्वतःच्या account म्हणून चालवू नका. त्यामुळे संभाव्य नुकसान संपूर्ण machine ऐवजी एका directory पुरते मर्यादित राहते. credentials model च्या आवाक्याबाहेर ठेवा. context window मध्ये असलेली कोणतीही माहिती tool call द्वारे पुन्हा बाहेर पाठवली जाऊ शकते. यासाठी helper मागे मर्यादित कालावधीचे short-lived tokens वापरा. याचे वर्णन तुमच्या AI agents पासून secrets दूर ठेवणे येथे आहे. खर्चावर कठोर मर्यादा ठेवा. कारण unattended loop मधील प्रत्येक iteration साठी कोणीही लक्ष ठेवत नसताना billing होते. हे नियंत्रणात ठेवण्यासाठी आवश्यक caps आणि batching यांचे वर्णन नेहमी सुरू असलेल्या VPS वरील AI agent खर्च नियंत्रण येथे आहे.

तुमचा agent तुम्ही स्वतः लिहिलेल्या script ऐवजी harness मध्ये चालत असल्यास, या टप्प्यातील काही भाग code नसून configuration असतो. स्थापित करण्यासारखे DeepSeek Harness plugins budget caps, tool permission rules आणि injection scanning यांसारख्या बाबींचा मोठा भाग हाताळतात.

खर्चासाठी एक ठोस संख्या पाहू. July 2026 नुसार, Claude Opus 5 साठी 1 million input tokens मागे $5 आणि 1 million output tokens मागे $25 आकारले जातात. वाढत जाणारा conversation पुन्हा पुन्हा पाठवणारा chatty agent एका task मध्ये काही hundred thousand tokens वापरू शकतो. Prompt caching आणि routine steps साठी smaller model वापरणे, prompt मधील कोणत्याही बदलापेक्षा या गणनेत अधिक मोठा फरक घडवते.

Prompt injection चाही विचार येथे करावा. तुमचा agent web page, issue tracker किंवा inbox वाचत असल्यास, तो मजकूर लिहिणारी व्यक्ती तुमच्या agent साठी instructions देखील लिहित असते. Web search हे दार प्रथम उघडणारे tool असते. agent ला तुमच्या स्वतःच्या SearXNG instance कडे निर्देशित करणे येथे wiring आणि त्यामुळे निर्माण होणारी injection surface एकत्र दाखवली आहे. यासाठी अधिक हुशार system prompt हा उपाय नाही. खरा उपाय boundary आहे. कारण repository delete करू न शकणाऱ्या agent ला ते delete करण्यास प्रवृत्त करता येत नाही.

कोणता मार्ग अनुसरावा?

एक अभ्यासक्रम निवडा आणि सहा अभ्यासक्रमांमधून थोडे थोडे शिकण्याऐवजी तो पूर्ण करा. Microsoft ai-agents-for-beginners repository हा सर्वांत संपूर्ण मोफत पर्याय आहे. हा अठरा धड्यांचा अभ्यासक्रम आहे आणि July 2026 पर्यंत त्याला 70,000 पेक्षा जास्त stars मिळाले आहेत. त्याची रचना वर दिलेल्या टप्प्यांशी सहज जुळते. Trending agent repositories ची यादी उपलब्ध प्रकल्प पाहण्यासाठी उपयुक्त असते. मात्र अभ्यासक्रमासाठी ती तितकी उपयुक्त नसते. कारण stars नुसार लावलेली यादी लोकप्रियतेनुसार क्रमबद्ध असते, शिकवण्याच्या क्रमाने नाही.

सरावासाठी प्रत्यक्ष प्रकल्प हवा असल्यास coding agent हे सुरुवातीचे सर्वोत्तम लक्ष्य आहे. त्याचा प्रतिसाद त्वरित मिळतो, tools स्पष्ट असतात आणि चुका सहज पूर्ववत करता येतात. VPS वर coding AI agent चालवणे यामध्ये एका agent ची सुरुवातीपासून शेवटपर्यंत प्रक्रिया दिली आहे. सुरुवातीपासून स्वतः तयार करण्याऐवजी कार्यरत systems चा अभ्यास करायचा असल्यास, सर्वोत्तम self hosted AI agents मधील तुलना पाहा. त्यात अनेक प्रकल्प समान loop वेगवेगळ्या पद्धतीने कसे सोडवतात हे दाखवले आहे.

यासाठी किती वेळ लागतो?

ज्यांना आधीपासून programming येते, त्यांच्यासाठी stages 1 आणि 2 एका संध्याकाळीत पूर्ण होतात. stage 3 साठी एक weekend लागतो. त्यातील बराच वेळ protocol पेक्षा tool descriptions समजून घेण्यात जातो. stages 4 आणि 5 साठी प्रत्यक्ष वापराचे काही आठवडे लागतात. कारण तुमचा agent काय विसरतो हे तो विसरताना त्याचे निरीक्षण केल्यावरच समजते. stage 6 पूर्णपणे कधीच संपत नाही. तुम्ही प्रत्येक नवीन capability देता तेव्हा ही प्रक्रिया पुन्हा सुरू होते.

सलग दोन महिने संध्याकाळी वेळ दिल्यास बहुतेक लोक working, bounded आणि useful agent तयार करतात. ज्यांना एक वर्ष लागते, ते सहसा तयार करण्याऐवजी वाचतच राहतात.

FAQ

AI agent तयार करण्यासाठी मला machine learning माहीत असणे आवश्यक आहे का?

नाही. Agent तयार करणे म्हणजे API द्वारे model ला call करणे आणि त्याच्या tool requests प्रत्यक्ष functions शी जोडणे होय. हे सामान्य application programming आहे. तुम्हाला training, gradients किंवा datasets हाताळावे लागत नाहीत. तुमचा agent कार्य करतो की नाही हे ठरवणारी कौशल्ये म्हणजे tools साठी schema design, error handling आणि Linux permissions. तुम्ही model fine tune करण्याचे पुढचे काम स्वीकारले, तरच machine learning theory संबंधित ठरते. ते वेगळे काम असून त्यासाठी वेगळ्या पूर्वअटी आहेत.

LangChain किंवा CrewAI सारख्या framework पासून सुरुवात करावी का?

प्रथम एक raw loop स्वतः लिहा. त्यानंतर framework स्वीकारा. Framework stage 2 मधील तीस ओळी configuration object ने बदलते. ते configuration object कशाची जागा घेत आहे हे माहीत झाल्यावर सोयीचे ठरते; त्यापूर्वी ते गोंधळात टाकू शकते. तुमचा agent चुकीचे वर्तन करताना message list आणि tool results यांचा थेट विचार करावा लागतो. ते कधी पाहिलेले नसतील, तर हे अधिक कठीण होते. स्वतःचा एक loop लिहिल्यानंतर framework यंत्रणा लपवण्याऐवजी तुमचा वेळ वाचवते.

AI agents शिकण्यासाठी किती खर्च येतो?

खर्च मर्यादित ठेवल्यास बहुतेक लोकांच्या अपेक्षेपेक्षा कमी येतो. या सहा stages साठी hosted API key आणि छोटा VPS पुरेसा आहे. खरा धोका hourly rate नसून, तुम्ही झोपलेले असताना प्रत्येक iteration साठी billing करणारा अमर्यादित loop हा आहे. पहिल्याच दिवशी तुमच्या API account वर कठोर spend limit सेट करा. तुम्ही लिहिलेल्या प्रत्येक loop मध्ये iteration cap जोडा. नियमित steps साठी स्वस्त model वापरा. Model स्थानिक पातळीवर चालवल्यास token bill राहत नाही; त्याऐवजी hardware requirement येते.

AI agent आणि chatbot यांच्यात काय फरक आहे?

Chatbot एकदा उत्तर देतो. Agent एक cycle पुन्हा पुन्हा चालवतो: model tool मागतो, तुमचा code ते चालवतो, result परत जातो आणि पुढे काय करायचे ते model ठरवतो. या पुनरावृत्तीमुळे agent अनेक steps असलेले task पूर्ण करू शकतो. याच कारणामुळे chatbot ला आवश्यक नसलेल्या boundaries agent साठी आवश्यक असतात. Chatbot चे चुकीचे उत्तर म्हणजे खराब paragraph. Agent चे चुकीचे उत्तर म्हणजे खराब paragraph आणि त्यावर त्याने केलेली कोणतीही कृती.

#ai-agents#learning#curriculum#mcp#self-hosting