SSD Nodes Learn
मार्गदर्शक Matt Connorद्वारे Matt Connor · अपडेटेड 2026-07-24

OpenClaw सारखा AI agent कसा बनवायचा

OpenClaw सारखा self-hosted AI agent कसा तयार करायचा ते शिका. CVE-2026-32922 सारख्या security issues टाळण्यासाठी hardening कशा प्रकारे आवश्यक आहे ते पहा.

OpenClaw नक्की काय आहे

OpenClaw हा एक self-hosted personal AI agent आहे. तुम्ही तो तुमच्या स्वतःच्या server वर चालवू शकता, तुमच्या सध्याच्या chat apps शी तो जोडू शकता, आणि तो shell commands रन करू शकतो, browser नियंत्रित करू शकतो, तुमच्या files वाचू आणि लिहू शकतो, आणि तुम्ही त्याला पाठवलेल्या messages वर आधारित कृती करू शकतो. हा MIT-licensed आहे, local-first आहे, आणि mid-2026 पर्यंत याला GitHub वर 380,000 पेक्षा जास्त stars आहेत, ज्यामुळे तो या platform वरील सर्वात जास्त stars असलेल्या projects पैकी एक ठरतो. या सर्व गोष्टींच्या पलीकडे, हा सुव्यवस्थितरित्या जोडलेला एक छोटासा भागांचा संच आहे. ही post त्या भागांची माहिती देते जेणेकरून तुम्हाला समजेल की अशा प्रकारचे tool कसे बनवले जाते आणि त्यातील धोके कुठे आहेत.

एक महत्त्वाची चेतावणी: कारण ती खालील प्रत्येक design choice ला आकार देते. March 2026 मध्ये OpenClaw मध्ये चार दिवसांच्या कालावधीत नऊ security issues समोर आले होते, ज्यामध्ये 9.9/10 रेटिंग असलेला एक critical privilege-escalation flaw (CVE-2026-32922) समाविष्ट होता. हे project तुमच्यासारख्या operator द्वारे harden करण्यासाठी डिझाइन केलेले आहे. कोणताही command रन करू शकणारा agent हा तो ज्या box वर चालतो आणि तुम्ही त्याच्याभोवती लावलेल्या मर्यादांवर अवलंबून असतो. वाचताना हे लक्षात ठेवा.

The gateway daemon: एक process, जो private ठेवला जातो

याचे केंद्र एक single long-running process आहे, ज्याला सहसा gateway म्हटले जाते. हा control plane आहे. तो messages प्राप्त करतो, काय करायचे ते ठरवतो, tools चालवतो आणि replies परत पाठवतो. इतर सर्व गोष्टी त्याच्याशी जोडलेल्या असतात.

Gateway बद्दलची सर्वात महत्त्वाची गोष्ट म्हणजे तो कुठे listen करतो. Default प्रमाणे OpenClaw याला loopback address, 127.0.0.1 वर bind करतो, त्यामुळे जोपर्यंत तुम्ही तो मुद्दाम expose करत नाही, तोपर्यंत तो internet वरून उपलब्ध नसतो. तो तिथेच राहू द्या. हा असा single process आहे जो commands रन करण्याचे काम करतो, त्यामुळे जर gateway expose झाला, तर तो शोधणाऱ्या कोणालाही तुमच्या server मध्ये remote foothold मिळू शकतो. जेव्हा तुम्हाला तुमच्या laptop वरून त्याच्याशी संपर्क साधण्याची गरज पडेल, तेव्हा port उघडण्याऐवजी VPN किंवा SSH tunnel द्वारे ते करा. जो port reach करता येत नाही, त्यावर कोणीही attack करू शकत नाही.

Channel connectors: message मिळवणे आणि reply पाठवणे

एक personal agent तेव्हाच उपयुक्त ठरतो जेव्हा तुम्ही तुमच्या सध्याच्या apps मधून त्याच्याशी संवाद साधू शकता. channel connectors हेच काम करतात. प्रत्येक connector Telegram, WhatsApp, Slack, किंवा Discord सारख्या एका platform शी त्या platform च्या bot API किंवा webhooks वापरून संवाद साधतो.

सर्वात महत्त्वाचे म्हणजे सर्वांचे स्वरूप सारखेच आहे. connector त्या platform वर bot register करतो, तुमचा incoming message प्राप्त करतो (platform polling द्वारे किंवा platform कडून येणाऱ्या webhook द्वारे), तो message gateway कडे सोपवतो, आणि gateway चा reply त्याच API द्वारे परत पाठवतो. Connector हा एक पातळ translation layer आहे. तो "एक Telegram message आला आहे" याचे रूपांतर "येथे agent साठी text आहे" मध्ये करतो आणि पुन्हा उलट प्रक्रिया करतो. स्वतःचा connector बनवणे म्हणजे प्रामुख्याने एका platform च्या bot documentation वाचणे आणि त्याच्या message format ला gateway च्या format शी मॅप करणे एवढेच आहे.

The brain and the tool loop

Gateway च्या आत असा भाग असतो जो त्याला chatbot ऐवजी agent बनवतो. ही एक loop आहे.

एक message येतो. Gateway तो message language model कडे पाठवतो आणि त्यासोबत model ला वापरण्यास परवानगी असलेल्या tools ची यादी पाठवतो. Model तो message वाचते आणि ठरवते: थेट उत्तर द्यावे की tool कॉल करावे. जर त्याने tool कॉल केले, तर gateway ते tool चालवतो, निकाल (result) कॅप्चर करतो आणि तो निकाल model कडे परत पाठवतो. Model त्या निकालाकडे पाहते आणि पुन्हा निर्णय घेते. जोपर्यंत model कडे करण्यासाठी काही उरलेले नसते आणि ते अंतिम reply तयार करत नाही, तोपर्यंत ही प्रक्रिया पुन्हा पुन्हा घडते.

ही loop हीच agent ची मूळ संकल्पना आहे, आणि agent chat app मध्ये असो किंवा terminal मध्ये, ही loop सारखीच असते. tools या loop ला standard पद्धतीने कसे जोडले जातात, यासाठी connecting tools through the Model Context Protocol हे चांगले पुढील वाचन आहे, आणि model च्या बाजूसाठी, running the model itself on your own hardware हे माहिती देते.

The tool set is the point, and the danger

Tools मुळेच OpenClaw शक्तिशाली बनतो. एक tool जे shell command चालवते, एक tool जे browser नियंत्रित करते, एक tool जे files वाचते आणि लिहिते. वरील loop ला या गोष्टींचा access दिला, तर तो तुमच्या कीबोर्डवरून तुम्ही काय करू शकता त्यासारखीच जवळपास सर्व काही करू शकतो. ही व्याप्तीच हे पूर्ण product आहे, आणि तोच सर्वात मोठा धोका देखील आहे.

Chat app मधून येणाऱ्या सूचनांवर आधारित कोणताही command रन करू शकणारा agent, हा एक मोठा attack surface आहे. एक चुकीची सूचना, browser tool भेट देणाऱ्या वेब पेजमध्ये लपलेला prompt-injection attack, किंवा March 2026 मधील flaws सारखी bug, "माझे calendar वाचा" याचे रूपांतर "माझ्या files डिलीट करा" मध्ये करू शकते. म्हणून मर्यादा (limits) या optional नसतात. agent ला sudo शिवाय एक dedicated, unprivileged user म्हणून चालवा, जेणेकरून compromise झाल्यास privilege escalation होऊ नये. धोकादायक tools साठी approval step ठेवा जेणेकरून agent काही विनाशकारी करण्यापूर्वी विचारणा करेल. Tool execution sandbox मध्ये चालवा जेणेकरून एखादा runaway command मर्यादित राहील. Model ची API key isolate करा जेणेकरून leak झाल्यास तुमचा account हॅक होऊ नये.

कोणतीही shell commands चालवणारी गोष्ट expose करण्यापूर्वी, मूलभूत गोष्टी व्यवस्थित पूर्ण करा. तुमच्या स्वतःच्या box साठी येथे एक checklist तयार करा, आणि मग ती वरून खाली पूर्ण करा:

ToolVPS hardening checklist

unprivileged-user बद्दलची सविस्तर माहिती running services as an unprivileged user मध्ये दिली आहे, आणि प्रत्यक्ष project साठी पूर्ण safe-setup walkthrough running OpenClaw safely on a VPS मध्ये आहे.

Memory as plain files

बहुतेक लोकांना वाटते की agent ची memory डेटाबेसमध्ये असावी. OpenClaw तसे करत नाही. ते memory disk वर plain Markdown files म्हणून साठवते, आणि हा निर्णय कॉपी करण्यासारखा आहे.

Files सोप्या असतात. त्यात migrate करण्यासाठी कोणतेही schema नसते, चालू ठेवण्यासाठी कोणतेही service नसते आणि कोणतेही query language शिकण्याची गरज नसते. त्या inspect करता येतात: तुम्ही folder उघडून agent तुमच्याबद्दल काय मानतो ते नक्की वाचू शकता, file edit करून चुकीची नोंद दुरुस्त करू शकता किंवा एखादी memory काढून टाकू शकता. आणि त्या portable आहेत, कारण agent नवीन server वर हलवणे म्हणजे फक्त एक directory कॉपी करणे आहे. single-user personal agent साठी, text files चे folder पुरेसे आहे, आणि यामुळे संपूर्ण system समजण्यास सोपे राहते.

Skills: क्षमता वाढवण्याचा एक portable मार्ग

In-built tools व्यतिरिक्त, OpenClaw एक portable skill format वापरते जेणेकरून community त्याच्या core मध्ये बदल न करता त्याची क्षमता वाढवू शकेल. Skill म्हणजे सूचनांचा आणि कधीकधी code चा एक self-contained bundle आहे जो agent ला नवीन कार्य शिकवतो. जेव्हा कामासाठी गरज असते, तेव्हा agent skill load करतो.

अशा format चा फायदा असा आहे की क्षमता (abilities) शेअर करता येतात. कोणीतरी विशिष्ट कामासाठी skill लिहिते, ती publish करते आणि इतर लोक ती वापरू शकतात. जर तुम्ही स्वतःचा agent बनवत असाल, तर सुरुवातीलाच एक लहान, स्पष्ट extension format परिभाषित केल्यास तुम्हाला नंतर प्रत्येक capability core मध्ये hard-code करावी लागणार नाही.

Bring your own model

OpenClaw हे model-agnostic आहे. ते स्वतःचे language model देत नाही. त्याऐवजी, ते तुम्ही निवडलेल्या model शी जोडले जाते, जे hosted API किंवा तुम्ही स्वतः चालवलेले model असू शकते.

खर्च, privacy आणि control साठी हा फरक महत्त्वाचा आहे. Hosted API तुम्हाला कोणत्याही hardware व्यवस्थापनाशिवाय सर्वात शक्तिशाली models देते, जे per-token किमतीवर असते आणि तुमचे prompts तुमच्या server च्या बाहेर जातात. Ollama सारख्या गोष्टी वापरून self-hosted model वापरल्यास, प्रत्येक message तुमच्या स्वतःच्या box वर राहतो आणि खर्च फक्त hardware आणि power इतकाच असतो, जो लहान किंवा संथ model चालवण्याच्या किमतीत असतो. अनेक लोक या दोन्ही गोष्टींचे मिश्रण वापरतात. जर तुम्हाला agent पूर्णपणे private ठेवायचा असेल, तर self-hosting the model on your VPS हा तो भाग आहे जो शेवटची त्रुटी भरून काढतो, आणि Hermes Agent हे तुलना करण्यासाठी दुसरे self-hosted agent आहे.

Should you build one?

तुम्ही हे सर्व बनवू शकता. याचे भाग काही exotic नाहीत: एक daemon, काही chat connectors, एक model-and-tools loop, Markdown चे folder आणि एक plugin format. ते समजून घेणे खरोखर उपयुक्त आहे, कारण ते तुम्ही वापरणाऱ्या प्रत्येक agent चे रहस्य उलगडते आणि धोका नक्की कुठे आहे हे सांगते.

परंतु बहुतेक लोकांसाठी प्रामाणिक उत्तर म्हणजे, नवीन शोध लावण्यापेक्षा (reinvent) प्रत्यक्ष गोष्ट वापरणे आणि ती harden करणे हे आहे. OpenClaw ने आधीच connectors, loop आणि skill format सोडवले आहे, आणि त्यावर प्रत्यक्ष security scrutiny झाले आहे. तुमचा प्रयत्न त्या भागावर खर्च करणे अधिक चांगले आहे जो खरोखर तुमचा आहे, म्हणजेच तुमच्या स्वतःच्या server वरील setup आणि hardening. शिकण्यासाठी एक लहान agent बनवा. वापरण्यासाठी प्रत्यक्ष agent चालवा आणि सुरक्षित करा.

सामान्य पायाभूत गोष्टी building your own AI agent on a VPS मध्ये आहेत, आणि building an agent with Claude मध्ये brain म्हणून विशिष्ट model वापरून त्याच कल्पना दाखवल्या आहेत.

FAQ

OpenClaw सारखा agent बनवणे कठीण आहे का?

वैयक्तिक भाग कठीण नाहीत. एक gateway process, एक chat connector, एक model-and-tools loop आणि files चे folder हे प्रत्येक आपापल्या पद्धतीने सोपे आहेत. कठीण भाग तो सुरक्षितपणे करणे हा आहे. Chat messages मधून shell commands चालवणारा agent हा एक गंभीर security surface आहे, आणि sandboxing, permissions आणि unprivileged-user setup योग्यरित्या करणे हे features एकत्र जोडण्यापेक्षा जास्त कष्टाचे काम आहे.

OpenClaw डेटाबेसऐवजी memory Markdown files म्हणून का साठवते?

कारण single-user personal agent साठी files पुरेशी आहेत आणि खूप सोप्या आहेत. चालवण्यासाठी कोणतेही database service नसते, memory मॅन्युअली वाचणे आणि दुरुस्त करणे सोपे असते, आणि agent दुसऱ्या server वर हलवणे म्हणजे फक्त एक directory कॉपी करणे आहे. मोठ्या scale साठी डेटाबेस आवश्यक असतो, इथे नाही.

Personal AI agent चा सर्वात धोकादायक भाग कोणता?

त्याला कृती करण्यास मदार देणारी tools: shell commands चालवणे, browser नियंत्रित करणे आणि files लिहिणे. हेच त्याला बनवण्याचे कारण आहे आणि तेच तुम्हाला इजा पोहोचवण्याचे कारण आहे. OpenClaw ची March 2026 ची security event, ज्यामध्ये 9.9-rated critical सह चार दिवसांत नऊ issues आले, हे tool layer काळजीपूर्वक हाताळण्यासाठी सर्वात स्पष्ट उदाहरण आहे: unprivileged user म्हणून चालवा, विनाशकारी कृतींवर मर्यादा (gate) आणा आणि execution sandbox मध्ये करा.

मला एक बनवण्यासाठी स्वतःचे language model आवश्यक आहे का?

नाही. OpenClaw सारखे agents model-agnostic असतात, त्यामुळे तुम्ही तुमच्या आवडीचे model जोडू शकता. सर्वात शक्तिशाली models साठी ते hosted API असू शकते, किंवा पूर्ण privacy साठी तुम्ही स्वतः चालवलेले model असू शकते. Ollama सह self-hosting केल्यास, लहान model चालवण्याच्या खर्चात प्रत्येक message तुमच्या स्वतःच्या server वर राहतो.