Claude आणि n8n: VPS वर AI workflow कसे तयार कराल
स्वतःच्या VPS वरील n8n मध्ये Claude जोडा: credentials, nodeनुसार model निवड, 3 कार्यरत AI workflows, खर्चाचे अचूक गणित आणि सामान्य errors समजून घ्या.
तुम्ही काय तयार करणार आहात
तुम्ही आधीपासून चालवत असलेल्या n8n instance वर तीन कार्यरत AI workflows: तुम्ही पाठवलेल्या कोणत्याही मजकुराचा सारांश करणारा webhook, लेखांचे संरचित spreadsheet rows मध्ये रूपांतर करणारा scheduled feed-reader आणि प्रश्नांची उत्तरे देण्यासाठी स्वतःहून HTTP API कॉल करणारा AI Agent. हे तुमच्या VPS वरून Claude API कॉल करण्याला no-code पर्याय आहे. API तोच, tokens तेच आणि बिलही तेच; मात्र orchestration script ऐवजी n8n nodes मध्ये असते.
Docker वर self-hosted n8n मार्गदर्शकानुसार n8n आधीच HTTPS मागे सुरू आहे, असे मी गृहीत धरतो. तसे नसेल, तर ते आधी करा. Webhooks साठी वास्तविक TLS endpoint आवश्यक असतो. तसेच, तुम्ही API key ज्या credential store मध्ये ठेवणार आहात, त्यासाठी त्या मार्गदर्शकात वारंवार सांगितलेला encryption-key backup आवश्यक आहे.
येथील मुख्य अडचणी drag-and-drop शी संबंधित नाहीत. प्रत्येक node साठी योग्य model निवडणे, undefined चे अंतर्गत interpolation शांतपणे करणारी prompt fields आणि automation unattended चालते हे महत्त्वाचे मुद्दे आहेत. एका run साठी अर्धा cent खर्च करणारा workflow स्वस्त वाटतो; पण retry loop मुळे तो एका रात्रीत चार हजार वेळा चालला, तर खर्च वाढतो. या मार्गदर्शकाचा बहुतांश भाग याच मुद्द्यांवर आहे.
एक क्रेडेन्शियल, बॅकअप घेतलेल्या key ने एन्क्रिप्ट केलेले
platform.claude.com वरील Anthropic Console मध्ये Settings, त्यानंतर API Keys उघडा आणि n8n-vps सारख्या नावाने API key तयार करा. ती key एकदाच दाखवली जाते. खात्यात निधी भरा किंवा billing सेट करा; API वापरासाठी प्रत्येक token नुसार शुल्क आकारले जाते आणि तो कोणत्याही Claude.ai subscription पासून पूर्णपणे स्वतंत्र असतो.
n8n मध्ये: Credentials, Create credential निवडा, Anthropic निवडा, key API Key field मध्ये paste करा आणि save करा. प्रत्येक workflow मधील प्रत्येक Claude node या एकाच साठवलेल्या credential चा संदर्भ घेतो. त्यामुळे key node मध्ये पुन्हा paste करण्याची गरज नसते.
दोन ऑपरेशनल नोंदी.
पहिली, n8n साठवलेली credentials N8N_ENCRYPTION_KEY ने encrypt करते. n8n मार्गदर्शिकेनुसार ही environment variable तुमच्या compose file मध्ये स्पष्टपणे set केली, तर container rebuild केल्यानंतरही तुमची credential टिकून राहते. n8n ने ती स्वतः generate केली आणि नंतर volume गमावला, तर या key सह प्रत्येक साठवलेली credential unrecoverable ciphertext बनते. ही key वगळली असल्यास, आत्ताच तिचा backup घ्या.
दुसरी, n8n credential store ला blast radius म्हणून गृहीत धरा. तुमच्या instance वरील workflows edit करू शकणारी कोणतीही व्यक्ती तुमच्या Anthropic key चा वापर करून requests करू शकते. Community edition मध्ये credentials साठी per-user permissions नाहीत. त्यामुळे या instance मध्ये इतर कोणी login करत असल्यास, accounts देण्यापूर्वी paid n8n licence मागे कोणती access controls असतात ते वाचा. compromised किंवा runaway instance साठी कमाल मर्यादा निश्चित करण्याकरिता Console मधील Settings मध्ये spend limit set करा.
नमुन्याची निवड प्रत्येक node साठी स्वतंत्रपणे करा
n8n मधील Claude nodes मधील model dropdown API मधून थेट भरला जातो. त्यामुळे तुमची key ज्या models साठी प्रवेश देऊ शकते तेच त्यात दिसतात. July 2026 पर्यंत प्रत्येक दशलक्ष input/output tokens साठी API pricing अशी आहे: Claude Haiku 4.5 (claude-haiku-4-5) साठी $1/$5 आणि 200K context window, Claude Sonnet 5 (claude-sonnet-5) साठी $3/$15, तसेच August 31, 2026 पर्यंत introductory किंमत $2/$10, आणि Claude Opus 4.8 (claude-opus-4-8) साठी $5/$25. Sonnet आणि Opus दोन्हीकडे 1M-token context windows आहेत. सर्वांत कठीण reasoning कामांसाठी Claude Fable 5 (claude-fable-5) सुद्धा $10/$50 दराने उपलब्ध आहे; या मार्गदर्शकातील कोणत्याही कामासाठी त्याची गरज नाही. हेच exact IDs वापरा. जुन्या tutorial मधून लक्षात राहिलेला date-suffixed variant वापरल्यास 404 मिळेल. Prices बदलत राहतात. त्यामुळे कुठेही वाचलेल्या कोणत्याही संख्येवर, यासह, विश्वास ठेवण्यापूर्वी platform.claude.com तपासा.
तुम्ही अंगीकारायची सवय अशी आहे: model ची निवड platform नुसार नव्हे, तर प्रत्येक node साठी करा. Classification, extraction, summarization आणि routing ही automation मधील मूलभूत कामे Haiku वर उत्तम चालतात. त्यांची किंमत Sonnet च्या list price च्या एक-तृतीयांश आणि Opus च्या एक-पंचमांश आहे. Agents आणि multi-step reasoning साठी Sonnet राखून ठेवा. चुकीच्या उत्तराची किंमत tokens पेक्षा जास्त असेल अशा क्वचित workflow साठी Opus वापरा. पाच Claude nodes असलेल्या workflow मध्ये models मिसळणे शक्य आहे आणि तसे करणे योग्यही आहे.
दोन Claude nodes आणि कोणता कुठे वापरायचा
n8n मध्ये दोन वेगवेगळे Anthropic integrations उपलब्ध आहेत. चुकीचा integration निवडणे ही नवशिक्यांकडून होणारी सर्वात सामान्य चूक आहे.
Anthropic node हा नियमित app node आहे: एक request आत येतो आणि एक response बाहेर जातो. त्याच्या Text resource मध्ये Message a Model operation आहे. तसेच images आणि documents चे विश्लेषण करण्यासाठी operations आहेत. Workflow logic n8n मध्ये असेल, म्हणजे trigger, Claude call आणि त्यानंतरचा node अशी रचना असेल, तेव्हा हा node वापरा. खालील Workflows 1 आणि 2 मध्ये हा node किंवा त्याचा chain equivalent वापरला आहे.
Anthropic Chat Model node हा sub-node आहे. तो AI Agent किंवा Basic LLM Chain सारख्या root node ला model पुरवणारा छोटा attachment आहे. त्याला स्वतःचा trigger किंवा output नसतो. तो model picker आणि Maximum Number of Tokens तसेच Sampling Temperature यांसारखे sampling options उपलब्ध करून देतो. n8n च्या docs मधील एक महत्त्वाची बाब लक्षात ठेवा: sub-nodes मधील expressions प्रत्येक item सापेक्ष resolve होत नाहीत. ते नेहमी first input item सापेक्ष resolve होतात. त्यामुळे per-item expressions sub-node मध्ये न ठेवता root node च्या prompt fields मध्ये ठेवा.
Workflow 1: webhook इन, summary आउट
AI automation मधील hello-world: URL वर POST केलेली कोणतीही माहिती summarize होऊन Slack किंवा तुमच्या inbox मध्ये पोहोचते.
- Webhook node, HTTP Method POST, path
summarize. n8n तुम्हाला test URL आणि production URL देते; workflow active असेल तेव्हाच production URL ऐकते. - Anthropic node, Message a Model, model
claude-haiku-4-5, Max Tokens सुमारे 300. - Slack node (किंवा Send Email), response text एखाद्या channel वर post करा.
Prompt मध्ये n8n expressions आणि Claude एकत्र येतात. POST body $json.body अंतर्गत उपलब्ध होते, त्यामुळे user message field असे दिसते:
Summarize the following feedback in three bullets, then one line:
verdict: praise | complaint | churn-risk. No preamble.
{{ $json.body.text }}Role आणि format संबंधी instructions node च्या system prompt field मध्ये द्या, user message मध्ये नाही. Payload बदलत असताना system prompt स्थिर राहतो. त्यामुळे behavior स्थिर राहते आणि सहा महिन्यांनंतरही prompt समजण्यास सुलभ राहतो. VPS वरून त्याची चाचणी घ्या:
curl -X POST https://n8n.example.com/webhook/summarize \
-H 'Content-Type: application/json' \
-d '{"text": "Third support ticket this month about slow disk IO..."}'Haiku वर प्रत्येक run ची किंमत: prompt सह 1,200-token payload साठी सुमारे $0.0012 input खर्च येतो आणि output मधील 300 tokens साठी $0.0015 खर्च येतो; म्हणजे साधारणपणे एका cent च्या चौथ्या भागाइतकी किंमत. महिन्याला 1,000 runs केल्यास खर्च $3 पेक्षा कमी राहतो. हाच node Opus 4.8 कडे निर्देशित केल्यास खर्च सुमारे पाचपट असतो. तुम्ही तयार करत असलेल्या प्रत्येक workflow साठी हे प्रमाण लागू होते. म्हणून प्रत्येक node साठी model निवडण्याची सवय महत्त्वाची आहे.
Workflow 2: नियोजित RSS ते संरचित पंक्ती
आता ठरावीक वेळापत्रकावर चालणारा संरचित आउटपुट असलेला workflow पाहू: दर तासाला RSS feed वाचा, प्रत्येक item चे वर्गीकरण करा आणि sheet मध्ये पंक्ती जोडा.
- Schedule Trigger, दर तासाला.
- RSS Read, feed URL. प्रत्येक article साठी एक item आउटपुट मिळतो.
- Basic LLM Chain, यामध्ये Anthropic Chat Model sub-node
claude-haiku-4-5वर सेट केलेला असतो आणि Structured Output Parser sub-node मध्ये JSON schema असतो. - Google Sheets (किंवा Postgres), प्रत्येक item साठी एक पंक्ती जोडा.
Structured Output Parser मुळे "Claude, please return JSON" ही केवळ अपेक्षा न राहता एक करार बनतो: तो model च्या उत्तराचे तुमच्या schema नुसार validation करतो आणि चुकीच्या पंक्ती लिहिण्याऐवजी item ला स्पष्टपणे fail करतो. उदाहरणार्थ, schema असा असू शकतो:
{
"type": "object",
"properties": {
"category": { "type": "string", "enum": ["release", "security", "tutorial", "other"] },
"relevance": { "type": "number" },
"one_line_summary": { "type": "string" }
},
"required": ["category", "relevance", "one_line_summary"]
}Chain च्या prompt मध्ये feed item चा संदर्भ दिला जातो:
Classify this article for a VPS hosting audience.
Title: {{ $json.title }}
Content: {{ $json.contentSnippet }}येथे खर्चाचे गणित वेगळे असते: खर्च प्रत्येक run साठी नसून प्रत्येक item साठी असतो. दर तासाला 50 articles आणि दररोज 24 तास म्हणजे महिन्याला 36,000 Claude calls होतात. Article च्या लांबीवर अवलंबून Haiku साठी खर्च साधारणपणे $40–90 असू शकतो; Opus साठी तो याच्या सुमारे पाचपट असतो. LLM node आधी deduplicate करा. यासाठी आधी पाहिलेल्या links विरुद्ध साधा IF वापरा किंवा n8n चा Remove Duplicates node वापरा. त्यामुळे संख्या मोठ्या प्रमाणात कमी होते, कारण दर तासाच्या बहुतेक polls मध्ये नवीन काहीही नसते. सर्वात स्वस्त token म्हणजे तुम्ही केलेलाच नाही असा call.
वर्कफ्लो 3: टूल्स वापरणारा AI Agent
पहिले दोन वर्कफ्लो पाइपलाइन आहेत; त्यातील पायऱ्या तुम्ही ठरवता. AI Agent node ही रचना उलटवतो: तुम्ही Claude ला एक उद्दिष्ट आणि टूल्स देता, आणि काम पूर्ण होईपर्यंत कोणती टूल्स कोणत्या क्रमाने कॉल करायची हे तो ठरवतो. n8n साठी chat model sub-node आणि त्याला जोडलेले किमान एक tool sub-node आवश्यक आहे.
याचे एक ठोस उदाहरण म्हणजे monitoring मधून "काय बंद आहे आणि का" याचे उत्तर देणारा ops assistant:
- Chat Trigger (किंवा webhook); प्रश्न येथे येतो.
- AI Agent, ज्यामध्ये
claude-sonnet-5वर सेट केलेला Anthropic Chat Model sub-node असतो. Agents tool calls चे नियोजन करून त्यांची साखळी तयार करतात; साध्या single-tool agents साठी Haiku पुरेसा असू शकतो, पण tools ची संख्या वाढल्यावर Sonnet ही व्यवहार्य किमान निवड आहे. - tool म्हणून जोडलेला HTTP Request node, जो तुमच्या Uptime Kuma status API किंवा Zabbix endpoint कडे निर्देशित केलेला असतो. दुसरे HTTP tool REST API असलेल्या इतर कोणत्याही सेवेला कॉल करू शकते.
बहुतेक काम दोन settings करतात. Agent चा System Message त्याचे काम निश्चित करतो: "तुम्ही ops assistant आहात. उत्तर देण्यापूर्वी वर्तमान monitor state तपासण्यासाठी status tool वापरा. फक्त बंद असलेले monitors आणि त्यांचा कालावधी नोंदवा." प्रत्येक tool चे description हे मानवांसाठीचे documentation नसते; Claude ने ते tool कधी कॉल करायचे हे ठरवण्यासाठी ते वापरले जाते. "सर्व monitored services ची सध्याची up/down state JSON म्हणून परत करते" असे description योग्य वेळी कॉल केले जाते; "status API" असे अस्पष्ट description दुर्लक्षित होऊ शकते किंवा चुकीच्या पद्धतीने वापरले जाऊ शकते. HTTP Request node tool म्हणून जोडताना Optimize Response option सक्षम करा आणि आवश्यक JSON fields निवडा. अन्यथा प्रत्येक verbose API response input tokens म्हणून model च्या context मध्ये पाठवला जातो आणि त्यासाठी शुल्क आकारले जाते.
Agent वर Max Iterations सेट करा; त्याची default value 10 आहे. कार्य करणारी सर्वात लहान संख्या निवडा. त्यामुळे "agent ने 4 tool calls नंतर हार मानली" आणि model च्या डझनभर round-trips चा loop यांमध्ये फरक पडतो. Billing ची रचना समजून घ्या: प्रत्येक iteration मध्ये आतापर्यंतचे संपूर्ण conversation, system message, प्रश्न आणि आधीचे प्रत्येक tool result input tokens म्हणून पुन्हा पाठवले जातात. सहा-iteration agent run मध्ये cumulative input tokens सहजपणे 20,000 आणि output 2,000 पर्यंत जाऊ शकतात: Sonnet 5 च्या introductory pricing नुसार सुमारे $0.06, आणि standard $3/$15 नुसार अंदाजे $0.09. साध्या summarization run च्या तुलनेत हा खर्च वीसपट असू शकतो. एका agent ला अनेक tools जोडण्याची गरज वारंवार भासत असेल, तर तुमच्या VPS वर MCP servers चालवणे ही अधिक स्वच्छ architecture ठरते.
खर्चावरील नियंत्रण, कारण कोणीही निरीक्षण करत नाही
मानवी ऑपरेटर keyboard समोर असताना आपोआप लागू करतो ती नियंत्रणे unattended workflow मध्ये स्पष्टपणे सेट करावी लागतात. सर्वांत कमी खर्चाच्या नियंत्रणापासून सुरुवात करून चार स्तर वापरा.
प्रत्येक Claude node वर Max Tokens सेट करा. ही कमाल output मर्यादा असते. Summarizer साठी 300 आणि classifier साठी 100 पुरेसे असतात. त्यामुळे खर्चाच्या मोठ्या भागावर मर्यादा येते ($5–$25 प्रति million output tokens, input साठी $1–$5). हे runaway प्रक्रिया थांबवण्यासाठीही उपयोगी आहे. Prompt मधील चुकीमुळे Claude ने अनावश्यकपणे मोठे उत्तर दिले, तरी खर्च 8,000 tokens ऐवजी 300 tokensपुरता मर्यादित राहतो.
प्रत्येक node साठी Model निवडा. याचा वर उल्लेख केला आहे. सध्याच्या lineup मध्ये यामुळे किंमत पाच ते दहा पट बदलू शकते आणि हे सेट करण्यासाठी दहा सेकंद पुरतात.
Loops ला मर्यादा घाला. Agents वर Max Iterations सेट करा. Workflow च्या settings मध्ये workflow timeout सेट करा, जेणेकरून अडकलेली execution सतत चालू न राहता बंद होईल. प्रत्येक node वरील Retry On Fail वापरताना काळजी घ्या. तात्पुरत्या errors साठी ते योग्य आहे; परंतु retries मुळे खर्च वाढतो. Wait Between Tries of 5000 ms सह Max Tries of 3 सेट केल्यास, कायमस्वरूपी failure झाल्यावर थांबण्यापूर्वी प्रत्येक item साठी तुमच्याकडून तीन वेळा शुल्क आकारले जाऊ शकते. आधीच महागडी execution यशस्वी झालेल्या node भोवती retry कधीही लावू नका.
बॅकस्टॉप म्हणून error workflow वापरा. Error Trigger node ने सुरू होणारा workflow तयार करा. तो failed workflow चे नाव आणि error Slack वर पोस्ट करेल. त्यानंतर प्रत्येक AI workflow च्या settings मध्ये तो workflow Error Workflow म्हणून सेट करा. हे workflow ज्या गंभीर failure mode ला पकडते तो असा असतो: schedule-triggered workflow प्रत्येक run मध्ये error देतो, दर तासाला संपूर्ण आठवडाभर चालतो आणि बंद होण्यापूर्वी प्रत्येक run मध्ये tokens खर्च करतो. Anthropic Console मध्ये monthly spend limit सेट करा. Scheduled workflow सक्रिय केल्यानंतर पहिल्या काही दिवसांत Console मधील usage page तपासा. नेमक्या कोणत्या गोष्टींसाठी शुल्क आकारले जात आहे हे समजून घ्यायचे असल्यास, token वापर मार्गदर्शक त्याचे सविस्तर विश्लेषण करते.
अपयशाच्या स्थिती आणि दिसणारे संदेश
नोड लगेचच "Authorization failed - please check your credentials." संदेशासह अयशस्वी होतो. API ने 401 परत केले. संबंधित body अशी आहे:
{"type": "error", "error": {"type": "authentication_error", "message": "invalid x-api-key"}}चुकीच्या पद्धतीने paste केलेली key, अपूर्ण key, शेवटी राहिलेली whitespace किंवा tutorial मधील placeholder हे याचे कारण असू शकते. n8n credential पुन्हा तयार करून key पुन्हा paste करा. ती काल कार्यरत होती, पण आता कार्यरत नसल्यास Console मध्ये key revoke केली आहे का किंवा volume restore मुळे वेगळ्या N8N_ENCRYPTION_KEY ने encrypted केलेली credential परत आली आहे का ते तपासा.
Executions 429 rate_limit_error सह गटागटाने अयशस्वी होतात. संदेश साधारणपणे असा असतो: "Number of request tokens has exceeded your per-minute rate limit." Rate limits प्रति-मिनिट buckets मध्ये लागू होतात. n8n मुळे पन्नास webhook किंवा RSS executions एकाच वेळी सुरू होणे सहज शक्य आहे. रचना बदलून ही समस्या सोडवा: items parallel पद्धतीने न चालवता क्रमाने process करा (Loop Over Items). Retry On Fail मध्ये Max Tries 3 सेट करा आणि Wait Between Tries साठी कमाल 5000 ms सेट करा; n8n हे field 5000 ms वर मर्यादित ठेवते. Retries पुढील minute window मध्ये जाण्यासाठी अधिक मोठा backoff आवश्यक असल्यास error path मध्ये Wait node ठेवा किंवा items एकावेळी एक process करा. Response मध्ये किती वेळ प्रतीक्षा करावी हे स्पष्ट करणारा retry-after header असतो. n8n चे fixed wait हे header वाचू शकत नाही. त्यामुळे अधिक मोठा pause स्वतः तयार करा.
तुमच्या model चे नाव देताना 404 not_found_error येतो. Body मध्ये चुकीचे नाव दिसते:
{"type": "error", "error": {"type": "not_found_error", "message": "model: claude-haiku-4.5"}}Hyphens ऐवजी dots (4.5 हे 4-5 साठी), जुन्या blog post मधील date suffix किंवा निवृत्त केलेला model हे कारण असू शकते. सध्याच्या list विरुद्ध ID तपासा. Model field मध्ये नाव expression म्हणून type करण्याऐवजी dropdown मधून निवडल्यास ही समस्या टाळता येते.
Claude तुम्ही विचारलेला नसलेला प्रश्नाचे उत्तर देतो. कुठेही error दिसत नाही आणि run यशस्वी दिसतो. Payload मध्ये message वापरले असताना {{ $json.body.text }} सारख्या अनुपलब्ध field चा संदर्भ देणारे n8n expression तुमच्या prompt मध्ये undefined हा literal string समाविष्ट करते. त्यामुळे Claude काहीही नसलेल्या prompt ला उत्तर देतो. संदर्भित node अजिबात execute झाला नसेल, तर "Referenced node is unavailable" संदेश मिळतो. मात्र अनुपलब्ध field असल्यास कोणताही error दिसत नाही. Workflow activate करण्यापूर्वी real data सह एकदा run करा आणि node च्या input panel मध्ये प्रत्यक्ष rendered prompt तपासा. Expression editor resolved value चे preview दाखवतो आणि पाहिल्यास undefined तेथे स्पष्ट दिसते.
FAQ
Claude ला n8n शी कसे जोडावे?
platform.claude.com वरील Anthropic Console मध्ये API key तयार करा. त्यानंतर n8n मध्ये Anthropic प्रकाराचे credential जोडा आणि ते API Key field मध्ये paste करा. प्रत्येक Claude node, Anthropic app node आणि Anthropic Chat Model sub-node या साठवलेल्या credential चा संदर्भ घेतात. n8n ते N8N_ENCRYPTION_KEY ने encrypt करते. त्यामुळे त्या key चा backup घ्या; अन्यथा volume नष्ट झाल्यास तुमचे credentialsही नष्ट होतील.
प्रत्येक वेळी AI workflow चालवण्याचा खर्च किती असतो?
प्रत्येक run मधील tokens चा अंदाज घ्या. त्यानंतर तो model च्या प्रति-million किंमतीने गुणा करा. July 2026 नुसार Haiku 4.5 ची input/output tokens साठी किंमत अनुक्रमे $1/$5 प्रति million आहे. Sonnet 5 ची किंमत $3/$15 आहे. August 2026 पर्यंत introductory किंमत $2/$10 आहे. Haiku वर webhook summarization चा खर्च साधारणपणे cent च्या एक-चतुर्थांश इतका असतो. Sonnet वर अनेक tool calls असलेला agent run साधारण $0.06–$0.10 इतका खर्चिक ठरतो, कारण प्रत्येक iteration मध्ये संपूर्ण conversation input म्हणून पुन्हा पाठवली जाते. अंदाजांवर अवलंबून न राहता Console मधील usage page वर run तपासा.
n8n automations साठी कोणते Claude model वापरावे?
Classification, extraction, summarization आणि routing यांसाठी Haiku 4.5 वापरा. वेग आणि किंमत महत्त्वाची असलेल्या high-volume कामांसाठीही ते योग्य आहे. AI Agent nodes आणि multi-step reasoning साठी Sonnet 5 वापरा. चुकीच्या उत्तराचा खर्च त्याच्या $5/$25 list price चे समर्थन करेल अशाच ठिकाणी Opus 4.8 वापरा. त्याची किंमत Haiku पेक्षा पाचपट आणि Sonnet पेक्षा थोडी कमी दुप्पट आहे. Model workflow साठी नव्हे, तर प्रत्येक node साठी सेट करा. एका workflow मध्ये तिन्ही models मिसळता येतात.
Claude API वर n8n workflow चा अनावश्यक जास्त खर्च कसा थांबवावा?
Guardrails चे अनेक स्तर वापरा: प्रत्येक Claude node वर कमी Max Tokens, agents वर Max Iterations, workflow timeout आणि failures मुळे token खर्च वाढू नये यासाठी संयत Retry On Fail settings. त्यानंतर Error Trigger workflow जोडा. कोणतेही AI workflow fail झाल्यावर तो Slack मध्ये alert पाठवेल. तसेच Anthropic Console मध्ये monthly spend limit सेट करा. ही hard ceiling असेल आणि VPS वरील कोणतीही गोष्ट ती ओलांडू शकणार नाही.
AI Agent च्या tool calls साठी अतिरिक्त शुल्क लागते का?
स्वतंत्र tool fee नाही. मात्र tools विनामूल्य नाहीत. प्रत्येक tool result input tokens म्हणून model कडे परत पाठवला जातो. प्रत्येक agent iteration मध्ये त्यावेळची संपूर्ण conversation पुन्हा पाठवली जाते. Filter न केलेला chatty API response प्रत्यक्ष prompt पेक्षा कितीतरी मोठा होऊ शकतो. त्यामुळे HTTP Request tools वर Optimize Response enable करा आणि agent ला आवश्यक असलेली fieldsच परत करा.