कोणता Claude model वापरावा? खर्च आणि तुलना
Opus 4.8, Sonnet 5 की Haiku 4.5? July 2026 चे नवीन दर तपासा आणि 1,00,000 jobs वर होणाऱ्या खर्चाची अचूक तुलना आणि योग्य settings जाणून घ्या.
मी कोणता Claude model वापरला पाहिजे?
तुम्ही कोणता Claude model वापरला पाहिजे याचे थोडक्यात उत्तर: Claude Opus 4.8 ने सुरुवात करा. जर तुमच्याकडे ठोस कारण नसेल, तर त्याचा वापर थांबवू नका. Anthropic चे मार्गदर्शन देखील असेच आहे. "जर तुम्हाला कोणता model वापरायचा आहे याबद्दल शंका असेल, तर जटिल agentic coding आणि enterprise कामासाठी Claude Opus 4.8 ने सुरुवात करा." जेव्हा काम स्पष्टपणे परिभाषित केलेले असेल आणि तुम्ही ते दिवसातून अनेक वेळा राबवत असाल, तेव्हा Claude Sonnet 5 वर स्विच करा. जेव्हा काम यांत्रिक असेल आणि तुम्हाला अचूक उत्तर कसे असावे हे माहित असेल, तेव्हा मोठ्या प्रमाणात काम करण्यासाठी Claude Haiku 4.5 वापरा. दीर्घकाळ चालणाऱ्या agents साठी Claude Fable 5 हा सर्वात वरचा पर्याय आहे.
या निवडीसाठी काही खर्च येतो. 23 July 2026 पर्यंत Claude API (application programming interface) चे दर खालीलप्रमाणे आहेत. हे दर प्रति मिलियन tokens (ज्याला docs मध्ये MTok असे लिहिले आहे) आहेत.
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): 31 August 2026 पर्यंत introductory pricing: $2 in, $10 out. 1 September 2026 पासून standard $3 in, $15 out लागू होईल. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
हे identifiers जसे लिहिले आहेत तसेच आहेत. त्यांच्या पुढे काहीही जोडलेले नाही.
1M-token मॉडेल्सवर आकारानुसार (size) कोणताही अतिरिक्त शुल्क आकारला जात नाही: "900k-token च्या request साठी तेवढाच per-token दर आकारला जातो, जो 9k-token च्या request साठी असतो."
प्रत्येक model नक्की कशासाठी आहे
Anthropic प्रत्येक model साठी एक ओळ वापरून त्याचे वर्णन करते, आणि हे वर्णन कोणत्याही leaderboard पेक्षा अधिक मार्गदर्शक ठरते.
- Claude Fable 5: "long-running agents साठी next-generation intelligence." latency च्या बाबतीत या चारही models मध्ये सर्वात संथ (slowest) आहे.
- Claude Opus 4.8: "complex agentic coding आणि enterprise work साठी." मध्यम latency.
- Claude Sonnet 5: "speed आणि intelligence चे सर्वोत्तम संयोजन." वेगवान (Fast).
- Claude Haiku 4.5: "frontier intelligence जवळ असलेले सर्वात वेगवान model."
Haiku 4.5 मध्ये काही मर्यादा आहेत, ज्या किमतीपेक्षाही कामासाठी त्याची उपयुक्तता ठरवतात. याची context window 1M ऐवजी 200K tokens आहे, त्यामुळे मोठे repository किंवा long agent transcript यामध्ये बसणार नाहीत. synchronous Messages API वर याची maximum output 64K tokens आहे, तर इतर models साठी ती 128K tokens आहे. तसेच, याची knowledge cutoff फेब्रुवारी 2025 आहे, तर इतर तीन models साठी ती जानेवारी 2026 आहे.
प्रत्यक्ष वर्कलोडवर या निवडीमुळे येणारा खर्च काय असेल?
या लाइनअपमधील प्रत्येक मॉडेलचा आउटपुट दर हा इनपुट दराच्या पाचपट आहे. Opus 4.8 साठी $5 इनपुट आणि $25 आउटपुट आहे. Haiku 4.5 साठी $1 इनपुट आणि $5 आउटपुट आहे. हा रेशो संपूर्ण रेंजमध्ये सारखाच आहे, त्यामुळे तुम्ही निवडलेले मॉडेल अशा कामांसाठी महत्त्वाचे ठरते जिथे मोठ्या प्रमाणात आउटपुट जनरेट होते.
Agentic वर्क हे अशा प्रकारच्या कामाचे उदाहरण आहे, कारण thinking tokens साठी आउटपुट टोकन्सप्रमाणे शुल्क आकारले जाते आणि मजकूर तुमच्यापर्यंत पोहोचला नाही तरी ते max_tokens मध्ये मोजले जातात. Fable 5, Opus 4.8, Opus 4.7 आणि Sonnet 5 मध्ये reasoning summary डीफॉल्टनुसार वगळले जाते, त्यामुळे thinking फील्ड रिकामे येते. बिलिंगमध्ये कोणताही बदल होत नाही: "दोन्ही परिस्थितीत ब्लॉकसाठी सारखेच शुल्क आकारले जाते आणि multi-turn conversations मध्ये तो सारख्याच पद्धतीने परत पाठवला जातो." Claude टोकन बिल नक्की कशावर अवलंबून असते यामध्ये याचे सविस्तर विश्लेषण दिले आहे.
तुम्ही तुलना करत असलेल्या मॉडेल्समध्ये thinking सुरू आहे की नाही यावर फरक पडतो, आणि जर तुम्ही याकडे दुर्लक्ष केले तर खर्च चाचणी (cost test) चुकीची ठरू शकते. Sonnet 5 आणि Fable 5 मध्ये thinking आधीपासूनच सुरू असते आणि त्यासाठी कोणत्याही कॉन्फिगरेशनची गरज नसते. Opus 4.8 आणि Opus 4.7 मध्ये, जोपर्यंत तुम्ही request मध्ये thinking: {type: "adaptive"} सेट करत नाही, तोपर्यंत ते बंद असते. आकडेवारी तपासण्यापूर्वी दोन्ही बाजूंची कॉन्फिगरेशन तपासा.
सर्वात स्वस्त मॉडेल सर्वात महागडे का ठरू शकते
एक स्वतंत्र कोडिंग टास्क (coding task) घ्या. या विनंतीमध्ये 60,000 tokens चा context आहे आणि मॉडेल thinking सह 8,000 tokens चे output देते. येथे कोणतेही caching नाही, त्यामुळे सर्व गणित स्पष्टपणे दिसते.
Opus 4.8 वर: $5 दराने 0.06 MTok input म्हणजे $0.30, आणि $25 दराने 0.008 MTok output म्हणजे $0.20. एक प्रयत्न (attempt) करण्यासाठी $0.50 खर्च होतात. Haiku 4.5 वर तोच प्रयत्न $0.06 + $0.04 म्हणजे $0.10 मध्ये होतो.
Haiku प्रति प्रयत्न पाच पटीने स्वस्त आहे, जे वरवर पाहता खूप फायदेशीर वाटते. परंतु, अयशस्वी प्रयत्न केल्यावर काय होते ते पहा. चुकीचे उत्तर वाचण्यासाठी तुमचा वेळ खर्च होतो. रिट्राई (retry) करताना तुम्ही तेच उत्तर context म्हणून पुन्हा पाठवता, त्यामुळे प्रत्येक पुढील प्रयत्न मागील प्रयत्नापेक्षा मोठा असतो. जेव्हा तिसऱ्या प्रयत्नातही उत्तर मिळत नाही, तेव्हा तुम्ही Opus कडे वळता: $0.30 Haiku + $0.50 Opus म्हणजे $0.80, जे एकदा Opus वापरण्यापेक्षा 60% जास्त आहे.
त्यामुळे, मुख्य प्रश्न असा आहे की तुम्ही उत्तर किती स्वस्तपणे तपासू शकता. जेव्हा चुकीचे उत्तर एका सेकंदात स्पष्ट होते, तेव्हा लहान मॉडेल फायदेशीर ठरते. परंतु, चूक शोधण्यासाठी जर carefully diff वाचणे आवश्यक असेल, तर लहान मॉडेलमुळे तुमचा जो वेळ वाया जातो, तो बिलामध्ये (invoice) दिसत नाही.
लहान मॉडेल कधी श्रेष्ठ ठरते
खालील प्रकरणांमध्ये Haiku 4.5 हा योग्य पर्याय आहे:
- Mechanical subagent work. फाईल्सचे नाव बदलणे किंवा search output गोळा करणे यांसारख्या कामांसाठी प्रगत reasoning ची गरज नसते. एकदा तुम्ही build an AI agent with Claude करून त्याला helpers दिले की हा एक standard pattern बनतो.
- Log triage. एखादी ओळ केवळ noise आहे की मानवी लक्ष वेधून घेण्यासारखी आहे, याचा निर्णय घेणे हे एक मर्यादित judgement आहे ज्यामध्ये failure mode स्पष्ट असतो.
- Classification against a fixed label set. आउटपुट लहान असते आणि नमुन्यावर (sample) accuracy मोजता येते.
- High-volume production calls. दिवसाला 100,000 runs असताना, per-token खर्च आता केवळ एक rounding error राहत नाही. AI workflows wired into n8n मध्ये सहसा असेच घडते.
- ज्या कामांमध्ये युजरसाठी response speed महत्त्वाची आहे. Haiku 4.5 हे या lineup मधील सर्वात वेगवान मॉडेल आहे.
एक मर्यादा विशेषतः Haiku साठी लागू आहे. Opus 4.8 आणि Sonnet 5 मध्ये minimum cacheable prompt 1,024 tokens आहे, तर Haiku मध्ये तो 4,096 tokens आहे. या किमान मर्यादेपेक्षा कमी असल्यास "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Sonnet 5 वर cache होणारा 1,500-token चा instruction block Haiku 4.5 वर silently cache होत नाही. याचे लक्षण म्हणजे cache_creation_input_tokens आणि cache_read_input_tokens दोन्ही zero वर असणे, जे keeping an always-on agent's costs down आणि cache न होण्याच्या इतर कारणांसोबत येते.
उत्तर बदलणारे घटक
यापैकी प्रत्येक घटक मॉडेलच्या नावापेक्षाही अधिक परिणामकारक ठरतो.
Effort. output_config.effort मुळे मॉडेल उत्तर देण्यापूर्वी किती काम करेल हे नियंत्रित केले जाते. याचे स्तर low, medium, high, xhigh आणि max आहेत, आणि high हा डीफॉल्ट स्तर आहे: "effort ला high वर सेट केल्यास, effort पॅरामीटर पूर्णपणे वगळल्यास जे परिणाम मिळतात, तेच अगदी तंतोतंत मिळतात." हे विनंतीच्या (request) मुख्य स्तरावर नसून output_config च्या आत असते:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort प्रत्येक response मधील प्रत्येक token वर परिणाम करते: "याचा परिणाम tool calls सह सर्व token खर्चवर होऊ शकतो. उदाहरणार्थ, कमी effort असल्यास Claude कमी tool calls करेल." याचा परिणाम agentic loop वर अधिक होतो. ही कोणतीही token मर्यादा (cap) नाही: "Effort हा एक वर्तणुकीचा (behavioral) सिग्नल आहे, तो कडक token बजेट नाही." Anthropic प्रत्येक स्तरासाठी खर्च मल्टिप्लायर जाहीर करत नाही आणि तुम्हाला स्वतःच्या use case चे परीक्षण करण्यास सांगते. त्यामुळे, आज दुपारी तुम्ही Opus 4.8 (low वर) आणि Sonnet 5 (high वर) यांची प्रत्यक्ष तुलना करू शकता. Haiku 4.5 मध्ये effort ला सपोर्ट देणाऱ्या मॉडेल्सच्या यादीत समाविष्ट नाही.
Prompt caching. Cache read चा खर्च हा मूळ input rate च्या 0.1x इतका असतो, आणि विविध tiers मध्ये याचे प्रमाण मॉडेल निवड ठरवते. Opus 4.8 वरील cache hit चा खर्च $0.50 / MTok आहे, तर Haiku 4.5 वरील uncached input चा खर्च $1 / MTok आहे. त्यामुळे, चांगल्या प्रकारे cache केलेल्या Opus prefix चा खर्च, cold Haiku prompt पेक्षा प्रति input token कमी असतो. मोठ्या आणि स्थिर (stable) prefix ला पुन्हा पुन्हा पाठवणाऱ्या कोणत्याही workload साठी, मॉडेल निवडण्यापेक्षा session hygiene अधिक फायदेशीर ठरते.
Batches. जर उत्तरासाठी कोणतीही प्रतीक्षा नसेल, तर Message Batches API "input आणि output दोन्ही tokens वर 50% सवलत" देऊन तेच मॉडेल्स चालवते. हे खालील तुलनेतील प्रत्येक ओळ (row) निम्मी करते आणि ते सर्व tiers मध्ये काम करते: 1 September 2026 पासून, एकाच किमतीत, synchronous Sonnet 5 job पेक्षा batched Opus 4.8 job स्वस्त पडतो, जिथे तुम्ही latency च्या बदल्यात अधिक क्षमता मिळवता.
एक कामासाठी खर्चाची तुलना
वर्कलोड: 100,000 सपोर्ट ईमेल्सचे वर्गीकरण करणे. प्रत्येक कॉलसाठी 2,000 इनपुट टोकन्स आणि 300 आउटपुट टोकन्स. म्हणजेच 200 MTok इनपुट आणि 30 MTok आउटपुट.
- Haiku 4.5: 200 x $1 = $200 इन, 30 x $5 = $150 आऊट. एकूण $350.
- Sonnet 5, introductory rate: 200 x $2 = $400 इन, 30 x $10 = $300 आऊट. एकूण $700.
- Sonnet 5, 1 September 2026 पासून: 200 x $3 = $600 इन, 30 x $15 = $450 आऊट. एकूण $1,050.
- Opus 4.8: 200 x $5 = $1,000 इन, 30 x $25 = $750 आऊट. एकूण $1,750.
उद्याच्या किमतींनुसार पुनर्गणना करण्यासाठी चार संख्या बदला. खालील समायोजनांमुळे निकालात मॉडेलच्या नावापेक्षा जास्त बदल होतात:
- Batching मुळे प्रत्येक ओळीचा खर्च निम्मा होतो: $175, $350, $525 आणि $875. रात्रीच्या वर्गीकरण प्रक्रियेत (nightly classification run) काहीही थांबत नाही, त्यामुळे ते न वापरण्याचे कोणतेही कारण नाही.
- Shared prefix कॅश करणे. समजा, 2,000 इनपुट टोकन्सपैकी 1,200 टोकन्स प्रत्येक वेळी एकच instruction block आहेत. Sonnet 5 (introductory rate) वर, याला $2 / MTok ऐवजी कॅश हिट म्हणून $0.20 / MTok खर्च येतो, त्यामुळे 120 MTok साठी $240 ऐवजी $24 खर्च होतात. $2 दराने 80 MTok नवीन इनपुट ($160) आणि $300 आउटपुट मिळवा. अशा प्रकारे Sonnet 5 चा खर्च $700 ऐवजी $484 च्या जवळ येतो. Haiku 4.5 वर ही पद्धत लागू होत नाही, कारण 1,200 टोकन्स हे त्याच्या 4,096-token किमान मर्यादेपेक्षा कमी आहेत.
- Retries. समजा, तुम्ही 8% ईमेल्ससाठी Haiku चे उत्तर नाकारता आणि ते Opus 4.8 वर पुन्हा चालवता. $350 मध्ये 0.08 x $1,750 = $140 मिळवा, ज्यामुळे $490 येतात. माझी न वापरता तुमच्या स्वतःच्या rejection rate ची गणना करा.
- Tool definitions, जर कामात त्यांचा वापर होत असेल तर. जर
tool_choiceहेautoवर सेट असेल, तर Opus 4.8 वर ते 290 टोकन्स असतात, Sonnet 5 वर 354 आणि Haiku 4.5 वर 496 टोकन्स असतात. सर्वात स्वस्त मॉडेलमध्ये सर्वात जास्त fixed overhead असतो.
$490 खर्च असलेला escalation path सह Haiku आणि $484 खर्च असलेला cached Sonnet 5 यांचा खर्च समान आहे, आणि त्यापैकी एक मॉडेल हे काम एकाच पासमध्ये पूर्ण करते. मॉडेल हा कधीही एकमेव प्रश्न नव्हता.
सेशनमध्ये मॉडेल बदलल्याने पैशांची बचत होते का?
स्टिकर प्राईसपेक्षा (sticker prices) ही बचत कमी प्रमाणात होते, कारण बचत ही प्रति टोकन (per token) असते आणि तुम्ही संपूर्ण कॅश्ड प्रीफिक्स (cached prefix) गमावण्याचा धोका पत्करता.
कॅश (cache) अमान्य (invalidate) करणारे घटक Anthropic ने स्पष्ट केले आहेत. प्रीफिक्स tools, system आणि messages या क्रमाने तयार केले जातात, आणि "प्रत्येक स्तरावरील बदलामुळे तो स्तर आणि त्यानंतरचे सर्व स्तर अमान्य होतात." दोन विनंती सेटिंग्ज (request settings) देखील या यादीत आहेत: "thinking configuration आणि resolved effort स्तर हे स्वतः प्रॉम्प्टमध्ये समाविष्ट केले जातात, त्यामुळे त्यांपैकी काहीही बदलल्यास नवीन कॅश प्रीफिक्स तयार होतो." अधिक माहितीसाठी डॉक्युमेंटेशन असे सांगते: "कॅश हिट्सवर (cache hits) अवलंबून असलेल्या संभाषणादरम्यान (conversation) बदल करण्याऐवजी, विविध वर्कलोड्समध्ये effort बदला."
मॉडेल या दस्तऐवजीकृत यादीत नाही, त्यामुळे कोणत्याही निष्कर्षावर पोहोचू नका. मॉडेल बदलल्यानंतर पहिल्या विनंतीसाठी cache_read_input_tokens वाचा आणि मिळालेल्या आकड्यावरून निर्णय घ्या. 150,000-token Opus 4.8 प्रीफिक्सवर, कॅश रीड (cache read) खर्च सुमारे $0.08 आहे आणि नवीन राईट (write) खर्च सुमारे $0.94 आहे, जो तुम्ही शोधत असलेल्या प्रति-टोकन फरकाच्या (per-token gap) अनेक टर्नपेक्षा जास्त आहे.
त्यामुळे, एकाच कामाच्या दरम्यान हे बदल करू नका, तर टास्क (tasks) बदलताना करा. Claude Code मध्ये याचा अर्थ असा आहे की, आधी /clear करा (जेव्हा कॅश आधीच काढून टाकले जात असते), त्यानंतर /model किंवा /effort करा.
तुमच्या स्वतःच्या workload वर उत्तर कसे तपासायचे
दुसऱ्या मॉडेलवरून घेतलेल्या count वरून prompt चा आकार (size) ठरवू नका. token-counting endpoint वापरण्यासाठी मोफत आहे आणि तुम्ही जे मॉडेल निवडाल त्याच्या tokenizer नुसार ते count करते, म्हणून तुम्ही ज्या मॉडेलचा वापर करणार आहात तेच नाव द्या. Opus 4.7 आणि त्यानंतरची मॉडेल्स, Fable 5 आणि Sonnet 5 ही नवीन tokenizer वापरतात जी "एकाच मजकुरासाठी अंदाजे 30% जास्त tokens तयार करतात", त्यामुळे जुन्या मॉडेलवर मोजलेला budget नवीन मॉडेलवर कमी पडू शकतो.
त्यानंतर मिळालेला रिस्पॉन्स वाचा. input_tokens मध्ये फक्त uncached उर्वरित भाग असतो, त्यामुळे खरा prompt size हा cache_creation_input_tokens आणि cache_read_input_tokens मिळवून मिळतो. A first Claude API app on a VPS वर ही मोजणी करणे सर्वात सोपे आहे, आणि which Claude plan fits your usage हा तुमचा वापरानुसार token साठी पैसे देण्याबाबतचा वेगळा निर्णय आहे.
FAQ
कोडिंगसाठी कोणता Claude model सर्वोत्तम आहे?
जटिल agentic कोडिंगसाठी Claude Opus 4.8 हा अधिकृत सुरुवातीचा बिंदू आहे. जुलै 2026 पर्यंत, याची किंमत $5 प्रति million input tokens आणि $25 per million output आहे. Claude Sonnet 5 हा वेग आणि बुद्धिमत्ता यांचा सर्वोत्तम संगम मानला जातो. 31 August 2026 पर्यंत, $2 / $10 या दराने याची किंमत Sonnet 5 पेक्षा निम्म्यापेक्षाही कमी आहे. दोन्ही models वर एकच कार्य करा, thinking configuration स्थिर ठेवा आणि response.usage कडून एकूण token खर्च तपासा.
Claude Haiku 4.5 हे Sonnet 5 च्या जागी वापरण्यासाठी पुरेसे स्वस्त आहे का?
प्रति token, सहजपणे: Sonnet 5 च्या introductory pricing ($2 / $10) च्या तुलनेत Haiku 4.5 हे $1 / $5 आहे, किंवा 1 September 2026 पासून हे $3 / $15 आहे. मर्यादा (limits) यावर निर्णय घेतात. Haiku 4.5 मध्ये 1M ऐवजी 200K token context window आहे, synchronous Messages API वर 64K maximum output आहे, February 2025 चा reliable knowledge cutoff आहे, output_config.effort support नाही, आणि 4,096-token minimum cacheable prompt आहे जो लहान system prompts वर caching आपोआप अक्षम (disable) करतो.
सेशनच्या मध्यभागी स्वस्त Claude model वर स्विच केल्याने पैसे वाचतात का?
असे नेहमी घडत नाही. Anthropic नुसार, tools, system किंवा messages prefix मध्ये बदल, thinking configuration मध्ये बदल आणि output_config.effort मध्ये बदल केल्यास cache invalidators तयार होतात. मॉडेल स्विच केल्यावर अस्तित्वात असलेल्या cache वर काय परिणाम होतो हे दस्तऐवजीकरण केलेले नाही, त्यामुळे याला अज्ञात मानून त्यानंतरच्या पहिल्या विनंतीसाठी (request) cache_read_input_tokens वाचा. हे जाणून घेणे महत्त्वाचे आहे: 150,000-token Opus 4.8 prefix वर, cache read साठी सुमारे $0.08 खर्च होतो आणि fresh write साठी सुमारे $0.94 खर्च होतो, जे प्रति-token बचतीपेक्षा जास्त आहे. Claude Code मध्ये /clear नंतर, जेव्हा cache आपोआप काढून टाकले जाते, तेव्हाच कामांमध्ये (tasks) स्विच करा.
output_config.effort मुळे माझ्या बिलावर काय परिणाम होतो?
हे text, tool calls आणि thinking मध्ये model किती tokens खर्च करते हे बदलते. कमी effort मुळे कमी tool calls होतात, ज्यामुळे agentic loops मध्ये खर्च वाढतो कारण प्रत्येक tool result नंतरच्या turns मध्ये पुन्हा पाठवला जातो. याचे levels low, medium, high, xhigh आणि max आहेत, ज्यामध्ये high हे default आहे. Anthropic प्रत्येक level साठी cost multiplier जाहीर करत नाही; ते effort ला token budget ऐवजी behavioural signal मानतात, त्यामुळे तुमच्या स्वतःच्या कामावर याचे मोजमाप करा.
Claude Batches API मुळे किती बचत होते?
Asynchronous delivery च्या बदल्यात, input आणि output दोन्ही tokens वर 50% बचत होते. जुलै 2026 पर्यंत, यामुळे Opus 4.8 ची किंमत $2.50 in / $12.50 out, Sonnet 5 ची introductory pricing वर $1 / $5, आणि Haiku 4.5 ची किंमत $0.50 / $2.50 आहे. महत्त्वाचा तुलनात्मक फरक: 1 September 2026 पासून, एक batched Opus 4.8 job ची किंमत standard rate वर असलेल्या synchronous Sonnet 5 job पेक्षा कमी आहे, त्यामुळे batching मुळे त्याच पैशात अधिक शक्तिशाली model मिळते.