ఏ Claude మోడల్ వాడాలి? ధరల వివరాలు
Opus 4.8, Sonnet 5 లేదా Haiku 4.5 ల మధ్య ఏది ఉత్తమం? 100,000 జాబ్స్ పై ఖర్చుల పోలిక మరియు July 2026 API ధరల పూర్తి వివరాలను ఇక్కడ చూడండి.
నేను ఏ Claude మోడల్ను ఉపయోగించాలి?
మీరు ఏ Claude మోడల్ను ఉపయోగించాలో చెప్పడానికి క్లుప్తమైన సమాధానం: Claude Opus 4.8తో ప్రారంభించండి. ఏదైనా స్పష్టమైన కారణం ఉంటే తప్ప వేరే మోడల్కు మారకండి. Anthropic యొక్క సూచన కూడా ఇదే. "ఏ మోడల్ ఉపయోగించాలో మీకు తెలియకపోతే, సంక్లిష్టమైన agentic coding మరియు enterprise పనుల కోసం Claude Opus 4.8తో ప్రారంభించండి." పని స్పష్టంగా ఉన్నప్పుడు మరియు మీరు దానిని రోజుకు చాలాసార్లు రన్ చేస్తున్నప్పుడు Claude Sonnet 5కి మారండి. సరైన సమాధానం ఎలా ఉంటుందో మీకు తెలిసినప్పుడు, యంత్ర సంబంధిత (mechanical) మరియు అధిక పరిమాణం కలిగిన పనుల కోసం Claude Haiku 4.5ని ఉపయోగించండి. దీర్ఘకాలిక agents కోసం Claude Fable 5 అన్నిటికంటే పైన ఉంటుంది.
ఈ ఎంపికకు కొంత ఖర్చు ఉంటుంది. 23 July 2026 నాటికి Claude API (application programming interface) ధరలు, ప్రతి మిలియన్ టోకెన్లకు (docs లో MTok అని పిలుస్తారు) ఈ క్రింది విధంగా ఉన్నాయి:
- Claude Fable 5 (
claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 in, $25 out. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 in, $25 out. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): 31 August 2026 వరకు పరిచయ ధర (introductory pricing) ద్వారా $2 in, $10 out. 1 September 2026 నుండి ప్రామాణిక ధర $3 in, $15 out అమలులోకి వస్తుంది. 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 in, $5 out. 200K context.
ఆ identifiers ఉన్న విధంగానే ఉంటాయి. వాటికి ఏదీ జోడించబడదు.
1M-token మోడల్లపై పరిమాణం (size) ఆధారంగా అదనపు రుసుము ఉండదు: "900k-token రిక్వెస్ట్కు, 9k-token రిక్వెస్ట్తో సమానమైన per-token ధర వర్తిస్తుంది."
ప్రతి మోడల్ యొక్క అసలు ఉపయోగం
Anthropic ప్రతి మోడల్ గురించి ఒకే ఒక లైన్ వివరణ ఇస్తుంది. ఆ వివరణలు ఏ లీడర్బోర్డ్ కంటే మెరుగైన మార్గదర్శకత్వాన్ని అందిస్తాయి.
- Claude Fable 5: "దీర్ఘకాలిక ఏజెంట్ల కోసం నెక్స్ట్-జనరేషన్ ఇంటెలిజెన్స్." లేటెన్సీ (latency) పరంగా ఈ నలుగురిలో ఇది అత్యంత నెమ్మదిగా పనిచేస్తుంది.
- Claude Opus 4.8: "సంక్లిష్టమైన ఏజెంటిక్ కోడింగ్ మరియు ఎంటర్ప్రైజ్ పనుల కోసం." మోడరేట్ లేటెన్సీ.
- Claude Sonnet 5: "వేగం మరియు ఇంటెలిజెన్స్ యొక్క ఉత్తమ కలయిక." వేగంగా పనిచేస్తుంది.
- Claude Haiku 4.5: "అత్యంత వేగవంతమైన మోడల్ మరియు ఫ్రంటియర్ ఇంటెలిజెన్స్ కలిగి ఉంటుంది."
ధర కంటే ముందుగా, Haiku 4.5 యొక్క పరిమితులు అది ఏ పనికి సరిపోతుందో నిర్ణయిస్తాయి. దీని context window 1M కి బదులుగా 200K tokens మాత్రమే ఉంటుంది, కాబట్టి పెద్ద రిపోజిటరీ లేదా సుదీర్ఘమైన ఏజెంట్ ట్రాన్స్క్రిప్ట్ ఇందులో సరిపోదు. సింక్రొనస్ Messages APIలో దీని గరిష్ట అవుట్పుట్ 64K tokens, కానీ మిగిలిన మోడల్స్కు 128K tokens ఉంటుంది. దీని నమ్మదగిన నాలెడ్జ్ కటాఫ్ (knowledge cutoff) ఫిబ్రవరి 2025, కానీ మిగిలిన మూడు మోడల్స్ జనవరి 2026 వరకు ఉంటాయి.
నిజమైన వర్క్లోడ్పై ఈ ఎంపిక వల్ల కలిగే ఖర్చు ఎంత?
ఈ సిరీస్లోని ప్రతి మోడల్, ఇన్పుట్ రేటు కంటే ఐదు రెట్లు ఎక్కువ అవుట్పుట్ ధరను కలిగి ఉంటుంది. Opus 4.8 కి $5 ఇన్పుట్ మరియు $25 అవుట్పుట్ ధర ఉంటుంది. Haiku 4.5 కి $1 ఇన్పుట్ మరియు $5 అవుట్పుట్ ధర ఉంటుంది. ఈ నిష్పత్తి అన్ని మోడళ్లకు వర్తిస్తుంది, కాబట్టి మీరు ఎంచుకునే మోడల్, ఎక్కువ అవుట్పుట్ ఉత్పత్తి చేసే పనులకు చాలా కీలకం.
Agentic వర్క్ అనేది అటువంటి పనే, ఎందుకంటే thinking tokens ను అవుట్పుట్ tokens గా పరిగణించి బిల్లు వేస్తారు. టెక్స్ట్ మీకు చేరకపోయినా అవి max_tokens కింద లెక్కించబడతాయి. Fable 5, Opus 4.8, Opus 4.7 మరియు Sonnet 5 లలో reasoning summary డిఫాల్ట్గా ఉండదు, కాబట్టి thinking ఫీల్డ్ ఖాళీగా వస్తుంది. బిల్లింగ్ మారదు: "ఏ సందర్భంలోనైనా బ్లాక్ ఒకే విధంగా బిల్లు చేయబడుతుంది మరియు multi-turn conversations లో అదే విధంగా తిరిగి వస్తుంది." Claude టోకెన్ బిల్లును वास्तव में ఏమి నింపుతుంది అనేది దాని గురించి పూర్తి వివరాలను వివరిస్తుంది.
మీరు పోల్చుతున్న మోడళ్ల మధ్య thinking ఫీచర్ పని చేస్తుందో లేదో తేడా ఉంటుంది, దీనిని గమనించకపోతే ఖర్చుల పరీక్ష (cost test) తప్పుగా రావచ్చు. Sonnet 5 మరియు Fable 5 లలో thinking ఇప్పటికే ఆన్ లో ఉంటుంది, దానికి ఎటువంటి configuration అవసరం లేదు. Opus 4.8 మరియు Opus 4.7 లలో, మీరు రిక్వెస్ట్లో thinking: {type: "adaptive"} ని సెట్ చేసే వరకు అది ఆఫ్ లో ఉంటుంది. సంఖ్యలను విశ్లేషించే ముందు రెండు వైపులా కాన్ఫిగరేషన్ ఒకేలా ఉండేలా చూసుకోండి.
తక్కువ ధర కలిగిన మోడల్ అత్యంత ఖరీదైనదిగా ఎందుకు మారవచ్చు
ఒక స్వతంత్ర కోడింగ్ టాస్క్ (coding task) తీసుకోండి. ఆ రిక్వెస్ట్ 60,000 tokens contextను కలిగి ఉంది, మరియు మోడల్ thinkingతో కలిపి 8,000 tokens అవుట్పుట్ను ఇస్తుంది. Caching లేనందున, లెక్కలు స్పష్టంగా ఉంటాయి.
Opus 4.8 పై: $5 ధర కలిగిన 0.06 MTok ఇన్పుట్ ధర $0.30, మరియు $25 ధర కలిగిన 0.008 MTok అవుట్పుట్ ధర $0.20. ఒక ప్రయత్నానికి అయ్యే ఖర్చు $0.50. Haiku 4.5 పై అదే ప్రయత్నానికి $0.06 + $0.04, అంటే మొత్తం $0.10.
ప్రతి ప్రయత్నానికి Haiku ఐదు రెట్లు చౌకగా ఉంది. కానీ ఒక ప్రయత్నం విఫలమైతే ఏం జరుగుతుందో గమనిస్తే పరిస్థితి మారుతుంది. తప్పు సమాధానాన్ని చదవడం వల్ల మీ సమయం వృథా అవుతుంది. రీట్రై (retry) చేసేటప్పుడు, ఆ తప్పు సమాధానాన్ని మళ్ళీ contextగా పంపాల్సి వస్తుంది, కాబట్టి ప్రతి ప్రయత్నం అంతకంటే పెద్దదిగా మారుతుంది. మూడవ ప్రయత్నం కూడా విఫలమైనప్పుడు, మీరు Opusని వాడాల్సి వస్తుంది: $0.30 (Haiku) + $0.50 (Opus) = $0.80. ఇది ఒక్కసారి Opusని వాడటం కంటే 60% ఎక్కువ ఖర్చు.
కాబట్టి, సమాధానాన్ని ఎంత తక్కువ ఖర్చుతో తనిఖీ చేయగలరు అనేదే అసలైన ప్రశ్న. తప్పు సమాధానం ఒక సెకనులో అర్థమైతే, చిన్న మోడల్ లాభదాయకం. కానీ తప్పును గుర్తించడానికి diffను జాగ్రత్తగా చదవాల్సి వస్తే, చిన్న మోడల్ వల్ల మీ సమయం వృథా అవుతుంది, ఇది బిల్లులో కనిపించదు.
చిన్న మోడల్స్ ఎక్కడ మెరుగ్గా పనిచేస్తాయి
ఈ సందర్భాలలో Haiku 4.5 సరైన ఎంపిక:
- Mechanical subagent పనులు. ఫైల్లను రీనేమ్ చేసే లేదా సెర్చ్ అవుట్పుట్ను సేకరించే subagent కి లోతైన reasoning అవసరం లేదు. మీరు build an AI agent with Claude చేసి దానికి helpers ఇచ్చినప్పుడు ఇది సాధారణ పద్ధతిగా మారుతుంది.
- Log triage. ఒక లైన్ అనవసరమైనదా లేదా మనిషి దృష్టికి వెళ్లాలా అని నిర్ణయించడం అనేది ఒక పరిమితమైన judgement.
- Fixed label set ఆధారంగా classification చేయడం. అవుట్పుట్ చిన్నదిగా ఉంటుంది మరియు ఒక sample ద్వారా ఖచ్చితత్వాన్ని కొలవవచ్చు.
- High-volume production calls. రోజుకు 100,000 రన్ల వద్ద, per-token వ్యత్యాసం గణనీయంగా మారుతుంది. AI workflows wired into n8n లో ఇది సాధారణంగా కనిపిస్తుంది.
- యూజర్కు response speed ముఖ్యమైన ఏ పనైనా. Haiku 4.5 ఈ lineup లో అత్యంత వేగవంతమైన మోడల్గా రేట్ చేయబడింది.
Haiku కి ఒక పరిమితి ఉంది. Opus 4.8 మరియు Sonnet 5 లలో minimum cacheable prompt 1,024 tokens ఉండగా, Haiku లో ఇది 4,096 tokens. ఈ కన్నా తక్కువ ఉంటే "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned". Sonnet 5 లో cache అయ్యే 1,500-token instruction block, Haiku 4.5 లో cache అవ్వదు. దీనిని cache_creation_input_tokens మరియు cache_read_input_tokens రెండూ సున్నా (zero) వద్ద ఉండటం ద్వారా గుర్తించవచ్చు. keeping an always-on agent's costs down కోసం మరియు cache నివేదించబడని ఇతర కారణాల వల్ల ఇది జరుగుతుంది.
సమాధానాన్ని మార్చే అంశాలు
వీటిలో ప్రతిదీ మోడల్ పేరు కంటే బిల్లు మొత్తాన్ని ఎక్కువగా ప్రభావితం చేస్తుంది.
Effort. output_config.effort అనేది మోడల్ సమాధానం ఇచ్చే ముందు ఎంత పని చేయాలి అనేదాన్ని నియంత్రిస్తుంది. దీని స్థాయిలు low, medium, high, xhigh మరియు max, మరియు high అనేది డిఫాల్ట్ విలువ: "effort ను high గా సెట్ చేయడం వల్ల, effort పారామీటర్ను పూర్తిగా వదిలేయడం వల్ల వచ్చే ఫలితమే వస్తుంది." ఇది రిక్వెస్ట్ యొక్క టాప్ లెవల్లో కాకుండా output_config లో భాగంగా ఉంటుంది:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort అనేది రెస్పాన్స్లోని ప్రతి టోకెన్ను ప్రభావితం చేస్తుంది: "ఇది tool calls తో సహా అన్ని టోకెన్ ఖర్చులను ప్రభావితం చేయగలదు. ఉదాహరణకు, తక్కువ effort ఉంటే Claude తక్కువ tool calls చేస్తుంది." ఇది ఏజెంటిక్ లూప్లో ప్రభావం చూపుతుంది. ఇది టోకెన్ పరిమితి (token cap) కాదు: "Effort అనేది ఒక ప్రవర్తనా సంకేతం (behavioral signal), కఠినమైన టోకెన్ బడ్జెట్ కాదు." Anthropic ప్రతి స్థాయికి ఖర్చు గుణకం (cost multiplier) ను ప్రకటించలేదు, కాబట్టి మీ స్వంత యూజ్ కేస్ను పరీక్షించుకోవాలని సూచిస్తుంది. అందువల్ల, ఈ రోజు pomeriggio మీరు high వద్ద నడిచే Sonnet 5 ను, low వద్ద నడిచే Opus 4.8 తో పోల్చి చూడవచ్చు. Effort ని సపోర్ట్ చేసే మోడళ్ల జాబితాలో Haiku 4.5 లేదు.
Prompt caching. కాష్ రీడ్ (cache read) ఖర్చు బేస్ ఇన్పుట్ రేటులో 0.1x ఉంటుంది. మోడల్ ఎంపికను నిర్ణయించే అంశం వివిధ టియర్లలో ఇది ఎలా పనిచేస్తుందనేది. Opus 4.8 లో కాష్ హిట్ ధర $0.50 / MTok, మరియు Haiku 4.5 లో అన్కాష్డ్ ఇన్పుట్ ధర $1 / MTok. కాబట్టి, సరిగ్గా కాష్ చేయబడిన Opus ప్రిఫిక్స్, కోల్డ్ Haiku ప్రాంప్ట్ కంటే తక్కువ ఖర్చుతో కూడుకున్నది. పెద్ద మరియు స్థిరమైన ప్రిఫిక్స్ను పదేపదే పంపే ఏ వర్క్లోడ్కైనా, మోడల్ ఎంపిక కంటే సెషన్ హైజీన్ (Session hygiene) ఉత్తమం.
Batches. సమాధానం కోసం వేచి ఉండాల్సిన అవసరం లేకపోతే, Message Batches API "ఇన్పుట్ మరియు అవుట్పుట్ టోకెన్లపై 50% తగ్గింపుతో" అదే మోడళ్లను రన్ చేస్తుంది. ఇది క్రింద ఉన్న పోలికలోని ప్రతి వరుస విలువను సగానికి తగ్గిస్తుంది, మరియు ఇది అన్ని టియర్లలో పనిచేస్తుంది: 1 September 2026 నుండి, ఒక బాటched Opus 4.8 జాబ్, స్టాండర్డ్ ధర వద్ద ఉన్న సింక్రోనస్ Sonnet 5 జాబ్ కంటే తక్కువ ఖర్చుతో కూడుకున్నది; ఇది అదే డబ్బుతో సామర్థ్యం (capability) కోసం లేటెన్సీని (latency) త్యాగం చేస్తుంది.
ఒక పనికి అయ్యే ఖర్చుల పోలిక
Workload: 100,000 సపోర్ట్ ఈమెయిల్స్ను క్లాసిఫై చేయాలి. ప్రతి కాల్కు 2,000 input tokens మరియు 300 output tokens ఉంటాయి. అంటే మొత్తం 200 MTok input మరియు 30 MTok output అవసరం.
- Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. మొత్తం $350.
- Sonnet 5, introductory rate: 200 x $2 = $400 in, 30 x $10 = $300 out. మొత్తం $700.
- Sonnet 5, 1 September 2026 నుండి: 200 x $3 = $600 in, 30 x $15 = $450 out. మొత్తం $1,050.
- Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. మొత్తం $1,750.
రేపటి ధరలతో మళ్ళీ లెక్కించడానికి నాలుగు నంబర్లను మార్చండి. కింద ఉన్న సర్దుబాటులు మోడల్ పేరు కంటే ఫలితాన్ని ఎక్కువగా మారుస్తాయి:
- ప్రతి లైన్లో Batching వల్ల ఖర్చు సగానికి తగ్గుతుంది: $175, $350, $525 మరియు $875. రాత్రిపూట జరిగే classification run కోసం ఎటువంటి వేచి ఉండాల్సిన అవసరం లేదు, కాబట్టి దీనిని వదిలేయడానికి కారణం లేదు.
- Shared prefix ని Caching చేయడం. ఉదాహరణకు, 2,000 input tokens లో 1,200 టోకెన్లు ప్రతిసారీ ఒకే instruction block అనుకుందాం. Sonnet 5 (introductory rate) లో ఇవి $2 / MTok కి బదులుగా cache hits గా $0.20 / MTok కి వస్తాయి. కాబట్టి 120 MTok ఖర్చు $240 కి బదులుగా $24 అవుతుంది. దీనికి $2 రేటుతో 80 MTok కొత్త input ($160) మరియు $300 output ని కలిపితే, Sonnet 5 ఖర్చు $700 కి బదులుగా $484 కి చేరుతుంది. Haiku 4.5 లో ఈ పద్ధతి పని చేయదు, ఎందుకంటే 1,200 టోకెన్లు దాని 4,096-token కనీస పరిమితి కంటే తక్కువ.
- Retries. 8% ఈమెయిల్స్లో Haiku ఇచ్చే సమాధానాన్ని మీరు తిరస్కరిస్తారని మరియు వాటిని Opus 4.8 లో మళ్ళీ రన్ చేస్తారని అనుకుందాం. $350 కి 0.08 x $1,750 = $140 ని కలిపితే $490 వస్తుంది. నా రేటును కాకుండా మీ స్వంత rejection rate ని లెక్కించండి.
- Tool definitions, ఒకవేళ పని వాటిని ఉపయోగిస్తే.
tool_choiceఅనేదిautoగా ఉన్నప్పుడు, Opus 4.8 లో అవి 290 tokens, Sonnet 5 లో 354 మరియు Haiku 4.5 లో 496 tokens ఉంటాయి. అత్యంత చౌకైన మోడల్కు అత్యధిక fixed overhead ఉంటుంది.
Escalation path తో $490 కి వచ్చే Haiku మరియు cached Sonnet 5 ($484) ఖర్చులు సమానంగా ఉన్నాయి, మరియు వాటిలో ఒకటి ఒకే pass లో పనిని పూర్తి చేస్తుంది. మోడల్ అనేది మాత్రమే మొత్తం సమస్య కాదు.
సెషన్ మధ్యలో మోడల్లను మార్చడం వల్ల డబ్బు ఆదా అవుతుందా?
స్టిక్కర్ ధరల కంటే ఇది తక్కువ సందర్భాల్లోనే జరుగుతుంది, ఎందుకంటే ఆదా అనేది ప్రతి token మీద ఆధారపడి ఉంటుంది మరియు మీరు కోల్పోయేది మొత్తం cached prefix.
Cacheను ఏవి చెల్లకుండా చేస్తాయో Anthropic వివరిస్తుంది. Prefixes tools, system, మరియు messages క్రమంలో నిర్మించబడతాయి, మరియు "ప్రతి స్థాయిలో జరిగే మార్పులు ఆ స్థాయిని మరియు తదుపరి అన్ని స్థాయిలను చెల్లకుండా చేస్తాయి." ఆ జాబితాలో రెండు request settings కూడా ఉన్నాయి: "The thinking configuration మరియు resolved effort level అనేవి prompt లోనే భాగంగా మారుతాయి, కాబట్టి వాటిలో ఏదైనా మార్చినా కొత్త cache prefix ప్రారంభమవుతుంది." డాక్యుమెంటేషన్ ఇంకా ఇలా చెబుతోంది: "Cache hits మీద ఆధారపడే సంభాషణల మధ్యలో కాకుండా, వేర్వేరు workloads మధ్యలో effort మార్చండి."
మోడల్ ఆ డాక్యుమెంటేషన్ జాబితాలో లేదు, కాబట్టి దాన్ని ఏ విధంగానూ ఊహించకండి. మోడల్ మార్చిన తర్వాత మొదటి request లో cache_read_input_tokens చూడండి, ఆ సంఖ్య మీకు సమాధానం చెబుతుంది. 150,000-token Opus 4.8 prefix మీద cache read ఖర్చు సుమారు $0.08 మరియు కొత్త write ఖర్చు సుమారు $0.94 ఉంటుంది, ఇది మీరు ఆశించిన per-token వ్యత్యాసం కంటే ఎక్కువ.
కాబట్టి ఈ మార్పులను పనుల (tasks) మధ్యలో చేయండి, ఒకే సంభాషణలో చేయకండి. Claude Code లో దీని అర్థం మొదట /clear చేయాలి, ఎందుకంటే అప్పుడు cache పక్కన పడుతుంది, ఆ తర్వాత /model లేదా /effort చేయవచ్చు.
మీ స్వంత workload మీద సమాధానాన్ని ఎలా పరీక్షించాలి
వేరే model నుండి తీసుకున్న count ఆధారంగా prompt size ని నిర్ణయించవద్దు. token-counting endpoint ఉచితంగా లభిస్తుంది మరియు మీరు పేర్కొన్న model యొక్క tokenizer ని ఉపయోగించి లెక్కిస్తుంది, కాబట్టి మీరు ఉపయోగించాలనుకుంటున్న model పేరును మాత్రమే పేర్కొనండి. Opus 4.7 మరియు ఆ తరువాతి వెర్షన్లు, Fable 5 మరియు Sonnet 5 కొత్త tokenizer ని ఉపయోగిస్తాయి. ఇవి "ఒకే text కోసం సుమారుగా 30% ఎక్కువ tokens ని ఉత్పత్తి చేస్తాయి". కాబట్టి పాత model ఆధారంగా లెక్కించిన budget, కొత్త model లో తక్కువగా కనిపిస్తుంది (per-token rate మారకపోయినా).
తరువాత వచ్చిన సమాధానాన్ని చదవండి. input_tokens అనేది కేవలం uncached remainder మాత్రమే, కాబట్టి అసలైన prompt size అంటే ఆ field తో పాటు cache_creation_input_tokens మరియు cache_read_input_tokens కలిపి ఉంటుంది. A first Claude API app on a VPS అనేది ఆ కొలతను నిర్వహించడానికి అత్యంత సరళమైన మార్గం, మరియు which Claude plan fits your usage అనేది మీరు token కి చెల్లిస్తారా లేదా అనే విషయంపై తీసుకునే విడిగా ఉండే నిర్ణయం.
FAQ
కోడింగ్ కోసం ఏ Claude model ఉత్తమమైనది?
జూలై 2026 నాటికి, క్లిష్టమైన agentic coding కోసం Claude Opus 4.8 ప్రాథమిక పాయింట్. దీని ధర ప్రతి మిలియన్ input tokens కి $5 మరియు output tokens కి $25. వేగం మరియు తెలివితేటల కలయికగా Claude Sonnet 5 ని పరిగణించవచ్చు. 31 August 2026 వరకు దీని ధర $2 / $10 గా ఉంది, ఇది సగం కంటే తక్కువ. ఒకే పనిని రెండింటిపై రన్ చేయండి, thinking configuration ని స్థిరంగా ఉంచండి, మరియు response.usage నుండి మొత్తం token ఖర్చును పోల్చి చూడండి.
Sonnet 5 స్థానంలో Claude Haiku 4.5 ని ఉపయోగించడం తక్కువ ఖర్చుతో కూడుకున్నదా?
Token పరంగా చూస్తే, సులభంగానే: Sonnet 5 యొక్క పరిచయ ధర $2 / $10 కాగా, Haiku 4.5 ధర $1 / $5. 1 September 2026 నుండి ధరలు మారుతాయి. పరిమితులు (limits) దీనిని నిర్ణయిస్తాయి. Haiku 4.5 కి 200K token context window మాత్రమే ఉంది (1M కాదు), synchronous Messages API లో గరిష్టంగా 64K output మాత్రమే వస్తుంది, దీనికి February 2025 వరకు మాత్రమే నమ్మదగిన జ్ఞానం (knowledge cutoff) ఉంది, దీనికి output_config.effort సపోర్ట్ లేదు, మరియు 4,096-token కనీస cacheable prompt ఉంటుంది, ఇది చిన్న system prompts పై caching ని నిలిపివేస్తుంది.
సెషన్ మధ్యలో తక్కువ ధర కలిగిన Claude model కి మారడం వల్ల డబ్బు ఆదా అవుతుందా?
అంతగా ఆదా కాదు. tools, system లేదా messages prefix లో మార్పులు, thinking configuration లో మార్పులు, మరియు output_config.effort లో మార్పులు cache invalidators గా Anthropic పేర్కొంది. ఒక model switch వల్ల ఉన్నతమైన cache కి ఏమవుతుందో డాక్యుమెంటేషన్ లేదు, కాబట్టి దానిని తెలియని అంశంగా పరిగణించండి మరియు తదుపరి మొదటి రిక్వెస్ట్ వద్ద cache_read_input_tokens చదవండి. దీని ప్రభావం ఎక్కువగా ఉంటుంది: 150,000-token Opus 4.8 prefix పై cache read ఖర్చు సుమారు $0.08 మరియు కొత్త write ఖర్చు సుమారు $0.94 ఉంటుంది. ఇది per-token ఆదా కంటే ఎక్కువ. Claude Code లో /clear తర్వాత, cache పక్కన పడేసినప్పుడు మాత్రమే పనుల మధ్యలో మారండి.
output_config.effort నా బిల్లుపై ఎలాంటి ప్రభావం చూపుతుంది?
ఇది text, tool calls మరియు thinking కోసం model ఎంత tokens ఖర్చు చేస్తుందో మారుస్తుంది. తక్కువ effort ఉంటే tool calls తక్కువగా ఉంటాయి, ఇది agentic loops లో ఖర్చును పెంచుతుంది ఎందుకంటే ప్రతి tool result తదుపరి turns లో మళ్ళీ పంపబడుతుంది. దీని స్థాయిలు low, medium, high, xhigh మరియు max, ఇందులో high డిఫాల్ట్. Anthropic ప్రతి స్థాయికి ప్రత్యేకమైన cost multiplier ని ప్రకటించలేదు; effort అనేది token budget కంటే ప్రవర్తనా సంకేతం (behavioural signal) అని వారు పేర్కొన్నారు, కాబట్టి మీ స్వంత పనిపై దీనిని కొలవండి.
Claude Batches API ఎంత డబ్బు ఆదా చేస్తుంది?
Asynchronous delivery కి బదులుగా, input మరియు output tokens రెండింటిపై 50% ఆదా అవుతుంది. జూలై 2026 నాటికి, Opus 4.8 ధర $2.50 in / $12.50 out, Sonnet 5 పరిచయ ధర $1 / $5, మరియు Haiku 4.5 ధర $0.50 / $2.50 గా ఉంది. గమనించదగ్గ పోలిక: 1 September 2026 నుండి, ఒక batched Opus 4.8 job ధర, standard rate వద్ద ఉన్న synchronous Sonnet 5 job కంటే తక్కువగా ఉంటుంది. కాబట్టి batching ద్వారా అదే డబ్బుతో శక్తివంతమైన model ని పొందవచ్చు.