SSD Nodes Learn
கல்வி வழிகாட்டிகள் Matt Connorஆல் Matt Connor · புதுப்பிக்கப்பட்டது 2026-07-24

எந்த Claude model சிறந்தது? கட்டண விவரங்கள்

Claude Opus 4.8, Sonnet 5 மற்றும் Haiku 4.5 ஆகியவற்றின் July 2026 API rates மற்றும் 100,000 jobs-க்கான ఖర్చు ஒப்பீட்டை இங்கே விரிவாகக் காணலாம்.

நான் எந்த Claude model-ஐப் பயன்படுத்த வேண்டும்?

நீங்கள் எந்த Claude model-ஐப் பயன்படுத்த வேண்டும் என்பதற்கான சுருக்கமான பதில்: Claude Opus 4.8-இல் தொடங்குங்கள். ஒரு குறிப்பிட்ட காரணத்திற்காக மட்டுமே அதிலிருந்து மாற்றிக்கொள்ள வேண்டும். Anthropic நிறுவனத்தின் வழிகாட்டுதலும் இதுவே: "எந்த model-ஐப் பயன்படுத்தப் போவது என்று உங்களுக்குத் தெரியவில்லை என்றால், சிக்கலான agentic coding மற்றும் enterprise வேலைகளுக்கு Claude Opus 4.8-இல் தொடங்குங்கள்." பணித் தெளிவாகத் தெரிந்தால் மற்றும் ஒரு நாளைக்கு பலமுறை இயக்க வேண்டியிருந்தால் Claude Sonnet 5-க்கு மாறலாம். சரியான விடை எப்படி இருக்கும் என்று உங்களுக்குத் தெரிந்த, அதிகப்படியான mechanical வேலைகளுக்கு Claude Haiku 4.5-க்கு மாறலாம். நீண்ட நேரம் இயங்கும் agents-களுக்கு Claude Fable 5 மிகச்சிறந்த தேர்வாகும்.

இந்தத் தேர்வுக்குக் கட்டணம் உண்டு. 23 July 2026 நிலவரப்படி, Claude API (application programming interface) விகிதங்கள் ஒரு மில்லியன் tokens (docs-இல் MTok எனக் குறிப்பிடப்பட்டுள்ளது) மதிப்பிற்கு கீழே கொடுக்கப்பட்டுள்ளன:

  • Claude Fable 5 (claude-fable-5): $10 / MTok in, $50 / MTok out. 1M context.
  • Claude Opus 4.8 (claude-opus-4-8): $5 in, $25 out. 1M context.
  • Claude Opus 4.7 (claude-opus-4-7): $5 in, $25 out. 1M context.
  • Claude Sonnet 5 (claude-sonnet-5): 31 August 2026 வரை அறிமுக விலையாக $2 in, $10 out. 1 September 2026 முதல் நிலையான $3 in, $15 out நடைமுறைக்கு வரும். 1M context.
  • Claude Haiku 4.5 (claude-haiku-4-5): $1 in, $5 out. 200K context.

இந்த identifiers அப்படியே இருக்கும். அவற்றுடன் எதையும் சேர்க்க முடியாது.

1M-token models-களுக்குத் தரவு அளவு (size) அடிப்படையில் கூடுதல் கட்டணம் இல்லை: "ஒரு 900k-token request-க்கான கட்டணம், 9k-token request-க்கான அதே per-token விகிதத்திலேயே கணக்கிடப்படும்."

ஒவ்வொரு model-ன் உண்மையான பயன்பாடு

Anthropic ஒவ்வொரு model-ஐயும் ஒரு வரியில் விவரிக்கிறது. அந்த விளக்கங்கள் எந்த leaderboard-ஐ விடவும் சிறந்த வழிகாட்டியாக அமையும்.

  • Claude Fable 5: "நீண்ட நேரம் இயங்கும் agents-களுக்கான அடுத்த தலைமுறை intelligence." latency அடிப்படையில் இந்த நான்கு model-களில் இதுவே மிக மெதுவானது.
  • Claude Opus 4.8: "சிக்கலான agentic coding மற்றும் enterprise வேலைகளுக்காக." மிதமான latency கொண்டது.
  • Claude Sonnet 5: "வேகம் மற்றும் intelligence ஆகியவற்றின் சிறந்த கலவை." வேகமானது.
  • Claude Haiku 4.5: "frontier intelligence கொண்ட மிக வேகமான model."

Haiku 4.5-ன் வரம்புகள் (limits), விலையை விட அதன் பயன்பாட்டுத் தகுதியைத் தீர்மானிக்கின்றன. இதன் context window 1M tokens என்பதற்குப் பதிலாக 200K tokens மட்டுமே, எனவே பெரிய repository அல்லது நீண்ட agent transcript இதில் அடங்காது. synchronous Messages API-ல் இதன் maximum output 64K tokens மட்டுமே, மற்றவை 128K tokens வழங்குகின்றன. மேலும், மற்ற மூன்று model-களின் knowledge cutoff January 2026 ஆக இருக்கும்போது, இதன் reliable knowledge cutoff February 2025 ஆகும்.

உண்மையான workload-இல் இந்தத் தேர்வு எனக்கு எவ்வளவு செலவை ஏற்படுத்தும்?

இந்த வரிசையில் உள்ள ஒவ்வொரு model-இன் output விலை, அதன் input விலையை விட ஐந்து மடங்கு அதிகமாக இருக்கும். Opus 4.8-இல் $5 input மற்றும் $25 output ஆகும். Haiku 4.5-இல் $1 input மற்றும் $5 out ஆகும். இந்த விகிதம் அனைத்து model-களுக்கும் பொருந்தும், எனவே அதிக output உருவாக்கும் வேலைகளுக்கு நீங்கள் தேர்ந்தெடுக்கும் model மிக முக்கியமானது.

Agentic work என்பது அத்தகைய வகை வேலைதான், ஏனெனில் thinking tokens ஆகியவை output tokens ஆகக் கணக்கிடப்படும். உங்களைச் சென்றடையும் text இல்லாவிட்டாலும் அவை max_tokens கணக்கில் வரும். Fable 5, Opus 4.8, Opus 4.7 மற்றும் Sonnet 5 ஆகியவற்றுలో reasoning summary இயல்பாகவே (default) நீக்கப்படும், எனவே thinking field காலியாகக் கிடைக்கும். கட்டண முறை மாறாது: "எப்படியிருந்தாலும், multi-turn conversations-இல் அந்த block ஒரே மாதிரியாகக் கணக்கிடப்பட்டுத் திரும்பப் பெறப்படும்." Claude token bill-ஐ உண்மையில் எது நிரப்புகிறது என்பது அதனை முழுமையாக விளக்குகிறது.

ஒப்பீடு செய்யும் model-களுக்கு இடையே thinking செயல்பாடு இயங்குமா இல்லையா என்பதில் வேறுபாடு உள்ளது, இதை நீங்கள் கவனிக்கத் தவறினால் cost test தவறாகிவிடும். Sonnet 5 மற்றும் Fable 5 ஆகியவற்றில் thinking ஏற்கனவே இயங்கிக் கொண்டிருக்கும், அதற்கு எந்த configuration தேவையில்லை. Opus 4.8 மற்றும் Opus 4.7 ஆகியவற்றில், request-இல் thinking: {type: "adaptive"} ஐ நீங்கள் அமைக்கும் வரை அது இயங்காது. எண்களைப் பகுப்பாய்வு செய்வதற்கு முன், இருபுறமும் configuration ஒரே மாதிரியாக இருப்பதை உறுதி செய்து கொள்ளவும்.

மலிவான model ஏன் அதிக செலவை ஏற்படுத்தக்கூடும்

ஒரு தனித்த coding task-ஐ எடுத்துக்கொள்வோம். அந்த request-இல் 60,000 tokens context உள்ளது, மேலும் model thinking உட்பட 8,000 tokens output-ஐ உருவாக்குகிறது. Caching பயன்படுத்தப்படாததால், கணக்கீடு அப்படியே இருக்கும்.

Opus 4.8-இல்: $5 விலையுள்ள 0.06 MTok input-க்கு $0.30 செலவாகும், மேலும் $25 விலையுள்ள 0.008 MTok output-க்கு $0.20 செலவாகும். ஒரு attempt-க்கு மொத்தம் $0.50 செலவாகும். Haiku 4.5-இல் இதே attempt $0.06 + $0.04 என மொத்தம் $0.10 ஆகும்.

Haiku ஒரு attempt-க்கு ஐந்து மடங்கு மலிவானது. இது அதிக லாபம் தருவது போலத் தோன்றும், ஆனால் ஒரு failed attempt-ஆல் என்ன நடக்கும் என்பதைப் பார்த்தால் உண்மை புரியும். தவறான விடையைப் படிப்பதற்கு உங்கள் நேரம் செலவாகும். மறுமுறை முயற்சிக்கும்போது (retry), அந்தத் தவறான விடையையே context ஆக மீண்டும் அனுப்புவதால், ஒவ்வொரு attempt-ம் முந்தையதை விடப் பெரியதாக இருக்கும். மூன்றாவது attempt-ஆலும் விடை சரியாக வராதபோது, நீங்கள் Opus-ஐப் பயன்படுத்தத் தொடங்குவீர்கள்: $0.30 (Haiku) + $0.50 (Opus) = $0.80. இது Opus-ஐ ஒருமுறை பயன்படுத்துவதை விட 60% கூடுதல் செலவாகும்.

எனவே, விடையைச் சரிபார்க்க எவ்வளவு செலவாகும் என்பதே முக்கியத் தீர்மானமாகும். தவறான விடை ஒரு நொடியில் தெரியவரும்போது, சிறிய model மிகவும் சிக்கனமானது. ஆனால் தவறைக் கண்டறிய ஒரு diff-ஐ கவனமாகப் படிக்க வேண்டியிருந்தால், சிறிய model உங்கள் நேரத்தை வீணாக்குகிறது; அந்த நேரத்திற்கான செலவு invoice-இல் தெரியாது.

சிறிய மாடல்கள் எங்கு முழுமையாகச் சிறந்து விளங்குகின்றன

இந்தச் சூழல்களில் Haiku 4.5 சிறந்த தேர்வாகும்:

  • Mechanical subagent வேலைகள். கோப்புகளைப் பெயர் மாற்றம் செய்யும் அல்லது search output-ஐச் சேகரிக்கும் ஒரு subagent-க்கு frontier reasoning தேவையில்லை. நீங்கள் build an AI agent with Claude செய்து அதற்கு helpers வழங்கிய பிறகு, இது ஒரு standard pattern ஆகும்.
  • Log triage. ஒரு வரி noise தானா அல்லது மனிதர்களின் கவனத்திற்குத் தேவையா என்று தீர்மானிப்பது ஒரு narrow judgement ஆகும்; இதில் தோல்வி அடைவதற்கான வாய்ப்புகள் மிகத் தெளிவாகத் தெரியும்.
  • Fixed label set-க்கு எதிரான Classification. இதன் output சிறியதாக இருக்கும் மற்றும் ஒரு sample மூலம் துல்லியத்தை (accuracy) அளவிட முடியும்.
  • High-volume production calls. ஒரு நாளைக்கு 100,000 runs நடக்கும்போது, per-token வித்தியாசம் ஒரு சிறிய கணக்கீட்டுத் தவறு (rounding error) என்ற நிலையிலிருந்து மாறிவிடும். AI workflows wired into n8n ஆகியவற்றின் பொதுவான வடிவம் இதுவேயாகும்.
  • பயனர் பயன்பாட்டிற்கு response speed முக்கியமாக இருக்கும் எந்தச் சூழலிலும். Haiku 4.5 இந்த வரிசையில் மிக வேகமான model ஆகக் கருதப்படுகிறது.

Haiku-விற்கு மட்டுமே உரிய ஒரு வரம்பு உள்ளது. இதன் minimum cacheable prompt 4,096 tokens ஆகும்; ஆனால் Opus 4.8 மற்றும் Sonnet 5 ஆகியவற்றில் இது 1,024 tokens ஆகும். இந்த குறைந்தபட்ச அளவை விடக் குறைவாக இருந்தால், "any requests to cache fewer than this number of tokens will be processed without caching, and no error is returned" எனும் நிலை ஏற்படும். Sonnet 5-இல் cache ஆகக்கூடிய ஒரு 1,500-token instruction block, Haiku 4.5-இல் அமைதியாக (silently) cache ஆகாது. இதன் அறிகுறியாக cache_creation_input_tokens மற்றும் cache_read_input_tokens ஆகிய இரண்டும் zero அளவில் இருக்கும். keeping an always-on agent's costs down செய்வதற்கும், cache இழப்பதற்கான பிற காரணங்களுக்கும் இது ஒரு முக்கியக் காரணியாகும்.

பதில்களை மாற்றும் காரணிகள்

இவற்றில் ஒவ்வொன்றும் model name-ஐ விட கட்டணத்தில் அதிக மாற்றத்தை ஏற்படுத்தும்.

Effort. output_config.effort என்பது model பதில் அளிப்பதற்கு முன் எவ்வளவு வேலை செய்ய வேண்டும் என்பதைக் கட்டுப்படுத்துகிறது. இதன் நிலைகள் (levels) low, medium, high, xhigh மற்றும் max ஆகும்; high என்பது default நிலை: "efforthigh என அமைப்பது, effort parameter-ஐ முற்றிலுமாகத் தவிர்க்கும் போது கிடைக்கும் அதே செயல்திறனைத் தரும்." இது request-ன் top level-ல் இல்லாமல் output_config-க்குள் அமைந்துள்ளது:

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=4096,
    output_config={"effort": "medium"},
    messages=messages,
)

Effort என்பது response-ல் உள்ள ஒவ்வொரு token-ஐயும் பாதிக்கிறது: "இது tool calls உட்பட அனைத்து token செலவுகளையும் பாதிக்கலாம். உதாரணமாக, குறைந்த effort இருந்தால் Claude குறைவான tool calls செய்யும்." இது ஒரு agentic loop-ல் இந்த விளைவை அதிகப்படுத்தும். இது token cap கிடையாது: "Effort என்பது ஒரு behavioral signal மட்டுமே, அது ஒரு கண்டிப்பான token budget அல்ல." Anthropic ஒவ்வொரு நிலைக்கும் ஒரு cost multiplier-ஐ வெளியிடவில்லை; எனவே உங்கள் சொந்த use case-ஐ நீங்களே சோதித்துப் பார்க்க வேண்டும். இதனால், high நிலையில் இயங்கும் Sonnet 5 மற்றும் low நிலையில் இயங்கும் Opus 4.8 ஆகியவற்றை இன்று மாலை நீங்கள் ஒப்பிட்டுப் பார்க்க முடியும். effort-ஐ ஆதரிக்கும் models பட்டியலில் Haiku 4.5 இல்லை.

Prompt caching. ஒரு cache read, base input rate-ல் 0.1x மட்டுமே செலவாகும். model தேர்வைத் தீர்மானிக்கும் காரணி, பல்வேறு tiers-களில் இது எவ்வாறு செயல்படுகிறது என்பதில்தான் உள்ளது. Opus 4.8-ல் ஒரு cache hit-க்கு $0.50 / MTok செலவாகும், ஆனால் Haiku 4.5-ல் uncached input-க்கு $1 / MTok செலவாகும். எனவே, சரியாக cache செய்யப்பட்ட Opus prefix, ஒரு cold Haiku prompt-ஐ விட ஒரு input token-க்குக் குறைந்த செலவே தரும். பெரிய மற்றும் நிலையான prefix-ஐ மீண்டும் மீண்டும் அனுப்பும் எந்தவொரு workload-க்கும், model தேர்வை விட session hygiene சிறந்தது.

Batches. பதிலுக்காகக் காத்திருக்க வேண்டிய அவசியம் இல்லை என்றால், Message Batches API ஒரே மாதிரியான models-களை "input மற்றும் output tokens இரண்டிற்கும் 50% தள்ளகதியுடன்" இயக்கும். இது கீழே உள்ள ஒப்பீட்டின் ஒவ்வொரு வரிசையையும் பாதியாகக் குறைக்கும், மேலும் இது அனைத்து tiers-களிலும் செயல்படும்: 1 September 2026 முதல், ஒரு batched Opus 4.8 job, நிலையான விலையில் உள்ள ஒரு synchronous Sonnet 5 job-ஐ விடக் குறைந்த செலவாகும்; இது ஒரே தொகையில் latency-க்குப் பதிலாக capability-ஐ வழங்குகிறது.

ஒரு வேலையின் செலவு ஒப்பீடு

Workload: 100,000 support emails-களை classify செய்ய வேண்டும். ஒவ்வொரு call-க்கும் 2,000 input tokens மற்றும் 300 output tokens தேவைப்படும். அதாவது மொத்தம் 200 MTok input மற்றும் 30 MTok output தேவைப்படும்.

  • Haiku 4.5: 200 x $1 = $200 in, 30 x $5 = $150 out. Total $350.
  • Sonnet 5, introductory rate: 200 x $2 = $400 in, 30 x $10 = $300 out. Total $700.
  • Sonnet 5, from 1 September 2026: 200 x $3 = $600 in, 30 x $15 = $450 out. Total $1,050.
  • Opus 4.8: 200 x $5 = $1,000 in, 30 x $25 = $750 out. Total $1,750.

நாளை வரப்போகும் விலைகளைக் கொண்டு கணக்கிட நான்கு எண்களை மாற்றவும். கீழே உள்ள மாற்றங்கள் model name-ஐ விட முடிவை அதிக அளவில் மாற்றும்:

  • Batching halves every line: $175, $350, $525 மற்றும் $875. nightly classification run-இல் காத்திருக்கத் தேவையில்லை என்பதால், இதைத் தவிர்க்கத் தேவையில்லை.
  • Caching the shared prefix. 2,000 input tokens-இல் 1,200 tokens எப்போதும் ஒரே instruction block ஆக இருப்பதாகக் கொள்வோம். Sonnet 5 (introductory rate)-இல், இவை cache hits ஆக $0.20 / MTok செலவாகும், $2 / MTok அல்ல. எனவே 120 MTok-க்கு $240-க்கு பதிலாக $24 மட்டுமே செலவாகும். $2 விலையில் 80 MTok புதிய input மற்றும் $300 output சேர்த்தால், Sonnet 5-ன் மொத்தச் செலவு $700-க்கு பதிலாக $484 ஆக இருக்கும். Haiku 4.5-இல் இந்த நுட்பம் பலன் தராது, ஏனெனில் 1,200 tokens அதன் 4,096-token minimum அளவை விடக் குறைவு.
  • Retries. 8% emails-களுக்கு Haiku-வின் பதிலைத் நிராகரித்து, அவற்றை Opus 4.8-இல் மீண்டும் run செய்கிறீர்கள் என்று வைத்துக்கொள்வோம். $350 உடன் (0.08 x $1,750 = $140) சேர்த்தால், மொத்தம் $490 வரும். எனது விகிதத்தைப் பயன்படுத்தாமல், உங்கள் சொந்த rejection rate-ஐக் கணக்கிடுங்கள்.
  • Tool definitions, if the job uses them. tool_choice auto ஆக அமைக்கப்பட்டால், Opus 4.8-இல் அவை உருவாக்கும் system prompt 290 tokens ஆகும்; Sonnet 5-இல் 354 மற்றும் Haiku 4.5-இல் 496 tokens ஆகும். மலிவான model அதிகப்படியான fixed overhead-ஐக் கொண்டுள்ளது.

Escalation path உடன் கூடிய $490 செலவில் Haiku மற்றும் cached Sonnet 5 ($484) ஆகிய இரண்டும் சமமான செலவைக் கொண்டுள்ளன; இவற்றுள் ஒன்று ஒரே pass-இல் வேலையை முடிக்கும். Model என்பது மட்டுமே முழுமையான கேள்வி அல்ல.

ஒரு session-இன் நடுவில் model-ஐ மாற்றுவது பணத்தை மிச்சப்படுத்துமா?

Sticker prices-ஐ விட இது அரிதாகவே நடக்கும். ஏனெனில் சேமிப்பு என்பது per token அடிப்படையில் கணக்கிடப்படுகிறது; ஆனால் நீங்கள் இழப்பது முழுமையான cached prefix ஆகும்.

Cache-ஐ எவை invalidates செய்கின்றன என்பதை Anthropic ஆவணப்படுத்தியுள்ளது. Prefixes ஆகியவை tools, பிறகு system, பிறகு messages ஆகிய வரிசையில் கட்டமைக்கப்படுகின்றன. "ஒவ்வொரு level-லும் ஏற்படும் மாற்றங்கள் அந்த level மற்றும் அதற்குப் பிந்தைய அனைத்து levels-களையும் invalidates செய்கின்றன." இரண்டு request settings-களும் அந்தப் பட்டியலில் உள்ளன: "The thinking configuration மற்றும் resolved effort level ஆகியவை prompt-இன் உள்ளேயே render செய்யப்படுகின்றன, எனவே அவற்றில் எதை மாற்றினாலும் புதிய cache prefix தொடங்கும்." Docs இன்னும் விரிவாகக் கூறுகின்றன: "Cache hits-ஐ நம்பியிருக்கும் ஒரு conversation-இன் உள்ளே effort-ஐ மாற்றுவதற்குப் பதிலாக, வெவ்வேறு workloads-களுக்கு இடையே effort-ஐ மாற்றுங்கள்."

Model அந்த ஆவணப்படுத்தப்பட்ட பட்டியலில் இல்லை, எனவே எந்தத் திசையிலும் அதைத் தவறாகக் கணக்கிட வேண்டாம். ஒரு switch-க்குப் பிறகு முதல் request-இல் cache_read_input_tokens-ஐப் பார்த்து, அந்தத் தரவை வைத்து முடிவெடுங்கள். 150,000-token கொண்ட Opus 4.8 prefix-இல், ஒரு cache read சுமார் $0.08 செலவாகும், ஒரு புதிய write சுமார் $0.94 செலவாகும். நீங்கள் எதிர்பார்த்த per-token gap-ஐ விட இது அதிகமானது.

எனவே, இந்த மாற்றங்களை ஒரு task-இன் உள்ளே செய்யாமல், tasks-களுக்கு இடையில் செய்யுங்கள். Claude Code-இல், cache ஏற்கனவே discard செய்யப்படும்போது முதலில் /clear செய்யவும், அதன் பிறகு /model அல்லது /effort செய்யவும்.

உங்கள் சொந்த workload-இல் விடையைச் சோதிப்பது எப்படி

வேறு ஒரு model-இல் இருந்து எடுக்கப்பட்ட எண்ணிக்கையை வைத்து prompt-ஐ size செய்ய வேண்டாம். token-counting endpoint இலவசமானது. நீங்கள் எந்த model-ஐக் குறிப்பிடுகிறீர்களோ, அதன் tokenizer-ஐயே அது பயன்படுத்தும். எனவே, நீங்கள் பயன்படுத்தத் திட்டமிட்டுள்ள model-ஐயே குறிப்பிடவும். Opus 4.7 மற்றும் அதற்குப் பிந்தைய பதிப்புகள், Fable 5 மற்றும் Sonnet 5 ஆகியவை புதிய tokenizer-ஐப் பயன்படுத்துகின்றன. இவை "ஒரே text-க்கு தோராயமாக 30% அதிக tokens-ஐ உருவாக்குகின்றன". எனவே, பழைய model-இல் கணக்கிடப்பட்ட budget, புதிய model-இல் ஒரே per-token rate-இல் குறைவாகக் காட்டப்படும்.

பிறகு வந்த முடிவுகளைப் படிக்கவும். input_tokens என்பது uncached remainder மட்டுமே. எனவே, உண்மையான prompt size என்பது அந்த field உடன் cache_creation_input_tokens மற்றும் cache_read_input_tokens ஆகியவற்றின் கூடுதல் ஆகும். A VPS-இல் முதல் Claude API app என்பது அந்த அளவீட்டைச் செய்ய மிகச்சிறந்த இடமாகும். உங்கள் பயன்பாட்டிற்கு எந்த Claude plan பொருந்தும் என்பது நீங்கள் token-களுக்குப் பணம் செலுத்த வேண்டுமா இல்லையா என்பதைத் தீர்மானிக்கும் தனிப்பட்ட முடிவாகும்.

FAQ

Coding செய்ய எந்த Claude model சிறந்தது?

சிக்கலான agentic coding செய்ய Claude Opus 4.8 பரிந்துரைக்கப்படுகிறது. July 2026 நிலவரப்படி, இதன் விலை 1 million input tokens-க்கு $5 மற்றும் 1 million output tokens-க்கு $25 ஆகும். Claude Sonnet 5 வேகத்திற்கும் அறிவுத்திறனுக்கும் சிறந்த தேர்வாகக் கருதப்படுகிறது. 31 August 2026 வரை, இதன் விலை $2 / $10 என்பதால், இது பாதி விலையை விடக் குறைவானது. ஒரே பணியை இரண்டு models-லும் execute செய்து, thinking configuration-ஐ நிலையாக வைத்து, response.usage மூலம் மொத்த token செலவை ஒப்பிடவும்.

Sonnet 5-க்கு மாற்றாக Claude Haiku 4.5 போதுமான அளவு மலிவானதா?

Token அடிப்படையில் பார்த்தால், எளிதாகவே மாற்றலாம்: Sonnet 5-ன் அறிமுக விலை $2 / $10, ஆனால் Haiku 4.5 விலையானது $1 / $5 ஆகும். 1 September 2026 முதல் Sonnet 5 விலை $3 / $15 ஆக மாறும். ஆனால் அதன் வரம்புகள் (limits) முக்கியமானது. Haiku 4.5-ல் 200K token context window மட்டுமே உள்ளது (1M இல்லை). synchronous Messages API-ல் 64K maximum output மட்டுமே கிடைக்கும். இதன் knowledge cutoff February 2025 ஆகும். இதில் output_config.effort support இல்லை. மேலும், 4,096-token minimum cacheable prompt இருப்பதால், சிறிய system prompts-களுக்கு caching தானாகவே disable செய்யப்படும்.

Session நடுவில் மலிவான Claude model-க்கு மாறுவது பணத்தை மிச்சப்படுத்துமா?

எதிர்பார்த்ததை விட இது குறைவாகவே பணத்தை மிச்சப்படுத்தும். Anthropic நிறுவனத்தின்படி, tools, system அல்லது messages prefix-ல் மாற்றங்கள், thinking configuration-ல் மாற்றங்கள் மற்றும் output_config.effort-ல் மாற்றங்கள் ஆகியவை cache invalidators ஆகும். ஒரு model-ஐ மாற்றும்போது ஏற்கனவே உள்ள cache-க்கு என்ன நடக்கும் என்பது ஆவணப்படுத்தப்படவில்லை. எனவே, அதைத் தெரியாத ஒன்றாகக் கருதி, அடுத்த முதல் request-ன் போது cache_read_input_tokens என்பதைப் படிக்கவும். இதன் முக்கியத்துவம் இதுதான்: 150,000-token Opus 4.8 prefix-க்கு, ஒரு cache read-க்கு சுமார் $0.08 செலவாகும், ஆனால் புதிய write-க்கு சுமார் $0.94 செலவாகும். இது token அடிப்படையில் கிடைக்கும் பலமுறை சேமிப்பை விட அதிகம். Claude Code-ல் /clear செய்த பிறகு, cache தானாகவே நீக்கப்படுவதால், பணிகளுக்கு இடையே model-ஐ மாற்றலாம்.

output_config.effort எனது bill-ஐ எவ்வாறு பாதிக்கிறது?

இது text, tool calls மற்றும் thinking ஆகியவற்றிற்காக model செலவிடும் token எண்ணிக்கையை மாற்றுகிறது. Lower effort பயன்படுத்தும்போது tool calls குறையும். இது agentic loops-களில் பாதிப்பை ஏற்படுத்தும், ஏனெனில் ஒவ்வொரு tool result-ம் அடுத்தடுத்த turns-களில் மீண்டும் அனுப்பப்படும். இதன் levels low, medium, high, xhigh மற்றும் max ஆகும்; இதில் high என்பது default ஆகும். Anthropic ஒவ்வொரு level-க்கும் தனித்தனி cost multiplier-ஐக் குறிப்பிடவில்லை. effort என்பது token budget அல்ல, அது ஒரு behavioural signal மட்டுமே. எனவே உங்கள் பணியின் அடிப்படையில் இதைச் சோதித்துப் பார்க்கவும்.

Claude Batches API எவ்வளவு பணத்தை மிச்சப்படுத்துகிறது?

Asynchronous delivery-க்கு பதிலாக, input மற்றும் output tokens இரண்டிலும் 50% சேமிப்பு கிடைக்கும். July 2026 நிலவரப்படி, Opus 4.8 விலையானது $2.50 in / $12.50 out ஆகும். Sonnet 5 அறிமுக விலையில் $1 / $5 மற்றும் Haiku 4.5 விலையானது $0.50 / $2.50 ஆகும். ஒரு முக்கியமான ஒப்பீடு: 1 September 2026 முதல், batch முறையில் செய்யப்படும் Opus 4.8 job-ன் விலை, standard rate-ல் செய்யப்படும் synchronous Sonnet 5 job-ஐ விடக் குறைவு. எனவே, அதே பணத்திற்கு batching மூலம் சிறந்த model-ஐப் பெற முடியும்.