எந்த Claude model-ஐ தேர்வு செய்வது? விலை ஒப்பீடு
Claude Opus 4.8, Sonnet 5 மற்றும் Haiku 4.5 மாடல்களின் ஜூலை 2026 விலைப்பட்டியல் இதோ. 100,000 பணிகளுக்கான செலவு ஒப்பீடு மற்றும் உங்கள் கட்டணத்தை அதிகரிக்கும் முக்கிய காரணிகளை அறியுங்கள்.
எந்த Claude model-ஐ நான் பயன்படுத்த வேண்டும்?
எந்த Claude model-ஐப் பயன்படுத்த வேண்டும் என்பதற்கான சுருக்கமான பதில்: Claude Opus 4.8-ல் தொடங்கவும், அதை மாற்ற வேண்டியதற்கான தெளிவான காரணம் இருந்தால் மட்டுமே வேறு model-க்கு மாறவும். Anthropic-ன் வழிகாட்டுதலும் இதுவே: "எந்த model-ஐப் பயன்படுத்துவது என்பதில் உங்களுக்குத் தெளிவு இல்லையென்றால், சிக்கலான agentic coding மற்றும் enterprise பணிகளுக்கு Claude Opus 4.8-ல் தொடங்கவும்." ஒரு பணி நன்கு வரையறுக்கப்பட்டு, அதை நீங்கள் ஒரு நாளில் பலமுறை செய்ய வேண்டியிருந்தால், Claude Sonnet 5-க்கு மாறவும். சரியான விடை எது என்று உங்களுக்கு ஏற்கனவே தெரிந்திருக்கும் இயந்திரத்தனமான, அதிக அளவிலான பணிகளுக்கு Claude Haiku 4.5-க்கு மாறவும். நீண்ட நேரம் இயங்கும் agents-க்கு, இவை அனைத்திற்கும் மேலாக Claude Fable 5 உள்ளது.
இந்தத் தேர்வுக்கு ஒரு விலை உண்டு. 23 July 2026 நிலவரப்படி, Claude API (application programming interface)-ன் கட்டணங்கள் கீழே கொடுக்கப்பட்டுள்ளன. இவை ஒரு மில்லியன் tokens-க்கானவை, இதை ஆவணங்கள் MTok என்று குறிப்பிடுகின்றன.
- Claude Fable 5 (
claude-fable-5): $10 / MTok உள்ளீடு, $50 / MTok வெளியீடு. 1M context. - Claude Opus 4.8 (
claude-opus-4-8): $5 உள்ளீடு, $25 வெளியீடு. 1M context. - Claude Opus 4.7 (
claude-opus-4-7): $5 உள்ளீடு, $25 வெளியீடு. 1M context. - Claude Sonnet 5 (
claude-sonnet-5): 31 August 2026 வரை அறிமுக விலையாக $2 உள்ளீடு, $10 வெளியீடு. 1 September 2026 முதல் வழக்கமான $3 உள்ளீடு, $15 வெளியீடு அமலுக்கு வரும். 1M context. - Claude Haiku 4.5 (
claude-haiku-4-5): $1 உள்ளீடு, $5 வெளியீடு. 200K context.
மேலே உள்ள identifiers அப்படியே முழுமையானவை. அவற்றுடன் எதுவும் சேர்க்கப்படாது.
1M-token models-ல் அளவுக்காக கூடுதல் கட்டணம் இல்லை: “900k-token request-க்கு விதிக்கப்படும் per-token rate, 9k-token request-க்கான rate-க்கு சமம்.” இந்த rates API-க்கு அப்பாலும் பொருந்தும்; ஏனெனில் Claude Enterprise, அதன் seat price-க்கு மேலாக API rates அடிப்படையில் usage-ஐ கணக்கிடுகிறது. ஆகவே, கீழே உள்ள கணக்கீடு முழுவதும் seat plan பயன்படுத்தும் team-க்கும் அதேபோல பொருந்தும். Flat-rate subscription billing meter-ஐ மாற்றலாம்; ஆனால் இந்தத் தேர்வை மாற்றாது. காரணம், Claude Max-ன் இரு tiers-லும் அதே models உள்ளன; வேறுபாடு கிடைக்கும் usage அளவில் மட்டும் உள்ளது. அதே ladder-ல் கீழ்நிலையில், Claude Pro-ன் மாதத்திற்கு $20 கட்டணம் per-token rate-க்கு பதிலாக usage allowance-ஐ வழங்குகிறது. எனவே அங்கு உங்களைத் தடுப்பது bill அல்ல; limit reset ஆகும்.
தற்போது நீங்கள் அந்த நிலையில் இருந்தால், எந்த window-க்காக நீங்கள் காத்திருக்கிறீர்கள் என்பதை முதலில் கணக்கிட வேண்டும். அதன் பிறகே கீழே உள்ள கணக்கீட்டைச் செய்ய வேண்டும். ஏனெனில் அதிலிருந்து வெளியேறும் வழி cheaper rate அல்ல; smaller model, smaller context, அல்லது API-க்கு மாறுதல் ஆகும். நீங்கள் இன்னும் எந்தக் கட்டணத் திட்டத்தையும் தொடங்கவில்லை என்றால், முதலில் Pro-க்கு மாதம் $20 செலுத்துவது பயனுள்ளதா என்பதை மேலே குறிப்பிடப்பட்ட rates தீர்மானிக்காது. Free limit உங்களை எவ்வளவு அடிக்கடி தடுக்கிறது என்பதே அதைத் தீர்மானிக்கும்.
ஒவ்வொரு மாதிரியும் எதற்காகப் பயன்படுகிறது
ஒவ்வொரு மாதிரியைப் பற்றியும் Anthropic ஒரு வரியில் விவரிக்கிறது. அந்த வரிகள் எந்தவொரு தரவரிசைப் பட்டியலை விடவும் சிறந்த வழிகாட்டுதலை வழங்குகின்றன.
- Claude Fable 5: "நீண்ட காலம் இயங்கும் முகவர்களுக்கான (agents) அடுத்த தலைமுறை நுண்ணறிவு." நான்கில் இதுவே அதிக latency கொண்டது.
- Claude Opus 4.8: "சிக்கலான முகவர் சார்ந்த நிரலாக்கம் (agentic coding) மற்றும் நிறுவனப் பணிகளுக்காக." மிதமான latency கொண்டது.
- Claude Sonnet 5: "வேகம் மற்றும் நுண்ணறிவின் சிறந்த கலவை." வேகமானது.
- Claude Haiku 4.5: "எல்லைக்குட்பட்ட நுண்ணறிவுடன் கூடிய அதிவேக மாதிரி."
இந்த ஒப்பீட்டில் Fable 5-க்கு மட்டுமே பணிச்சுமைக்கான விலை நிர்ணயம் செய்யப்படவில்லை. Opus 4.8-ஐ விட இரண்டு மடங்கு அதிக விலையில், $10 உள்ளீட்டிற்கும் $50 வெளியீட்டிற்கும் எந்தப் பணிகள் லாபகரமானவை என்ற கேள்விக்குத் தனி விளக்கம் தேவைப்படுகிறது.
Haiku 4.5-ல் உள்ள கட்டுப்பாடுகள், விலையைத் தீர்மானிக்கும் முன்பே அது எந்தப் பணிக்கு ஏற்றது என்பதை முடிவு செய்கின்றன. இதன் context window 1M-க்கு பதிலாக 200K tokens மட்டுமே. எனவே, ஒரு பெரிய repository அல்லது நீண்ட முகவர் உரையாடல் இதில் பொருந்தாது. synchronous Messages API-ல் இதன் அதிகபட்ச வெளியீடு 64K tokens ஆகும், மற்றவற்றில் இது 128K ஆகும். மேலும், இதன் நம்பகமான அறிவு வரம்பு (knowledge cutoff) February 2025 ஆகும், மற்ற மூன்றிற்கும் இது January 2026 ஆக உள்ளது.
நிஜமான பணிச்சுமையில் இந்தத் தேர்வு எனக்கு என்ன செலவை ஏற்படுத்தும்?
இந்த வரிசையில் உள்ள ஒவ்வொரு மாடலும், உள்ளீட்டு விலையை விட ஐந்து மடங்கு அதிக விலையை வெளியீட்டுக்கு நிர்ணயிக்கின்றன. Opus 4.8 மாடலுக்கு உள்ளீடு $5 மற்றும் வெளியீடு $25 ஆகும். Haiku 4.5 மாடலுக்கு உள்ளீடு $1 மற்றும் வெளியீடு $5 ஆகும். இந்த விகிதம் அனைத்து மாடல்களுக்கும் பொருந்தும் என்பதால், அதிக வெளியீட்டை உருவாக்கும் பணிகளில் நீங்கள் தேர்ந்தெடுக்கும் மாடல் மிக முக்கியமானது.
ஏஜென்ட் சார்ந்த பணிகள் (Agentic work) இத்தகையவை, ஏனெனில் 'thinking tokens' வெளியீட்டு டோக்கன்களாகவே கணக்கிடப்படுகின்றன. அந்த உரை உங்களுக்குக் கிடைக்கவில்லை என்றாலும், அவை max_tokens-க்கு உட்படுத்தப்படும். Fable 5, Opus 4.8, Opus 4.7 மற்றும் Sonnet 5 ஆகியவற்றில், பகுத்தறிவுச் சுருக்கம் (reasoning summary) முன்னிருப்பாகத் தவிர்க்கப்படுகிறது, எனவே thinking புலம் காலியாகவே வரும். கட்டணத்தில் மாற்றம் இல்லை: "எப்படியிருந்தாலும், பலமுறை உரையாடும்போது (multi-turn conversations) இந்தத் தொகுதி ஒரே மாதிரியாகவே கணக்கிடப்பட்டு திருப்பி அனுப்பப்படுகிறது." Claude டோக்கன் கட்டணம் எதனால் நிரப்பப்படுகிறது என்பது இந்த அளவீட்டை முழுமையாக விளக்குகிறது.
நீங்கள் ஒப்பிடும் மாடல்களுக்கு இடையே 'thinking' அம்சம் இயங்குகிறதா இல்லையா என்பதில் வேறுபாடு உள்ளது. இதை கவனிக்கத் தவறினால் செலவு குறித்த சோதனை தவறாகிவிடும். Sonnet 5 மற்றும் Fable 5 மாடல்களில் 'thinking' ஏற்கனவே இயக்கப்பட்டிருக்கும், அதற்கு எந்த அமைப்பும் தேவையில்லை. Opus 4.8 மற்றும் Opus 4.7 மாடல்களில், நீங்கள் கோரிக்கையில் thinking: {type: "adaptive"}-ஐ அமைக்கும் வரை அது இயங்காது. எண்களைப் பகுப்பாய்வு செய்வதற்கு முன், இரு தரப்பிலும் உள்ள அமைப்புகளைச் சரியாகப் பொருத்தவும்.
குறைந்த விலை கொண்ட மாடல் ஏன் அதிக செலவை ஏற்படுத்தக்கூடும்
ஒரு குறிப்பிட்ட coding பணியை எடுத்துக்கொள்வோம். இந்த கோரிக்கையில் 60,000 tokens அளவுள்ள context உள்ளது, மேலும் சிந்திக்கும் நேரம் உட்பட 8,000 tokens அளவுள்ள output-ஐ அந்த மாடல் உருவாக்குகிறது. Caching வசதி இல்லாததால், கணக்கீடு தெளிவாகத் தெரியும்.
Opus 4.8 மாடலில்: 0.06 MTok input-க்கு $5 வீதம் $0.30, மற்றும் 0.008 MTok output-க்கு $25 வீதம் $0.20. இந்த முயற்சிக்கு மொத்தம் $0.50 செலவாகிறது. Haiku 4.5 மாடலில் அதே முயற்சிக்கு $0.06 மற்றும் $0.04 என மொத்தம் $0.10 செலவாகிறது.
Haiku ஒரு முயற்சிக்கு ஐந்து மடங்கு மலிவானது. இது அதிக சேமிப்பைத் தருவது போலத் தோன்றினாலும், ஒரு முயற்சி தோல்வியடையும் போது என்ன நடக்கும் என்பதை கவனிக்க வேண்டும். தவறான விடையைப் படிக்கும்போது உங்கள் நேரம் வீணாகிறது. அந்தத் தவறான விடையை மீண்டும் context-ஆக அனுப்பி முயற்சிக்கும்போது, ஒவ்வொரு முறையும் கோரிக்கையின் அளவு அதிகரித்துக்கொண்டே செல்கிறது. மூன்றாவது முறையும் விடை தவறாக இருக்கும்போது, நீங்கள் Opus-க்கு மாற வேண்டிய கட்டாயம் ஏற்படுகிறது: Haiku-வின் $0.30 மற்றும் Opus-ன் $0.50 என மொத்தம் $0.80 செலவாகிறது. இது Opus-ஐ நேரடியாக ஒருமுறை பயன்படுத்தியதை விட 60% கூடுதல் செலவாகும்.
எனவே, விடையை எவ்வளவு மலிவாகச் சரிபார்க்க முடியும் என்பதே முக்கியமான கேள்வி. ஒரு தவறான விடையை ஒரு நொடியில் கண்டறிய முடிந்தால், சிறிய மாடல் ஒரு சிறந்த தேர்வாகும். ஆனால், ஒரு தவறைக் கண்டறிய diff-ஐ கவனமாகப் படிக்க வேண்டியிருந்தால், சிறிய மாடல் உங்கள் நேரத்தை வீணாக்குகிறது; இந்தச் செலவு invoice-ல் இடம்பெறாது.
சிறிய மாடல் எப்போது சிறந்த தேர்வாகிறது
பின்வரும் சூழல்களில் Haiku 4.5 சரியான தேர்வாகும்:
- இயந்திரத்தனமான துணை முகவர் (subagent) பணிகள். கோப்புகளை மறுபெயரிடும் அல்லது தேடல் முடிவுகளைத் தொகுக்கும் ஒரு துணை முகவருக்கு உயர்தர பகுத்தறிவு (frontier reasoning) தேவையில்லை. நீங்கள் Claude-ஐக் கொண்டு AI முகவரை உருவாக்கும்போது அதற்கு உதவியாளர்களை வழங்கினால், இதுவே பொதுவான நடைமுறையாகும்.
- Log triage. ஒரு வரி தேவையற்றதா அல்லது மனிதரின் கவனத்திற்கு உரியதா என்று தீர்மானிப்பது ஒரு குறுகிய அளவிலான தீர்ப்பு; இதில் தவறு நடப்பதற்கான வாய்ப்பு மிகக் குறைவு.
- நிலையான லேபிள்களைக் கொண்டு வகைப்படுத்துதல். வெளியீடு சுருக்கமாக இருக்கும் மற்றும் மாதிரிகளில் துல்லியத்தை அளவிட முடியும்.
- அதிக அளவிலான production அழைப்புகள். ஒரு நாளைக்கு 100,000 முறை இயங்கும்போது, ஒவ்வொரு token-க்கும் உள்ள விலை வித்தியாசம் வெறும் கணக்கீட்டுப் பிழையாக இருக்காது. இதுவே n8n-ல் இணைக்கப்பட்ட AI பணிப்பாய்வுகளின் வழக்கமான வடிவமாகும்.
- பயனருக்குப் பதில் வேகம் முக்கியமாக இருக்கும் எந்தவொரு பணிக்கும். Haiku 4.5 இந்த வரிசையில் அதிவேகமான மாடலாக மதிப்பிடப்பட்டுள்ளது.
Haiku-வுக்கு என்று ஒரு குறிப்பிட்ட வரம்பு உள்ளது. இதன் குறைந்தபட்ச cacheable prompt அளவு 4,096 tokens ஆகும்; இது Opus 4.8 மற்றும் Sonnet 5 மாடல்களில் 1,024 tokens ஆக உள்ளது. இந்த குறைந்தபட்ச அளவுக்குக் கீழே, "இந்த எண்ணிக்கையை விடக் குறைவான tokens-ஐ cache செய்ய முயற்சிக்கும் கோரிக்கைகள் cache செய்யப்படாமல் செயலாக்கப்படும், மேலும் எந்தப் பிழையும் காட்டப்படாது". Sonnet 5-ல் cache ஆகும் 1,500-token அறிவுறுத்தல் தொகுதி, Haiku 4.5-ல் cache ஆகாது. இதைக் கண்டறியும் வழி, cache_creation_input_tokens மற்றும் cache_read_input_tokens ஆகிய இரண்டுமே பூஜ்ஜியத்தில் இருப்பதுதான். இது, எப்போதும் இயங்கும் முகவரின் செலவைக் குறைப்பது குறித்த பகுதியில், cache-ஐ இழப்பதற்கான பிற வழிகளுடன் விவரிக்கப்பட்டுள்ளது.
பதிலை மாற்றும் காரணிகள்
இவை ஒவ்வொன்றும் மாடல் பெயரை விட ஒரு கோரிக்கையின் முடிவை அதிக அளவில் மாற்றக்கூடியவை.
Effort. output_config.effort என்பது ஒரு மாடல் பதிலளிக்கும் முன் எவ்வளவு வேலை செய்ய வேண்டும் என்பதைக் கட்டுப்படுத்துகிறது. இதற்கான நிலைகள் low, medium, high, xhigh மற்றும் max ஆகும். இதில் high என்பது இயல்புநிலை (default) ஆகும்: "effort-ஐ high என அமைப்பது, effort அளவுருவை (parameter) முழுமையாகத் தவிர்ப்பதற்குச் சமமான செயல்பாட்டைத் தரும்." இது கோரிக்கையின் மேல் மட்டத்தில் இல்லாமல், output_config-க்குள் அமைகிறது:
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
output_config={"effort": "medium"},
messages=messages,
)Effort என்பது பதிலில் உள்ள ஒவ்வொரு token-ஐயும் பாதிக்கிறது: "இது tool calls உட்பட அனைத்து token செலவையும் பாதிக்கலாம். உதாரணமாக, குறைந்த effort என்பது Claude குறைவான tool calls-ஐயே செய்யும் என்பதைக் குறிக்கும்." இது ஒரு agentic loop-ல் கூடுதல் தாக்கத்தை ஏற்படுத்தும். இது ஒரு token வரம்பு (cap) அல்ல: "Effort என்பது ஒரு நடத்தை சார்ந்த சமிக்ஞையே தவிர, கடுமையான token வரவு-செலவுத் திட்டம் அல்ல." Anthropic ஒவ்வொரு நிலைக்கும் எந்தவொரு கட்டண உயர்வையும் (multiplier) வெளியிடவில்லை, எனவே உங்கள் பயன்பாட்டிற்கு ஏற்ப நீங்களே சோதித்துப் பார்க்க அறிவுறுத்துகிறது. எனவே, high-ல் இயங்கும் Sonnet 5 மற்றும் low-ல் இயங்கும் Opus 4.8 ஆகியவற்றை ஒப்பிட்டு இன்று மதியமே நீங்கள் சோதனையை மேற்கொள்ளலாம். Effort-ஐ ஆதரிக்கும் மாடல்களின் பட்டியலில் Haiku 4.5 இல்லை.
Prompt caching. ஒரு cache read-ன் விலை அடிப்படை input கட்டணத்தில் 0.1x ஆகும். மாடல் தேர்வை நிர்ணயிக்கும் எண், பல்வேறு நிலைகளில் (tiers) இது எவ்வாறு செயல்படுகிறது என்பதாகும். Opus 4.8-ல் ஒரு cache hit-ன் விலை $0.50 / MTok ஆகும், அதே சமயம் Haiku 4.5-ல் cache செய்யப்படாத input-ன் விலை $1 / MTok ஆகும். எனவே, பெரிய மற்றும் நிலையான prefix-ஐ மீண்டும் மீண்டும் அனுப்பும் எந்தவொரு பணிக்கும், மாடல் தேர்வை விட Session hygiene (சரியான cache மேலாண்மை) அதிக பலன் தரும்.
Batches. பதிலுக்காகக் காத்திருக்க வேண்டிய அவசியம் இல்லை என்றால், Message Batches API அதே மாடல்களை "input மற்றும் output tokens இரண்டிற்கும் 50% தள்ளுபடியுடன்" இயக்குகிறது. இது கீழே உள்ள ஒப்பீட்டு அட்டவணையின் ஒவ்வொரு வரிசையையும் பாதியாகக் குறைக்கிறது. இது அனைத்து நிலைகளிலும் செயல்படும்: 1 செப்டம்பர் 2026 முதல், ஒரு batched Opus 4.8 பணி, சாதாரண விலையில் இயங்கும் ஒரு synchronous Sonnet 5 பணியை விடக் குறைவான செலவே ஆகும். இது அதே பணத்தில், latency-க்கு பதிலாக அதிகத் திறனைப் பெற உதவுகிறது.
ஒரு பணிச் செலவு ஒப்பீடு
பணிச்சுமை: 100,000 ஆதரவு மின்னஞ்சல்களை வகைப்படுத்துதல். ஒவ்வொரு அழைப்பிற்கும் 2,000 உள்ளீட்டு tokens மற்றும் 300 வெளியீட்டு tokens. இது மொத்தம் 200 MTok உள்ளீடு மற்றும் 30 MTok வெளியீடு ஆகும்.
- Haiku 4.5: 200 x $1 = $200 உள்ளீடு, 30 x $5 = $150 வெளியீடு. மொத்தம் $350.
- Sonnet 5, அறிமுகக் கட்டணம்: 200 x $2 = $400 உள்ளீடு, 30 x $10 = $300 வெளியீடு. மொத்தம் $700.
- Sonnet 5, செப்டம்பர் 1, 2026 முதல்: 200 x $3 = $600 உள்ளீடு, 30 x $15 = $450 வெளியீடு. மொத்தம் $1,050.
- Opus 4.8: 200 x $5 = $1,000 உள்ளீடு, 30 x $25 = $750 வெளியீடு. மொத்தம் $1,750.
நாளைக்குரிய விலைகளைக் கொண்டு கணக்கிட நான்கு எண்களை மாற்றவும். கீழே உள்ள மாற்றங்கள், model பெயரை விட முடிவுகளில் அதிக தாக்கத்தை ஏற்படுத்துகின்றன:
- Batching ஒவ்வொரு வரியையும் பாதியாகக் குறைக்கிறது: $175, $350, $525 மற்றும் $875. இரவு நேர வகைப்படுத்தல் பணிக்கு எதற்காகவும் காத்திருக்க வேண்டியதில்லை என்பதால், இதைத் தவிர்க்கக் காரணமில்லை.
- பகிரப்பட்ட முன்னொட்டை (shared prefix) தற்காலிகமாகச் சேமித்தல் (Caching). 2,000 உள்ளீட்டு tokens-ல் 1,200 tokens ஒவ்வொரு முறையும் ஒரே மாதிரியான அறிவுறுத்தல் தொகுதியாக இருப்பதாகக் கொள்வோம். Sonnet 5-ன் அறிமுகக் கட்டணத்தில், இவை $2 / MTok-க்கு பதிலாக $0.20 / MTok என்ற cache hit விலையில் கிடைக்கும். எனவே 120 MTok-க்கு $240-க்கு பதிலாக $24 மட்டுமே செலவாகும். இதனுடன் $2 வீதம் 80 MTok புதிய உள்ளீடு ($160) மற்றும் $300 வெளியீட்டுச் செலவைச் சேர்த்தால், Sonnet 5-ன் செலவு $700-க்கு பதிலாக $484 ஆகக் குறையும். Haiku 4.5-ல் இந்த உத்தி வேலை செய்யாது, ஏனெனில் 1,200 tokens என்பது அதன் 4,096-token குறைந்தபட்ச வரம்பிற்குள் உள்ளது.
- மறுமுயற்சிகள் (Retries). Haiku-வின் பதில்களில் 8% மின்னஞ்சல்களை நிராகரித்து, அவற்றை Opus 4.8-ல் மீண்டும் இயக்குவதாகக் கொள்வோம். $350-உடன் 0.08 x $1,750 = $140-ஐச் சேர்த்தால், மொத்தம் $490 ஆகும். என்னுடைய மதிப்பீட்டைப் பயன்படுத்துவதற்குப் பதிலாக, உங்கள் சொந்த நிராகரிப்பு விகிதத்தை அளவிடவும்.
- கருவி வரையறைகள் (Tool definitions), பணி அவற்றைப் பயன்படுத்தினால். Opus 4.8-ல்
tool_choice-ஐautoஎன அமைக்கும்போது, அவை உருவாக்கும் system prompt 290 tokens ஆகும்; Sonnet 5-ல் 354 tokens மற்றும் Haiku 4.5-ல் 496 tokens. மலிவான model அதிக நிலையான மேல்நிலைச் செலவைக் (fixed overhead) கொண்டுள்ளது.
$490 செலவாகும் escalation path கொண்ட Haiku மற்றும் $484 செலவாகும் cached Sonnet 5 ஆகிய இரண்டும் ஏறக்குறைய ஒரே செலவைக் கொண்டுள்ளன. இவற்றில் ஒன்று பணியை ஒரே முயற்சியில் முடித்துவிடுகிறது. model தேர்வு மட்டுமே முழுமையான தீர்வாகாது.
ஒரு session-க்கு இடையில் மாடல்களை மாற்றுவது பணத்தை மிச்சப்படுத்துமா?
ஒவ்வொரு token-க்கும் சேமிப்பு கிடைப்பதால், sticker விலைகள் காட்டுவதை விட இது குறைவான பலனையே தருகிறது. ஏனெனில், நீங்கள் ஆபத்துக்கு உள்ளாக்குவது முழுமையாக cache செய்யப்பட்ட prefix-ஐ ஆகும்.
எந்தெந்த மாற்றங்கள் cache-ஐ செல்லாததாக்கும் என்பதை Anthropic ஆவணப்படுத்தியுள்ளது. Prefix-கள் tools, பின் system, மற்றும் messages என்ற வரிசையில் உருவாக்கப்படுகின்றன. "ஒவ்வொரு நிலையிலும் செய்யப்படும் மாற்றங்கள் அந்த நிலையையும், அதைத் தொடர்ந்து வரும் அனைத்து நிலைகளையும் செல்லாததாக்கும்." இரண்டு request அமைப்புகளும் அந்தப் பட்டியலில் உள்ளன: "Thinking configuration மற்றும் resolved effort நிலை ஆகியவை prompt-லேயே சேர்க்கப்படுகின்றன, எனவே அவற்றை மாற்றினால் புதிய cache prefix தொடங்கும்." Effort குறித்து ஆவணங்கள் மேலும் கூறுகின்றன: "cache hits-ஐச் சார்ந்திருக்கும் ஒரு உரையாடலுக்குள் effort-ஐ மாற்றுவதை விட, வெவ்வேறு workloads-க்கு இடையே அதை மாற்றுவது சிறந்தது."
மாடல் (model) அந்த ஆவணப்படுத்தப்பட்ட பட்டியலில் இல்லை, எனவே அதை மாற்றினால் என்ன நடக்கும் என்று நீங்களாகக் கருத வேண்டாம். மாற்றத்திற்குப் பிறகு முதல் request-ல் cache_read_input_tokens-ஐப் படித்து, அந்த எண்ணே பதிலளிக்கட்டும். 150,000-token Opus 4.8 prefix-ல், ஒரு cache read-க்கு சுமார் $0.08 செலவாகும், ஆனால் புதிய write-க்கு சுமார் $0.94 செலவாகும். இது நீங்கள் தேடும் per-token இடைவெளியை விட பல மடங்கு அதிகம்.
எனவே, இவற்றை ஒரு பணிக்கு உள்ளே மாற்றாமல், பணிகளுக்கு இடையே மாற்றவும். Claude Code-ஐப் பொறுத்தவரை, cache ஏற்கனவே நீக்கப்படும்போது முதலில் /clear-ஐச் செய்யவும், பிறகு /model அல்லது /effort-ஐச் செய்யவும். இவை இரண்டும் CLI-ல் தட்டச்சு செய்யப்படுபவை. நீங்கள் Linux-ல் வேலை செய்கிறீர்கள் என்றால், Anthropic Linux-க்காக வழங்கும் வசதி ஒரு நிலையான CLI-ஐ, இன்னும் beta நிலையில் உள்ள desktop app-உடன் இணைப்பதால், அதை நிறுவுவது பயனுள்ளது. இந்த மாற்றம் உங்கள் கட்டணத்தில் பிரதிபலிக்குமா என்பது நீங்கள் அந்த session-க்கு எப்படி பணம் செலுத்துகிறீர்கள் என்பதைப் பொறுத்தது. ஏனெனில், Claude Code ஒரு நிலையான மாதத் திட்டம் அல்லது per-token API credits மூலம் இயங்குகிறது, இதில் இரண்டாவது முறையில் மட்டுமே மாடல் மாற்றத்திற்கான கட்டணம் டாலர்களில் கணக்கிடப்படும்.
உங்கள் சொந்த பணிச்சுமையில் பதிலைச் சோதிப்பது எப்படி
வேறொரு model-ன் எண்ணிக்கையை வைத்து ஒரு prompt-ன் அளவைத் தீர்மானிக்க வேண்டாம். Token-counting endpoint-ஐப் பயன்படுத்துவது இலவசம்; நீங்கள் குறிப்பிடும் எந்த model-ன் tokenizer-ஐ வேண்டுமானாலும் அது பயன்படுத்தும், எனவே நீங்கள் எதை அழைக்கத் திட்டமிட்டுள்ளீர்களோ அதன் பெயரைத் குறிப்பிடவும். அந்த endpoint கட்டணம் வசூலிக்காத தளத்தின் சில பகுதிகளில் ஒன்றாகும், மேலும் கட்டணம் இன்றி நீங்கள் எதை இயக்கலாம் என்பதை நீங்கள் உண்மையான credit-ஐச் செலவழித்து ஒப்பீடு செய்வதற்கு முன்பே சரிபார்ப்பது நல்லது. Opus 4.7 மற்றும் அதற்குப் பிந்தைய பதிப்புகள், Fable 5 மற்றும் Sonnet 5 ஆகியவை புதிய tokenizer-ஐப் பயன்படுத்துகின்றன. இது "ஒரே உரைக்கு சுமார் 30% கூடுதல் tokens-ஐ உருவாக்குகிறது", எனவே பழைய model-ல் கணக்கிடப்பட்ட வரவுசெலவுத் திட்டம், புதிய model-ல் அதே per-token விலையில் குறைவாகவே காட்டும்.
பிறகு வந்த பதிலைப் படிக்கவும். input_tokens என்பது cache செய்யப்படாத மீதமுள்ள பகுதி மட்டுமே, எனவே உண்மையான prompt அளவு என்பது அந்த field உடன் cache_creation_input_tokens மற்றும் cache_read_input_tokens ஆகியவற்றைக் கூட்டியதாகும். VPS-ல் முதல் Claude API app என்பது அந்த அளவீட்டைச் செய்வதற்கு மிகவும் நம்பகமான சிறிய இடமாகும், மேலும் எந்த Claude திட்டம் உங்கள் பயன்பாட்டிற்குப் பொருந்தும் என்பது நீங்கள் token-க்கு பணம் செலுத்த வேண்டுமா இல்லையா என்பது குறித்த தனி முடிவாகும். இது சந்தாவை வைத்திருப்பதா இல்லையா என்பதை விட, எந்தச் சந்தாவை வைத்திருப்பது என்ற கேள்வியாக மாறினால், ChatGPT-க்கு இணையாக Claude-ன் அடுக்கு விலைப்பட்டியல் மற்ற provider-களின் சேவைகளில் அதே coding வேலைக்கு எவ்வளவு செலவாகும் என்பதை விளக்குகிறது. இந்த அளவீடு உங்கள் வேலையை நிரந்தரமாக API-க்கு மாற்றினால், சந்தாவை ஒரு அடுக்கு குறைப்பது அல்லது முழுமையாக நீக்குவது நீங்கள் ஏற்கனவே பணம் செலுத்திய காலத்திற்கு எந்தப் பாதிப்பையும் ஏற்படுத்தாது, எனவே எண்கள் கிடைத்த பிறகு முடிவெடுப்பதில் எந்த இழப்பும் இல்லை.
FAQ
கோடிங் செய்வதற்கு எந்த Claude model சிறந்தது?
சிக்கலான ஏஜென்ட் சார்ந்த கோடிங் பணிகளுக்கு Claude Opus 4.8 சிறந்த தொடக்கப்புள்ளியாக ஆவணப்படுத்தப்பட்டுள்ளது. ஜூலை 2026 நிலவரப்படி, இதன் விலை ஒரு மில்லியன் input tokens-க்கு $5 மற்றும் ஒரு மில்லியன் output tokens-க்கு $25 ஆகும். Claude Sonnet 5 வேகம் மற்றும் அறிவுத்திறன் ஆகியவற்றின் சிறந்த கலவையாகக் கருதப்படுகிறது. ஆகஸ்ட் 31, 2026 வரை இதன் விலை $2 / $10 என இருப்பதால், இது Opus-ஐ விட பாதிக்கும் குறைவான செலவையே ஏற்படுத்துகிறது. ஒரே பணியை இரண்டிலும் இயக்கி, thinking configuration-ஐ மாற்றாமல் வைத்து, response.usage மூலம் மொத்த token செலவை ஒப்பிட்டுப் பார்க்கவும்.
Claude Haiku 4.5-ஐ Sonnet 5-க்கு மாற்றாகப் பயன்படுத்தும் அளவுக்கு மலிவானதா?
token அடிப்படையில் பார்த்தால், ஆம்: Sonnet 5-ன் அறிமுக விலையான $2 / $10-டன் ஒப்பிடும்போது, Haiku 4.5-ன் விலை $1 / $5 ஆகும். செப்டம்பர் 1, 2026 முதல் இது $3 / $15 ஆக உயரும். ஆனால், வரம்புகளே முடிவை தீர்மானிக்கின்றன. Haiku 4.5-ல் 1M-க்கு பதிலாக 200K token context window மட்டுமே உள்ளது. synchronous Messages API-ல் 64K அதிகபட்ச output மட்டுமே பெற முடியும். பிப்ரவரி 2025 வரையிலான தகவல்கள் மட்டுமே இதில் உள்ளன. இதில் output_config.effort ஆதரவு இல்லை. மேலும், 4,096-token-க்கு குறைவான prompt-களுக்கு caching வசதி தானாகவே முடக்கப்படும்.
ஒரு session-க்கு இடையில் மலிவான Claude model-க்கு மாறுவது பணத்தைச் சேமிக்குமா?
தோன்றுவதை விட இது குறைவான சேமிப்பையே தருகிறது. tools, system அல்லது messages prefix-ல் மாற்றங்கள், thinking configuration-ல் மாற்றங்கள் மற்றும் output_config.effort-ல் மாற்றங்கள் ஆகியவை cache-ஐ செல்லாததாக்கும் என Anthropic ஆவணப்படுத்துகிறது. ஒரு model-லிருந்து இன்னொன்றுக்கு மாறும்போது ஏற்கனவே உள்ள cache என்னவாகும் என்பது ஆவணப்படுத்தப்படவில்லை. எனவே, அதைத் தெரியாத ஒன்றாகக் கருதி, அடுத்த முதல் request-ல் cache_read_input_tokens-ஐ சரிபார்க்கவும். 150,000-token Opus 4.8 prefix-ல், cache read செய்ய சுமார் $0.08-ம், புதிதாக write செய்ய சுமார் $0.94-ம் செலவாகும். இது per-token சேமிப்பை விட அதிகம். எனவே, cache கைவிடப்படும் நேரமான, Claude Code-ல் /clear-க்கு பிறகு பணிகளுக்கு இடையே மாறவும்.
output_config.effort எனது கட்டணத்தை எவ்வாறு பாதிக்கும்?
இது text, tool calls மற்றும் thinking ஆகியவற்றில் model செலவிடும் token-களின் எண்ணிக்கையை மாற்றுகிறது. effort குறைவாக இருந்தால் tool calls-ன் எண்ணிக்கை குறையும். ஏஜென்ட் லூப்களில் ஒவ்வொரு tool-ன் முடிவும் மீண்டும் அனுப்பப்படுவதால், இது ஒட்டுமொத்த செலவைக் குறைக்கும். இதற்கான நிலைகள் low, medium, high, xhigh மற்றும் max ஆகும்; high என்பது default நிலையாகும். effort என்பது token பட்ஜெட் அல்ல, அது ஒரு behavioural signal என்பதால், ஒவ்வொரு நிலைக்கும் தனிப்பட்ட கட்டண பெருக்கிகளை Anthropic வெளியிடவில்லை. எனவே, உங்கள் பணியில் இதை நீங்களே அளவிடவும்.
Claude Batches API எவ்வளவு சேமிப்பைத் தருகிறது?
அசின்க்ரோனஸ் (asynchronous) முறையில் முடிவுகளைப் பெறுவதன் மூலம், input மற்றும் output token-களில் 50% சேமிக்கலாம். ஜூலை 2026 நிலவரப்படி, Opus 4.8-க்கு $2.50 in / $12.50 out, Sonnet 5-க்கு $1 / $5 (அறிமுக விலை), மற்றும் Haiku 4.5-க்கு $0.50 / $2.50 என விலை அமையும். கவனிக்க வேண்டிய ஒப்பீடு என்னவென்றால், செப்டம்பர் 1, 2026 முதல் சாதாரண விலையில் இயங்கும் synchronous Sonnet 5-ஐ விட, batched Opus 4.8 மலிவானது. எனவே, அதே செலவில் சிறந்த model-ஐப் பயன்படுத்த batching உதவுகிறது.