مقایسه هزینه GPU VPS و API: محاسبه نقطه سربهسر
آیا اجاره GPU VPS بهصرفهتر از پرداخت به ازای توکن است؟ در این مقاله فرمول دقیق محاسبه نقطه سربهسر برای مدلهای مختلف و حجم کاری ماهانه را بررسی میکنیم تا هزینهها را کاهش دهید.
نقطهٔ سربهسر واقعی کجاست
یک GPU VPS زمانی از مدل پرداخت به ازای هر توکن (per-token) در APIها پیشی میگیرد که هزینهٔ اجارهٔ ماهانهٔ ثابت، تقسیم بر تعداد توکنهای خروجی که در آن ماه تولید میکنید، کمتر از مبلغی شود که API برای همان تعداد توکن دریافت میکند. مبلغ اجاره ثابت است، اما صورتحساب API با هر درخواست تغییر میکند. بنابراین پاسخ همیشه یک حجم ماهانه است، نه یک بله یا خیر ساده.
این محاسبات را برای یک GPU VPS میانرده با هزینهٔ 0.50 دلار در ساعت در نظر بگیرید که برای یک ماه 730 ساعته، معادل 365 دلار میشود. در مقایسه با API مدلهای پیشرو (frontier)، نقطهٔ سربهسر شما در 24.3 میلیون توکن خروجی در ماه است. در مقایسه با یک مدل تجاری کوچک، این مقدار 73 میلیون توکن است. در مقایسه با یک مدل open-weight میزبانیشده با همان اندازه، شما هرگز به نقطهٔ سربهسر نمیرسید، زیرا یک کارت گرافیک نمیتواند در یک ماه توکن کافی برای رسیدن به نقطهٔ تلاقی تولید کند.
مطالعات منتشرشده دربارهٔ نقطهٔ سربهسر، پاسخ این پرسش را نمیدهند. دو مورد از آنها که در اوایل سال 2026 منتشر شدند، نقطهٔ تلاقی را در حدود 72% بهرهوری پایدار روی یک H200 و بین 22% تا 48% چرخهٔ کاری (duty cycle) روی یک MI300X تخمین زدند. هر دو مطالعه، مقایسه را با محصول serverless همان فروشنده انجام دادهاند و هر دو شتابدهندههایی را قیمتگذاری کردهاند که هزینهٔ ساعتی آنها از کل هزینهٔ ماهانهٔ اکثر خوانندگان این متن بیشتر است. محاسبات ریاضی یکسان است. آنچه در ادامه میآید، این محاسبات را برای یک کارت، یک مدل متنباز در محدودهٔ 7B تا 30B و صورتحسابهای معمولی API بازنویسی میکند.
تمام اعداد زیر ورودی هستند، نه نتیجه. همهٔ آنها را با مقادیر خود جایگزین کنید.
فرمول، برای اینکه بتوانید اعداد خود را جایگزین کنید
cost_per_million = (hourly_rate * 1000000) / (tokens_per_second * 3600 * duty_cycle)
breakeven_millions_per_month = (hourly_rate * hours_per_month) / api_price_per_million
capacity_millions_per_month = (tokens_per_second * 3600 * hours_per_month) / 1000000
required_duty_cycle = breakeven_millions_per_month / capacity_millions_per_monthچهار ورودی وجود دارد که میتوانید همه آنها را اندازهگیری یا جستجو کنید.
hourly_rateهزینهای است که GPU VPS در هر ساعت دارد، با احتساب ساعاتی که بیکار است. اگر ماهانه پرداخت میکنید، قیمت ماهانه را بر 730 تقسیم کنید.tokens_per_secondنرخ خروجی کلی است که سرور شما تحت همزمانی (concurrency) واقعی شما حفظ میکند. این عدد، نرخ تکجریانی (single-stream) موجود در نمودارهای فروشنده نیست.duty_cycleکسری از ماه است که GPU صرف تولید توکن میکند. سروری که تمام ماه اجاره کردهاید و روزانه دو ساعت از آن استفاده میکنید، روی 8.3% قرار دارد.api_price_per_millionقیمت اندازهگیریشدهای است که برای توکنهای خروجی با آن مقایسه میکنید.
این مثال قیمت توکنهای خروجی را در هر دو طرف محاسبه میکند، زیرا خروجی بخش عمده صورتحساب برای کارهای چت و عاملها (agent) را تشکیل میدهد. اگر پرامپتهای شما طولانی هستند، ورودی را به هر دو طرف اضافه کنید. در سمت API، این یک ردیف جداگانه در صورتحساب است. در کارت گرافیک خودتان، پیشپر کردن (prefill) از زمان GPU استفاده میکند، بنابراین این مورد از قبل به صورت یک tokens_per_second اندازهگیریشده کمتر ظاهر میشود.
نحوه اندازهگیری توکن بر ثانیه پیش از اعتماد به محاسبات
تمام موارد فوق بر پایه یک عدد اندازهگیریشده استوار است. اگر این عدد را با ضریب 3 اشتباه محاسبه کنید، پاسخ نهایی نیز با همان ضریب اشتباه خواهد بود. این اندازهگیری را روی کارتی که اجاره کردهاید، با همان مدل و کوانتایزیشنی (quantisation) که واقعاً قصد اجرای آن را دارید، انجام دهید.
ابزار Ollama مقدار single-stream را با یک دستور به شما میدهد:
ollama run qwen3:8b --verbose "Write 400 words about disk latency."دستور --verbose پس از پایان پاسخ، یک بلوک زمانی چاپ میکند. خطی که اهمیت دارد eval rate است که بر حسب توکن بر ثانیه بیان میشود و فقط شامل مرحله تولید (generation) است. مقدار prompt eval rate سرعت پیشپردازش (prefill) است و معمولاً بسیار بالاتر است. اعداد شما با این مقادیر متفاوت خواهد بود:
eval count: 412 token(s)
eval duration: 9.612s
eval rate: 42.86 tokens/sمقدار single-stream برای مدل هزینهسنجی عدد مناسبی نیست، زیرا این مقدار فقط یک درخواست را در لحظه روی کارتی اندازهگیری میکند که توانایی پاسخدهی به چندین درخواست همزمان را دارد. برای بهدست آوردن عدد کلی (aggregate)، مدل را با vLLM اجرا کنید و throughput گزارششده توسط خودِ سرور را بخوانید:
pip install vllm
vllm serve Qwen/Qwen3-8B --max-model-len 8192هنگامی که درخواستها در حال پردازش هستند، سرور در هر بازه گزارشدهی یک خط وضعیت چاپ میکند. فیلدهای دقیق ممکن است در نسخههای مختلف vLLM تغییر کنند، بنابراین به جای تکیه بر خروجی من، خروجی سیستم خود را بخوانید:
Avg prompt throughput: 812.4 tokens/s, Avg generation throughput: 396.1 tokens/s, Running: 16 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.7%مقدار Avg generation throughput همان عددی است که فرمول به آن نیاز دارد. این عدد با افزودن درخواستهای همزمان افزایش مییابد تا زمانی که KV cache (حافظه کش کلید-مقدار که وضعیت توجه هر درخواست است و vLLM آن را در VRAM نگه میدارد) پر شود؛ پس از آن، رشد عدد متوقف میشود. اگر بیش از این فشار وارد کنید، درخواستها به جای سریعتر شدن، در صف قرار میگیرند که این وضعیت را به صورت افزایش تعداد Waiting مشاهده خواهید کرد. ابزار vLLM همچنین شامل یک تولیدکننده بار (load generator) به نام vllm bench serve است. فلگهای این ابزار بین نسخهها تغییر میکنند، بنابراین به جای کپی کردن دستور از یک پست وبلاگی، دستور vllm bench serve --help را روی نسخهای که نصب کردهاید اجرا کنید.
در حین اجرای تست، کارت گرافیک را زیر نظر بگیرید:
nvidia-smi --query-gpu=utilization.gpu,memory.used,power.draw --format=csv -l 5اگر در حین تولید، مقدار utilization.gpu نزدیک به 100% باقی بماند، شما با محدودیت throughput مواجه هستید و عددی که اندازهگیری کردهاید سقف واقعی است. اگر این مقدار پایین بماند، عامل دیگری محدودکننده است: تعداد کم درخواستهای همزمان، کلاینت کند، یا مدلی که در VRAM جا نمیشود و بخشی از آن به RAM سیستم منتقل (offload) شده است. Ollama و vLLM در اینجا توازنهای بسیار متفاوتی برقرار میکنند و شکاف بین آنها روی یک کارت واحد به قدری زیاد است که میتواند نقطه سربهسر (break-even) شما را چندین برابر تغییر دهد.
هزینهها در طول یک ماه چگونه محاسبه میشوند
این مثال عملی شامل یک VPS با GPU به ظرفیت 24 GB با هزینه 0.50 دلار در ساعت است که یک مدل 8B متنباز را توسط vLLM ارائه میدهد. نرخ خروجی در این سناریو 400 توکن در ثانیه بهصورت مجموع و با 16 درخواست همزمان اندازهگیری شده است. هزینه اجاره ثابت است، صرفنظر از اینکه از کارت استفاده میکنید یا خیر. ظرفیت در این نرخ معادل 1,051 میلیون توکن خروجی در ماه است؛ این همان مقداری است که کارت در صورت فعالیت مداوم و بدون توقف تولید میکند.
The data behind this chart
[
{
"output_tokens_millions": 5,
"gpu_vps_usd": 365,
"open_api_usd": 1,
"small_api_usd": 25,
"frontier_api_usd": 75
},
{
"output_tokens_millions": 10,
"gpu_vps_usd": 365,
"open_api_usd": 2,
"small_api_usd": 50,
"frontier_api_usd": 150
},
{
"output_tokens_millions": 25,
"gpu_vps_usd": 365,
"open_api_usd": 5,
"small_api_usd": 125,
"frontier_api_usd": 375
},
{
"output_tokens_millions": 50,
"gpu_vps_usd": 365,
"open_api_usd": 10,
"small_api_usd": 250,
"frontier_api_usd": 750
},
{
"output_tokens_millions": 100,
"gpu_vps_usd": 365,
"open_api_usd": 20,
"small_api_usd": 500,
"frontier_api_usd": 1500
},
{
"output_tokens_millions": 250,
"gpu_vps_usd": 365,
"open_api_usd": 50,
"small_api_usd": 1250,
"frontier_api_usd": 3750
},
{
"output_tokens_millions": 500,
"gpu_vps_usd": 365,
"open_api_usd": 100,
"small_api_usd": 2500,
"frontier_api_usd": 7500
},
{
"output_tokens_millions": 1000,
"gpu_vps_usd": 365,
"open_api_usd": 200,
"small_api_usd": 5000,
"frontier_api_usd": 15000
}
]خط هزینه GPU در مقدار 365 دلار ثابت میماند، زیرا هزینه اجاره به میزان استفاده شما از کارت بستگی ندارد. هر خط مربوط به API یک خط مستقیم است که از نقطه صفر عبور میکند. هر جفت از این خطوط دقیقاً یکبار یکدیگر را قطع میکنند.
در سطح 25 میلیون توکن خروجی در ماه، API مدلهای پیشرو (Frontier) مبلغ 375 دلار هزینه دارد، بنابراین اختلاف هزینه دو طرف کمتر از ده دلار است. در سطح 50 میلیون توکن، مدل تجاری کوچک مبلغ 250 دلار هزینه دارد و همچنان گزینه ارزانتری محسوب میشود. در سطح 1000 میلیون توکن خروجی، که نیازمند فعال بودن کارت در 95 درصد از زمان ماه است، API مدلهای متنباز میزبانیشده مبلغ 200 دلار هزینه دارد که باید با همان هزینه اجاره ثابت مقایسه شود. در این حجم کاری که کارت در بیشترین حد توان خود کار میکند، هزینه اجاره کارت تقریباً دو برابر گرانتر از سرویس API تمام میشود.
این نتیجه آخر برای بسیاری تعجبآور است، اما تصادفی نیست. یک endpoint میزبانیشده برای مدلهای متنباز، در واقع ناوگانی از GPUهاست که با بهرهوری بالا اجرا میشوند؛ بنابراین قیمت آن به هزینه یک کارت که در حالت اشباع کار میکند، نزدیک است. شما نمیتوانید با اجاره یک کارت و اجرای آن با باری کمتر از ظرفیت کامل، بر یک ناوگان اشباعشده پیروز شوید. آنچه میتوانید شکست دهید، قیمتگذاری مدلهای پیشرو (Frontier) است که نه بر اساس زمان مصرف سیلیکون، بلکه بر اساس توانمندی مدل تعیین میشود.
هزینه به ازای هر میلیون توکن خروجی در چرخههای کاری مختلف
حجم کاری و چرخه کاری (duty cycle) دو روی یک سکه هستند. اجارهبها، زمان را خریداری میکند. ساعات بیکاری هیچ خروجی ندارند اما همچنان هزینه ایجاد میکنند.
The data behind this chart
[
{
"label": "100% duty",
"self_host_usd_per_million": "0.35",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "50% duty",
"self_host_usd_per_million": "0.69",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "25% duty",
"self_host_usd_per_million": "1.39",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "10% duty",
"self_host_usd_per_million": "3.47",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "5% duty",
"self_host_usd_per_million": "6.94",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
},
{
"label": "2% duty",
"self_host_usd_per_million": "17.36",
"open_api_usd_per_million": "0.20",
"small_api_usd_per_million": "5.00",
"frontier_api_usd_per_million": "15.00"
}
]سه ستون API، قیمتهای رسمی منتشرشده تا اوت 2026 هستند: 0.20 دلار به ازای هر میلیون توکن خروجی برای یک مدل 8B با وزن باز (open-weight) میزبانیشده، 5.00 دلار برای یک مدل تجاری کوچک، و 15.00 دلار برای یک مدل پیشرو (frontier). این ارقام صرفاً جهت نمونه هستند. پیش از هر تصمیمی، صفحه قیمتهای روز را بررسی کنید. اگر مقایسه شما در برابر یک طرح اشتراک ماهانه ثابت است و نه توکنهای مصرفی، محاسبات اشتراک متفاوت عمل میکند و نقطه سربهسر تغییر خواهد کرد.
اگر کارت گرافیک را با حداکثر توان اجرا کنید، هزینه هر میلیون توکن خروجی 0.35 دلار خواهد بود که واقعاً ارزان است. در چرخه کاری 10 درصد، همان یک میلیون توکن 3.47 دلار هزینه دارد. در چرخه کاری 2 درصد، هزینه به 17.36 دلار میرسد که در محدوده قیمت 0.20 دلاری که مدلهای باز میزبانیشده برای خروجی مشابه دریافت میکنند، نیست.
در چرخههای کاری کمتر از حدود 10 درصد، اجاره GPU انتخاب گرانتری است. شما 3.47 دلار به ازای هر میلیون توکن برای خروجی میپردازید که قیمت بازار آن 0.20 دلار است؛ آنچه با این مابهتفاوت خریداری میکنید، حریم خصوصی و صورتحسابی است که تغییر نمیکند. این موارد میتوانند ارزش مالی واقعی داشته باشند، اما به عنوان یک مزیت قیمتی محسوب نمیشوند؛ پس آنها را در دستهبندی کاهش هزینه قرار ندهید.
حجم نقطه سربهسر برای هر سطح API
The data behind this chart
[
{
"label": "Hosted open 8B API",
"breakeven_tokens_millions": 1825,
"required_duty_pct": 174
},
{
"label": "Small commercial model",
"breakeven_tokens_millions": 73,
"required_duty_pct": 6.9
},
{
"label": "Frontier model",
"breakeven_tokens_millions": 24.3,
"required_duty_pct": 2.3
}
]برای سطح frontier، شما به 24.3 میلیون توکن خروجی در ماه نیاز دارید که تنها 2.3% از توانایی کارت است. این حد نصاب پایینی است. یک تیم کوچک که در طول روز کاری، ایجنتهای برنامهنویسی را اجرا میکند، بهراحتی از این مقدار عبور میکند.
برای سطح تجاری کوچک، شما به 73 میلیون توکن در ماه یا چرخه کاری 6.9% نیاز دارید. برای سطح مدلهای open-weight میزبانیشده، چرخه کاری مورد نیاز 174% است. هر مقداری بالاتر از 100% طبق تعریف غیرقابلدستیابی است: کارت باید بیش از ساعات موجود در یک ماه کار کند. یک کارت میانرده با این نرخ ساعتی نمیتواند در این مقایسه برنده باشد؛ بنابراین تنها راههای تغییر نتیجه، استفاده از کارت ارزانتر، کارت سریعتر یا دلیلی غیر از قیمت است.
آنچه فرمول پنهان میکند
این فرمول، هزینه ساعتهای GPU و توکنها را محاسبه میکند. چندین هزینه واقعی خارج از این فرمول قرار دارند.
Cold starts. یک مدل 8B با وزنهای 16 بیتی حدود 16 گیگابایت است و بارگذاری آن از دیسک محلی به VRAM دهها ثانیه زمان میبرد. اگر برای صرفهجویی در اجاره، سرور را بین دفعات استفاده متوقف کنید، در هر درخواست اول باید منتظر این زمان بارگذاری بمانید. اگر آن را روشن بگذارید تا از انتظار جلوگیری کنید، چرخه کاری (duty cycle) شما کاهش مییابد که باعث افزایش هزینه به ازای هر توکن میشود. همین بدهبستان، دلیل اصلی وجود استنتاج بدون سرور (serverless inference) است.
ذخیرهسازی و دانلود. وزنها حجیم هستند. یک مدل 8B در حالت 16 بیتی حدود 16 گیگابایت، یک مدل 30B کوانتیزه شده به 4 بیت حدود 18 گیگابایت، و یک مدل 30B در حالت 16 بیتی اصلاً در یک کارت 24 گیگابایتی جا نمیشود. سقف تواناییها در ردههای بالا بهسرعت محدود میشود، جایی که اجرای یک مدل متنباز با تریلیونها پارامتر مانند Kimi K3 به این معنی است که وزنها بهتنهایی از ظرفیت هر کارت تکگرافیکی که بتوانید ساعتی اجاره کنید، فراتر میروند. شما هر ماه هزینه آن دیسک را میپردازید و در هر بار بازسازی (rebuild) نیز هزینه زمانی آن را متحمل میشوید. پس از یک هفته آزمایش، دستور du -sh ~/.cache/huggingface/hub را اجرا کنید. حجم دیسک سریعتر از آنچه انتظار دارید رشد میکند، زیرا هر کوانتیزاسیونی که یک بار امتحان کردهاید، همچنان در آنجا باقی مانده است.
زمان شخصی شما. نسخههای درایور و CUDA، خطاهای out-of-memory در طول کانتکستی که دیروز کار میکرد، یا بهروزرسانی مدلی که قالب چت را تغییر میدهد. هیچکدام از اینها در ارقام هزینه به ازای توکن ظاهر نمیشوند، اما همگی از وقت آزاد شما کسر میشوند. اگر قبلاً تجربه انتخاب اندازه این سرورها را نداشتهاید، خواندن مطلب آنچه یک GPU VPS واقعاً به شما میدهد پیش از تعهد به یک ماه اجاره، ارزشمند است.
شکاف کیفیت. این بزرگترین هزینه پنهان و سختترین مورد برای قیمتگذاری است. یک مدل متنباز 8B، یک مدل پیشرو (frontier model) نیست. اگر این مدل برای انجام کاری به سه تلاش نیاز داشته باشد در حالی که مدل پیشرو با یک تلاش آن را انجام میدهد، قیمت واقعی آن به ازای هر پاسخ مفید، سه برابر مقدار جدول است و ممکن است در نهایت در انجام وظیفه شکست بخورد. پیش از مقایسه بر اساس قیمت، با پرامپتهای خودتان مقایسه کنید. برای بارهای کاری عاملمحور (agent workloads)، پاسخ معمول این است که درخواستها را بر اساس دشواری مسیریابی کنید و توکنهای محلی ارزان را برای کارهای حجیم نگه دارید؛ این همان چیزی است که کنترل هزینههای عامل در یک VPS در نهایت به آن ختم میشود.
صورتحسابهایی که فراموش کردهاید. یک نمونه GPU ساعتی که متوقف کردهاید، اغلب همچنان برای فضای ذخیرهسازی متصل و آدرس IP رزرو شده هزینه دریافت میکند. صورتحساب را بخوانید، نه صفحه قیمتها را.
زمانی که self-hosting به دلایلی غیر از قیمت برتری دارد
چهار موردی که در آنها محاسبات مالی عامل تعیینکننده نیست.
- دادههایی که نباید از کنترل شما خارج شوند. اگر یک قانون انطباق (compliance)، ارسال متن به شخص ثالث را ممنوع کند، قیمت به ازای هر توکن دیگر موضوع بحث نیست.
- حجم کاری بالا و مداوم طبق برنامه. یک job دستهبندی (batch classification) که هر شب 6 ساعت اجرا میشود، طبق طراحی دارای duty cycle معادل 25% است و هرگز با صورتحسابهای غیرمنتظره شما را غافلگیر نمیکند.
- محدودیتهای نرخ (Rate limits). کارت گرافیک شما یک صف اختصاصی دارد که متعلق به خودتان است.
- مدلی که هیچ API آن را ارائه نمیدهد. اگر به یک fine-tune خاص نیاز دارید، هیچ جایگزینی برای مقایسه وجود ندارد.
اگر میخواهید ابتدا نسخه ارزانتر را تست کنید، اجرای یک مدل کوچک روی یک VPS با Ollama تنها به یک بعدازظهر زمان نیاز دارد و تخمین اندازه یک مدل متنباز نسبت به کارتی که قصد اجاره آن را دارید به شما میگوید که واقعاً به چه GPU نیاز دارید. پیش از آنکه برای یک ماه اجاره GPU قرارداد ببندید، ابتدا در آنجا اندازهگیری کنید.
FAQ
در چه حجم توکن ماهانهای، استفاده از GPU VPS بهصرفهتر از قیمتگذاری API است؟
هزینه ماهانه GPU را بر قیمت API به ازای هر میلیون توکن خروجی تقسیم کنید. یک کارت گرافیک با اجاره ماهانه 365 دلار، در مقایسه با یک API پیشرو با قیمت 15.00 دلار به ازای هر میلیون توکن، در نقطه 24.3 میلیون توکن خروجی در ماه به نقطه سربهسر میرسد. در مقایسه با یک مدل تجاری کوچک با قیمت 5.00 دلار، این مقدار 73 میلیون توکن است. در برابر یک مدل open-weight میزبانیشده با قیمت 0.20 دلار، یک کارت میانرده نمیتواند در یک ماه توکن کافی تولید کند تا به نقطه سربهسر برسد.
چرا هزینه API برای یک مدل open-weight میزبانیشده کمتر از GPU شخصی من است؟
زیرا قیمت آن نزدیک به هزینه یک GPU با بار کاری کامل تعیین شده است، در حالی که کارت شما همیشه تحت بار کامل نیست. ارائهدهندهای که به هزاران درخواست همزمان پاسخ میدهد، ناوگان خود را نزدیک به ظرفیت اشباع نگه میدارد، بنابراین میتواند توکنها را نزدیک به هزینه نهایی تولید آنها بفروشد. کارت شما در بیشتر ساعات روز بیکار است و شما هزینه ساعات بیکاری را پرداخت میکنید. در چرخه کاری 10 درصد، هزینه شما 3.47 دلار به ازای هر میلیون توکن خروجی است، در حالی که هزینه آنها 0.20 دلار است.
آیا باید توکنهای ورودی را هم مانند توکنهای خروجی محاسبه کنم؟
اگر promptهای شما طولانی هستند، آنها را محاسبه کنید. مقایسه انجامشده در اینجا فقط از توکنهای خروجی استفاده میکند که عامل اصلی در کارهای چت و agent است. افزودن توکنهای ورودی، هر دو طرف را تغییر میدهد. در سمت API، این یک ردیف جداگانه و ارزانتر در صورتحساب است. روی کارت شخصی شما، prefill زمان GPU را مصرف میکند، بنابراین هزینه آن از قبل در مجموع توکنهای بر ثانیهای که اندازهگیری کردهاید لحاظ شده است. با طول promptهای واقعی خود اندازهگیری کنید تا دو طرف قابل مقایسه باقی بمانند.
چگونه توکن بر ثانیه مورد نیاز برای فرمول را اندازهگیری کنم؟
مدل را به همان شکلی که استفاده خواهید کرد سرو کنید، سپس نرخ تولید کلی را تحت concurrency واقعی بخوانید. با Ollama، دستور ollama run <model> --verbose یک eval rate بر حسب توکن بر ثانیه چاپ میکند، اما این یک جریان تکی است و ظرفیت یک سرور دستهای (batched) را کمتر از واقعیت نشان میدهد. با vLLM، سرور در حال اجرا هنگام پردازش درخواستها، Avg generation throughput را در لاگها ثبت میکند و این همان عددی است که باید استفاده کنید. همزمان nvidia-smi را نیز مانیتور کنید. اگر میزان استفاده از GPU در حین تولید نزدیک به 100 درصد نیست، هنوز به سقف توانایی آن نرسیدهاید.
آیا اجاره GPU VPS با استفاده کمتر از 10 درصد ارزش دارد؟
از نظر قیمت، خیر. در چرخه کاری 10 درصد، شما 3.47 دلار به ازای هر میلیون توکن خروجی میپردازید و در چرخه 2 درصد، این هزینه 17.36 دلار است. هر دو مقدار بالاتر از تمام APIهای مبتنی بر مصرف در این مقایسه (به جز رده پیشرو) هستند. تنها زمانی زیر این خط اجاره کنید که هدف شما از پرداخت هزینه، حفظ حریم خصوصی یا دسترسی به مدلی باشد که هیچ API آن را ارائه نمیدهد.