SSD Nodes Learn 🎉 VPS از $5.50/ماه
راهنماها Matt Connorتوسط Matt Connor · به‌روزرسانی شده 2026-08-13

مقایسه هزینه GPU VPS و API: محاسبه نقطه سر‌به‌سر

آیا اجاره GPU VPS به‌صرفه‌تر از پرداخت به ازای توکن است؟ در این مقاله فرمول دقیق محاسبه نقطه سر‌به‌سر برای مدل‌های مختلف و حجم کاری ماهانه را بررسی می‌کنیم تا هزینه‌ها را کاهش دهید.

نقطهٔ سر‌به‌سر واقعی کجاست

یک GPU VPS زمانی از مدل پرداخت به ازای هر توکن (per-token) در APIها پیشی می‌گیرد که هزینهٔ اجارهٔ ماهانهٔ ثابت، تقسیم بر تعداد توکن‌های خروجی که در آن ماه تولید می‌کنید، کمتر از مبلغی شود که API برای همان تعداد توکن دریافت می‌کند. مبلغ اجاره ثابت است، اما صورت‌حساب API با هر درخواست تغییر می‌کند. بنابراین پاسخ همیشه یک حجم ماهانه است، نه یک بله یا خیر ساده.

این محاسبات را برای یک GPU VPS میان‌رده با هزینهٔ 0.50 دلار در ساعت در نظر بگیرید که برای یک ماه 730 ساعته، معادل 365 دلار می‌شود. در مقایسه با API مدل‌های پیشرو (frontier)، نقطهٔ سر‌به‌سر شما در 24.3 میلیون توکن خروجی در ماه است. در مقایسه با یک مدل تجاری کوچک، این مقدار 73 میلیون توکن است. در مقایسه با یک مدل open-weight میزبانی‌شده با همان اندازه، شما هرگز به نقطهٔ سر‌به‌سر نمی‌رسید، زیرا یک کارت گرافیک نمی‌تواند در یک ماه توکن کافی برای رسیدن به نقطهٔ تلاقی تولید کند.

مطالعات منتشرشده دربارهٔ نقطهٔ سر‌به‌سر، پاسخ این پرسش را نمی‌دهند. دو مورد از آن‌ها که در اوایل سال 2026 منتشر شدند، نقطهٔ تلاقی را در حدود 72% بهره‌وری پایدار روی یک H200 و بین 22% تا 48% چرخهٔ کاری (duty cycle) روی یک MI300X تخمین زدند. هر دو مطالعه، مقایسه را با محصول serverless همان فروشنده انجام داده‌اند و هر دو شتاب‌دهنده‌هایی را قیمت‌گذاری کرده‌اند که هزینهٔ ساعتی آن‌ها از کل هزینهٔ ماهانهٔ اکثر خوانندگان این متن بیشتر است. محاسبات ریاضی یکسان است. آنچه در ادامه می‌آید، این محاسبات را برای یک کارت، یک مدل متن‌باز در محدودهٔ 7B تا 30B و صورت‌حساب‌های معمولی API بازنویسی می‌کند.

تمام اعداد زیر ورودی هستند، نه نتیجه. همهٔ آن‌ها را با مقادیر خود جایگزین کنید.

فرمول، برای اینکه بتوانید اعداد خود را جایگزین کنید

cost_per_million = (hourly_rate * 1000000) / (tokens_per_second * 3600 * duty_cycle)

breakeven_millions_per_month = (hourly_rate * hours_per_month) / api_price_per_million

capacity_millions_per_month = (tokens_per_second * 3600 * hours_per_month) / 1000000

required_duty_cycle = breakeven_millions_per_month / capacity_millions_per_month

چهار ورودی وجود دارد که می‌توانید همه آن‌ها را اندازه‌گیری یا جستجو کنید.

  • hourly_rate هزینه‌ای است که GPU VPS در هر ساعت دارد، با احتساب ساعاتی که بیکار است. اگر ماهانه پرداخت می‌کنید، قیمت ماهانه را بر 730 تقسیم کنید.
  • tokens_per_second نرخ خروجی کلی است که سرور شما تحت هم‌زمانی (concurrency) واقعی شما حفظ می‌کند. این عدد، نرخ تک‌جریانی (single-stream) موجود در نمودارهای فروشنده نیست.
  • duty_cycle کسری از ماه است که GPU صرف تولید توکن می‌کند. سروری که تمام ماه اجاره کرده‌اید و روزانه دو ساعت از آن استفاده می‌کنید، روی 8.3% قرار دارد.
  • api_price_per_million قیمت اندازه‌گیری‌شده‌ای است که برای توکن‌های خروجی با آن مقایسه می‌کنید.

این مثال قیمت توکن‌های خروجی را در هر دو طرف محاسبه می‌کند، زیرا خروجی بخش عمده صورت‌حساب برای کارهای چت و عامل‌ها (agent) را تشکیل می‌دهد. اگر پرامپت‌های شما طولانی هستند، ورودی را به هر دو طرف اضافه کنید. در سمت API، این یک ردیف جداگانه در صورت‌حساب است. در کارت گرافیک خودتان، پیش‌پر کردن (prefill) از زمان GPU استفاده می‌کند، بنابراین این مورد از قبل به صورت یک tokens_per_second اندازه‌گیری‌شده کمتر ظاهر می‌شود.

نحوه اندازه‌گیری توکن بر ثانیه پیش از اعتماد به محاسبات

تمام موارد فوق بر پایه یک عدد اندازه‌گیری‌شده استوار است. اگر این عدد را با ضریب 3 اشتباه محاسبه کنید، پاسخ نهایی نیز با همان ضریب اشتباه خواهد بود. این اندازه‌گیری را روی کارتی که اجاره کرده‌اید، با همان مدل و کوانتایزیشنی (quantisation) که واقعاً قصد اجرای آن را دارید، انجام دهید.

ابزار Ollama مقدار single-stream را با یک دستور به شما می‌دهد:

ollama run qwen3:8b --verbose "Write 400 words about disk latency."

دستور --verbose پس از پایان پاسخ، یک بلوک زمانی چاپ می‌کند. خطی که اهمیت دارد eval rate است که بر حسب توکن بر ثانیه بیان می‌شود و فقط شامل مرحله تولید (generation) است. مقدار prompt eval rate سرعت پیش‌پردازش (prefill) است و معمولاً بسیار بالاتر است. اعداد شما با این مقادیر متفاوت خواهد بود:

eval count:       412 token(s)
eval duration:    9.612s
eval rate:        42.86 tokens/s

مقدار single-stream برای مدل هزینه‌سنجی عدد مناسبی نیست، زیرا این مقدار فقط یک درخواست را در لحظه روی کارتی اندازه‌گیری می‌کند که توانایی پاسخ‌دهی به چندین درخواست همزمان را دارد. برای به‌دست آوردن عدد کلی (aggregate)، مدل را با vLLM اجرا کنید و throughput گزارش‌شده توسط خودِ سرور را بخوانید:

pip install vllm
vllm serve Qwen/Qwen3-8B --max-model-len 8192

هنگامی که درخواست‌ها در حال پردازش هستند، سرور در هر بازه گزارش‌دهی یک خط وضعیت چاپ می‌کند. فیلدهای دقیق ممکن است در نسخه‌های مختلف vLLM تغییر کنند، بنابراین به جای تکیه بر خروجی من، خروجی سیستم خود را بخوانید:

Avg prompt throughput: 812.4 tokens/s, Avg generation throughput: 396.1 tokens/s, Running: 16 reqs, Waiting: 0 reqs, GPU KV cache usage: 21.7%

مقدار Avg generation throughput همان عددی است که فرمول به آن نیاز دارد. این عدد با افزودن درخواست‌های همزمان افزایش می‌یابد تا زمانی که KV cache (حافظه کش کلید-مقدار که وضعیت توجه هر درخواست است و vLLM آن را در VRAM نگه می‌دارد) پر شود؛ پس از آن، رشد عدد متوقف می‌شود. اگر بیش از این فشار وارد کنید، درخواست‌ها به جای سریع‌تر شدن، در صف قرار می‌گیرند که این وضعیت را به صورت افزایش تعداد Waiting مشاهده خواهید کرد. ابزار vLLM همچنین شامل یک تولیدکننده بار (load generator) به نام vllm bench serve است. فلگ‌های این ابزار بین نسخه‌ها تغییر می‌کنند، بنابراین به جای کپی کردن دستور از یک پست وبلاگی، دستور vllm bench serve --help را روی نسخه‌ای که نصب کرده‌اید اجرا کنید.

در حین اجرای تست، کارت گرافیک را زیر نظر بگیرید:

nvidia-smi --query-gpu=utilization.gpu,memory.used,power.draw --format=csv -l 5

اگر در حین تولید، مقدار utilization.gpu نزدیک به 100% باقی بماند، شما با محدودیت throughput مواجه هستید و عددی که اندازه‌گیری کرده‌اید سقف واقعی است. اگر این مقدار پایین بماند، عامل دیگری محدودکننده است: تعداد کم درخواست‌های همزمان، کلاینت کند، یا مدلی که در VRAM جا نمی‌شود و بخشی از آن به RAM سیستم منتقل (offload) شده است. Ollama و vLLM در اینجا توازن‌های بسیار متفاوتی برقرار می‌کنند و شکاف بین آن‌ها روی یک کارت واحد به قدری زیاد است که می‌تواند نقطه سربه‌سر (break-even) شما را چندین برابر تغییر دهد.

هزینه‌ها در طول یک ماه چگونه محاسبه می‌شوند

این مثال عملی شامل یک VPS با GPU به ظرفیت 24 GB با هزینه 0.50 دلار در ساعت است که یک مدل 8B متن‌باز را توسط vLLM ارائه می‌دهد. نرخ خروجی در این سناریو 400 توکن در ثانیه به‌صورت مجموع و با 16 درخواست همزمان اندازه‌گیری شده است. هزینه اجاره ثابت است، صرف‌نظر از اینکه از کارت استفاده می‌کنید یا خیر. ظرفیت در این نرخ معادل 1,051 میلیون توکن خروجی در ماه است؛ این همان مقداری است که کارت در صورت فعالیت مداوم و بدون توقف تولید می‌کند.

ChartMonthly cost by output volume: one GPU VPS at $0.50 per hour against metered APIs (USD)
The data behind this chart
[
  {
    "output_tokens_millions": 5,
    "gpu_vps_usd": 365,
    "open_api_usd": 1,
    "small_api_usd": 25,
    "frontier_api_usd": 75
  },
  {
    "output_tokens_millions": 10,
    "gpu_vps_usd": 365,
    "open_api_usd": 2,
    "small_api_usd": 50,
    "frontier_api_usd": 150
  },
  {
    "output_tokens_millions": 25,
    "gpu_vps_usd": 365,
    "open_api_usd": 5,
    "small_api_usd": 125,
    "frontier_api_usd": 375
  },
  {
    "output_tokens_millions": 50,
    "gpu_vps_usd": 365,
    "open_api_usd": 10,
    "small_api_usd": 250,
    "frontier_api_usd": 750
  },
  {
    "output_tokens_millions": 100,
    "gpu_vps_usd": 365,
    "open_api_usd": 20,
    "small_api_usd": 500,
    "frontier_api_usd": 1500
  },
  {
    "output_tokens_millions": 250,
    "gpu_vps_usd": 365,
    "open_api_usd": 50,
    "small_api_usd": 1250,
    "frontier_api_usd": 3750
  },
  {
    "output_tokens_millions": 500,
    "gpu_vps_usd": 365,
    "open_api_usd": 100,
    "small_api_usd": 2500,
    "frontier_api_usd": 7500
  },
  {
    "output_tokens_millions": 1000,
    "gpu_vps_usd": 365,
    "open_api_usd": 200,
    "small_api_usd": 5000,
    "frontier_api_usd": 15000
  }
]

خط هزینه GPU در مقدار 365 دلار ثابت می‌ماند، زیرا هزینه اجاره به میزان استفاده شما از کارت بستگی ندارد. هر خط مربوط به API یک خط مستقیم است که از نقطه صفر عبور می‌کند. هر جفت از این خطوط دقیقاً یک‌بار یکدیگر را قطع می‌کنند.

در سطح 25 میلیون توکن خروجی در ماه، API مدل‌های پیشرو (Frontier) مبلغ 375 دلار هزینه دارد، بنابراین اختلاف هزینه دو طرف کمتر از ده دلار است. در سطح 50 میلیون توکن، مدل تجاری کوچک مبلغ 250 دلار هزینه دارد و همچنان گزینه ارزان‌تری محسوب می‌شود. در سطح 1000 میلیون توکن خروجی، که نیازمند فعال بودن کارت در 95 درصد از زمان ماه است، API مدل‌های متن‌باز میزبانی‌شده مبلغ 200 دلار هزینه دارد که باید با همان هزینه اجاره ثابت مقایسه شود. در این حجم کاری که کارت در بیشترین حد توان خود کار می‌کند، هزینه اجاره کارت تقریباً دو برابر گران‌تر از سرویس API تمام می‌شود.

این نتیجه آخر برای بسیاری تعجب‌آور است، اما تصادفی نیست. یک endpoint میزبانی‌شده برای مدل‌های متن‌باز، در واقع ناوگانی از GPUهاست که با بهره‌وری بالا اجرا می‌شوند؛ بنابراین قیمت آن به هزینه یک کارت که در حالت اشباع کار می‌کند، نزدیک است. شما نمی‌توانید با اجاره یک کارت و اجرای آن با باری کمتر از ظرفیت کامل، بر یک ناوگان اشباع‌شده پیروز شوید. آنچه می‌توانید شکست دهید، قیمت‌گذاری مدل‌های پیشرو (Frontier) است که نه بر اساس زمان مصرف سیلیکون، بلکه بر اساس توانمندی مدل تعیین می‌شود.

هزینه به ازای هر میلیون توکن خروجی در چرخه‌های کاری مختلف

حجم کاری و چرخه کاری (duty cycle) دو روی یک سکه هستند. اجاره‌بها، زمان را خریداری می‌کند. ساعات بیکاری هیچ خروجی ندارند اما همچنان هزینه ایجاد می‌کنند.

ChartCost per million output tokens at each duty cycle (USD, list prices August 2026)
The data behind this chart
[
  {
    "label": "100% duty",
    "self_host_usd_per_million": "0.35",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "50% duty",
    "self_host_usd_per_million": "0.69",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "25% duty",
    "self_host_usd_per_million": "1.39",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "10% duty",
    "self_host_usd_per_million": "3.47",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "5% duty",
    "self_host_usd_per_million": "6.94",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  },
  {
    "label": "2% duty",
    "self_host_usd_per_million": "17.36",
    "open_api_usd_per_million": "0.20",
    "small_api_usd_per_million": "5.00",
    "frontier_api_usd_per_million": "15.00"
  }
]

سه ستون API، قیمت‌های رسمی منتشرشده تا اوت 2026 هستند: 0.20 دلار به ازای هر میلیون توکن خروجی برای یک مدل 8B با وزن باز (open-weight) میزبانی‌شده، 5.00 دلار برای یک مدل تجاری کوچک، و 15.00 دلار برای یک مدل پیشرو (frontier). این ارقام صرفاً جهت نمونه هستند. پیش از هر تصمیمی، صفحه قیمت‌های روز را بررسی کنید. اگر مقایسه شما در برابر یک طرح اشتراک ماهانه ثابت است و نه توکن‌های مصرفی، محاسبات اشتراک متفاوت عمل می‌کند و نقطه سربه‌سر تغییر خواهد کرد.

اگر کارت گرافیک را با حداکثر توان اجرا کنید، هزینه هر میلیون توکن خروجی 0.35 دلار خواهد بود که واقعاً ارزان است. در چرخه کاری 10 درصد، همان یک میلیون توکن 3.47 دلار هزینه دارد. در چرخه کاری 2 درصد، هزینه به 17.36 دلار می‌رسد که در محدوده قیمت 0.20 دلاری که مدل‌های باز میزبانی‌شده برای خروجی مشابه دریافت می‌کنند، نیست.

در چرخه‌های کاری کمتر از حدود 10 درصد، اجاره GPU انتخاب گران‌تری است. شما 3.47 دلار به ازای هر میلیون توکن برای خروجی می‌پردازید که قیمت بازار آن 0.20 دلار است؛ آنچه با این مابه‌تفاوت خریداری می‌کنید، حریم خصوصی و صورت‌حسابی است که تغییر نمی‌کند. این موارد می‌توانند ارزش مالی واقعی داشته باشند، اما به عنوان یک مزیت قیمتی محسوب نمی‌شوند؛ پس آن‌ها را در دسته‌بندی کاهش هزینه قرار ندهید.

حجم نقطه سربه‌سر برای هر سطح API

ChartBreak-even output volume per month, and the duty cycle it requires
The data behind this chart
[
  {
    "label": "Hosted open 8B API",
    "breakeven_tokens_millions": 1825,
    "required_duty_pct": 174
  },
  {
    "label": "Small commercial model",
    "breakeven_tokens_millions": 73,
    "required_duty_pct": 6.9
  },
  {
    "label": "Frontier model",
    "breakeven_tokens_millions": 24.3,
    "required_duty_pct": 2.3
  }
]

برای سطح frontier، شما به 24.3 میلیون توکن خروجی در ماه نیاز دارید که تنها 2.3% از توانایی کارت است. این حد نصاب پایینی است. یک تیم کوچک که در طول روز کاری، ایجنت‌های برنامه‌نویسی را اجرا می‌کند، به‌راحتی از این مقدار عبور می‌کند.

برای سطح تجاری کوچک، شما به 73 میلیون توکن در ماه یا چرخه کاری 6.9% نیاز دارید. برای سطح مدل‌های open-weight میزبانی‌شده، چرخه کاری مورد نیاز 174% است. هر مقداری بالاتر از 100% طبق تعریف غیرقابل‌دستیابی است: کارت باید بیش از ساعات موجود در یک ماه کار کند. یک کارت میان‌رده با این نرخ ساعتی نمی‌تواند در این مقایسه برنده باشد؛ بنابراین تنها راه‌های تغییر نتیجه، استفاده از کارت ارزان‌تر، کارت سریع‌تر یا دلیلی غیر از قیمت است.

آنچه فرمول پنهان می‌کند

این فرمول، هزینه ساعت‌های GPU و توکن‌ها را محاسبه می‌کند. چندین هزینه واقعی خارج از این فرمول قرار دارند.

Cold starts. یک مدل 8B با وزن‌های 16 بیتی حدود 16 گیگابایت است و بارگذاری آن از دیسک محلی به VRAM ده‌ها ثانیه زمان می‌برد. اگر برای صرفه‌جویی در اجاره، سرور را بین دفعات استفاده متوقف کنید، در هر درخواست اول باید منتظر این زمان بارگذاری بمانید. اگر آن را روشن بگذارید تا از انتظار جلوگیری کنید، چرخه کاری (duty cycle) شما کاهش می‌یابد که باعث افزایش هزینه به ازای هر توکن می‌شود. همین بده‌بستان، دلیل اصلی وجود استنتاج بدون سرور (serverless inference) است.

ذخیره‌سازی و دانلود. وزن‌ها حجیم هستند. یک مدل 8B در حالت 16 بیتی حدود 16 گیگابایت، یک مدل 30B کوانتیزه شده به 4 بیت حدود 18 گیگابایت، و یک مدل 30B در حالت 16 بیتی اصلاً در یک کارت 24 گیگابایتی جا نمی‌شود. سقف توانایی‌ها در رده‌های بالا به‌سرعت محدود می‌شود، جایی که اجرای یک مدل متن‌باز با تریلیون‌ها پارامتر مانند Kimi K3 به این معنی است که وزن‌ها به‌تنهایی از ظرفیت هر کارت تک‌گرافیکی که بتوانید ساعتی اجاره کنید، فراتر می‌روند. شما هر ماه هزینه آن دیسک را می‌پردازید و در هر بار بازسازی (rebuild) نیز هزینه زمانی آن را متحمل می‌شوید. پس از یک هفته آزمایش، دستور du -sh ~/.cache/huggingface/hub را اجرا کنید. حجم دیسک سریع‌تر از آنچه انتظار دارید رشد می‌کند، زیرا هر کوانتیزاسیونی که یک بار امتحان کرده‌اید، همچنان در آنجا باقی مانده است.

زمان شخصی شما. نسخه‌های درایور و CUDA، خطاهای out-of-memory در طول کانتکستی که دیروز کار می‌کرد، یا به‌روزرسانی مدلی که قالب چت را تغییر می‌دهد. هیچ‌کدام از این‌ها در ارقام هزینه به ازای توکن ظاهر نمی‌شوند، اما همگی از وقت آزاد شما کسر می‌شوند. اگر قبلاً تجربه انتخاب اندازه این سرورها را نداشته‌اید، خواندن مطلب آنچه یک GPU VPS واقعاً به شما می‌دهد پیش از تعهد به یک ماه اجاره، ارزشمند است.

شکاف کیفیت. این بزرگ‌ترین هزینه پنهان و سخت‌ترین مورد برای قیمت‌گذاری است. یک مدل متن‌باز 8B، یک مدل پیشرو (frontier model) نیست. اگر این مدل برای انجام کاری به سه تلاش نیاز داشته باشد در حالی که مدل پیشرو با یک تلاش آن را انجام می‌دهد، قیمت واقعی آن به ازای هر پاسخ مفید، سه برابر مقدار جدول است و ممکن است در نهایت در انجام وظیفه شکست بخورد. پیش از مقایسه بر اساس قیمت، با پرامپت‌های خودتان مقایسه کنید. برای بارهای کاری عامل‌محور (agent workloads)، پاسخ معمول این است که درخواست‌ها را بر اساس دشواری مسیریابی کنید و توکن‌های محلی ارزان را برای کارهای حجیم نگه دارید؛ این همان چیزی است که کنترل هزینه‌های عامل در یک VPS در نهایت به آن ختم می‌شود.

صورت‌حساب‌هایی که فراموش کرده‌اید. یک نمونه GPU ساعتی که متوقف کرده‌اید، اغلب همچنان برای فضای ذخیره‌سازی متصل و آدرس IP رزرو شده هزینه دریافت می‌کند. صورت‌حساب را بخوانید، نه صفحه قیمت‌ها را.

زمانی که self-hosting به دلایلی غیر از قیمت برتری دارد

چهار موردی که در آن‌ها محاسبات مالی عامل تعیین‌کننده نیست.

  • داده‌هایی که نباید از کنترل شما خارج شوند. اگر یک قانون انطباق (compliance)، ارسال متن به شخص ثالث را ممنوع کند، قیمت به ازای هر توکن دیگر موضوع بحث نیست.
  • حجم کاری بالا و مداوم طبق برنامه. یک job دسته‌بندی (batch classification) که هر شب 6 ساعت اجرا می‌شود، طبق طراحی دارای duty cycle معادل 25% است و هرگز با صورت‌حساب‌های غیرمنتظره شما را غافلگیر نمی‌کند.
  • محدودیت‌های نرخ (Rate limits). کارت گرافیک شما یک صف اختصاصی دارد که متعلق به خودتان است.
  • مدلی که هیچ API آن را ارائه نمی‌دهد. اگر به یک fine-tune خاص نیاز دارید، هیچ جایگزینی برای مقایسه وجود ندارد.

اگر می‌خواهید ابتدا نسخه ارزان‌تر را تست کنید، اجرای یک مدل کوچک روی یک VPS با Ollama تنها به یک بعدازظهر زمان نیاز دارد و تخمین اندازه یک مدل متن‌باز نسبت به کارتی که قصد اجاره آن را دارید به شما می‌گوید که واقعاً به چه GPU نیاز دارید. پیش از آنکه برای یک ماه اجاره GPU قرارداد ببندید، ابتدا در آنجا اندازه‌گیری کنید.

FAQ

در چه حجم توکن ماهانه‌ای، استفاده از GPU VPS به‌صرفه‌تر از قیمت‌گذاری API است؟

هزینه ماهانه GPU را بر قیمت API به ازای هر میلیون توکن خروجی تقسیم کنید. یک کارت گرافیک با اجاره ماهانه 365 دلار، در مقایسه با یک API پیشرو با قیمت 15.00 دلار به ازای هر میلیون توکن، در نقطه 24.3 میلیون توکن خروجی در ماه به نقطه سر‌به‌سر می‌رسد. در مقایسه با یک مدل تجاری کوچک با قیمت 5.00 دلار، این مقدار 73 میلیون توکن است. در برابر یک مدل open-weight میزبانی‌شده با قیمت 0.20 دلار، یک کارت میان‌رده نمی‌تواند در یک ماه توکن کافی تولید کند تا به نقطه سر‌به‌سر برسد.

چرا هزینه API برای یک مدل open-weight میزبانی‌شده کمتر از GPU شخصی من است؟

زیرا قیمت آن نزدیک به هزینه یک GPU با بار کاری کامل تعیین شده است، در حالی که کارت شما همیشه تحت بار کامل نیست. ارائه‌دهنده‌ای که به هزاران درخواست همزمان پاسخ می‌دهد، ناوگان خود را نزدیک به ظرفیت اشباع نگه می‌دارد، بنابراین می‌تواند توکن‌ها را نزدیک به هزینه نهایی تولید آن‌ها بفروشد. کارت شما در بیشتر ساعات روز بیکار است و شما هزینه ساعات بیکاری را پرداخت می‌کنید. در چرخه کاری 10 درصد، هزینه شما 3.47 دلار به ازای هر میلیون توکن خروجی است، در حالی که هزینه آن‌ها 0.20 دلار است.

آیا باید توکن‌های ورودی را هم مانند توکن‌های خروجی محاسبه کنم؟

اگر promptهای شما طولانی هستند، آن‌ها را محاسبه کنید. مقایسه انجام‌شده در اینجا فقط از توکن‌های خروجی استفاده می‌کند که عامل اصلی در کارهای چت و agent است. افزودن توکن‌های ورودی، هر دو طرف را تغییر می‌دهد. در سمت API، این یک ردیف جداگانه و ارزان‌تر در صورت‌حساب است. روی کارت شخصی شما، prefill زمان GPU را مصرف می‌کند، بنابراین هزینه آن از قبل در مجموع توکن‌های بر ثانیه‌ای که اندازه‌گیری کرده‌اید لحاظ شده است. با طول promptهای واقعی خود اندازه‌گیری کنید تا دو طرف قابل مقایسه باقی بمانند.

چگونه توکن بر ثانیه مورد نیاز برای فرمول را اندازه‌گیری کنم؟

مدل را به همان شکلی که استفاده خواهید کرد سرو کنید، سپس نرخ تولید کلی را تحت concurrency واقعی بخوانید. با Ollama، دستور ollama run <model> --verbose یک eval rate بر حسب توکن بر ثانیه چاپ می‌کند، اما این یک جریان تکی است و ظرفیت یک سرور دسته‌ای (batched) را کمتر از واقعیت نشان می‌دهد. با vLLM، سرور در حال اجرا هنگام پردازش درخواست‌ها، Avg generation throughput را در لاگ‌ها ثبت می‌کند و این همان عددی است که باید استفاده کنید. همزمان nvidia-smi را نیز مانیتور کنید. اگر میزان استفاده از GPU در حین تولید نزدیک به 100 درصد نیست، هنوز به سقف توانایی آن نرسیده‌اید.

آیا اجاره GPU VPS با استفاده کمتر از 10 درصد ارزش دارد؟

از نظر قیمت، خیر. در چرخه کاری 10 درصد، شما 3.47 دلار به ازای هر میلیون توکن خروجی می‌پردازید و در چرخه 2 درصد، این هزینه 17.36 دلار است. هر دو مقدار بالاتر از تمام APIهای مبتنی بر مصرف در این مقایسه (به جز رده پیشرو) هستند. تنها زمانی زیر این خط اجاره کنید که هدف شما از پرداخت هزینه، حفظ حریم خصوصی یا دسترسی به مدلی باشد که هیچ API آن را ارائه نمی‌دهد.