SSD Nodes Learn 🎉 VPS mulai $5.50/bln
Panduan Matt ConnorOleh Matt Connor · Diperbarui 2026-08-13

Menjalankan Qwen 27B di VPS dengan Ollama

Qwen 3.8 belum tersedia di Ollama. Hitung kebutuhan RAM untuk tag 27B yang ada, termasuk batas VPS CPU-only dan kapasitas 8 hingga 64 GB.

Bisakah Qwen 3.8 27B dijalankan pada VPS tanpa GPU?

Untuk menjalankan Qwen 3.8 27B pada VPS, Anda harus memiliki tag model yang benar-benar tersedia. Per 4 Agustus 2026, pustaka Ollama sama sekali tidak memiliki entri qwen3.8. Tag 27B terdekat yang telah dirilis adalah qwen3.6:27b: 27.8 miliar parameter, kuantisasi Q4_K_M, dan lisensi Apache 2.0. Semua perintah dan angka di bawah ini menggunakan tag tersebut pada Ollama v0.32.5, yang dirilis pada 27 Juli 2026.

Jawaban singkatnya: bisa pada VPS dengan RAM 32 GB atau lebih, tetapi berjalan lambat. Model dense 27B pada Q4 memerlukan sekitar 17 GB RAM hanya untuk bobot, sebelum satu token konteks pun disimpan. Karena itu, paket 8 GB dan 16 GB sama sekali tidak mencukupi. Pada VPS DDR4 dua kanal yang umum, batas kecepatannya sekitar 3 token per detik. Kecepatan ini lebih lambat daripada kecepatan baca kebanyakan orang.

Dari mana angka 3.8 berasal? Kemungkinan besar dari jumlah parameter. Halaman Ollama untuk qwen3.6:27b mencantumkan 27.8B parameter. Angka 27.8 mudah diingat kembali sebagai 3.8. Ada juga qwen3.5:27b, yaitu build Q4_K_M yang sama dari rilis sebelumnya. Periksa daftar terbaru sebelum menyalin perintah apa pun di halaman tag qwen3.6 Ollama. Jika qwen3.8 yang sebenarnya dirilis nanti, perhitungan di sini tetap berlaku karena bergantung pada jumlah parameter dan bit per bobot, bukan nomor versinya.

Tag Ollama yang akan di-pull dan cara memeriksanya

Pull tag yang tidak ada akan menghasilkan error yang jelas. Karena itu, Anda dapat segera menentukannya langsung pada server.

ollama pull qwen3.8:27b
# Error: pull model manifest: file does not exist

ollama pull qwen3.6:27b
ollama show qwen3.6:27b

ollama show menampilkan arsitektur, jumlah parameter, panjang konteks, dan kuantisasi untuk tag yang benar-benar Anda miliki. Jika baris parameter berisi 27.8B dan baris kuantisasi berisi Q4_K_M, berarti Anda menggunakan build yang menjadi acuan panduan ini. Library tersebut juga menyediakan qwen3.6:27b-q8_0 dan qwen3.6:27b-bf16 untuk bobot yang sama dengan presisi lebih tinggi, serta sejumlah tag 35b-a3b yang merupakan model MoE (mixture of experts) dan berperilaku sangat berbeda pada CPU. Penjelasan lebih lanjut tersedia di bawah.

Jumlah parameter dikalikan byte per bobot

ChartQwen3.6 27B weights in RAM, by quantisation
The data behind this chart
[
  {
    "label": "Q4_K_M",
    "size_gb": 17,
    "bits_per_weight": 4.89,
    "notes": "published tag qwen3.6:27b"
  },
  {
    "label": "Q5_K_M",
    "size_gb": 19.8,
    "bits_per_weight": 5.7,
    "notes": "computed, no library tag exists"
  },
  {
    "label": "NVFP4",
    "size_gb": 20,
    "bits_per_weight": 5.76,
    "notes": "published tag 27b-nvfp4"
  },
  {
    "label": "Q8_0",
    "size_gb": 30,
    "bits_per_weight": 8.63,
    "notes": "published tag 27b-q8_0"
  },
  {
    "label": "BF16",
    "size_gb": 56,
    "bits_per_weight": 16.1,
    "notes": "published tag 27b-bf16"
  }
]

Rumusnya terdiri dari satu baris. Byte bobot = parameter * bit per bobot / 8. Pada 4 bit penuh, 27.8 billion parameter akan berukuran 13.9 GB. Tag Q4_K_M yang dirilis berukuran 17 GB, yang berarti 4.89 bit per bobot dalam praktiknya.

Perbedaan tersebut bukan kesalahan. Format K-quant tidak menyimpan setiap tensor pada lebar nominalnya. Tensor yang paling banyak kehilangan kualitas saat dikompresi disimpan pada 5 atau 6 bit, sedangkan embedding token dan layer output biasanya dibiarkan pada Q6_K atau Q8_0. Nama format tersebut menunjukkan nilai rata-rata, dan nilainya mendekati 4.9. Efek yang sama juga terlihat pada ujung skala lainnya: 56 GB untuk BF16 berarti 16.1 bit per bobot, bukan 16 secara tetap, karena file tersebut juga memuat metadata dan tabel embedding dengan presisi penuh.

Q5_K_M tidak memiliki tag yang dipublikasikan untuk model ini, sehingga baris 19.8 GB dihitung berdasarkan 5.7 bit per bobot yang umum digunakan format tersebut, bukan berdasarkan pengukuran. Q8_0 hampir menggandakan ukuran Q4 menjadi 30 GB. Pada mesin yang hanya menggunakan CPU, penggandaan tersebut membutuhkan traffic memori dua kali lebih besar untuk setiap token, sehingga throughput juga turun kira-kira setengahnya. Karena alasan itu saja, Q4_K_M merupakan default yang tepat di sini.

Biaya cache KV saat konteks bertambah

Bobot model memiliki biaya tetap. Cache KV (cache key dan value, yaitu state attention yang disimpan model untuk setiap token yang telah dilihat) bertambah secara linear sesuai panjang konteks. Komponen inilah yang biasanya paling cepat menghabiskan RAM.

ChartKV cache size by context length, 27B dense model
The data behind this chart
[
  {
    "label": "4k tokens",
    "kv_f16_gb": 1,
    "kv_q8_gb": 0.5
  },
  {
    "label": "8k tokens",
    "kv_f16_gb": 2,
    "kv_q8_gb": 1
  },
  {
    "label": "16k tokens",
    "kv_f16_gb": 4,
    "kv_q8_gb": 2
  },
  {
    "label": "32k tokens",
    "kv_f16_gb": 8,
    "kv_q8_gb": 4
  },
  {
    "label": "64k tokens",
    "kv_f16_gb": 16,
    "kv_q8_gb": 8
  },
  {
    "label": "128k tokens",
    "kv_f16_gb": 32,
    "kv_q8_gb": 16
  }
]

Angka tersebut menggunakan struktur yang dipakai Qwen pada model dense terbarunya dalam kelas ukuran ini: 64 layer, 8 head key/value dengan GQA (grouped-query attention), dan dimensi head 128. Dengan struktur tersebut, setiap token menggunakan 256 KiB pada f16. Jadi, penggunaannya mencapai 8 GB pada 32k token dan 32 GB pada 128k. Jangan mengandalkan perhitungan ini untuk mesin Anda. Muat model, lalu baca kolom SIZE pada ollama ps. Kolom tersebut melaporkan bobot, cache, dan overhead sebagai satu angka.

Inilah alasan konteks 256K pada kartu model lebih merupakan angka utama daripada rencana penggunaan. Mengisinya pada f16 memerlukan cache sebesar 64 GB, di luar bobot model, pada mesin yang telah menggunakan 17 GB untuk bobot. Secara default, Ollama tidak memberikan seluruh window kepada Anda. Ollama memuat window yang jauh lebih kecil, lalu Anda dapat menaikkannya secara sengaja dengan OLLAMA_CONTEXT_LENGTH. Naikkan nilainya secara bertahap dan periksa ollama ps setelah setiap perubahan.

Dua pengaturan dapat mengurangi cache hingga setengahnya atau lebih. OLLAMA_KV_CACHE_TYPE=q8_0 menyimpan cache pada 8 bit, bukan 16 bit, sehingga kebutuhan untuk 32k token turun dari 8 GB menjadi 4 GB. Pengaturan ini memerlukan flash attention. Karena itu, tetapkan OLLAMA_FLASH_ATTENTION=1 juga, lalu pastikan penurunan tersebut pada ollama ps, bukan dengan menganggap bahwa pengaturan telah diterapkan. OLLAMA_NUM_PARALLEL=1 sama pentingnya. Ollama dapat melayani beberapa permintaan secara bersamaan, dan setiap slot mendapatkan bagian konteksnya sendiri. Karena itu, membiarkan parallelism pada nilai default akan secara diam-diam menggandakan cache yang telah Anda anggarkan. Jika lebih dari satu orang akan menggunakan mesin ini, penggandaan tersebut menjadi sumber masalah. jumlah pengguna bersamaan yang dapat dilayani model self-hosted ditentukan oleh slot cache dan kedalaman antrean jauh sebelum ditentukan oleh jumlah core.

Kapasitas yang dapat ditampung oleh RAM 8, 16, 32, dan 64 GB

ChartUsable context by VPS RAM tier, f16 cache, headless Linux
The data behind this chart
[
  {
    "label": "8 GB",
    "q4_max_ctx_ktok": 0,
    "q8_max_ctx_ktok": 0,
    "notes": "Weights alone exceed the box. Use a 4b or 8b model."
  },
  {
    "label": "16 GB",
    "q4_max_ctx_ktok": 0,
    "q8_max_ctx_ktok": 0,
    "notes": "17 GB of weights does not fit in 16 GB of RAM."
  },
  {
    "label": "32 GB",
    "q4_max_ctx_ktok": 32,
    "q8_max_ctx_ktok": 0,
    "notes": "Q4 fits with room to spare. Q8 weights do not fit."
  },
  {
    "label": "64 GB",
    "q4_max_ctx_ktok": 128,
    "q8_max_ctx_ktok": 64,
    "notes": "Both fit. Q8 leaves much less room for context."
  }
]

Baca kedua angka tersebut sebagai ribuan token konteks yang dapat ditampung bersama bobot, dengan cache f16, pada VPS Linux tanpa antarmuka grafis yang menyisakan sekitar 1.5 GB untuk sistem operasi serta sedikit ruang tambahan. Angka nol berarti bobotnya sendiri tidak muat, sehingga tidak ada konteks yang dapat ditampung.

RAM 8 GB dan 16 GB bukan kasus yang nyaris cukup. Bobot sebesar 17 GB tidak muat dalam RAM 16 GB, dan tidak ada pengaturan konteks yang dapat mengubahnya. Menambahkan swap juga tidak menyelesaikan masalah ini. Ollama memetakan file GGUF ke memori, sehingga ketika halaman yang berada di RAM melebihi kapasitas RAM, kernel mulai mengeluarkan dan membaca ulang halaman tersebut. Akibatnya, setiap token harus membaca data berukuran gigabita dari disk. Server akan berada pada tingkat iowait yang tinggi dan menghasilkan jauh di bawah satu token per detik.

RAM 32 GB adalah titik awal yang layak. Bobot menggunakan 17 GB, sehingga tersisa sekitar 13 GB. Kapasitas ini mencukupi sekitar 32k token konteks f16 dengan sedikit ruang cadangan. Bobot Q8_0 berukuran 30 GB sama sekali tidak muat pada tingkat ini.

RAM 64 GB memberikan ruang yang nyaman. Q4 menyisakan ruang untuk sekitar 128k token konteks, sedangkan bobot Q8_0 dapat digunakan dengan sekitar 64k token konteks yang tersisa. Sebelum membayar RAM 64 GB untuk menggunakan Q8, pahami dengan jelas manfaat yang Anda dapatkan: output sedikit lebih baik dengan kecepatan setengahnya, pada mesin yang sejak awal sudah lambat. Bagi hampir semua pengguna, Q4 dengan konteks yang lebih panjang merupakan kompromi yang lebih baik.

Seberapa cepat inferensi CPU pada VPS?

Membuat satu token dari model dense berarti membaca setiap bobot dari memori satu kali. Bukan hanya sebagian. Semuanya. Jadi, batas kecepatannya bukan jumlah core, melainkan bandwidth memori dibagi ukuran bobot. Pada Q4, jumlah trafik memori tersebut adalah 17 GB per token.

ChartTheoretical token ceiling from memory bandwidth, 17 GB of weights
The data behind this chart
[
  {
    "label": "DDR4-2666, 2 channel",
    "mem_bandwidth_gb_s": 42.6,
    "ceiling_tok_s": 2.5
  },
  {
    "label": "DDR4-3200, 2 channel",
    "mem_bandwidth_gb_s": 51.2,
    "ceiling_tok_s": 3
  },
  {
    "label": "DDR5-4800, 2 channel",
    "mem_bandwidth_gb_s": 76.8,
    "ceiling_tok_s": 4.5
  },
  {
    "label": "DDR4-3200, 8 channel",
    "mem_bandwidth_gb_s": 204.8,
    "ceiling_tok_s": 12
  },
  {
    "label": "DDR5-4800, 12 channel",
    "mem_bandwidth_gb_s": 460.8,
    "ceiling_tok_s": 27.1
  }
]

Angka tersebut adalah batas maksimum, bukan hasil pengukuran. Output aktual biasanya sekitar 50 hingga 70 persen dari angka yang ditampilkan, karena latensi memori dan prefetching yang tidak sempurna membuat Anda tidak pernah mencapai puncak teoretis. VPS DDR4-3200 dua kanal memiliki batas maksimum 3 token per detik, jadi perkirakan sekitar 2. Server DDR5-4800 dua kanal memiliki batas maksimum 4.5, jadi perkirakan sekitar 3.

Baris server besar perlu diperhatikan. Platform EPYC dua belas kanal memiliki bandwidth 460.8 GB/detik dan batas maksimum 27.1 token per detik, tetapi Anda tidak menyewa seluruh sistem EPYC. Bandwidth memori adalah sumber daya seluruh host yang digunakan bersama oleh setiap tenant pada mesin tersebut. Jadi, slice 8 vCPU tidak menyediakan bandwidth eksklusif dari dua belas kanal. Panduan yang berfokus pada GPU biasanya mengabaikan hal ini. Inilah alasan dua paket VPS dengan jumlah vCPU identik dapat berbeda hingga tiga kali lipat saat menjalankan model yang sama.

Menambah vCPU juga berhenti membantu sejak awal karena alasan yang sama. Setelah core meminta data lebih cepat daripada yang dapat disediakan memory controller, thread tambahan hanya menambah overhead penjadwalan. Tidak ada manfaat lain. Atur OLLAMA_NUM_THREAD ke jumlah core fisik Anda, lakukan pengukuran, lalu coba setengah dari jumlah tersebut. Pada banyak paket bersama, nilai yang lebih rendah justru lebih cepat.

Pemrosesan prompt bekerja secara berbeda. Prefill, yaitu proses melewati input Anda sebelum token pertama muncul, lebih dibatasi oleh kemampuan komputasi daripada bandwidth. Karena itu, kinerjanya meningkat seiring jumlah core. Dampak praktisnya adalah jeda panjang sebelum output dimulai pada prompt besar, kemudian laju stabil yang lambat seperti di atas. Ukur kedua bagian tersebut secara terpisah dengan --verbose. Perintah ini mencetak prompt eval rate dan eval rate untuk setiap permintaan.

Jika dense 27B terlalu lambat, periksa tag qwen3.6:35b-a3b sebelum menyerah pada CPU. Tag tersebut mengaktifkan sekitar 3 miliar parameter per token, bukan seluruh 27.8 miliar parameter. Akibatnya, trafik memori per token berkurang hampir satu orde magnitudo, meskipun ukuran file di disk lebih besar. Anda menukar kebutuhan RAM dengan kecepatan. Pilihan runtime juga penting di sini. Ollama dan llama.cpp menyediakan kontrol tuning CPU yang berbeda untuk kode inferensi dasar yang sama.

Kapan sebaiknya menyewa GPU per jam

ChartGPU memory bandwidth and token ceiling on the same 17 GB of weights
The data behind this chart
[
  {
    "label": "L40S, 48 GB",
    "mem_bandwidth_gb_s": 864,
    "ceiling_tok_s": 51
  },
  {
    "label": "RTX 4090, 24 GB",
    "mem_bandwidth_gb_s": 1008,
    "ceiling_tok_s": 59
  },
  {
    "label": "A100, 80 GB",
    "mem_bandwidth_gb_s": 2039,
    "ceiling_tok_s": 120
  },
  {
    "label": "H100 SXM, 80 GB",
    "mem_bandwidth_gb_s": 3350,
    "ceiling_tok_s": 197
  }
]

Rumus yang sama jika diterapkan pada bandwidth memori GPU yang dipublikasikan menghasilkan jawaban dalam kategori yang berbeda. Kartu konsumen 24 GB memiliki batas atas 59 token per detik pada bobot ini. Kartu pusat data saat ini mencapai 197. Selisih ini tidak dapat diatasi dengan menyesuaikan jumlah thread. Kartu tersebut menjalankan memorinya pada 1008 GB/s, sedangkan VPS Anda hanya mencapai puluhan GB/s.

Karena itu, tentukan batas berdasarkan beban kerja, bukan preferensi. Inferensi CPU adalah pilihan yang tepat ketika pekerjaan berjalan secara asinkron dan tidak ada orang yang menunggu hasilnya: membuat ringkasan kumpulan dokumen pada malam hari, atau menjalankan tugas klasifikasi setiap malam saat Anda tidur. Sewa GPU segera setelah seseorang menunggu output, atau ketika permintaan datang lebih cepat daripada satu permintaan setiap 30 detik, karena server yang hanya menggunakan CPU tidak memiliki kapasitas batching dan antrean akan terus bertambah.

Perbandingan biaya tidak sesederhana yang terlihat. VPS 64 GB ditagih setiap jam sepanjang bulan, terlepas dari apakah model sedang dimuat atau tidak, sedangkan instance GPU hanya ditagih selama Anda menjalankannya. Jika penggunaan sebenarnya adalah dua jam per hari, GPU sewaan dapat lebih cepat sekaligus lebih murah. Hitung duty cycle terlebih dahulu, lalu bandingkan harganya. Memilih VPS dengan GPU membahas hal-hal yang perlu diperiksa pada instance itu sendiri, sedangkan vLLM lebih unggul daripada Ollama setelah Anda melayani permintaan bersamaan pada GPU karena vLLM melakukan batching dengan benar.

Ada opsi ketiga yang sering dilupakan. Pertahankan model 27B pada CPU untuk pekerjaan batch, lalu gunakan model API yang di-host di depan jalur interaktif. Tidak ada keharusan bagi satu model untuk melayani keduanya.

Instal Ollama dan ukur kemampuan mesin Anda

Skrip instalasi ini adalah skrip resmi dan menyiapkan service systemd yang berjalan sebagai user khusus ollama.

curl -fsSL https://ollama.com/install.sh | sh
ollama --version
free -g

ollama --version seharusnya menampilkan 0.32.5 atau yang lebih baru. Periksa free -g sebelum menarik apa pun. Jika kolom total pada baris Mem menunjukkan angka di bawah 32, hentikan proses ini dan pilih model yang lebih kecil. Menarik model berukuran 17 GB yang tidak dapat Anda jalankan hanya membuang waktu satu jam dan banyak ruang disk.

Atur opsi runtime dalam systemd override, bukan di shell Anda. Model berjalan di dalam service sehingga tidak pernah melihat environment interaktif Anda.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_CONTEXT_LENGTH=8192"
Environment="OLLAMA_NUM_PARALLEL=1"
Environment="OLLAMA_MAX_LOADED_MODELS=1"
Environment="OLLAMA_FLASH_ATTENTION=1"
Environment="OLLAMA_KV_CACHE_TYPE=q8_0"
Environment="OLLAMA_KEEP_ALIVE=60m"
sudo systemctl restart ollama
ollama pull qwen3.6:27b
ollama run qwen3.6:27b --verbose "Name two Linux distributions."

Output --verbose adalah hasil pengukuran yang Anda perlukan. eval rate adalah jumlah token per detik selama proses generasi. prompt eval rate adalah kecepatan prefill. load duration adalah waktu yang diperlukan untuk membaca weights dari disk. Karena itu, OLLAMA_KEEP_ALIVE=60m diatur: pada CPU, memuat ulang 17 GB dari disk pada setiap permintaan memerlukan waktu lebih lama daripada memproses permintaan itu sendiri.

Saat model masih dimuat, periksa penggunaan resource dari terminal kedua.

ollama ps

Kolom SIZE menunjukkan penggunaan memori sebenarnya, termasuk KV cache. Nilainya seharusnya mendekati ukuran weights ditambah baris untuk panjang context Anda pada tabel KV. Pada 8192 token dengan cache 8-bit, perkirakan tambahan sekitar satu gigabyte di atas ukuran weights, dibandingkan 2 GB jika cache tetap menggunakan f16. Kolom PROCESSOR seharusnya menampilkan 100% CPU. Jika menampilkan nilai lain, berarti ada sesuatu yang telah menggunakan GPU dan angka kecepatan dalam panduan ini tidak menggambarkan mesin Anda.

Mode kegagalan dan string persis yang akan Anda lihat

Model menolak dimuat. Ollama mencetak baris yang menyebutkan kedua angka dalam format model requires more system memory (18.6 GiB) than is available (15.2 GiB). Ini adalah kegagalan yang baik karena Ollama melakukan pemeriksaan sebelum mengalokasikan memori, bukan membiarkan kernel menanganinya. Kurangi panjang konteks, gunakan tag yang lebih kecil, atau beralih ke paket yang lebih besar.

Proses menghilang di tengah jawaban. Klien tidak menampilkan informasi yang berguna, dan journalctl -u ollama -n 50 menunjukkan bahwa service dimulai ulang. Jalankan dmesg -T | tail. Baris yang berbunyi Out of memory: Killed process ... (ollama) berarti kernel OOM killer menghentikan proses tersebut. Ini terjadi ketika pemeriksaan sebelum pemuatan berhasil, tetapi cache melampaui estimasi selama percakapan yang panjang. Kurangi panjang konteks.

Pull langsung gagal. Error: pull model manifest: file does not exist berarti tag tersebut tidak ada di library. Mengetik qwen3.8:27b menghasilkan pesan ini persis, begitu juga kesalahan pengetikan apa pun pada nomor versi. Pastikan tag tersebut pada halaman library sebelum menyalahkan jaringan Anda.

Semuanya berfungsi, tetapi sangat lambat. Kecepatan di bawah satu token per detik pada mesin dengan RAM yang cukup menunjukkan paging, bukan masalah komputasi. Jalankan vmstat 1 selama proses pembuatan output. Kolom si atau so yang bernilai nonzero berarti kernel sedang melakukan swapping. Solusinya adalah mengurangi panjang konteks atau jumlah model yang dimuat. Nilai wa yang terus tinggi tanpa aktivitas swap berarti bobot memory-mapped sedang dibaca ulang dari disk. Ini berarti bobot tersebut sebenarnya tidak muat di memori.

Token pertama memerlukan 30 detik, lalu output menjadi lebih cepat. Itu adalah prefill dan merupakan hal yang normal. System prompt yang panjang harus diproses ulang pada setiap request yang tidak menggunakan cache. Karena itu, pendekkan system prompt sebelum menyesuaikan hal lain.

Kegunaan sebenarnya 27B yang hanya berjalan pada CPU

Tetapkan ekspektasi berdasarkan angka, bukan harapan. Pada kecepatan dua hingga empat token per detik, jawaban sepanjang 500 token memerlukan waktu antara dua hingga empat menit. Kecepatan ini tidak dapat digunakan untuk chat, tetapi sepenuhnya memadai untuk antrean tugas. Perangkumkan dokumen, pemberian tag secara massal, ekstraksi bidang dari kumpulan file, dan peninjauan kode tanpa pengawasan masih dapat menggunakan kecepatan tersebut karena tidak ada pengguna yang menunggu respons. Bantuan pemrograman berada tepat di batas ini. Karena itu, mengarahkan agen pemrograman ke model yang Anda host bermanfaat untuk tugas latar belakang seperti pesan commit dan pembuatan kerangka pengujian, bukan untuk saran inline yang harus Anda tunggu.

Alasan privasi adalah alasan yang sebenarnya. Model berjalan pada hardware yang Anda sewa dan kendalikan, tidak ada request yang meninggalkan server, dan tidak ada biaya per token. Hal ini sangat bernilai untuk data yang diatur oleh regulasi, bahkan pada kecepatan tiga token per detik. Bandingkan secara realistis dengan alternatifnya: self-hosting model berskala frontier memerlukan hardware sepuluh kali lebih banyak, sedangkan model 27B pada CPU adalah titik termurah pada kurva tersebut yang output-nya masih layak dibaca.

Jika ini adalah instalasi Ollama pertama Anda, panduan lengkap untuk menjalankan Ollama pada VPS menjelaskan penyiapan service, HTTP API, dan aturan firewall yang diasumsikan sudah tersedia dalam panduan ini. Jangan mengekspos port 11434 ke Internet. Ollama tidak menyediakan autentikasi bawaan, sehingga apa pun yang dapat mengakses port tersebut dapat menggunakan model Anda dan membaca prompt Anda.

FAQ

Apakah ada model Qwen 3.8 27B di Ollama?

Tidak. Per 4 August 2026, library Ollama tidak memiliki namespace qwen3.8. Tag 27B yang tersedia adalah qwen3.5:27b dan qwen3.6:27b. Keduanya merupakan build Q4_K_M dari model dense dengan 27.8 miliar parameter. Angka 3.8 dalam istilah pencarian hampir pasti merupakan jumlah parameter 27.8B yang diingat sebagai nomor versi. Periksa https://ollama.com/library/qwen3.6/tags untuk melihat daftar terbaru, dan jalankan pull qwen3.6:27b jika Anda menginginkan rilis 27B terbaru. Tag yang tidak tersedia akan gagal dengan Error: pull model manifest: file does not exist.

Berapa RAM yang diperlukan untuk menjalankan model Qwen 27B pada VPS?

32 GB adalah batas minimum yang praktis untuk Q4_K_M. Bobot model berukuran 17 GB. Sistem operasi memerlukan sekitar 1.5 GB. KV cache menambahkan sekitar 1 GB untuk setiap 4000 token konteks pada f16. Paket 16 GB sama sekali tidak dapat menampung bobot model. Swap juga tidak membantu karena file dipetakan ke memori, lalu kernel membacanya kembali dari disk pada setiap token. 64 GB menyediakan ruang untuk konteks yang panjang atau bobot Q8_0 berukuran 30 GB.

Berapa token per detik yang dapat dihasilkan model 27B pada CPU?

Bagi bandwidth memori dengan ukuran bobot, lalu ambil 50 hingga 70 persen dari hasilnya. VPS dengan DDR4-3200 dua kanal memiliki batas sekitar 3 token per detik dan menghasilkan sekitar 2 token per detik. Server dengan DDR5-4800 dua kanal memiliki batas sekitar 4.5 dan menghasilkan sekitar 3 token per detik. Platform server dengan lebih banyak kanal terlihat jauh lebih baik di atas kertas. Namun, bandwidth memori digunakan bersama oleh semua tenant pada host. Karena itu, ukur performa Anda sendiri dengan ollama run qwen3.6:27b --verbose dan baca baris eval rate.

Sebaiknya saya menggunakan Q4 atau Q8 pada VPS yang hanya menggunakan CPU?

Q4_K_M, hampir dalam semua kasus. Q8_0 berukuran 30 GB, sedangkan Q4_K_M berukuran 17 GB. Karena itu, Q8_0 memerlukan paket 64 GB dan memindahkan hampir dua kali lebih banyak data memori untuk setiap token. Akibatnya, kecepatan token per detik turun kira-kira setengahnya. Perbedaan kualitas antara Q4_K_M dan Q8_0 pada model 27B kecil untuk sebagian besar tugas. Gunakan RAM untuk konteks yang lebih panjang. Konteks yang lebih panjang mengubah kemampuan model, bukan hanya gaya perumusannya.

Kapan menyewa GPU lebih murah daripada menggunakan VPS dengan RAM besar?

Saat beban penggunaan rendah atau ada orang yang menunggu hasil. GPU dengan memori 24 GB menghasilkan sekitar 59 token per detik pada bobot ini, dibandingkan 2 atau 3 token per detik pada VPS biasa. GPU juga hanya dikenai biaya selama digunakan. VPS 64 GB dikenai biaya sepanjang bulan, baik model sedang dimuat maupun tidak. Hitung berapa jam per hari Anda benar-benar menghasilkan token. Jika kurang dari dua atau tiga jam, penyewaan GPU per jam biasanya lebih unggul dalam kecepatan dan biaya. Pemrosesan batch berprioritas rendah yang berjalan terus-menerus adalah kondisi ketika VPS always-on lebih menguntungkan.