Perbedaan Agen AI, LLM, dan Asisten AI
Pahami perbedaan agen AI, LLM, dan asisten AI: LLM memerlukan RAM, asisten menambah antarmuka chat, sedangkan agen memakai tool, loop, dan kredensial.
Apa perbedaan antara agen AI, LLM, dan asisten AI?
Agen AI, LLM, dan asisten AI merupakan tiga lapisan dalam satu stack. Cara membedakannya adalah dengan melihat kebutuhan masing-masing terhadap server. LLM (large language model) adalah file berisi bobot model yang memerlukan RAM dan komputasi. Asisten adalah model tersebut yang dibungkus dalam antarmuka chat, dengan akun dan riwayat tersimpan, dan hampir selalu berjalan pada perangkat keras milik pihak lain. Agen adalah asisten yang juga memiliki tool dan loop, serta menyimpan kredensial. Karena itu, agen harus berjalan pada mesin yang selalu aktif.
Sebagian besar tulisan tentang topik ini berhenti pada definisi. Definisi tersebut penting karena setiap lapisan memiliki biaya yang berbeda. Lapisan pertama memerlukan RAM. Lapisan berikutnya memerlukan URL publik dan TLS (transport layer security). Lapisan terakhir memerlukan kredensial. Setiap kredensial yang telah digunakan agen harus Anda rotasi.
LLM adalah bobot, dan bobot memerlukan RAM
LLM adalah file yang berisi angka. Anda mengunduhnya, runtime memuatnya ke memori, lalu LLM menjawab satu permintaan setiap kali. Kontraknya terbatas: teks masuk dan teks keluar. Model tidak memiliki memori antarpanggilan, jam, akses jaringan, atau kemampuan untuk membuka file. Semua hal yang tampak seperti diingat oleh LLM sebenarnya ditempelkan ke konteksnya oleh program yang memanggilnya.
Angka yang menentukan paket VPS Anda adalah ukuran file tersebut karena seluruh file berada di memori selama model berjalan. Pada kuantisasi 4-bit yang secara default dirilis oleh Ollama, perkirakan sekitar 0.6 GB untuk setiap satu miliar parameter, lalu tambahkan satu atau dua gigabyte untuk context window dan runtime itu sendiri.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]Build qwen3:8b berukuran 5.2 GB di disk dan memerlukan sekitar 8 GB RAM agar dapat berjalan tanpa swapping. VPS 4 GB tidak dapat memuat qwen3:14b, yang berukuran 9.3 GB bahkan sebelum Anda mengetik satu kata. Baris terbesar di sini, qwen3:32b, memerlukan sekitar 24 GB, yang pada sebagian besar daftar harga berarti paket berbeda dengan tagihan bulanan berbeda.
Muat ke memori adalah satu hal. Kecepatan adalah hal lain. Pada VPS yang hanya menggunakan CPU, bottleneck-nya adalah bandwidth memori, bukan kecepatan clock. Karena itu, model yang muat di memori tetap dapat menjawab hanya beberapa token per detik. Hal ini cukup untuk pekerjaan yang berjalan semalaman, tetapi tidak nyaman untuk chat. GPU meningkatkan angka tersebut kira-kira satu orde magnitudo dan juga meningkatkan tagihan Anda. Karena itu, buat keputusan berdasarkan pengukuran: benchmark VPS dengan beban kerja yang ingin Anda jalankan dan baca kapan VPS GPU sebanding dengan harganya. Untuk mulai menjalankan bobot, buka Ollama pada VPS Anda sendiri.
Asisten adalah LLM ditambah antarmuka chat
Asisten adalah lapisan produk di sekitar model. ChatGPT dan Claude adalah asisten: model, jendela chat, akun, percakapan tersimpan, dan pembatasan laju. Hampir tidak ada bagian tersebut yang berjalan pada hardware yang Anda kendalikan. Karena itu, asisten hosted memerlukan biaya langganan dan RAM sebesar 0.
Versi self-hosted adalah front end seperti Open WebUI yang diarahkan ke Ollama lokal atau API hosted. Front end ini merupakan software kecil. Siapkan sekitar 1 GB resident untuk antarmuka chat, di luar kebutuhan model. Namun, front end memerlukan URL publik dan sertifikat, sedangkan bare model tidak. Tujuannya agar Anda dapat mengaksesnya dari ponsel: terbitkan sertifikat dengan Certbot dan Nginx, atau lakukan terminasi TLS pada Traefik di depan beberapa aplikasi. Jika Anda masih memilih front end, bandingkan alternatif Open WebUI.
Asisten memberikan jawaban. Asisten tidak melakukan tindakan. Saat asisten menulis perintah shell, seseorang membaca perintah tersebut dan memutuskan apakah akan menempelkannya. Orang tersebut merupakan lapisan keamanan. Agent adalah komponen yang menghilangkan lapisan tersebut.
Agen menambahkan alat dan loop
Agen adalah asisten yang dapat memanggil fungsi, lalu membaca hasilnya. Ada dua bagian yang menjalankan proses ini. Bagian pertama adalah tool: deskripsi fungsi yang dapat diminta model, beserta kode Anda yang benar-benar menjalankannya. Bagian kedua adalah loop: program Anda memanggil model, model meminta tool, program Anda menjalankan tool tersebut, menambahkan output ke percakapan, lalu memanggil model lagi. Proses ini berulang sampai model menyatakan bahwa tugasnya selesai atau batas yang ditetapkan menghentikannya.
Loop tersebut hanyalah kode biasa, dan loop dasar dapat dibuat dalam kurang dari seratus baris. Hal yang menjadikannya agen adalah tool tersebut memiliki kredensial nyata, sehingga loop dapat mengubah sesuatu di luar dirinya. Fakta ini menjadi dasar setiap keputusan hosting di bawah ini. Keterampilan agen dan server MCP (model context protocol) adalah dua cara untuk memberikan lebih banyak tool kepada agen tanpa menulis ulang loop.
- Agen tetap berjalan setelah sesi Anda berakhir. Chat berakhir ketika Anda menutup tab. Proses agen dapat berlangsung selama dua puluh menit dan harus tetap berjalan ketika laptop Anda masuk mode tidur. Karena itu, agen harus dijalankan pada server yang selalu aktif, melalui service atau timer systemd yang menjalankannya kembali setelah reboot.
- Agen menyimpan secret. Contohnya API key, SSH key, dan password database. Apa pun yang dapat dibaca agen dapat dipaksa untuk digunakan oleh instruksi berbahaya yang disembunyikan di dalam inputnya. Karena itu, jauhkan secret dari jangkauan agen.
- Biaya agen bertambah berdasarkan loop, bukan berdasarkan pertanyaan Anda. Pada setiap langkah, seluruh percakapan dikirim ulang sebagai input. Karena itu, proses sepuluh langkah membayar transkrip tersebut sepuluh kali. Inilah alasan token input mendominasi biaya agen dan alasan Anda perlu menetapkan batas keras pada biaya setiap proses.
- Agen dapat melakukan kesalahan yang mengubah data. Jawaban yang salah dalam chat hanya membuat Anda perlu membacanya kembali. Perintah delete yang salah di dalam loop dapat menghapus direktori Anda. Jalankan agen sebagai user dengan hak akses paling rendah yang tetap memungkinkan agen bekerja, dan untuk coding agent, jalankan agen di sandbox sebelum memberinya akses ke repository Anda.
Kebutuhan setiap lapisan terhadap server
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]Baca kolom RAM dengan teliti karena kolom tersebut tidak mencakup model. Front end chat dan runtime agent sama-sama merupakan program kecil. Jika agent memanggil model yang di-host, 2 GB RAM sudah cukup untuk menjalankannya, dan paket murah merupakan pilihan yang layak, bukan sekadar kompromi. Jika bobot model ditempatkan pada server yang sama, baris model 8 GB akan mendominasi kebutuhan lainnya.
Kolom-kolom lain lebih penting daripada yang diperkirakan banyak orang. Hanya lapisan model yang menjadi lebih cepat dengan GPU. Hanya lapisan assistant yang pada umumnya memerlukan URL publik karena browser harus mengaksesnya; agent hanya memerlukannya jika sesuatu dari luar harus memanggilnya, misalnya melalui webhook. Agent juga menyimpan several kredensial. Inilah perbedaan utama antara agent dan jendela chat. Jendela chat dapat memberikan jawaban yang salah. Agent dapat memberikan jawaban yang salah lalu bertindak berdasarkan jawaban tersebut.
Apakah Anda memerlukan GPU untuk menjalankan agen AI?
Tidak, kecuali Anda juga meng-host bobot model pada mesin yang sama. Loop agen terdiri atas permintaan HTTP, penguraian JSON, dan pemanggilan subprocess. CPU hampir tidak digunakan saat agen menunggu jaringan. Pertanyaan tentang GPU sebenarnya adalah pertanyaan tentang lapisan LLM.
Karena itu, pisahkan keputusan tersebut. Jika teks tidak boleh meninggalkan mesin Anda, siapkan biaya untuk memori yang dapat menampung model dan, agar kecepatannya memadai, GPU untuk menjalankannya. Jika Anda hanya menginginkan otomatisasi, gunakan model dengan biaya berdasarkan token dan alokasikan dana untuk uptime serta backup. Sebagian besar agen yang di-self-host pada 2026 memanggil model yang di-host, sehingga biaya operasionalnya lebih rendah.
Bisakah Anda meng-host sendiri agen AI?
Ya. Agen adalah komponen yang paling layak di-host sendiri karena loop tersebut menyimpan data dan kredensial Anda. VPS kecil dengan RAM 2 GB, service manager, dan akses jaringan keluar dapat menjalankan agen sungguhan. Pilih cara membangun sendiri di VPS jika Anda ingin mengendalikan loop tersebut, atau deploy salah satu agen self-hosted yang siap digunakan jika Anda ingin memulai dari sesuatu yang sudah selesai.
Meng-host sendiri assistant itu mudah: cukup satu container dan satu sertifikat. Meng-host sendiri model adalah bagian yang mahal. Banyak orang berhenti setelah melihat token diproses sangat lambat oleh CPU. Host sendiri weight model jika data tidak boleh keluar dari server, atau jika volume penggunaan membuat biaya per token terlalu tinggi. Jika tidak, biarkan agen memanggil API dan pertahankan bagian yang penting tetap berjalan secara lokal.
Apakah ChatGPT merupakan agen AI?
Produk chat menjadi agen saat dapat memanggil tool dan bertindak berdasarkan hasilnya tanpa meminta persetujuan Anda terlebih dahulu. Berdasarkan pengujian tersebut, asisten yang di-hosting dan memiliki kemampuan browsing, eksekusi kode, atau konektor merupakan agen. Perbedaannya bagi Anda terletak pada lokasi loop tersebut berjalan dan kredensial siapa yang digunakannya. Pada produk yang di-hosting, keduanya berada di pihak vendor. Pada server milik Anda sendiri, keduanya berada di bawah kendali Anda, begitu pula tanggung jawab atas apa pun yang dilakukan loop tersebut pada pukul tiga pagi.
Reaktif, perencanaan, dan multi-agen
Daftar ringkasan sering mencantumkan tujuh jenis agen. Sebagian besar kategori tersebut hanya untuk pemasaran. Dua perbedaan memengaruhi kode yang Anda tulis, dan satu perbedaan memengaruhi biaya. Agen reaktif memanggil tool, membaca hasilnya, lalu memberikan respons. Agen perencanaan menulis rencana terlebih dahulu, lalu menjalankannya. Pendekatan ini lebih andal untuk pekerjaan yang panjang, tetapi membutuhkan lebih banyak token karena rencana dikirim ulang pada setiap langkah. Penyiapan multi-agen memungkinkan satu agen memulai agen lain. Pendekatan ini sekaligus meningkatkan penggunaan token dan jumlah kemungkinan kegagalan. Karena itu, pendekatan ini hanya bermanfaat jika subpekerjaannya benar-benar independen, misalnya mencari empat sumber secara bersamaan. Mulailah dengan agen reaktif. Tambahkan perencanaan ketika proses mulai berlangsung lama. Gunakan multi-agen sebagai pilihan terakhir. Untuk gambaran yang lebih luas, lihat hal yang layak dipelajari tentang agen AI pada 2026.
Cara mengetahui lapisan yang sebenarnya Anda jalankan
Di server, periksa proses yang menggunakan memori.
free -h
ps -eo rss,comm --sort=-rss | head -5Jika baris teratas adalah ollama atau llama-server yang menggunakan beberapa gigabyte RSS (resident set size, yaitu memori yang benar-benar ditempati proses), berarti Anda meng-host model tersebut. Jika tidak ada proses yang menggunakan lebih dari beberapa ratus megabyte dan tagihan API Anda terus meningkat, berarti Anda meng-host agen atau asisten dan menyewa modelnya. Jika daftar tersebut kosong karena semua proses berlangsung di tab browser, berarti Anda adalah pengguna asisten. Itu merupakan pilihan yang wajar sampai Anda memerlukan perangkat lunak yang bertindak atas nama Anda.
Mana yang ingin Anda jalankan?
- Untuk menjaga privasi teks, jalankan model dengan self-host LLM menggunakan Ollama, lalu bandingkan runtime melalui Ollama dengan vLLM setelah satu pengguna berkembang menjadi sepuluh.
- Untuk mengendalikan seluruh alur dan alatnya, bangun agennya: bangun agen AI Anda sendiri di VPS.
- Untuk mendapatkan sesuatu yang sudah berfungsi malam ini, deploy salah satu dari agen self-hosted yang layak dijalankan.
- Jika belum ada server yang mendasari semua ini, mulai dari apa yang sebenarnya diberikan VPS kepada Anda.
FAQ
Apakah agen AI hanya LLM dengan langkah tambahan?
Langkah tambahan itulah produknya. LLM mengubah teks menjadi teks dan tidak melakukan hal lain. Agen mengelilinginya dengan alat yang dapat dipanggil serta loop yang terus memanggil alat tersebut. Alat-alat itu membawa kredensial, sehingga output dapat mengubah file, database, atau service yang sedang berjalan. Karena itu, agen memerlukan mesin yang selalu aktif, service manager, dan kebijakan secrets. LLM hanya memerlukan memori yang cukup untuk memuat weight-nya saat memberikan jawaban.
Apakah saya memerlukan GPU untuk menjalankan agen AI?
Tidak untuk agennya. Loop tersebut menjalankan HTTP request, menangani JSON, dan memanggil subprocess. Semua tugas itu dapat dikelola CPU sambil menunggu jaringan. GPU hanya diperlukan jika Anda meng-host weight model sendiri dan ingin menghasilkan lebih dari beberapa token per detik. Agen yang memanggil model hosted dapat berjalan dengan baik pada VPS kecil tanpa GPU.
Berapa banyak RAM yang diperlukan VPS untuk agen AI?
Sekitar 2 GB jika agen memanggil model hosted, karena runtime, dependensi, dan database lokal kecil adalah semua yang perlu dimuatnya. Tambahkan model jika Anda meng-host weight-nya: qwen3:8b saja memerlukan sekitar 8 GB. Karena itu, server all-in-one dimulai dari kapasitas tersebut dan meningkat sesuai model yang Anda pilih.
Apakah saya dapat meng-host asisten AI sendiri dan menjaga percakapan tetap privat?
Ya, dengan satu pengecualian yang menentukan semuanya. Front end self-hosted seperti Open WebUI menyimpan akun dan riwayat di server Anda. Percakapan hanya tetap privat jika model di belakangnya juga berjalan secara lokal. Jika front end yang sama diarahkan ke hosted API, teks tetap meninggalkan server Anda pada setiap pesan. Dengan demikian, Anda mempertahankan riwayat, tetapi bukan privasinya.
Apa perbedaan antara agen AI dan chatbot?
Chatbot memberikan respons lalu berhenti. Agen menentukan tindakan berikutnya, memanggil alat, membaca hasilnya, lalu menentukan tindakan lagi sampai tugas selesai atau batas menghentikannya. Uji praktisnya adalah sebagai berikut: jika software dapat mengubah sesuatu tanpa manusia menekan tombol di antara jawaban dan tindakan, software tersebut adalah agen. Agen itu memerlukan hosting dan guardrail yang menyertainya.