Perbezaan Ejen AI, LLM dan Pembantu AI
Ketahui perbezaan teknikal antara LLM, pembantu AI dan ejen AI. Fahami mengapa LLM memerlukan RAM, pembantu memerlukan antara muka, dan ejen memerlukan pelayan yang sentiasa aktif.
Apakah perbezaan antara ejen AI, LLM dan pembantu AI?
Ejen AI, LLM dan pembantu AI merupakan tiga lapisan dalam satu tindanan (stack), dan cara untuk membezakannya adalah dengan bertanya apakah keperluan setiap satu daripada pelayan. LLM (large language model) ialah fail pemberat (weights) yang memerlukan RAM dan kuasa pengkomputeran. Pembantu ialah model tersebut yang dibalut dengan antara muka sembang, berserta akaun dan sejarah yang disimpan, yang hampir selalu berada pada perkakasan pihak lain. Ejen pula ialah pembantu yang turut mempunyai alatan dan gelung (loop), serta memegang kelayakan (credentials), yang menjadikannya perlu dijalankan pada mesin yang sentiasa hidup.
Kebanyakan penulisan mengenai soalan ini terhenti pada definisi sahaja. Definisi tersebut hanya penting kerana setiap lapisan mengenakan caj kepada anda dengan cara yang berbeza. Satu lapisan menelan kos RAM. Lapisan seterusnya menelan kos URL awam dan TLS (transport layer security). Lapisan terakhir menelan kos kelayakan, dan kelayakan yang telah digunakan oleh ejen ialah kelayakan yang kini perlu anda tukar (rotate).
LLM ialah pemberat, dan pemberat memerlukan RAM
LLM ialah fail yang mengandungi nombor. Anda memuat turunnya, runtime akan memuatkannya ke dalam memori, dan ia menjawab satu permintaan pada satu masa. Kontraknya terhad: teks dimasukkan, teks dikeluarkan. Model ini tidak mempunyai memori antara panggilan, tiada jam, tiada akses rangkaian dan tiada cara untuk membuka fail. Segala perkara yang kelihatan diingati oleh LLM telah ditampal ke dalam konteksnya oleh program yang memanggilnya.
Nombor yang menentukan pelan VPS anda ialah saiz fail tersebut, kerana keseluruhan fail berada dalam memori semasa model berjalan. Pada kuantisasi 4-bit yang dibekalkan oleh Ollama secara lalai, anggarkan kira-kira 0.6 GB bagi setiap bilion parameter, kemudian tambah satu atau dua gigabait untuk tetingkap konteks dan runtime itu sendiri.
The data behind this chart
[
{
"label": "qwen3:4b",
"download_gb": 2.5,
"ram_gb_needed": 6
},
{
"label": "qwen3:8b",
"download_gb": 5.2,
"ram_gb_needed": 8
},
{
"label": "qwen3:14b",
"download_gb": 9.3,
"ram_gb_needed": 12
},
{
"label": "qwen3:32b",
"download_gb": 20.0,
"ram_gb_needed": 24
}
]Binaan qwen3:8b bersaiz 5.2 GB pada cakera dan memerlukan kira-kira 8 GB RAM untuk berjalan tanpa swapping. VPS 4 GB tidak akan memuatkan qwen3:14b, yang bersaiz 9.3 GB sebelum anda menaip satu perkataan pun ke dalamnya. Baris terbesar di sini, qwen3:32b, memerlukan kira-kira 24 GB, yang dalam kebanyakan senarai harga merupakan pelan berbeza dengan bil bulanan yang berbeza.
Memuatkan ke dalam memori adalah satu persoalan. Kelajuan adalah persoalan lain. Pada VPS yang hanya menggunakan CPU, kesesakan berlaku pada lebar jalur memori dan bukannya kelajuan jam, jadi model yang muat dalam memori masih boleh menjawab pada kadar beberapa token sesaat. Ini memadai untuk tugasan yang berjalan sepanjang malam tetapi tidak selesa untuk sembang. GPU meningkatkan angka tersebut sebanyak kira-kira satu tertib magnitud, dan ia juga meningkatkan bil anda, jadi buat keputusan dengan ukuran: lakukan penanda aras pada VPS dengan beban kerja yang anda rancang untuk jalankan dan baca bila VPS GPU berbaloi dengan harganya. Untuk memulakan pemberat agar dapat berjalan, mulakan dengan Ollama pada VPS anda sendiri.
Pembantu ialah LLM berserta antara muka sembang
Pembantu ialah lapisan produk di sekeliling model. ChatGPT dan Claude ialah pembantu: sebuah model, tetingkap sembang, akaun, perbualan yang disimpan, dan had kadar. Hampir tiada satu pun daripada komponen ini berjalan pada perkakasan yang anda kawal, itulah sebabnya pembantu yang dihoskan memerlukan langganan dan penggunaan RAM sifar.
Versi yang dihoskan sendiri ialah bahagian hadapan (front end) seperti Open WebUI yang dihalakan ke Ollama tempatan atau API yang dihoskan. Bahagian hadapan ini merupakan perisian yang ringan. Jangkakan sekitar 1 GB RAM untuk antara muka sembang, sebagai tambahan kepada keperluan model itu sendiri. Apa yang diperlukannya, yang tidak diperlukan oleh model asas, ialah URL awam dan sijil, kerana anda ingin mengaksesnya daripada telefon: keluarkan sijil dengan Certbot dan Nginx, atau tamatkan TLS pada Traefik di hadapan beberapa aplikasi. Jika anda masih memilih bahagian hadapan, bandingkan alternatif Open WebUI.
Seorang pembantu memberikan jawapan. Ia tidak bertindak. Apabila ia menulis arahan shell, seseorang akan membaca arahan tersebut dan memutuskan sama ada untuk menampalnya. Orang tersebut ialah lapisan keselamatan, dan ejen ialah entiti yang menyingkirkan lapisan tersebut.
Ejen menambah alatan dan gelung
Ejen ialah pembantu yang boleh memanggil fungsi dan kemudian membaca hasilnya. Dua bahagian melaksanakan kerja ini. Bahagian pertama ialah alatan: penerangan tentang fungsi yang mungkin diminta oleh model, berserta kod anda yang benar-benar menjalankannya. Bahagian kedua ialah gelung: program anda memanggil model, model meminta alatan, program anda menjalankannya, menambah output ke dalam perbualan dan memanggil model sekali lagi. Proses ini berulang sehingga model menyatakan ia telah selesai atau had tertentu menghentikannya.
Gelung tersebut hanyalah kod biasa, dan gelung asas boleh dimuatkan dalam bawah seratus baris. Apa yang menjadikannya ejen ialah alatan tersebut membawa kelayakan sebenar, jadi gelung itu boleh mengubah sesuatu di luar dirinya. Fakta tunggal itu mendorong setiap keputusan pengehosan di bawah. Kemahiran ejen dan pelayan MCP (model context protocol) adalah dua cara untuk memberikan ejen lebih banyak alatan tanpa menulis semula gelung tersebut.
- Ia melangkaui sesi anda. Sembang berakhir apabila anda menutup tab. Pelaksanaan ejen boleh mengambil masa dua puluh minit dan harus bertahan walaupun komputer riba anda masuk ke mod tidur, jadi ia perlu berada pada mesin yang sentiasa hidup, dimulakan oleh servis atau pemasa systemd yang menghidupkannya semula selepas but semula.
- Ia menyimpan rahsia. Kunci API, kunci SSH, kata laluan pangkalan data. Apa sahaja yang boleh dibaca oleh ejen, arahan berniat jahat yang tersembunyi dalam inputnya boleh menyebabkan ejen menggunakannya, jadi jauhkan rahsia daripada capaian ejen.
- Kosnya meningkat mengikut gelung, bukan mengikut soalan anda. Setiap langkah menghantar semula keseluruhan perbualan sebagai input, jadi pelaksanaan sepuluh langkah membayar transkrip itu sepuluh kali ganda. Inilah sebabnya token input mendominasi bil ejen dan sebab anda mahukan had keras pada jumlah perbelanjaan satu pelaksanaan.
- Ia boleh melakukan kesilapan yang melibatkan penulisan. Jawapan yang salah dalam sembang hanya merugikan anda kerana perlu membaca semula. Padaman yang salah di dalam gelung merugikan anda kerana kehilangan direktori. Jalankan ia sebagai pengguna dengan keistimewaan paling rendah yang masih membolehkannya berfungsi, dan bagi ejen pengekodan, lakukan sandboxing sebelum anda memberikannya repositori anda.
Keperluan setiap lapisan daripada pelayan
The data behind this chart
[
{
"label": "LLM (weights you host)",
"ram_gb": 8,
"gpu": "helps a lot",
"public_url": "no",
"credentials": "none"
},
{
"label": "Assistant (chat surface)",
"ram_gb": 1,
"gpu": "no",
"public_url": "yes",
"credentials": "one login"
},
{
"label": "Agent (tools and a loop)",
"ram_gb": 2,
"gpu": "no",
"public_url": "only for webhooks",
"credentials": "several"
}
]Teliti lajur RAM dengan cermat kerana ia tidak termasuk model. Antara muka sembang dan runtime ejen adalah program yang kecil. Jika ejen memanggil model yang dihoskan, 2 GB RAM sudah memadai untuk menjalankannya, dan pelan kos rendah adalah penyelesaian sebenar dan bukannya satu kompromi. Jika anda meletakkan pemberat (weights) pada pelayan yang sama, baris model 8 GB akan mengatasi segala keperluan lain.
Lajur-lajur lain adalah lebih penting daripada jangkaan ramai. Hanya lapisan model yang menjadi lebih pantas dengan GPU. Hanya lapisan pembantu yang memerlukan URL awam secara lazimnya, kerana pelayar perlu mencapainya; ejen hanya memerlukannya apabila sesuatu di luar perlu memanggil masuk, seperti webhook. Selain itu, ejen menyimpan several kelayakan, yang merupakan perbezaan sebenar antara ejen dan tetingkap sembang. Tetingkap sembang boleh memberikan maklumat yang salah. Ejen boleh memberikan maklumat yang salah dan kemudian bertindak berdasarkan maklumat tersebut.
Adakah anda memerlukan GPU untuk menjalankan ejen AI?
Tidak, melainkan anda juga mengehoskan pemberat (weights) pada mesin yang sama. Gelung ejen terdiri daripada permintaan HTTP, penghuraian JSON dan panggilan subproses, manakala CPU hampir melahu sementara menunggu rangkaian. Persoalan mengenai GPU sebenarnya adalah persoalan tentang lapisan LLM.
Oleh itu, asingkan keputusan tersebut. Jika teks tidak boleh keluar dari pelayan anda, bayar untuk memori bagi menampung model dan, untuk kelajuan yang boleh digunakan, bayar untuk GPU bagi menjalankannya. Jika anda hanya mahukan automasi, sewa model mengikut token dan gunakan wang tersebut untuk uptime serta sandaran (backups). Kebanyakan ejen yang dihoskan sendiri pada tahun 2026 memanggil model yang dihoskan, dan ia lebih murah untuk dikendalikan dengan cara tersebut.
Bolehkah anda melakukan self-hosting bagi ejen AI?
Ya, dan ejen merupakan lapisan yang paling berbaloi untuk di-self-host, kerana gelung tersebut merupakan tempat data dan kelayakan anda disimpan. Sebuah VPS kecil dengan 2 GB RAM, pengurus servis dan akses rangkaian keluar mampu menjalankan ejen yang sebenar. Ikuti laluan bina-sendiri pada VPS jika anda mahu menguasai gelung tersebut, atau deploy salah satu ejen self-hosted yang sedia ada jika anda lebih suka bermula dengan sesuatu yang sudah siap.
Melakukan self-hosting bagi pembantu adalah mudah: ia hanya memerlukan satu container dan satu sijil. Melakukan self-hosting bagi model adalah bahagian yang mahal, dan ia merupakan perkara yang ditinggalkan oleh pengguna selepas mereka melihat token merangkak keluar daripada CPU. Lakukan self-hosting bagi weights apabila data tidak boleh keluar daripada kotak, atau apabila volum anda menyebabkan harga per-token menjadi membebankan. Jika tidak, biarkan ejen memanggil API dan simpan bahagian yang penting secara lokal.
Adakah ChatGPT merupakan ejen AI?
Sesuatu produk sembang menjadi ejen sebaik sahaja ia boleh memanggil alat dan bertindak berdasarkan hasil tersebut tanpa meminta kebenaran anda terlebih dahulu. Berdasarkan ujian tersebut, pembantu yang dihoskan dengan keupayaan melayari web, pelaksanaan kod, atau penyambung adalah ejen. Perbezaannya bagi anda ialah di mana gelung tersebut berjalan dan kelayakan siapa yang digunakannya. Dalam produk yang dihoskan, kedua-duanya milik vendor. Pada pelayan anda sendiri, kedua-duanya milik anda, berserta tanggungjawab terhadap apa sahaja tindakan yang dilakukan oleh gelung tersebut pada pukul 3 pagi.
Reaktif, perancangan dan berbilang ejen
Ringkasan sering menyenaraikan tujuh jenis ejen. Kebanyakan jenis tersebut hanyalah pemasaran. Dua perbezaan mengubah kod yang anda tulis, dan satu perbezaan mengubah kos bil. Ejen reaktif memanggil alat, membaca jawapan dan membalas. Ejen perancangan menulis pelan terlebih dahulu kemudian melaksanakannya, yang berfungsi lebih baik untuk tugasan panjang dan menelan kos token yang lebih tinggi, kerana pelan tersebut dihantar semula pada setiap langkah. Persediaan berbilang ejen membolehkan satu ejen memulakan ejen lain, dan ia melipatgandakan penggunaan token serta mod kegagalan pada masa yang sama, jadi ia hanya berbaloi apabila sub-tugasan benar-benar bebas, seperti mencari empat sumber serentak. Mulakan dengan reaktif. Tambah perancangan apabila proses menjadi panjang. Gunakan berbilang ejen sebagai langkah terakhir. Untuk gambaran yang lebih luas, lihat apa yang berbaloi untuk dipelajari tentang ejen AI pada tahun 2026.
Cara menentukan lapisan yang sebenarnya anda jalankan
Pada pelayan, semak proses yang menggunakan memori.
free -h
ps -eo rss,comm --sort=-rss | head -5Jika baris teratas ialah ollama atau llama-server yang memegang beberapa gigabait RSS (resident set size, iaitu memori yang sebenarnya diduduki oleh sesuatu proses), anda sedang mengehoskan model tersebut. Jika tiada apa-apa yang melebihi beberapa ratus megabait dan bil API anda terus meningkat, anda sedang mengehoskan ejen atau pembantu dan menyewa model tersebut. Jika senarai itu kosong kerana segala-galanya berlaku dalam tab pelayar, anda ialah pelanggan kepada pembantu, yang merupakan kedudukan yang baik sehingga anda memerlukan perisian yang bertindak bagi pihak anda.
Yang mana satu ingin anda jalankan?
- Untuk memastikan teks kekal peribadi, jalankan model tersebut: hos sendiri LLM dengan Ollama, kemudian bandingkan masa jalan dengan Ollama berbanding vLLM sebaik sahaja seorang pengguna bertambah menjadi sepuluh.
- Untuk menguasai gelung dan alatan tersebut, bina ejen anda: bina ejen AI anda sendiri pada VPS.
- Untuk mendapatkan sesuatu yang berfungsi pada malam ini, gunakan ejen siap pakai daripada ejen hos sendiri yang berbaloi untuk dijalankan.
- Jika tiada satu pun daripada ini mempunyai pelayan di bawahnya lagi, mulakan di apa yang sebenarnya diberikan oleh VPS kepada anda.
FAQ
Adakah ejen AI sekadar LLM dengan langkah tambahan?
Langkah tambahan itulah produknya. LLM hanya menukar teks kepada teks dan tiada yang lain. Ejen melengkapkan LLM dengan alatan yang boleh dipanggil serta gelung yang terus memanggil alatan tersebut. Alatan ini membawa kelayakan (credentials), jadi outputnya boleh mengubah fail, pangkalan data atau servis yang sedang berjalan. Itulah sebabnya ejen memerlukan mesin yang sentiasa hidup, pengurus servis dan polisi rahsia (secrets policy), manakala LLM hanya memerlukan memori yang cukup untuk menyimpan pemberatnya (weights) semasa menjawab.
Adakah saya memerlukan GPU untuk menjalankan ejen AI?
Tidak untuk ejen itu sendiri. Gelung tersebut terdiri daripada permintaan HTTP, pengendalian JSON dan panggilan subproses, yang boleh diuruskan oleh mana-mana CPU sementara ia menunggu rangkaian. Anda hanya memerlukan GPU apabila anda mengehoskan pemberat model sendiri dan mahukan lebih daripada beberapa token sesaat daripadanya. Ejen yang memanggil model yang dihoskan boleh berjalan dengan lancar pada VPS kecil tanpa sebarang GPU.
Berapakah jumlah RAM yang diperlukan oleh VPS untuk ejen AI?
Sekitar 2 GB apabila ejen memanggil model yang dihoskan, kerana runtime, dependensinya dan pangkalan data tempatan yang kecil adalah semua yang disimpan di dalamnya. Tambahkan model jika anda mengehoskan pemberatnya: qwen3:8b sahaja memerlukan sekitar 8 GB, jadi kotak semua-dalam-satu bermula pada tahap itu dan meningkat mengikut model yang anda pilih.
Bolehkah saya mengehoskan sendiri pembantu AI dan memastikan perbualan saya sulit?
Ya, dengan satu syarat yang menentukan segala-galanya. Bahagian hadapan (front end) yang dihoskan sendiri seperti Open WebUI menyimpan akaun dan sejarah pada pelayan anda. Perbualan itu sendiri hanya kekal sulit jika model di belakangnya juga bersifat tempatan. Jika anda menghalakan bahagian hadapan yang sama kepada API yang dihoskan, teks tersebut tetap akan meninggalkan kotak anda pada setiap mesej, jadi anda hanya menyimpan sejarah tetapi bukan privasi.
Apakah perbezaan antara ejen AI dan chatbot?
Chatbot membalas dan berhenti. Ejen memutuskan perkara yang perlu dilakukan seterusnya, memanggil alat, membaca hasilnya dan membuat keputusan semula, sehingga tugasan selesai atau had menghentikannya. Ujian praktikalnya: jika perisian boleh mengubah sesuatu tanpa manusia menekan butang antara jawapan dan tindakan, ia adalah ejen, dan ia memerlukan pengehosan serta kawalan keselamatan (guardrails) yang disertakan bersamanya.