Cara Bina Ejen AI Sendiri di VPS
Ketahui cara membina ejen AI yang mampu menjalankan tugasan secara automatik di VPS. Panduan ini merangkumi konsep gelung model bahasa, penggunaan alatan, MCP dan memori.
Apakah sebenarnya ejen AI
Ejen AI ialah gelung yang dibalut di sekeliling model bahasa. Model tersebut membaca situasi, memutuskan satu tindakan, kod anda melaksanakan tindakan itu, hasilnya kembali kepada model, dan gelung itu berjalan semula sehingga tugasan selesai. Itulah keseluruhan konsepnya. Chatbot biasa menjawab sekali dan berhenti. Ejen terus berjalan, mengambil tindakan sebenar di antara gilirannya sendiri, sehingga ia mencapai matlamat yang anda berikan. Gelung ini cukup kecil untuk ditulis sendiri dalam satu petang, yang merupakan titik permulaan bagi laluan berperingkat untuk mempelajari ejen dari awal, sebelum menambah alatan, memori, dan ciri keselamatan di atasnya.
Tindakan adalah bahagian yang penting. Secara sendirinya, model bahasa hanya menghasilkan teks. Ia tidak boleh membaca fail, memanggil API, atau menjalankan arahan. Ejen memberikan model satu set alatan yang ia dibenarkan untuk guna, dan cara untuk memintanya. Apabila model ingin mencari di web atau menulis fail, ia tidak melakukan kerja itu sendiri. Ia mengeluarkan permintaan berstruktur, kod anda menjalankan alat tersebut, dan jawapan kembali sebagai perkara seterusnya yang dibaca oleh model. Model membekalkan pertimbangan; pelayan anda membekalkan tenaga kerja.
Bukan setiap tugasan memerlukan ejen, dan memilih ejen secara lalai adalah kesilapan biasa. Jika langkah-langkah diketahui lebih awal, skrip biasa adalah lebih ringkas, lebih pantas, dan lebih boleh dipercayai. "Ambil halaman ini setiap jam dan e-melkan harga kepada saya" ialah tugasan berjadual, bukan ejen. Bina ejen apabila laluan tidak ditetapkan lebih awal, apabila model perlu melihat apa yang ditemuinya dan memutuskan perkara seterusnya untuk dilakukan. Kos bagi ejen ialah ketidakpastian, jadi hanya tanggung kos tersebut apabila fleksibiliti yang diperoleh berbaloi.
Alatan: cara ejen bertindak
Alatan ialah sebarang keupayaan yang anda berikan kepada model, yang diterangkan dengan cukup jelas supaya ia tahu bila perlu menggunakannya. Membaca fail, menjalankan arahan shell, membuat pertanyaan pangkalan data, menghantar mesej: setiap satunya adalah alatan dengan nama, penerangan ringkas dan senarai input. Anda yang menentukan alatan tersebut; model yang memutuskan bila untuk memanggilnya. Carian web biasanya merupakan alatan pertama yang berbaloi untuk ditambah, dan jika anda sudah menjalankan instans SearXNG sendiri, anda boleh menukarkannya menjadi backend carian ejen daripada membayar API carian komersial.
Mekanismenya adalah sama di mana-mana sahaja, tidak kira apa jua model yang anda gunakan. Model akan mengembalikan permintaan berstruktur yang menamakan alatan dan mengisi inputnya. Kod anda melihat permintaan tersebut, menjalankan fungsi yang sepadan, dan menghantar semula hasilnya pada pusingan seterusnya. Model membaca hasil tersebut dan sama ada memanggil alatan lain atau menulis jawapan akhirnya. Function calling ialah sistem paip di sebalik setiap ejen, dan gelung yang menggerakkannya hanyalah beberapa baris kod biasa.
Di sinilah juga terletaknya kawalan anda. Model boleh meminta untuk menjalankan sesuatu arahan, tetapi tiada apa-apa yang akan berjalan sehingga kod anda memilih untuk menjalankannya. Jurang itulah tempat anda meletakkan gesaan kelulusan untuk tindakan berbahaya, had pada perkara yang boleh dicapai oleh sesuatu alatan, dan log bagi segala tindakan yang dilakukan oleh ejen. Tahap keselamatan sesuatu ejen bergantung sepenuhnya pada alatan yang anda berikan dan pemeriksaan yang anda letakkan di hadapannya.
MCP: cara standard untuk menyambungkan alatan
Menulis integrasi baharu secara manual bagi setiap servis akan menjadi membebankan dengan cepat. Model Context Protocol, atau MCP, ialah standard terbuka yang menyelesaikan masalah ini. Daripada mengekod alatan baharu untuk fail, pangkalan data dan penjejak isu anda, anda hanya perlu menghalakan ejen kepada pelayan MCP yang sudah mendedahkan perkara tersebut sebagai alatan. Ejen hanya perlu menggunakan satu protokol; pelayan pula melakukan kerja untuk berhubung dengan sistem sebenar.
Faedahnya ialah penggunaan semula. Pelayan MCP yang ditulis oleh orang lain untuk servis yang anda gunakan akan tersedia kepada ejen anda tanpa kod integrasi baharu, dan pelayan yang anda tulis boleh digunakan oleh mana-mana ejen yang menyokong protokol tersebut. Beberapa aplikasi yang dihoskan sendiri kini menyertakan pelayan MCP mereka sendiri: openGym, penjejak senaman mendedahkan pelayan MCP baca-sahaja, supaya ejen boleh menjawab soalan tentang sejarah latihan anda tanpa keupayaan untuk mengubah apa-apa. Pada VPS, perkara ini penting kerana anda boleh menjalankan pelayan MCP sebagai servis kecil yang berasingan di samping ejen, dengan setiap satunya hanya mempunyai akses yang diperlukan. Apabila sistem di sebalik pelayan tersebut berada pada rangkaian yang tidak dapat dilihat oleh VPS, seperti pangkalan data di rumah atau pejabat, mengiklankan rangkaian tersebut kepada tailnet anda dengan subnet router membolehkan ejen mencapainya melalui alamat peribadi tanpa mendedahkan apa-apa kepada internet awam. Saya membincangkan persediaan ini dalam menjalankan pelayan MCP pada VPS.
Memori dan perolehan
Model bahasa tidak mempunyai memori sendiri antara panggilan. Segala perkara yang diketahui tentang tugasan semasa perlu diberikan kepadanya pada setiap giliran. Untuk tugasan pendek, ini tidak menjadi masalah kerana keseluruhan perbualan dimuatkan dalam satu permintaan. Jumlah yang boleh dimuatkan bergantung pada tetingkap konteks, dan model yang dihoskan sendiri melalui Ollama mempunyai tetingkap lalai yang kecil yang akan menggugurkan giliran paling lama secara senyap, jadi menetapkan num_ctx agar sepadan dengan trafik yang dijana oleh gelung anda adalah berbaloi dilakukan sebelum anda menyalahkan ejen kerana terlupa. Untuk tugasan yang lebih panjang, anda perlu menguruskan memori sendiri, dan terdapat dua corak yang perlu diketahui.
Corak pertama ialah pad conteng (scratchpad). Anda memberikan ejen satu fail yang boleh dibaca dan ditulis, serta mengarahkannya untuk merekodkan apa yang dipelajari semasa proses berjalan. Pada giliran seterusnya, atau sesi seterusnya, ia membaca semula fail tersebut dan menyambung tugasan dari tempat ia berhenti. Ini adalah memori dalam bentuk dokumen biasa, dan ia berkesan kerana ejen menganggap fail tersebut sebagai satu lagi alat.
Corak kedua ialah perolehan (retrieval). Apabila ejen memerlukan pengetahuan daripada sekumpulan besar dokumen yang tidak mungkin dimuatkan dalam satu permintaan, anda menyimpan dokumen tersebut dalam bentuk yang boleh dicari dan hanya menarik bahagian yang relevan ke dalam paparan model apabila diperlukan. Corak ini dipanggil retrieval-augmented generation, atau RAG. Ejen bertanyakan soalan, kod anda mencari beberapa petikan yang sepadan, dan hanya petikan tersebut yang dihantar kepada model. Storan tersebut berada pada pelayan anda, jadi dokumen peribadi anda tidak akan keluar dari pelayan tersebut.
Banyak ejen, satu penyelaras
Satu ejen dengan banyak alatan mencukupi untuk kebanyakan tugasan. Apabila sesuatu kerja berskala besar atau secara semula jadinya terbahagi kepada beberapa bahagian, struktur yang berbeza lebih membantu: ejen penyelaras yang menurunkan tugas kepada sub-ejen khusus. Penyelaras memecahkan matlamat kepada bahagian-bahagian kecil, menyerahkan setiap bahagian kepada sub-ejen yang dibina untuk jenis kerja tersebut, dan menggabungkan hasilnya. Penurunan tugas memerlukan saluran komunikasi antara bahagian-bahagian tersebut, dan versi paling ringkas sudah tersedia pada pelayan anda: dua sesi Claude Code pada VPS yang sama boleh menghantar mesej antara satu sama lain, yang merupakan cara murah untuk menguji bagaimana proses penyerahan tugas berfungsi sebelum anda membina sebarang mekanisme penyelarasan sendiri.
Kelebihannya ialah fokus. Sub-ejen dengan skop kerja yang sempit dan set alatan yang kecil membuat keputusan yang lebih baik berbanding ejen umum yang mengendalikan segala-galanya, dan bahagian-bahagian yang bebas boleh dijalankan pada masa yang sama. Kosnya ialah penyelarasan, yang merupakan beban sebenar, jadi kekalkan penggunaan ejen tunggal sehingga sesuatu tugasan jelas memerlukan lebih daripada itu. Mulakan dengan ringkas, dan tambah ejen hanya apabila satu ejen jelas kelihatan terbeban.
Self-hosted atau hosted: model mana yang menjalankan ejen anda
Model ialah satu bahagian ejen yang tidak perlu anda jalankan sendiri, dan memilih tempat ia berada adalah keputusan paling besar yang akan anda buat. Model hosted, yang dicapai melalui API, memberikan anda penaakulan paling kuat tanpa perlu mengendalikan apa-apa: anda menghantar teks, anda mendapat teks kembali. Model self-hosted berjalan pada pelayan anda sendiri, yang memastikan setiap permintaan kekal peribadi, mengenakan harga tetap dan bukannya yuran setiap token, serta tidak pernah bergantung pada ketersediaan pihak lain. Pertukarannya adalah dari segi keupayaan dan usaha. Model hosted terbaik mendahului apa yang boleh anda jalankan sendiri, dan menjalankan model sendiri bermakna menyediakan memori yang mencukupi untuk memuatkannya.
Perkara terakhir itu adalah kekangan praktikalnya. Model perlu dimuatkan ke dalam memori pelayan anda, dan jika anda menggunakan GPU, ke dalam memori videonya. Model yang terlalu besar untuk perkakasan tidak akan dimuatkan. Sebelum anda merancang ejen self-hosted, semak sama ada model yang anda mahukan sesuai dengan mesin yang anda miliki:
Jika angka tersebut tidak sepadan, anda mempunyai tiga langkah: pilih model yang lebih kecil, gunakan kuantisasi yang lebih agresif untuk mengecilkannya, atau gunakan API hosted untuk penaakulan dan simpan hanya alatan serta data anda pada pelayan. Banyak ejen self-hosted bermula dengan model tempatan melalui Ollama pada VPS dan menggunakan API hosted sebagai sandaran untuk langkah yang paling sukar.
Pelayan adalah bahagian yang berbahaya
Ejen yang boleh menjalankan arahan shell dan menulis fail adalah berkuasa, dan itulah sebabnya ia berbahaya. Pertimbangan model adalah baik tetapi tidak sempurna, dan arahan yang salah, pepijat, atau input berniat jahat boleh mengubah ejen yang membantu menjadi ejen yang memadam perkara yang salah atau membocorkan rahsia. Kerja keselamatan bukanlah pilihan, dan pada pelayan, ia adalah bahagian yang paling penting.
Beberapa tabiat membawa beban yang paling besar. Jalankan ejen sebagai pengguna khusus yang tidak mempunyai keistimewaan (unprivileged user), jangan sekali-kali sebagai root, supaya kesilapan mempunyai had; penaakulan yang sama ada dalam menjalankan servis sebagai pengguna tanpa keistimewaan. Simpan rahsianya, seperti API keys, di luar kod dan hanya boleh dibaca oleh pengguna tersebut. Dan lakukan sandbox pada alatan yang menyentuh sistem, supaya ejen hanya boleh mencapai apa yang benar-benar diperlukan. Jika anda lebih suka tidak menulis setiap semakan secara manual, plugin DeepSeek Harness yang berbaloi untuk dipasang merangkumi perkara yang sama sebagai komponen siap guna: peraturan kebenaran alatan, pengimbasan prompt injection, dan had pada jumlah perbelanjaan ejen sebelum ia berhenti. Untuk contoh kerja bagi mengeraskan ejen yang dihoskan sendiri (self-hosted), lihat menjalankan OpenClaw dengan selamat pada VPS. Jika anda lebih suka menggunakan model yang dihoskan untuk kecerdasan, panduan pendamping mengenai membina ejen dengan Claude pada VPS mengambil idea yang sama dan meletakkan model khusus di belakangnya.
Untuk contoh kerja, membina ejen peribadi gaya OpenClaw menggunakan komponen ini, dan jika anda lebih suka menjalankan ejen yang sudah siap, mulakan dengan menghoskan sendiri Hermes Agent pada VPS atau menjalankan Agent Zero pada pelayan anda sendiri, dan ejen AI yang dihoskan sendiri terbaik pada 2026 membandingkan setiap pilihan siap guna yang kami liputi, secara bersebelahan.
FAQ
Apakah perbezaan antara ejen AI dan chatbot?
Chatbot menjawab mesej dan berhenti. Ejen menjalankan gelung: model menentukan tindakan, kod anda melaksanakannya, hasil dihantar semula kepada model, dan proses ini berulang sehingga tugasan selesai. Perbezaannya ialah ejen mengambil tindakan sebenar di antara giliran, memanggil alatan untuk membaca fail, menjalankan arahan, atau membuat pertanyaan kepada servis, bukannya sekadar menghasilkan teks.
Adakah saya memerlukan GPU untuk menjalankan ejen AI pada VPS?
Hanya jika anda mengehos sendiri model tersebut. Gelung ejen, alatan, dan memori adalah kod biasa yang berjalan dengan baik pada VPS biasa tanpa GPU. GPU penting apabila anda ingin menjalankan model bahasa pada perkakasan sendiri, kerana model tersebut perlu dimuatkan ke dalam memori. Jika anda menggunakan model yang dihoskan melalui API, pengiraan berat berlaku di tempat lain dan VPS yang sederhana sudah memadai.
Apakah itu MCP dan adakah saya memerlukannya untuk membina ejen?
MCP, atau Model Context Protocol, ialah standard terbuka untuk menyambungkan ejen kepada alatan dan sumber data. Anda tidak semestinya memerlukannya, kerana anda boleh menulis setiap alatan secara manual. MCP menjimatkan kerja tersebut dengan membolehkan anda menggunakan semula pelayan sedia ada untuk servis biasa dan mendedahkan sistem anda sekali sahaja untuk digunakan oleh mana-mana ejen. Ia merupakan kemudahan yang berbaloi apabila bilangan integrasi semakin bertambah.
Adakah selamat untuk memberikan ejen AI akses kepada pelayan saya?
Ia boleh menjadi selamat, jika anda mengawalnya. Ejen yang menjalankan arahan hanya selamat setakat akaun yang digunakannya dan alatan yang anda benarkan. Jalankan ia sebagai pengguna tanpa keistimewaan (unprivileged user), simpan rahsianya di tempat yang tidak boleh dicapai, lakukan sandboxing pada alatan yang menyentuh sistem fail, dan perlukan kelulusan untuk tindakan yang sukar dibatalkan. Anggap ejen sebagai kod yang tidak dipercayai tetapi bijak, dan berikan hanya apa yang diperlukan oleh tugasan tersebut.