Cara Belajar AI Agents Dari Peringkat Asas
Kuasai ejen AI melalui enam peringkat praktikal bermula daripada konsep gelung, penggunaan alatan, memori, hingga aspek keselamatan. Bina projek sendiri di setiap tahap.
Laluan dalam enam peringkat
Untuk mempelajari ejen AI dari peringkat asas, ikuti enam peringkat ini mengikut urutan: konsep, gelung pertama anda, alatan, memori, reka bentuk gelung, dan keselamatan. Setiap peringkat mempunyai satu perkara yang perlu anda bina sendiri. Melangkau peringkat adalah punca paling biasa mengapa seseorang terhenti, kerana kerangka kerja (framework) menyembunyikan bahagian yang sebenarnya perlu anda fahami.
Ejen AI ialah gelung di sekeliling model bahasa yang dibenarkan untuk memanggil alatan. Ayat itu adalah keseluruhan subjeknya. Segala-galanya selepas itu hanyalah perincian tentang apa yang dimasukkan ke dalam gelung, apa yang boleh dicapai oleh alatan tersebut, dan cara anda menghentikan gelung apabila ia tidak berfungsi dengan betul. Jika anda boleh menerangkan gelung tersebut kepada orang lain, anda telah mempelajari perkara itu. Jika anda hanya mampu menamakan kerangka kerja, anda belum mempelajarinya.
Pelan di bawah mengandaikan anda belajar dengan cara membina. Baca satu peringkat, bina perkara kecil tersebut, sengajakan kerosakannya, kemudian teruskan. Peringkat yang hanya anda baca ialah peringkat yang belum anda laksanakan.
Perkara yang anda sebenarnya perlukan sebelum peringkat 1
Senarai prasyarat yang jujur adalah pendek, dan lebih ringkas daripada yang dicadangkan oleh kebanyakan halaman kursus.
- Anda boleh membaca dan menulis Python atau TypeScript pada tahap skrip lima puluh baris.
- Anda selesa menggunakan Linux shell: memasang pakej, menyunting fail, membaca log.
- Anda mempunyai API key untuk model yang dihoskan, atau mesin yang boleh menjalankan model tempatan.
Itu sahaja senarai keseluruhannya. Anda tidak memerlukan teori pembelajaran mesin (machine learning), dan anda tidak perlu melatih model. Tiada apa-apa dalam kerja ejen melibatkan kecerunan (gradients) atau data latihan. Kad grafik hanya penting jika anda memutuskan untuk menjalankan model itu sendiri, yang merupakan kemahiran berasingan yang boleh anda pelajari kemudian daripada menghoskan Ollama pada VPS untuk self host LLM.
Apa yang orang pandang rendah ialah bahagian shell. Ejen gagal disebabkan oleh keizinan (permissions), laluan (paths), pemboleh ubah persekitaran (environment variables), dan proses yang mati secara senyap. Jika stack trace mengenai PATH atau mod fail membuatkan anda menutup terminal, luangkan masa hujung minggu untuk mempelajari asas Linux terlebih dahulu. Ia akan menjimatkan masa anda selama sebulan kemudian.
Peringkat 1: apakah itu ejen, dan apakah ia bukan
Mulakan dengan satu panggilan API tanpa gelung. Hantar satu prompt, cetak balasnya, dan perhatikan kiraan token dalam respons tersebut. Anda kini memahami unit kos dan unit kependaman.
Kemudian, pelajari penggunaan alat (tool use), yang merupakan satu-satunya idea yang benar-benar baharu dalam bidang ini. Anda menerangkan fungsi kepada model sebagai nama, penerangan, dan skema JSON (JavaScript object notation) untuk inputnya. Model tersebut tidak menjalankan apa-apa. Ia membalas dengan permintaan berstruktur: panggil run_command dengan argumen tersebut. Kod anda menjalankan fungsi itu, menghantar output kembali sebagai mesej, dan bertanya kepada model sekali lagi. Model tersebut ialah perancang yang membaca teks dan menulis teks. Kod anda ialah entiti yang mempunyai "tangan". Kod pada bahagian anda dalam pertukaran tersebut mempunyai nama apabila anda mula membandingkan reka bentuk: ia adalah the agent harness, iaitu gelung, alat, dan kebenaran yang membaluti model yang tidak mempunyai keupayaan tersebut secara sendirinya.
Chatbot berakhir selepas satu balasan. Ejen mengulangi pertukaran tersebut sehingga model berhenti meminta alat. Pengulangan itulah perbezaan keseluruhannya, dan itulah sebabnya mod kegagalan juga berbeza. Chatbot memberikan jawapan yang salah sekali sahaja. Ejen bertindak berdasarkan jawapan yang salah beberapa kali sebelum sesiapa menyedarinya.
Peringkat 2: tulis gelung anda sendiri, sekali sahaja
Jangan bermula dengan rangka kerja (framework). Tulis kira-kira tiga puluh baris kod Python supaya anda memahami bentuk perkara tersebut.
sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-hereimport subprocess
import anthropic
client = anthropic.Anthropic()
tools = [{
"name": "run_command",
"description": "Run a read only shell command and return its output.",
"input_schema": {
"type": "object",
"properties": {"command": {"type": "string"}},
"required": ["command"],
},
}]
messages = [{"role": "user", "content": "How much disk space is free here?"}]
while True:
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=messages,
)
if response.stop_reason != "tool_use":
break
messages.append({"role": "assistant", "content": response.content})
results = []
for block in response.content:
if block.type == "tool_use":
done = subprocess.run(
block.input["command"], shell=True,
capture_output=True, text=True, timeout=10,
)
results.append({
"type": "tool_result",
"tool_use_id": block.id,
"content": done.stdout or done.stderr,
})
messages.append({"role": "user", "content": results})
print(next(b.text for b in response.content if b.type == "text"))Jalankan ia dengan python3 agent.py. Pelaksanaan yang berjaya akan mencetak satu perenggan yang menamakan sistem fail anda serta ruang kosongnya, kerana model meminta df -h, kod anda menjalankannya, dan hantaran kedua menukarkan jadual tersebut menjadi satu ayat. Jika ia tidak mencetak apa-apa, gelung tersebut tamat sebelum blok teks tiba. Tambahkan print(response.stop_reason) di dalam gelung dan perhatikan perubahan nilai tersebut.
Sekarang, rosakkan ia secara sengaja. Padamkan baris tool_use_id dan baca ralat tersebut, kerana hasil alat tanpa id yang sepadan akan ditolak oleh API dan ia merupakan pepijat paling lazim bagi pemula. Ajukan soalan yang memerlukan dua arahan dan perhatikan gelung tersebut berjalan sebanyak dua kali. Ajukan sesuatu yang mustahil dan perhatikan sama ada ia berputus asa atau berpusing selama-lamanya.
Satu amaran tentang contoh ini. Ia menghantar output model terus ke dalam shell dengan shell=True, yang boleh diterima pada mesin percubaan yang boleh anda bina semula, tetapi salah di tempat lain. Peringkat 6 akan membetulkan perkara ini. Konsep di bawah gelung ini dibincangkan dengan lebih panjang lebar dalam membina ejen AI anda sendiri pada VPS.
Peringkat 3: alatan yang belum dimiliki oleh ejen
Alat run_command anda berfungsi, tetapi ejen sebenar memerlukan alatan yang boleh mencapai ke luar kotak: sistem tiket, pangkalan data, repositori. Menulis pembungkus (wrapper) khusus untuk setiap servis, bagi setiap ejen, tidak boleh diskalakan.
Model Context Protocol (MCP) ialah jawapan yang dipersetujui oleh industri. Pelayan MCP mendedahkan set alatan melalui pengangkutan standard, dan mana-mana ejen yang menyokong MCP boleh menggunakannya tanpa kod penyambung (glue code) tersuai. Pelayan sistem fail rujukan hanya memerlukan satu arahan:
npx -y @modelcontextprotocol/server-filesystem /home/you/projectsIni memerlukan Node dipasang, dan argumen direktori ialah satu-satunya laluan yang akan disentuh oleh pelayan tersebut. Ini ialah model keselamatan dalam bentuk kecil: pelayan yang menentukan sempadan, bukan model. Halakan klien kepadanya dan ejen anda akan memperoleh keupayaan membaca dan menulis fail yang tidak anda tulis sendiri. Menjalankan alatan ini dengan betul, di bawah akaun servis dan dengan pilihan pengangkutan yang dijelaskan, diliputi dalam menjalankan pelayan MCP pada VPS untuk ejen pengekodan AI. Bagi pelayan kedua yang menghala ke data sebenar dan bukannya direktori sementara, self hosting openGym, penjejak senaman menyediakan pelayan baca sahaja, supaya anda boleh berlatih bertanya soalan tentang sejarah latihan anda sendiri tanpa memberikan ejen akses kepada perkara yang boleh dirosakkannya.
Pengajaran peringkat ini ialah reka bentuk alatan adalah kerja yang sebenar. Penerangan yang samar membuatkan model meneka. Alat yang mengembalikan empat puluh ribu aksara akan meracuni tetingkap konteks. Alat yang boleh memadamkan sesuatu akhirnya akan memadamkan sesuatu.
Peringkat 4: memori, yang kebanyakannya hanyalah fail
Pengguna baharu biasanya terus menggunakan pangkalan data vektor untuk tujuan ini. Jangan lakukannya, sekurang-kurangnya buat masa ini.
Ejen tidak mempunyai memori antara panggilan. Anda menghantar semula keseluruhan perbualan setiap kali, itulah sebabnya sesi yang panjang menelan kos lebih tinggi bagi setiap pusingan berbanding sesi yang pendek. Oleh itu, memori terbahagi kepada dua masalah. Masalah pertama ialah perkara yang dimuatkan ke dalam tetingkap konteks pada masa ini, yang anda uruskan dengan meringkaskan, membuang output alat yang lama, dan menyimpan cache awalan prompt yang stabil supaya anda membayar sebahagian kecil daripada harga untuknya. Masalah kedua ialah perkara yang kekal selepas but semula, iaitu storan.
Bagi masalah kedua, fail markdown biasa yang boleh dibaca dan ditulis oleh ejen adalah lebih baik daripada pangkalan data vektor untuk hampir setiap projek awal. Berikan satu fail kepadanya, beritahu formatnya, arahkan ia membaca fail tersebut sebelum bermula dan mengemas kininya apabila ia mempelajari sesuatu. Anda mendapat kebanyakan manfaatnya, dan anda boleh membuka fail tersebut untuk melihat perkara yang dipercayai oleh ejen anda. Gunakan embedding dan perolehan (retrieval) hanya apabila nota tidak lagi muat dalam tetingkap konteks, dan bukan sebelum itu.
Tahap 5: gelung ialah produk
Sekarang anda boleh membina ejen yang berfungsi semasa anda memerhatikannya. Tahap 5 ialah menjadikannya berfungsi apabila anda tidak memerhatikannya.
Empat soalan menentukan sama ada ejen yang tidak diselia selamat untuk ditinggalkan. Apakah pencetusnya, supaya ia tidak berjalan tanpa tujuan. Apakah sempadan yang membatasi operasinya, supaya kesilapan kekal kecil. Bagaimanakah hasilnya disahkan, kerana ejen yang menilai kerjanya sendiri akan sentiasa lulus. Apakah bajet yang menghentikannya, sama ada dalam token atau masa sebenar. Mereka bentuk empat perkara tersebut secara sengaja merupakan disiplin yang diterangkan dalam kejuruteraan gelung, dan perkara yang diliputi oleh definisi tersebut.
Latihan: ambil ejen tahap 2 anda, berikan tugasan yang memerlukan empat atau lima langkah, dan tambahkan had lelaran yang tegas. Kemudian, alih keluar had tersebut dan perhatikan kesan gelung tanpa had terhadap bil token anda. Lakukan perkara ini sekali dengan bajet yang kecil supaya anda tidak melakukannya secara tidak sengaja pada bajet yang besar.
Tahap 6: keselamatan, rahsia, dan kos
Tahap ini bukanlah pilihan, dan ia diletakkan di akhir hanya kerana anda tidak akan merasai risikonya sehingga anda membina sesuatu yang berfungsi.
Jalankan ejen sebagai pengguna tanpa keistimewaan (unprivileged user) sendiri, jangan sekali-kali sebagai root atau akaun anda sendiri, supaya kesan kerosakan terhad kepada satu direktori dan bukannya keseluruhan mesin. Jauhkan kelayakan (credentials) daripada capaian model, kerana apa-apa yang berada dalam tetingkap konteks boleh dipetik semula melalui panggilan alat (tool call). Penyelesaiannya adalah dengan menggunakan token jangka hayat pendek yang diselia oleh pembantu seperti yang diterangkan dalam menjauhkan rahsia daripada ejen AI anda. Tetapkan had siling yang tegas untuk perbelanjaan, kerana gelung yang tidak dipantau akan mengenakan caj bagi setiap lelaran tanpa pengetahuan sesiapa. Had dan pemprosesan kelompok (batching) yang memastikan ia terkawal diterangkan dalam kawalan kos ejen AI pada VPS yang sentiasa aktif.
Jika ejen anda berjalan di dalam harness dan bukannya skrip yang anda tulis sendiri, sebahagian daripada tahap ini adalah konfigurasi dan bukannya kod. plugin DeepSeek Harness yang berbaloi untuk dipasang merangkumi perkara yang sama dengan had bajet, peraturan kebenaran alat, dan pengimbasan suntikan (injection scanning).
Kos memerlukan satu angka yang konkrit. Setakat Julai 2026, Claude Opus 5 mengenakan caj $5 bagi setiap juta token input dan $25 bagi setiap juta token output. Ejen yang banyak berinteraksi dengan menghantar semula perbualan yang semakin panjang boleh menggunakan beberapa ratus ribu token dalam satu tugasan sahaja. Cache prompt dan penggunaan model yang lebih kecil untuk langkah rutin mengubah pengiraan tersebut dengan lebih ketara berbanding sebarang pengubahsuaian prompt.
Suntikan prompt (prompt injection) juga termasuk dalam bahagian ini. Jika ejen anda membaca halaman web, penjejak isu, atau peti masuk, maka sesiapa sahaja yang menulis teks tersebut sebenarnya sedang menulis arahan kepada ejen anda. Carian web biasanya merupakan alat yang membuka pintu ini terlebih dahulu, dan menghalakan ejen kepada instans SearXNG anda sendiri menunjukkan pendawaian serta permukaan suntikan yang diciptanya secara bersebelahan. Pertahanan terbaik bukanlah sistem prompt yang lebih bijak. Ia adalah sempadan, kerana ejen yang tidak mempunyai kebenaran untuk memadam repositori tidak boleh dipujuk untuk memadamnya.
Peta jalan manakah yang perlu anda ikuti?
Pilih satu kurikulum dan selesaikan kurikulum tersebut daripada mencuba enam kurikulum sekaligus. Repositori ai-agents-for-beginners Microsoft merupakan kurikulum percuma yang paling lengkap, iaitu kursus lapan belas pelajaran yang telah melepasi 70,000 bintang setakat Julai 2026, dan ia dipetakan dengan jelas mengikut peringkat di atas. Senarai repositori ejen yang sedang sohor kini berguna untuk melihat apa yang wujud, namun kurang berkesan sebagai sukatan pelajaran kerana senarai yang disusun mengikut bintang adalah berdasarkan populariti, bukannya urutan pembelajaran.
Apabila anda mahukan projek sebenar untuk berlatih, ejen pengekodan merupakan sasaran pertama yang terbaik: maklum balasnya serta-merta, alatan yang digunakan jelas, dan kesilapan mudah untuk dibatalkan. Menjalankan ejen AI pengekodan pada VPS membincangkan satu proses dari awal hingga akhir. Jika anda lebih suka mengkaji sistem yang berfungsi daripada membina dari sifar, perbandingan dalam ejen AI self-hosted terbaik menunjukkan bagaimana beberapa projek menyelesaikan gelung yang sama dengan cara yang berbeza.
Berapa lama masa yang diambil?
Bagi seseorang yang sudah mempunyai kemahiran pengaturcaraan, peringkat 1 dan 2 boleh diselesaikan dalam satu malam. Peringkat 3 mengambil masa satu hujung minggu, dengan kebanyakan masa dihabiskan untuk memahami deskripsi alatan dan bukannya protokol. Peringkat 4 dan 5 mengambil masa beberapa minggu penggunaan sebenar, kerana anda hanya akan mengetahui perkara yang dilupakan oleh ejen anda dengan memerhatikannya terlupa. Peringkat 6 tidak pernah benar-benar selesai, dalam erti kata bahawa setiap keupayaan baharu yang anda berikan akan membukanya semula.
Dua bulan meluangkan masa setiap malam secara konsisten membolehkan kebanyakan orang membina ejen yang berfungsi, terhad, dan berguna. Mereka yang mengambil masa setahun biasanya adalah mereka yang terus membaca tanpa memulakan pembinaan.
FAQ
Adakah saya perlu tahu pembelajaran mesin (machine learning) untuk membina ejen AI?
Tidak. Membina ejen bermaksud memanggil model melalui API dan menyambungkan permintaan alatnya kepada fungsi sebenar, yang merupakan pengaturcaraan aplikasi biasa. Anda tidak perlu menyentuh latihan, kecerunan (gradients), atau set data. Kemahiran yang menentukan sama ada ejen anda berfungsi ialah reka bentuk skema untuk alat, pengendalian ralat, dan keizinan Linux. Teori pembelajaran mesin hanya menjadi relevan jika anda ingin melakukan fine-tuning pada model, yang merupakan tugas berbeza dengan prasyarat yang berbeza.
Patutkah saya bermula dengan rangka kerja (framework) seperti LangChain atau CrewAI?
Tulis satu gelung (loop) mentah dahulu, kemudian baru gunakan rangka kerja. Rangka kerja menggantikan tiga puluh baris kod dalam peringkat 2 dengan objek konfigurasi, yang memudahkan kerja setelah anda tahu apa yang digantikannya, tetapi mengelirukan jika anda belum tahu. Apabila ejen anda berkelakuan tidak sepatutnya, anda perlu menaakul senarai mesej dan hasil alat secara terus, dan itu jauh lebih sukar jika anda tidak pernah melihatnya. Selepas membina satu gelung sendiri, rangka kerja akan menjimatkan masa anda dan bukannya menyembunyikan mekanismenya.
Berapakah kos untuk mempelajari ejen AI?
Kurang daripada jangkaan kebanyakan orang, jika anda mengehadkannya. Kunci API berhos dan VPS kecil sudah mencukupi untuk merangkumi segala-galanya dalam enam peringkat ini. Risiko sebenar bukanlah kadar bayaran setiap jam, tetapi gelung tanpa had yang mengenakan caj setiap lelaran semasa anda tidur. Tetapkan had perbelanjaan yang ketat pada akaun API anda pada hari pertama, tambahkan had lelaran pada setiap gelung yang anda tulis, dan gunakan model yang lebih murah untuk langkah rutin. Menjalankan model secara setempat (locally) menghapuskan bil token dan menggantikannya dengan keperluan perkakasan.
Apakah perbezaan antara ejen AI dan chatbot?
Chatbot menjawab sekali sahaja. Ejen mengulangi satu kitaran: model meminta alat, kod anda menjalankannya, hasilnya dihantar semula, dan model memutuskan perkara seterusnya. Pengulangan itulah yang membolehkan ejen menyelesaikan tugas dengan beberapa langkah, dan itulah sebabnya ejen memerlukan sempadan yang tidak diperlukan oleh chatbot. Jawapan yang salah daripada chatbot hanyalah perenggan yang buruk. Jawapan yang salah daripada ejen ialah perenggan yang buruk berserta apa sahaja tindakan yang telah dilakukannya.