Cara Belajar Ejen AI Dari Peringkat Asas
Kuasai ejen AI melalui enam peringkat praktikal bermula daripada konsep gelung, alatan, memori, hingga keselamatan. Bina projek sendiri untuk faham cara ia berfungsi.
Laluan dalam enam peringkat
Untuk mempelajari ejen AI dari peringkat asas, ikuti enam peringkat ini mengikut urutan: konsep, gelung pertama anda, alatan, memori, reka bentuk gelung, dan keselamatan. Setiap peringkat mempunyai satu perkara yang perlu anda bina dengan tangan anda sendiri. Melangkau peringkat adalah punca paling biasa mengapa orang terhenti, kerana kerangka kerja (framework) menyembunyikan bahagian yang sebenarnya perlu anda fahami.
Ejen AI ialah gelung di sekeliling model bahasa yang dibenarkan untuk memanggil alatan. Ayat itu adalah keseluruhan subjeknya. Segala-galanya selepas itu adalah perincian tentang perkara yang dimasukkan ke dalam gelung, perkara yang boleh disentuh oleh alatan, dan cara anda menghentikan gelung apabila ia tidak berfungsi dengan betul. Jika anda boleh menerangkan gelung tersebut kepada orang lain, anda telah mempelajari perkara itu. Jika anda hanya boleh menamakan kerangka kerja, anda belum mempelajarinya.
Pelan di bawah mengandaikan anda belajar dengan cara membina. Baca satu peringkat, bina perkara kecil tersebut, rosakkan ia dengan sengaja, kemudian teruskan. Peringkat yang hanya anda baca ialah peringkat yang belum anda laksanakan.
Apa yang anda sebenarnya perlukan sebelum peringkat 1
Senarai prasyarat yang jujur adalah pendek, dan lebih ringkas daripada yang dicadangkan oleh kebanyakan halaman kursus.
- Anda boleh membaca dan menulis Python atau TypeScript pada tahap skrip lima puluh baris.
- Anda selesa menggunakan shell Linux: memasang pakej, menyunting fail, membaca log.
- Anda mempunyai API key untuk model yang dihoskan, atau mesin yang boleh menjalankan model tempatan.
Itu sahaja senarai keseluruhannya. Anda tidak memerlukan teori pembelajaran mesin, dan anda tidak perlu melatih model. Tiada apa-apa dalam kerja ejen melibatkan kecerunan (gradients) atau data latihan. Kad grafik hanya penting jika anda memutuskan untuk menjalankan model itu sendiri, yang merupakan kemahiran berasingan yang boleh anda pelajari kemudian daripada menghoskan Ollama pada VPS untuk self host LLM.
Apa yang orang pandang rendah ialah bahagian shell. Ejen gagal disebabkan oleh kebenaran (permissions), laluan (paths), pemboleh ubah persekitaran (environment variables), dan proses yang mati secara senyap. Jika stack trace mengenai PATH atau mod fail membuatkan anda menutup terminal, luangkan masa hujung minggu untuk mempelajari asas Linux terlebih dahulu. Ia akan menjimatkan masa anda selama sebulan kemudian.
Peringkat 1: apakah itu ejen, dan apakah ia bukan
Mulakan dengan satu panggilan API tanpa gelung. Hantar satu prompt, cetak balasnya, dan perhatikan kiraan token dalam respons tersebut. Anda kini memahami unit kos dan unit kependaman (latency).
Kemudian, pelajari penggunaan alatan (tool use), yang merupakan satu-satunya idea yang benar-benar baharu dalam bidang ini. Anda menerangkan fungsi kepada model sebagai nama, penerangan, dan skema JSON (JavaScript object notation) untuk inputnya. Model tersebut tidak menjalankan apa-apa. Ia membalas dengan permintaan berstruktur: panggil run_command dengan argumen tersebut. Kod anda menjalankan fungsi itu, menghantar output kembali sebagai mesej, dan bertanya kepada model sekali lagi. Model tersebut ialah perancang yang membaca teks dan menulis teks. Kod andalah yang bertindak sebagai pelaksana.
Chatbot berakhir selepas satu balasan. Ejen mengulangi pertukaran tersebut sehingga model berhenti meminta alatan. Pengulangan itulah perbezaan keseluruhannya, dan itulah sebabnya mod kegagalan juga berbeza. Chatbot memberikan jawapan yang salah sekali sahaja. Ejen bertindak berdasarkan jawapan yang salah beberapa kali sebelum sesiapa menyedarinya.
Peringkat 2: tulis gelung anda sendiri, sekali sahaja
Jangan bermula dengan rangka kerja (framework). Tulis kira-kira tiga puluh baris kod Python supaya anda memahami bentuk asasnya.
sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-hereimport subprocess
import anthropic
client = anthropic.Anthropic()
tools = [{
"name": "run_command",
"description": "Run a read only shell command and return its output.",
"input_schema": {
"type": "object",
"properties": {"command": {"type": "string"}},
"required": ["command"],
},
}]
messages = [{"role": "user", "content": "How much disk space is free here?"}]
while True:
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=messages,
)
if response.stop_reason != "tool_use":
break
messages.append({"role": "assistant", "content": response.content})
results = []
for block in response.content:
if block.type == "tool_use":
done = subprocess.run(
block.input["command"], shell=True,
capture_output=True, text=True, timeout=10,
)
results.append({
"type": "tool_result",
"tool_use_id": block.id,
"content": done.stdout or done.stderr,
})
messages.append({"role": "user", "content": results})
print(next(b.text for b in response.content if b.type == "text"))Jalankan ia dengan python3 agent.py. Pelaksanaan yang berjaya akan mencetak satu perenggan yang menamakan sistem fail anda serta ruang kosongnya, kerana model meminta df -h, kod anda menjalankannya, dan hantaran kedua menukarkan jadual tersebut menjadi satu ayat. Jika tiada apa-apa yang dicetak, gelung tersebut tamat sebelum blok teks tiba. Tambahkan print(response.stop_reason) di dalam gelung dan perhatikan perubahan nilai tersebut.
Sekarang, rosakkan kod tersebut secara sengaja. Padamkan baris tool_use_id dan baca ralat yang dipaparkan, kerana hasil alat tanpa id yang sepadan akan ditolak oleh API dan ini merupakan ralat paling lazim bagi pemula. Ajukan soalan yang memerlukan dua arahan dan perhatikan gelung tersebut berjalan sebanyak dua kali. Ajukan sesuatu yang mustahil dan perhatikan sama ada ia berputus asa atau berputar selama-lamanya.
Satu amaran mengenai contoh ini. Ia menghantar output model terus ke dalam shell dengan shell=True, yang boleh diterima pada mesin percubaan yang boleh dibina semula, tetapi salah jika dilakukan di tempat lain. Peringkat 6 akan membetulkan perkara ini. Konsep di bawah gelung ini dibincangkan dengan lebih lanjut dalam membina ejen AI anda sendiri pada VPS.
Peringkat 3: alatan yang belum dimiliki oleh ejen
Alat run_command anda berfungsi, tetapi ejen sebenar memerlukan alatan yang boleh mencapai ke luar kotak: sistem tiket, pangkalan data, repositori. Menulis pembungkus (wrapper) khusus untuk setiap servis, bagi setiap ejen, tidak boleh diskalakan.
Model Context Protocol (MCP) ialah jawapan yang dipersetujui oleh industri. Pelayan MCP mendedahkan set alatan melalui pengangkutan standard, dan mana-mana ejen yang menyokong MCP boleh menggunakannya tanpa kod penyambung (glue code) tersuai. Pelayan sistem fail rujukan hanya memerlukan satu arahan:
npx -y @modelcontextprotocol/server-filesystem /home/you/projectsIni memerlukan Node dipasang, dan argumen direktori ialah satu-satunya laluan yang akan disentuh oleh pelayan tersebut. Ini adalah model keselamatan dalam bentuk kecil: pelayan yang menentukan sempadan, bukan model. Halakan klien kepadanya dan ejen anda akan memperoleh keupayaan membaca dan menulis fail yang tidak anda tulis sendiri. Menjalankan perkara ini dengan betul, di bawah akaun servis dan dengan pilihan pengangkutan yang dijelaskan, diliputi dalam menjalankan pelayan MCP pada VPS untuk ejen pengekodan AI.
Pengajaran peringkat ini ialah reka bentuk alatan adalah kerja yang sebenar. Penerangan yang samar membuatkan model meneka. Alat yang mengembalikan empat puluh ribu aksara akan meracuni tetingkap konteks. Alat yang boleh memadamkan sesuatu akhirnya akan memadamkan sesuatu.
Tahap 4: memori, yang kebanyakannya hanyalah fail
Pengguna baharu biasanya terus memilih pangkalan data vektor untuk tujuan ini. Jangan lakukannya, sekurang-kurangnya buat masa ini.
Ejen tidak mempunyai memori antara panggilan. Anda menghantar semula keseluruhan perbualan setiap kali, itulah sebabnya sesi yang panjang menelan kos lebih tinggi bagi setiap pusingan berbanding sesi yang pendek. Jadi, memori terbahagi kepada dua masalah. Masalah pertama ialah apa yang muat dalam tetingkap konteks sekarang, yang anda uruskan dengan meringkaskan, membuang output alat yang lama, dan menyimpan cache awalan prompt anda yang stabil supaya anda membayar sebahagian kecil sahaja daripada harganya. Masalah kedua ialah apa yang kekal selepas but semula, iaitu storan.
Bagi masalah kedua, fail markdown biasa yang boleh dibaca dan ditulis oleh ejen adalah lebih baik daripada pangkalan data vektor untuk hampir setiap projek pertama. Berikan satu fail kepadanya, beritahu formatnya, arahkan ia membaca fail tersebut sebelum bermula dan mengemas kininya apabila ia mempelajari sesuatu. Anda mendapat kebanyakan manfaatnya, dan anda boleh membuka fail tersebut untuk melihat apa yang dipercayai oleh ejen anda. Beralihlah kepada embedding dan perolehan (retrieval) apabila nota tersebut tidak lagi muat dalam tetingkap konteks, dan bukan sebelum itu.
Tahap 5: gelung ialah produk
Setakat ini, anda boleh membina ejen yang berfungsi semasa anda memerhatikannya. Tahap 5 ialah memastikan ia berfungsi apabila anda tidak memerhatikannya.
Empat soalan menentukan sama ada ejen tanpa pengawasan selamat untuk ditinggalkan. Apakah pencetusnya, supaya ia tidak berjalan tanpa sebab. Apakah sempadan operasinya, supaya kesilapan kekal kecil. Bagaimanakah hasilnya disahkan, kerana ejen yang menilai kerja sendiri akan sentiasa lulus. Apakah bajet yang menghentikannya, sama ada dalam token atau masa sebenar. Mereka bentuk empat perkara tersebut secara sengaja adalah disiplin yang diterangkan dalam kejuruteraan gelung, dan perkara yang diliputi oleh definisi tersebut.
Latihannya: ambil ejen tahap 2 anda, berikan tugasan yang memerlukan empat atau lima langkah, dan tambahkan had lelaran yang tegas. Kemudian, alih keluar had tersebut dan perhatikan apa yang dilakukan oleh gelung tanpa had terhadap bil token anda. Lakukan perkara itu sekali dengan bajet kecil supaya anda tidak melakukannya secara tidak sengaja pada bajet yang besar.
Peringkat 6: keselamatan, rahsia, dan kos
Peringkat ini bukanlah pilihan, dan ia diletakkan di akhir hanya kerana anda tidak akan merasai risikonya sehingga anda membina sesuatu yang berfungsi.
Jalankan ejen sebagai pengguna tanpa keistimewaan (unprivileged user) sendiri, jangan sekali-kali sebagai root dan jangan sebagai akaun anda sendiri, supaya kesan kerosakan terhad kepada satu direktori dan bukannya seluruh mesin. Jauhkan kelayakan (credentials) daripada capaian model, kerana apa sahaja yang berada dalam tetingkap konteks boleh dipetik semula melalui panggilan alat, dan penyelesaiannya adalah dengan mengehadkan token jangka hayat pendek di sebalik pembantu seperti yang diterangkan dalam menjaga rahsia daripada ejen AI anda. Tetapkan had perbelanjaan yang tegas, kerana gelung yang tidak dipantau akan mengenakan caj bagi setiap lelaran tanpa sesiapa yang memerhati, dan had serta pemprosesan kelompok (batching) yang memastikan ia terkawal ada dalam kawalan kos ejen AI pada VPS yang sentiasa aktif.
Kos memerlukan satu angka yang konkrit. Setakat Julai 2026, Claude Opus 5 mengenakan caj $5 bagi setiap juta token input dan $25 bagi setiap juta token output, dan ejen yang banyak berkomunikasi dengan menghantar semula perbualan yang semakin panjang boleh menolak beberapa ratus ribu token melalui satu tugasan sahaja. Penimbalan prompt (prompt caching), dan penggunaan model yang lebih kecil untuk langkah rutin, mengubah pengiraan tersebut jauh lebih berkesan berbanding sebarang pengubahsuaian prompt.
Suntikan prompt (prompt injection) juga termasuk dalam bahagian ini. Jika ejen anda membaca halaman web, penjejak isu, atau peti masuk, maka sesiapa sahaja yang menulis teks tersebut sebenarnya sedang menulis arahan kepada ejen anda. Carian web biasanya merupakan alat yang membuka pintu ini terlebih dahulu, dan menghalakan ejen ke instans SearXNG anda sendiri menunjukkan pendawaian serta permukaan suntikan yang diciptanya secara bersebelahan. Pertahanannya bukanlah sistem prompt yang lebih bijak. Ia adalah sempadan, kerana ejen yang tidak boleh memadam repositori tidak boleh dipujuk untuk memadamnya.
Peta jalan manakah yang perlu anda ikuti?
Pilih satu kurikulum dan selesaikan kurikulum tersebut daripada mencuba enam kurikulum sekaligus. Repositori ai-agents-for-beginners Microsoft merupakan kurikulum percuma yang paling lengkap, iaitu kursus lapan belas pelajaran yang telah melepasi 70,000 bintang setakat Julai 2026, dan ia dipetakan dengan jelas mengikut peringkat di atas. Senarai repositori ejen yang sedang sohor kini berguna untuk mengetahui apa yang wujud, namun kurang berkesan sebagai silabus kerana senarai yang disusun mengikut bintang adalah berdasarkan populariti dan bukannya urutan pembelajaran.
Apabila anda mahukan projek sebenar untuk berlatih, ejen pengekodan merupakan sasaran pertama yang terbaik: maklum balasnya serta-merta, alatan yang digunakan jelas, dan kesilapan mudah untuk dibetulkan. Menjalankan ejen AI pengekodan pada VPS membimbing anda melalui satu proses dari awal hingga akhir. Jika anda lebih suka mengkaji sistem yang berfungsi daripada membina dari sifar, perbandingan dalam ejen AI self-hosted terbaik menunjukkan bagaimana beberapa projek menyelesaikan gelung yang sama dengan cara yang berbeza.
Berapa lama masa yang diambil?
Bagi seseorang yang sudah mempunyai kemahiran pengaturcaraan, peringkat 1 dan 2 boleh diselesaikan dalam satu malam. Peringkat 3 mengambil masa satu hujung minggu, dengan kebanyakan masa dihabiskan untuk memahami deskripsi alatan dan bukannya protokol. Peringkat 4 dan 5 mengambil masa beberapa minggu penggunaan sebenar, kerana anda hanya akan mengetahui perkara yang dilupakan oleh ejen anda dengan memerhatikannya terlupa. Peringkat 6 tidak pernah benar-benar selesai, kerana setiap keupayaan baharu yang anda berikan akan membuka semula peringkat tersebut.
Dua bulan meluangkan masa setiap malam secara konsisten membolehkan kebanyakan orang membina ejen yang berfungsi, terhad, dan berguna. Mereka yang mengambil masa sehingga setahun biasanya adalah mereka yang terus membaca tanpa memulakan pembinaan.
FAQ
Adakah saya perlu tahu pembelajaran mesin (machine learning) untuk membina ejen AI?
Tidak. Membina ejen bermaksud memanggil model melalui API dan menyambungkan permintaan alatnya kepada fungsi sebenar, yang merupakan pengaturcaraan aplikasi biasa. Anda tidak akan menyentuh latihan, kecerunan (gradients), atau set data. Kemahiran yang menentukan sama ada ejen anda berfungsi ialah reka bentuk skema untuk alatan, pengendalian ralat, dan keizinan Linux. Teori pembelajaran mesin hanya menjadi relevan jika anda ingin melakukan fine-tuning pada model, yang merupakan tugas berbeza dengan prasyarat yang berbeza.
Patutkah saya bermula dengan rangka kerja (framework) seperti LangChain atau CrewAI?
Tulis satu gelung (loop) mentah dahulu, kemudian baru gunakan rangka kerja. Rangka kerja menggantikan tiga puluh baris kod dalam peringkat 2 dengan objek konfigurasi, yang memudahkan kerja setelah anda tahu apa yang digantikannya, tetapi mengelirukan jika anda belum memahaminya. Apabila ejen anda berkelakuan tidak betul, anda perlu menaakul senarai mesej dan hasil alat secara terus, dan itu jauh lebih sukar jika anda tidak pernah melihatnya. Selepas membina satu gelung sendiri, rangka kerja akan menjimatkan masa anda dan bukannya menyembunyikan mekanismenya.
Berapakah kos untuk mempelajari ejen AI?
Kurang daripada jangkaan kebanyakan orang, jika anda mengehadkannya. Kunci API yang dihoskan dan VPS kecil sudah mencukupi untuk keenam-enam peringkat ini. Risiko sebenar bukanlah kadar bayaran setiap jam, tetapi gelung tanpa had yang mengenakan caj setiap lelaran semasa anda tidur. Tetapkan had perbelanjaan yang ketat pada akaun API anda pada hari pertama, tambahkan had lelaran pada setiap gelung yang anda tulis, dan gunakan model yang lebih murah untuk langkah rutin. Menjalankan model secara setempat (locally) menghapuskan bil token dan menggantikannya dengan keperluan perkakasan.
Apakah perbezaan antara ejen AI dan chatbot?
Chatbot menjawab sekali sahaja. Ejen mengulangi kitaran: model meminta alat, kod anda menjalankannya, hasil dihantar semula, dan model memutuskan perkara seterusnya. Pengulangan itulah yang membolehkan ejen menyelesaikan tugasan dengan beberapa langkah, dan itulah sebabnya ejen memerlukan sempadan yang tidak diperlukan oleh chatbot. Jawapan yang salah daripada chatbot hanyalah perenggan yang buruk. Jawapan yang salah daripada ejen adalah perenggan yang buruk berserta apa sahaja tindakan yang telah dilakukannya.