SSD Nodes Learn RAM 8GB — $66/mwaka
Mwongozo Matt ConnorNa Matt Connor · Imeboreshwa 2026-08-01

Jinsi ya kujifunza mawakala wa AI kuanzia mwanzo

Fuata hatua sita za kujifunza mawakala wa AI: dhana, mzunguko wa kwanza, zana, kumbukumbu, muundo wa mzunguko na usalama, huku ukijenga kila hatua.

Njia katika hatua sita

Ili kujifunza mawakala wa AI kuanzia mwanzo, pitia hatua sita kwa mpangilio: dhana, mzunguko wako wa kwanza, zana, kumbukumbu, muundo wa mzunguko, na usalama. Kila hatua ina jambo moja unalojenga kwa mikono yako mwenyewe. Kuruka hatua za mwanzo ndiyo sababu ya kawaida ya watu kukwama, kwa sababu mfumo huficha hasa sehemu uliyohitaji kuiona.

Wakala wa AI ni mzunguko unaomzunguka modeli ya lugha na kuiruhusu kuita zana. Sentensi hiyo ndiyo mada nzima. Kila kitu kinachofuata ni maelezo kuhusu kinachoingia kwenye mzunguko, vitu ambavyo zana zinaweza kufikia, na jinsi ya kusimamisha mzunguko unapokosea. Ukiweza kumweleza mtu mwingine mzunguko huo, umejifunza jambo hilo. Ukiweza kutaja mifumo pekee, bado hujalijifunza.

Mpango ulio hapa chini unachukulia kuwa unajifunza kwa kujenga. Soma hatua, jenga kitu kidogo, kiharibu kwa makusudi, kisha songa mbele. Hatua ambayo umeisoma tu ni hatua ambayo bado hujaitekeleza.

Unachohitaji kabla ya hatua ya 1

Orodha halisi ya mahitaji ya awali ni fupi, na ni fupi kuliko inavyodaiwa na kurasa nyingi za kozi.

  • Unaweza kusoma na kuandika Python au TypeScript kwa kiwango cha script yenye mistari hamsini.
  • Uko tayari kutumia Linux shell: kusakinisha package, kuhariri file, na kusoma log.
  • Una API key ya model inayopangishwa, au mashine inayoweza kuendesha model ya ndani.

Hiyo ndiyo orodha yote. Huhitaji nadharia ya machine learning, wala huhitaji kuwa umefunza model. Hakuna kitu katika kazi ya agent kinachohusisha gradients au training data. Graphics card ni muhimu tu ukiamua kuendesha model mwenyewe. Huo ni ujuzi tofauti ambao unaweza kujifunza baadaye kupitia kupangisha Ollama kwenye VPS ili kuendesha LLM yako mwenyewe.

Kitu ambacho watu hukadiria chini ni sehemu ya shell. Agents hushindwa kwa sababu ya ruhusa, paths, environment variables, na processes zinazokufa kimya. Ikiwa stack trace kuhusu PATH au file mode inakufanya ufunge terminal, tumia wikendi kujifunza misingi ya Linux kwanza. Hilo litakuokoa mwezi mmoja baadaye.

Hatua ya 1: wakala ni nini, na si nini

Anza kwa ombi moja la API bila kitanzi. Tuma prompt, chapisha jibu, kisha angalia idadi ya tokeni katika jibu. Sasa unaelewa kipimo cha gharama na kipimo cha muda wa kusubiri.

Kisha jifunze matumizi ya zana. Hili ndilo wazo jipya la msingi katika eneo hili lote. Unaeleza function kwa modeli kwa kutumia jina, maelezo, na schema ya JSON (JavaScript object notation) ya ingizo lake. Modeli haiendeshi chochote. Inajibu kwa ombi lenye muundo: kuita run_command kwa hoja hizi. Msimbo wako huendesha function, hutuma matokeo kama ujumbe, kisha huiuliza modeli tena. Modeli ni mpangaji anayesoma maandishi na kuandika maandishi. Msimbo wako ndio unaotekeleza vitendo.

Chatbot huisha baada ya jibu moja. Agent hurudia mawasiliano hayo hadi modeli iache kuomba zana. Kurudia huko ndiko kunakotofautisha mambo haya mawili, na ndiyo sababu hali za hitilafu pia hutofautiana. Chatbot hutoa jibu lisilo sahihi mara moja. Agent hutenda kulingana na jibu lisilo sahihi mara kadhaa kabla mtu yeyote hajagundua.

Hatua ya 2: andika kitanzi mwenyewe, mara moja

Usianze na framework. Andika takribani mistari thelathini ya Python ili muundo wa programu uwe wako.

sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-here
import subprocess
import anthropic

client = anthropic.Anthropic()

tools = [{
    "name": "run_command",
    "description": "Run a read only shell command and return its output.",
    "input_schema": {
        "type": "object",
        "properties": {"command": {"type": "string"}},
        "required": ["command"],
    },
}]

messages = [{"role": "user", "content": "How much disk space is free here?"}]

while True:
    response = client.messages.create(
        model="claude-opus-5",
        max_tokens=4096,
        tools=tools,
        messages=messages,
    )
    if response.stop_reason != "tool_use":
        break
    messages.append({"role": "assistant", "content": response.content})
    results = []
    for block in response.content:
        if block.type == "tool_use":
            done = subprocess.run(
                block.input["command"], shell=True,
                capture_output=True, text=True, timeout=10,
            )
            results.append({
                "type": "tool_result",
                "tool_use_id": block.id,
                "content": done.stdout or done.stderr,
            })
    messages.append({"role": "user", "content": results})

print(next(b.text for b in response.content if b.type == "text"))

Iendeshe kwa python3 agent.py. Uendeshaji unaofaulu huchapisha aya moja inayotaja filesystems zako na nafasi yake iliyo huru, kwa sababu model iliomba df -h, msimbo wako ukaitekeleza, kisha awamu ya pili ikabadilisha jedwali hilo kuwa sentensi. Ikiwa hakuna kinachochapishwa, kitanzi kilimalizika kabla ya text block kufika. Weka print(response.stop_reason) ndani ya kitanzi na ufuatilie jinsi thamani zinavyobadilika.

Sasa ivunje kwa makusudi. Futa mstari wa tool_use_id na usome kosa, kwa sababu matokeo ya tool yasiyokuwa na id inayolingana hukataliwa na API, na hili ndilo kosa linalofanywa zaidi na wanaoanza. Uliza swali linalohitaji commands mbili na ufuatilie kitanzi kinavyoendeshwa mara mbili. Uliza jambo lisilowezekana na uone kama itaacha kujaribu au itazunguka bila mwisho.

Tahadhari moja kuhusu mfano huu. Unapitisha moja kwa moja output ya model kwenye shell kwa shell=True, jambo linalokubalika kwenye mashine ya majaribio unayoweza kuijenga upya, lakini si sahihi mahali pengine popote. Hatua ya 6 inarekebisha hilo. Dhana zilizo chini ya kitanzi zimeelezwa kwa urefu zaidi katika kujenga AI agent wako mwenyewe kwenye VPS.

Hatua ya 3: zana ambazo wakala hakuwa nazo awali

Zana yako ya run_command inafanya kazi, lakini wakala halisi anahitaji zana zinazofikia mifumo iliyo nje ya seva: mfumo wa tiketi, hifadhidata na hazina ya msimbo. Kuandika kifungashio maalum kwa kila huduma na kwa kila wakala hakupanuki.

Model Context Protocol (MCP) ndiyo suluhisho lililokubaliwa na sekta. Seva ya MCP hufichua seti ya zana kupitia usafirishaji sanifu, na wakala yeyote anayejua MCP anaweza kuzitumia bila msimbo maalum wa kuunganisha. Seva rejelewa ya mfumo wa faili ni amri moja:

npx -y @modelcontextprotocol/server-filesystem /home/you/projects

Hii inahitaji Node iwe imesakinishwa, na hoja ya saraka ndiyo njia pekee ambayo seva itagusa. Huu ndio mfano mfupi wa muundo wa usalama: seva ndiyo huamua mpaka, si modeli. Elekeza mteja kwake, na wakala wako atapata uwezo wa kusoma na kuandika faili ambao hukuandika wewe. Kuendesha seva hizi ipasavyo, chini ya akaunti ya huduma na kwa chaguo za usafirishaji zilizoelezwa, kumejadiliwa katika kuendesha seva za MCP kwenye VPS kwa mawakala wa usimbaji wa AI.

Somo la hatua hii ni kwamba usanifu wa zana ndiyo kazi halisi. Maelezo yasiyo wazi huifanya modeli ikisie. Zana inayorejesha herufi elfu arobaini huharibu dirisha la muktadha. Zana inayoweza kufuta vitu hatimaye itafuta vitu.

Hatua ya 4: kumbukumbu, ambayo kwa kiasi kikubwa ni faili tu

Wanaoanza mara nyingi hutumia hifadhidata ya vekta katika hatua hii. Usifanye hivyo, angalau si bado.

Agent haina kumbukumbu kati ya simu. Unatuma tena mazungumzo yote kila mara. Ndiyo maana kikao kirefu hugharimu zaidi kwa kila zamu kuliko kikao kifupi. Kwa hiyo, kumbukumbu hugawanyika katika matatizo mawili. La kwanza ni kile kinachotoshea kwenye dirisha la muktadha kwa sasa. Unakidhibiti kwa kufanya muhtasari, kupunguza matokeo ya zamani ya zana, na kuhifadhi akiba ya sehemu thabiti ya mwanzo ya kidokezo chako ili ulipe sehemu ndogo ya gharama yake. La pili ni kile kinachobaki baada ya kuanzisha upya mfumo. Hicho ni uhifadhi.

Kwa tatizo la pili, faili la kawaida la markdown ambalo agent anaweza kusoma na kuandika linafaa zaidi kuliko hifadhidata ya vekta kwa karibu kila mradi wa kwanza. Mpe faili moja, mwambie muundo wake, na mwambie alisome faili hilo kabla ya kuanza na kulisasisha anapojifunza jambo. Utapata faida kubwa, na unaweza kufungua faili hilo na kuona kile agent wako anaamini. Tumia embeddings na retrieval pale madokezo yanapoacha kutoshea kwenye dirisha la muktadha, na si kabla ya hapo.

Hatua ya 5: mzunguko ndio bidhaa

Kufikia hapa unaweza kuunda agent inayofanya kazi unapoifuatilia. Hatua ya 5 ni kuifanya ifanye kazi usipokuwepo.

Maswali manne huamua ikiwa agent isiyosimamiwa ni salama kuachwa iendelee yenyewe. Ni nini kinachoianzisha, ili isianze bila sababu. Inafanya kazi ndani ya mpaka gani, ili kosa libaki dogo. Matokeo yanathibitishwaje, kwa sababu agent inayokagua kazi yake yenyewe daima hujipatia ufaulu. Ni bajeti gani inayoizuia, kwa idadi ya tokeni au muda halisi wa utekelezaji. Kubuni vipengele hivyo vinne kwa makusudi ndiyo nidhamu inayofafanuliwa katika uundaji wa mizunguko na kile kinachojumuishwa na ufafanuzi huo.

Zoezi: chukua agent yako ya hatua ya 2, ipe kazi inayohitaji hatua nne au tano, kisha uongeze kikomo thabiti cha marudio. Ondoa kikomo hicho na uangalie athari za mzunguko usio na kikomo kwenye bili yako ya tokeni. Fanya hivyo mara moja kwa bajeti ndogo ili usije ukafanya kwa bahati mbaya kwenye bajeti kubwa.

Hatua ya 6: usalama, siri, na gharama

Hatua hii si ya hiari. Imewekwa mwisho kwa sababu huwezi kuhisi hatari hadi ujenge kitu kinachofanya kazi.

Endesha agent kwa mtumiaji wake asiye na mamlaka ya juu. Usiendeshe kamwe kama root au kama akaunti yako mwenyewe. Kwa njia hii, athari za uvunjaji wa usalama zinaishia kwenye saraka badala ya kuathiri mashine nzima. Weka vitambulisho vya ufikiaji mbali na kile ambacho model inaweza kufikia. Kila kitu kilicho kwenye dirisha la muktadha kinaweza kunukuliwa na kutolewa kupitia mwito wa zana. Suluhisho ni kutumia tokeni za muda mfupi zenye upeo mdogo, kupitia helper, kama ilivyoelezwa katika kuweka siri mbali na mawakala wako wa AI. Weka kikomo kisichozidiwa cha matumizi. Kitanzi kinachoendeshwa bila usimamizi hutoza gharama kwa kila marudio bila mtu anayefuatilia. Vikomo na uchakataji wa mafungu unaodhibiti hali hii vimeelezwa katika udhibiti wa gharama za agent wa AI kwenye VPS inayowashwa kila wakati.

Gharama inahitaji nambari moja ya wazi. Kufikia July 2026, Claude Opus 5 hutoza $5 kwa kila tokeni milioni moja za ingizo na $25 kwa kila tokeni milioni moja za towe. Agent mwenye mazungumzo mengi anay tuma tena mazungumzo yanayokua anaweza kupitisha tokeni laki kadhaa kupitia kazi moja. Uhifadhi wa prompt kwenye akiba na kutumia model ndogo kwa hatua za kawaida hubadilisha hesabu hiyo kwa kiwango kikubwa zaidi kuliko marekebisho yoyote ya prompt.

Prompt injection inahusika hapa pia. Ikiwa agent yako inasoma ukurasa wa wavuti, mfumo wa kufuatilia masuala, au kikasha cha ujumbe, basi aliyeandika maandishi hayo pia anaandika maagizo kwa agent yako. Kinga si prompt ya mfumo yenye ujanja zaidi. Kinga ni mpaka wa ruhusa. Agent ambaye hawezi kufuta repository hawezi kushawishiwa kuifuta.

Ni ramani ipi unayopaswa kufuata?

Chagua mtaala mmoja na ukamilishe badala ya kujaribu sita. Hifadhi ya Microsoft ai-agents-for-beginners ndiyo iliyo kamili zaidi kati ya hifadhi za bila malipo. Ina kozi ya masomo kumi na nane ambayo imepata nyota zaidi ya 70,000 kufikia Julai 2026. Pia inaendana vizuri na hatua zilizoelezwa hapo juu. Orodha za hifadhi za mawakala zinazovuma zinafaa kwa kuona vilivyopo, lakini hazifai sana kama mtaala. Hii ni kwa sababu orodha iliyopangwa kwa nyota hupangwa kulingana na umaarufu, si kwa mpangilio wa kufundisha.

Unapotaka mradi halisi wa kufanya mazoezi, wakala wa kuandika msimbo ndiye chaguo bora la kwanza. Maoni hutolewa mara moja, zana zinaeleweka, na makosa ni rahisi kuyatengua. Kuendesha wakala wa AI wa kuandika msimbo kwenye VPS kunaeleza mchakato mzima. Ikiwa ungependa kusoma mifumo inayofanya kazi badala ya kuijenga kuanzia mwanzo, ulinganisho katika mawakala bora wa AI wanaojihifadhi unaonyesha jinsi miradi kadhaa inavyotekeleza mzunguko huo kwa njia tofauti.

Inachukua muda gani?

Kwa mtu ambaye tayari anapanga programu, hatua ya 1 na 2 huchukua jioni moja. Hatua ya 3 huchukua wikendi moja, na muda mwingi hutumika kueleza zana badala ya itifaki. Hatua ya 4 na 5 huchukua wiki chache za matumizi halisi, kwa sababu unajifunza tu kile ambacho wakala wako husahau kwa kuuangalia ukisahau. Hatua ya 6 haikamiliki kabisa, kwa maana kwamba kila uwezo mpya unaompa huifanya ianze tena.

Jioni mbili za miezi miwili zenye mfululizo huwafikisha watu wengi kwenye wakala unaofanya kazi, mwenye mipaka na unaofaa. Wanaochukua mwaka mmoja kwa kawaida ni wale walioendelea kusoma badala ya kujenga.

FAQ

Je, ninahitaji kujua machine learning ili kuunda wakala wa AI?

Hapana. Kuunda wakala kunamaanisha kuita modeli kupitia API na kuunganisha maombi yake ya zana na functions halisi. Hii ni programming ya kawaida ya programu. Huhitaji kushughulikia training, gradients au datasets. Ujuzi unaoamua kama wakala wako utafanya kazi ni kubuni schema za zana, kushughulikia errors na kusanidi permissions za Linux. Nadharia ya machine learning huwa muhimu tu ukiendelea kufanya fine tuning ya modeli. Hilo ni jukumu tofauti lenye masharti tofauti ya awali.

Je, nianze na framework kama LangChain au CrewAI?

Kwanza andika loop moja ya moja kwa moja, kisha tumia framework. Framework hubadilisha mistari thelathini ya stage 2 na kuwa configuration object. Hii ni rahisi baada ya kujua inachobadilisha, lakini inaweza kuchanganya kabla ya hapo. Wakati wakala wako anafanya kazi isivyotarajiwa, unahitaji kuchanganua moja kwa moja orodha ya messages na matokeo ya zana. Hilo ni gumu zaidi ikiwa hujawahi kuyaona. Baada ya kuandika loop yako mwenyewe, framework hukuokoa muda badala ya kuficha utaratibu.

Kujifunza mawakala wa AI hugharimu kiasi gani?

Gharama ni ndogo kuliko watu wengi wanavyotarajia, ukidhibiti matumizi. API key ya huduma ya nje na VPS ndogo vinatosha kwa hatua hizi sita. Hatari halisi si kiwango cha gharama kwa saa. Ni loop isiyo na kikomo inayotoza gharama kwa kila iteration wakati umelala. Weka spend limit isiyoweza kuzidi kwenye akaunti yako ya API siku ya kwanza. Ongeza iteration cap kwenye kila loop unayoandika. Tumia modeli ya gharama ndogo kwa hatua za kawaida. Kuendesha modeli locally huondoa gharama ya tokeni na badala yake kunahitaji hardware yenye uwezo unaofaa.

Kuna tofauti gani kati ya wakala wa AI na chatbot?

Chatbot hujibu mara moja. Wakala hurudia cycle: modeli huomba zana, code yako huiendesha, matokeo hurudishwa, kisha modeli huamua hatua inayofuata. Marudio hayo huwezesha wakala kukamilisha kazi yenye hatua kadhaa. Pia ndiyo sababu mawakala wanahitaji mipaka ambayo chatbots hazihitaji. Jibu lisilo sahihi kutoka kwa chatbot ni paragraph mbaya. Jibu lisilo sahihi kutoka kwa wakala ni paragraph mbaya pamoja na hatua yoyote aliyochukua kulihusu.

#ai-agents#learning#curriculum#mcp#self-hosting