Aina za mawakala wa AI na jinsi zinavyofanya kazi
Jifunze tofauti kati ya mawakala wa reflex, goal-based, utility-based, na learning agents. Tunachambua ni aina zipi za mawakala unaoweza kujiendeshea mwenyewe kwenye seva yako.
Aina za mawakala wa AI
Aina za mawakala wa AI zinatokana na taksonomia moja: mawakala wa reflex rahisi, reflex inayotegemea modeli, wanaolenga malengo, wanaolenga matumizi, na mawakala wanaojifunza. Kila jina linaelezea jambo moja: kiasi gani wakala anakumbuka na anapanga mbali kiasi gani kabla ya kuchukua hatua. Istilahi nyingine mbili, multi-agent na hierarchical, zinaelezea jinsi mawakala kadhaa wanavyounganishwa pamoja badala ya jinsi wakala mmoja anavyofanya maamuzi.
Orodha hiyo ni ya zamani kuliko kila modeli uliyowahi kutumia. Inatoka kwenye kitabu cha kiwango cha juu cha AI, na ilinusurika ujio wa large language models kwa sababu inauliza swali ambalo bado linaamua usanifu wako: kitu hiki kinahitaji kujua nini kabla hakijachukua hatua? Ikiwa bado unajaribu kutofautisha mahali wakala anapoishia na chat assistant anapoanzia, soma tofauti kati ya wakala wa AI na LLM inayomwendesha kwanza. Ukurasa huu unaanza baada ya mstari huo.
Mawakala wa reflex rahisi: sharti moja, kitendo kimoja
Wakala wa reflex rahisi huunganisha ingizo la sasa na kitendo, na hauhifadhi kumbukumbu yoyote ya yaliyotangulia. Ikiwa joto ni zaidi ya 25, washa feni. Huo ndio utaratibu mzima.
Bila shaka umeshawahi kuendesha wakala wa aina hii. Webhook inayochochea workflow ya n8n, ambayo inasoma fomu iliyowasilishwa na kuandika safu kwenye database, ni wakala wa reflex rahisi. Inabaki kuwa hivyo hata kama language model imewekwa katikati ili kuchagua kategoria ya safu hiyo. Ikiwa utaiuliza ilichokifanya saa moja iliyopita, haiwezi kukuambia, kwa sababu hakuna kilichohifadhi jibu hilo.
Aina hii ni sahihi mara nyingi zaidi kuliko watu wanavyotarajia. Ni nafuu kuendesha, na kushindwa kwake ni dhahiri: sharti lilitimia, au halikutimia. Wakati kazi ikiwa ni "X ikifika, fanya Y", kumbukumbu huongeza njia za kukosea na haileti faida yoyote. Wakala wa n8n anayeanzishwa na webhook ni sehemu hii ya taksonomia ikiwa na kiolesura cha mtumiaji juu yake.
Wakala huu hufeli pale tu kitendo sahihi kinapohitaji historia. Bot ya kujibu ujumbe isiyo na hali ya thread itajipinga yenyewe kwenye ujumbe wa tatu, kwa sababu ujumbe miwili ya kwanza haikuwa sehemu ya ingizo lake.
Mawakala wa reflex wenye msingi wa modeli: kuhifadhi hali kati ya matukio
Wakala wa reflex mwenye msingi wa modeli huhifadhi picha ya ndani ya mazingira yake na kusasisha picha hiyo kadiri pembejeo mpya zinapofika. Neno "modeli" hapa linamaanisha modeli ya ulimwengu, si mtandao wa neva (neural network). Neno hili lilitumika kabla ya maana ya sasa kwa takriban miaka arobaini, na huwachanganya karibu kila mtu anapolisoma kwa mara ya kwanza.
Kanuni ya otomatiki ya nyumbani inayozima taa baada ya dakika 20 bila mwendo ni ya msingi wa modeli. Lazima iwe hivyo. "Hakuna mwendo sasa hivi" na "hakuna mwendo tangu 21:40" ni pembejeo sawa kwa wakala rahisi wa reflex, kwa hivyo hali iliyohifadhiwa pekee ndiyo inayoweza kuzitofautisha.
Toleo la LLM ni wakala yeyote aliye na hifadhi ya kumbukumbu nyuma yake: muhtasari wa mazungumzo unaoendelea, au faili rahisi ya markdown ambayo wakala huisoma mwanzoni mwa kila utekelezaji. Huduma ya kumbukumbu ya ndani kwa ajili ya wakala ni wazo hilo lililowekwa kwenye mfumo. Utaratibu haubadiliki. Picha ya wakala kuhusu ulimwengu huishi muda mrefu zaidi kuliko tukio lililoianzisha.
Hali ina gharama yake. Ukweli uliopitwa na wakati ni mbaya zaidi kuliko kutokuwa na ukweli wowote, kwa sababu wakala hufanya maamuzi kulingana nao kwa kujiamini kikamilifu na bila onyo. Kitu chochote unachohifadhi kinahitaji njia ya kuisha muda wake au njia ya kukaguliwa upya, vinginevyo wakala ataendelea kufanya hoja kuhusu seva uliyoiacha kufanya kazi mwezi Machi.
Mawakala wanaozingatia malengo: kupanga kuelekea hali unayoweza kuikagua
Wakala anayezingatia lengo hupokea hali inayolengwa na kutafuta mfululizo wa hatua za kuifikia. Hufanya kazi kuanzia mwisho kurudi nyuma, kwa hivyo njia haijaandikwa mapema.
Wakala wa kuandika msimbo (coding agent) ndiye mfano dhahiri zaidi unaoweza kuujaribu mwenyewe. "Fanya jaribio linalofeli lifaulu" halitaji faili wala hatua zozote. Wakala husoma jaribio, huunda mpango, kuhariri kitu, kuendesha jaribio, kusoma hitilafu, na kujaribu tena. Mzunguko huu huishia kwenye ukaguzi ambao wakala anaweza kuufanya kihalisi, ndiyo maana maelekezo hayo hufanya kazi na "boresha msimbo huu" haifanyi kazi. Lengo ambalo wakala anaweza kulipima ni lengo ambalo wakala anaweza kulifikia. Lengo ambalo hawezi kulipima hugeuka kuwa mzunguko usio na mwisho wenye gharama. Kuendesha wakala wa kuandika msimbo kwenye VPS yako mwenyewe huweka mzunguko huo mahali ambapo unaweza kufanya kazi bila kutumia kompyuta yako.
Gharama hupatikana katika hatua hii. Kila hatua ya kupanga ni ombi lingine la modeli linalobeba historia ya awali, kwa hivyo kazi ya hatua kumi si mara kumi ya bei ya hatua moja, bali ni zaidi ya hapo. Uhandisi unaozingatiwa hapa ni umbo la mzunguko na sharti la kuusimamisha, ambalo ndilo mada ya uhandisi wa mzunguko.
Mawakala wanaotumia utility: kuchagua kati ya majibu kadhaa mazuri
Lengo ni la binary. Utility ni alama. Wakala anayetumia utility hukabiliwa na matokeo kadhaa yanayokubalika na huchagua lile lenye alama ya juu zaidi kulingana na utendaji uliouandika.
Kazi ya backup inayopaswa kukamilika kabla ya siku ya kazi kuanza bila kujaa kwa uplink ni tatizo la utility. Hakuna jibu moja sahihi, bali ni uwiano wa mambo (trade-off). Router inayoamua ni model ipi itashughulikia ombi lipi, ikipima bei dhidi ya ubora wa jibu, ina muundo uleule.
Algorithm si sehemu ngumu. Kuandika utendaji wa utility wa kweli ndiyo sehemu ngumu. Ukipima kwa gharama pekee, utapata model ya bei nafuu zaidi kwa kila ombi, ikijumuisha lile ombi moja lililohitaji model ya gharama kubwa. Mfumo huboresha kile ulichopima hasa, jambo ambalo ni tatizo pale kile ulichopima kilichaguliwa kwa sababu kilikuwa rahisi kupimika.
Mawakala wa kujifunza: aina ambayo watu wengi hudhani tayari wanayo
Wakala wa kujifunza hubadilisha tabia yake mwenyewe kulingana na maoni kuhusu matokeo ya awali. Inahitaji kitu kinachotathmini matokeo na kitu kinachobadilisha sera kulingana na matokeo hayo.
Ni mifumo michache sana inayojiendesha yenyewe (self-hosted) inayokidhi vigezo hivi. Wakala anayesoma madokezo aliyoandika wiki iliyopita ni wakala anayetegemea modeli (model-based agent) yenye faili la kumbukumbu. Uzito wake (weights) ni uleule. Sera yake ni ileile. Urejeshaji wa taarifa si kujifunza, na tofauti hii ni ya kivitendo: mfumo unaotegemea kumbukumbu hurudia kosa milele isipokuwa kitu fulani kihariri kumbukumbu hiyo, wakati mfumo wa kujifunza unapaswa kuacha kulirudia kosa hilo.
Ikiwa unataka sehemu ya kujifunza, jenga tathmini kwanza. Seti ya majaribio yenye alama, uendeshaji wa mabadiliko yako dhidi ya seti hiyo, na uamuzi wa kuhifadhi au kutupa mabadiliko hayo ni mzunguko uliofungwa (closed loop) ambapo wewe ndiye sehemu ya kujifunza. Hilo ni polepole kuliko linavyosikika, na ndilo toleo pekee linalofanya kazi leo kwenye sehemu zinazojiendesha (self-hosted). Kujiendeshea mfumo wa tathmini ndipo mahali pa kuanzia.
Mifumo ya mawakala wengi na mifumo ya kihierarkia: mpangilio, si aina
Hizi si aina ya sita na ya saba. Zinaelezea jinsi mawakala wanavyopangwa.
Mfumo wa mawakala wengi huendesha mawakala kadhaa kwa wakati mmoja ndani ya mazingira yaliyoshirikiwa, kama vile foleni (queue) au git repository. Kwa sababu mazingira yanashirikiwa, mawakala hugongana ndani yake. Mawakala wawili kuhariri faili moja ndilo kosa la kawaida, na suluhisho lake ni lock au foleni ya kazi. Hakuna prompt inayoweza kutatua hili.
Mfumo wa kihierarkia huweka msimamizi juu ya wafanyakazi. Msimamizi hugawanya kazi, hutoa sehemu zake, na kuunganisha matokeo yanayorudi. Mfumo huu ni maarufu kwa sababu unaendana na jinsi watu wanavyogawanya kazi, na ni ghali kwa sababu muktadha wa msimamizi hukua kwa kila ripoti anayosoma. A multi-agent harness inaonyesha jinsi ya kuunganisha mifumo hiyo katika utendaji.
Wakala mmoja anayefanya kazi vizuri ni bora kuliko wanne wanaofanya kazi kwa kusuasua.
Kila hatua ya kukabidhi kazi ni mahali ambapo taarifa zinaweza kupotea. Anza na kitanzi kimoja. Kigawanye tu pale unapoweza kutaja hatua inayokwamisha mtiririko wa kazi (bottleneck).
Kwa nini karibu kila mfumo halisi ni mseto
Fikiria wakala wa deployment unayoweza kujiendeshea mwenyewe. Webhook huianzisha, jambo ambalo ni la kiitikio (reflex). Inasoma hali ya sasa ya release, jambo ambalo linategemea modeli (model-based). Inapanga hatua kutoka toleo linaloendelea hadi toleo lengwa, jambo ambalo linategemea lengo (goal-based). Inachagua muda wa rollout kulingana na mzigo wa sasa, jambo ambalo linategemea matumizi (utility-based). Haiwahi kuhariri sera yake yenyewe, kwa hivyo haijifunzi.
Mfumo mmoja, safu nne za taksonomia kwa wakati mmoja. Taksonomia inathibitisha umuhimu wake kama orodha ya ukaguzi wa usanifu, si kama lebo ya bidhaa iliyokamilika. Mfumo unapofanya kazi vibaya, swali la maana ni safu ipi iliyo na hitilafu. Kichochezi kilichofanya kazi kwenye tukio lisilo sahihi, hali iliyopitwa na wakati, ukaguzi wa lengo ambao hauwezi kufaulu kamwe, na alama inayozawadia matokeo yasiyo sahihi ni hitilafu nne tofauti zenye marekebisho manne tofauti.
Ni aina gani inayofaa kwa kazi ipi
- Trigger isiyobadilika, majibu yasiyobadilika, hakuna historia inayohitajika: reflex rahisi.
- Majibu sahihi yanategemea yaliyotokea awali: reflex inayotegemea modeli.
- Hali ya mwisho inaweza kukaguliwa lakini njia haijulikani mapema: inayotegemea lengo.
- Matokeo kadhaa yanayokubalika yenye uwiano wa kweli kati yao: inayotegemea manufaa.
- Unahitaji matokeo kuboreka kadiri muda unavyopita: jenga mzunguko wa tathmini (eval loop), na ukubali kuwa wewe ndiye sehemu ya kujifunza.
Je, unaweza kujiendeshea mawakala hawa mwenyewe, na gharama yake ni nini?
Ndiyo, na gharama hugawanyika mara mbili. Orchestration ni nafuu. Instance ya n8n au loop ya wakala katika Python hutumia muda wake mwingi kusubiri maombi ya mtandao, kwa hivyo 2 vCPU na 4 GB ya RAM inatosha. Gharama halisi iko kwenye model.
Ikiwa wakala anaita API iliyohifadhiwa kwenye seva nyingine, seva yako haihitaji chochote na bili huongezeka kulingana na idadi ya tokens. Kwa wakala anayefanya kazi kwa malengo, hii inamaanisha gharama huongezeka kulingana na idadi ya hatua za kupanga unazoruhusu, kwa hivyo weka kikomo kwenye loop.
Ikiwa utaendesha model kwenye vifaa vyako mwenyewe, RAM ndiyo huamua kile unachoweza kuendesha. Takwimu hapa chini ni ukubwa wa faili zilizochapishwa kwa ajili ya 4-bit quantised weights kufikia Agosti 2026, kando ya makadirio ya jumla ya RAM inayohitajika, kwa sababu context window na runtime zote zinahitaji nafasi zaidi ya uzito wa model yenyewe.
The data behind this chart
[
{
"label": "3B model",
"weights_gb": 2,
"ram_needed_gb": 6
},
{
"label": "8B model",
"weights_gb": 4.9,
"ram_needed_gb": 10
},
{
"label": "14B model",
"weights_gb": 9,
"ram_needed_gb": 16
},
{
"label": "32B model",
"weights_gb": 20,
"ram_needed_gb": 32
},
{
"label": "70B model",
"weights_gb": 43,
"ram_needed_gb": 64
}
]Model ya 8B katika 4-bit ina uzito wa takriban 4.9 GB, na mashine yenye 10 GB ya RAM huiendesha bila kutumia swap. Model ya 70B katika quantisation hiyo hiyo ina uzito wa 43 GB na inahitaji takriban 64 GB. Kumbuka kile ambacho namba hizo hazijumuishi: kasi. Kwenye VPS isiyo na GPU, model ya 8B katika 4-bit hutoa tokens chache kwa sekunde. Hii inafaa kwa wakala anayefanya kazi kwenye foleni usiku kucha, lakini ni polepole sana kwa kazi yoyote ambayo mtu anaisubiri. Hifadhi inference ya ndani kwa ajili ya kazi za batch, na tumia GPU au API kwa sehemu zinazohitaji mwingiliano wa haraka. Orodha fupi ya mawakala wa AI unaoweza kujiendeshea inaelezea ni miradi ipi inayostahili nafasi kwenye diski, na njia ya kujifunza mawakala mwaka 2026 inaelezea nini cha kujifunza na kwa mpangilio upi.
Mahali ambapo taksonomia huacha kusaidia
Haisemi chochote kuhusu zana au ruhusa. Mawakala wa vitabu vya kiada hutambua na kutenda. Hakuna mtu aliyeandika sura hiyo aliyekuwa na wasiwasi kuhusu wakala anayeshikilia API token ya uzalishaji. Wakala anayezingatia malengo mwenye ufikiaji wa shell na wakala anayezingatia malengo mwenye muunganisho mmoja wa database wa kusoma pekee (read-only) wako kwenye mstari mmoja wa jedwali na wanabeba hatari tofauti kabisa. Amua kile ambacho wakala anaweza kugusa kabla ya kuamua jinsi anavyopaswa kuwa mwerevu, na soma jinsi ya kuweka siri mbali na wakala wa AI kabla ya kumpa kitambulisho (credential).
Pia haisemi chochote kuhusu kinachotokea wakati hatua fulani inashindwa. Mawakala wa kweli hutumia muda wao mwingi wa runtime kushughulikia makosa: kikomo cha kasi (rate limit), au zana iliyorejesha kitu ambacho model haikutarajia. Kanuni hiyo ndiyo huamua kama mfumo wako unaweza kutumika, na hakuna mstari wowote wa taksonomia unaoelezea jambo hilo.
FAQ
Je, ni aina gani tano za AI agents?
Simple reflex, model-based reflex, goal-based, utility-based, na learning agents. Zimepangwa kulingana na kiasi cha maarifa ambacho agent anacho kabla ya kuchukua hatua. Simple reflex agent huona tu input ya sasa. Model-based agent huhifadhi hali ya mazingira yake. Goal-based agent hupanga hatua kuelekea hali lengwa. Utility-based agent hupima matokeo kadhaa yanayokubalika na kuchagua lenye alama ya juu zaidi. Learning agent hubadilisha sera yake yenyewe kutokana na maoni (feedback), jambo ambalo karibu hakuna usanidi wa self-hosted unaolifanya.
Ni aina gani ya AI agent ninayopaswa kutumia kwa automation rahisi?
Simple reflex agent, ambayo kwa vitendo inamaanisha webhook au ratiba inayochochea mlolongo uliopangwa. Ikiwa jibu sahihi linategemea tu input iliyowasili, kumbukumbu (memory) huongeza uwezekano wa kufeli bila kuongeza uwezo wowote. Hamia kwenye muundo wa model-based pale unapoweza kutaja uamuzi mmoja ambao lazima ujue yaliyotokea awali.
Je, ninaweza kuendesha AI agents zangu kwenye VPS?
Ndiyo. Safu ya orchestration ni nyepesi, kwa hivyo 2 vCPU na 4 GB ya RAM huendesha workflow engine au agent loop kwa urahisi. Uamuzi wa msingi ni mahali ambapo model inaendeshwa. Hosted API huifanya seva kuwa ndogo na kuhamishia gharama kwenye tokens. Local model inahitaji RAM kulingana na idadi ya vigezo vyake (parameter count), na bila GPU itazalisha tokens chache kwa sekunde, jambo linalofaa zaidi kwa kazi za batch zilizopangwa foleni kuliko dirisha la chat.
Je, large language model ni AI agent yenyewe?
Hapana. Model huchora ramani ya input text kwenda output text kisha huacha. Inakuwa agent pale kitu kinapoifunga kwenye loop inayoweza kutenda kazi duniani na kurudisha matokeo, jambo linalohitaji zana (tools) inazoweza kuita na sharti linaloiambia loop lini iache. Kifungashio (wrapper) ndicho agent. Model ni sehemu moja tu ndani yake.
Je, ninahitaji mfumo wa multi-agent?
Mara nyingi si lazima. Loop moja yenye zana kadhaa hushughulikia kazi nyingi na ni rahisi zaidi kuifanyia debug. Mawakala wengi (multiple agents) husaidia pale sehemu za kazi zinapokuwa huru kabisa na zinaweza kuendeshwa kwa wakati mmoja, au pale sehemu moja inapohitaji model tofauti. Gharama yake ni uratibu: hali iliyoshirikiwa (shared state), na msimamizi ambaye muktadha wake hukua kwa kila ripoti ya mfanyakazi anayoisoma. Ongeza agent wa pili pale unapoweza kuonyesha hatua inayokwenda polepole.