SSD Nodes Learn 🎉 VPS $4.99/aydan başlayan
Rehberler Matt ConnorYazan Matt Connor · Güncellendi 2026-08-05

Yapay Zeka Aracısı, LLM ve Asistan Farkı

LLM RAM gerektiren ağırlıklardır; asistan sohbet arayüzü ekler; aracı ise araçlar, döngü ve kimlik bilgileriyle sürekli açık bir makine ister.

Yapay zeka aracısı, LLM ve yapay zeka asistanı arasındaki fark nedir?

Yapay zeka aracısı, LLM ve yapay zeka asistanı aynı yığının üç katmanıdır. Bunları ayırt etmenin yolu, her birinin bir sunucudan neye ihtiyaç duyduğuna bakmaktır. LLM (large language model), RAM ve işlem gücü gerektiren bir ağırlık dosyasıdır. Asistan, hesap ve kaydedilmiş geçmiş içeren bir sohbet arayüzüyle sunulan modeldir ve neredeyse her zaman başka birinin donanımında çalışır. Aracı ise araçlara ve bir döngüye de sahip olan asistandır. Ayrıca kimlik bilgilerini tutar. Bu nedenle sürekli açık kalan bir makinede çalıştırılması gerekir.

Bu soruyla ilgili metinlerin çoğu tanımlarda kalır. Tanımların önemli olmasının nedeni, her katmanın maliyetlendirmesinin farklı olmasıdır. İlk katman RAM maliyeti oluşturur. Sonraki katman genel erişime açık bir URL ve TLS (transport layer security) gerektirir. Son katman kimlik bilgileri gerektirir. Bir aracının kullandığı kimlik bilgisi, artık döndürülmesi gereken bir kimlik bilgisidir.

Bir LLM, ağırlıklardan oluşur ve ağırlıklar RAM gerektirir

Bir LLM, sayılardan oluşan bir dosyadır. Bu dosya indirilir, bir runtime tarafından belleğe yüklenir ve her seferinde tek bir isteği yanıtlar. Sözleşme kapsamı sınırlıdır: metin girer, metin çıkar. Model çağrılar arasında belleğini korumaz; saate veya ağa erişemez ve dosya açamaz. Bir LLM'nin hatırlıyor gibi göründüğü her şey, onu çağıran program tarafından context içine eklenmiştir.

VPS planını belirleyen sayı, bu dosyanın boyutudur; çünkü model çalışırken dosyanın tamamı bellekte tutulur. Ollama'nın varsayılan olarak kullandığı 4-bit quantisation için her 1 milyar parametre başına yaklaşık 0.6 GB hesaplanmalıdır. Ardından context window ve runtime için 1 veya 2 GB daha eklenmelidir.

ChartQwen3 download size and the RAM the box needs (published sizes, ollama.com, August 2026)
The data behind this chart
[
  {
    "label": "qwen3:4b",
    "download_gb": 2.5,
    "ram_gb_needed": 6
  },
  {
    "label": "qwen3:8b",
    "download_gb": 5.2,
    "ram_gb_needed": 8
  },
  {
    "label": "qwen3:14b",
    "download_gb": 9.3,
    "ram_gb_needed": 12
  },
  {
    "label": "qwen3:32b",
    "download_gb": 20.0,
    "ram_gb_needed": 24
  }
]

qwen3:8b derlemesi diskte 5.2 GB yer kaplar ve swapping olmadan çalışmak için yaklaşık 8 GB RAM ister. 4 GB RAM'e sahip bir VPS, tek bir kelime yazılmadan önce 9.3 GB olan qwen3:14b dosyasını yükleyemez. Buradaki en büyük satır olan qwen3:32b, yaklaşık 24 GB gerektirir. Bu değer, çoğu fiyat listesinde farklı bir plan ve farklı bir aylık ücret anlamına gelir.

Belleğe sığması bir konudur. Hız ise başka bir konudur. Yalnızca CPU kullanan bir VPS'te darboğaz, clock speed yerine memory bandwidth olur. Bu nedenle sığan bir model bile saniyede yalnızca birkaç token üretebilir. Gece boyunca çalışan bir iş için bu kabul edilebilir, ancak chat için rahatsız edici olabilir. GPU bu değeri yaklaşık bir kat artırır; faturanızı da artırır. Bu nedenle kararı ölçüm yaparak verin: çalıştırmayı planladığınız iş yüküyle VPS üzerinde benchmark yapın ve GPU VPS'nin ücretini ne zaman karşıladığını okuyun. Ağırlıkları çalıştırmaya başlamak için önce kendi VPS'nizde Ollama ile başlayın.

Bir asistan, bir LLM ile sohbet arayüzünün birleşimidir

Asistan, bir modelin çevresindeki ürün katmanıdır. ChatGPT ve Claude birer asistandır: model, sohbet penceresi, hesap, kaydedilmiş konuşmalar ve hız sınırı. Bunların neredeyse hiçbiri kontrol edilen donanımda çalışmaz. Bu nedenle barındırılan bir asistan abonelik ücreti gerektirir ve RAM kullanımını sıfıra indirir.

Self-host edilen sürüm, yerel bir Ollama'ya veya barındırılan bir API'ye yönlendirilen Open WebUI gibi bir ön yüzdür. Ön yüz, küçük bir yazılımdır. Sohbet arayüzü için yaklaşık 1 GB yerleşik bellek kullanımı beklenmelidir. Buna modelin ihtiyaç duyduğu bellek eklenir. Ancak çıplak bir modelin ihtiyaç duymadığı bir gereksinim daha vardır: telefon üzerinden erişim sağlanacağı için herkese açık bir URL ve sertifika gerekir: Certbot ve Nginx ile sertifika alın veya TLS sonlandırmasını birden fazla uygulamanın önündeki Traefik üzerinde yapın. Bir ön yüz seçmeye devam ediyorsanız Open WebUI alternatiflerini karşılaştırın.

Bir asistan yanıt verir. Eylem gerçekleştirmez. Bir shell komutu yazdığında bu komutu bir kişi okur ve yapıştırıp yapıştırmayacağına karar verir. Bu kişi bir güvenlik katmanıdır. Bu katmanı ortadan kaldıran yapı ise agent'tır.

Bir agent araç ekler ve bir döngü çalıştırır

Agent, işlevleri çağırabilen ve ardından sonuçları okuyabilen bir asistandır. İki bölüm bu işi yapar. İlki bir araçtır: modelin isteyebileceği bir işlevin açıklaması ve bu işlevi gerçekten çalıştıran kodunuz. İkincisi döngüdür: programınız modeli çağırır, model bir araç ister, programınız bu aracı çalıştırır, çıktıyı konuşmaya ekler ve modeli yeniden çağırır. Bu işlem, model tamamlandığını söyleyene veya bir sınır işlemi durdurana kadar tekrarlanır.

Döngü sıradan bir koddur ve temel bir uygulama yüz satırdan kısa olabilir. Onu agent yapan şey, araçların gerçek kimlik bilgilerine sahip olmasıdır; bu nedenle döngü kendi dışındaki bir şeyi değiştirebilir. Aşağıdaki tüm barındırma kararlarını belirleyen temel unsur budur. Agent becerileri ve MCP (model context protocol) sunucuları, döngüyü yeniden yazmadan bir agente daha fazla araç sağlamanın iki yoludur.

Kutunun her katman için gereksinimleri

ChartWhat each layer asks of a server you own
The data behind this chart
[
  {
    "label": "LLM (weights you host)",
    "ram_gb": 8,
    "gpu": "helps a lot",
    "public_url": "no",
    "credentials": "none"
  },
  {
    "label": "Assistant (chat surface)",
    "ram_gb": 1,
    "gpu": "no",
    "public_url": "yes",
    "credentials": "one login"
  },
  {
    "label": "Agent (tools and a loop)",
    "ram_gb": 2,
    "gpu": "no",
    "public_url": "only for webhooks",
    "credentials": "several"
  }
]

RAM sütununu dikkatle okuyun; bu sütunda model hesaba katılmaz. Bir sohbet arayüzü ve agent runtime, küçük programlardır. Agent, barındırılan bir model çağırıyorsa, onu çalıştırmak için 2 GB RAM yeterlidir ve uygun fiyatlı bir plan gerçek bir çözüm olur; taviz sayılmaz. Ağırlıkları aynı kutuda tutarsanız 8 GB model satırı diğer tüm gereksinimlere kıyasla belirleyici olur.

Diğer sütunlar beklenenden daha önemlidir. GPU yalnızca model katmanını hızlandırır. Genel olarak public URL'ye yalnızca assistant katmanı ihtiyaç duyar; çünkü tarayıcının bu katmana erişmesi gerekir. Agent için public URL yalnızca webhook gibi dışarıdan bir bileşenin çağrı göndermesi gerektiğinde gereklidir. Ayrıca bir agent several kimlik bilgisi tutar. Agent ile sohbet penceresi arasındaki asıl fark budur. Sohbet penceresi hatalı olabilir. Agent hatalı olabilir ve ardından bu hataya dayanarak işlem gerçekleştirebilir.

AI agent çalıştırmak için GPU gerekir mi?

Hayır. Ancak ağırlıkları aynı makinede barındırıyorsanız GPU gerekebilir. Agent döngüsü HTTP istekleri, JSON ayrıştırma işlemleri ve subprocess çağrılarından oluşur. Ağ yanıtını beklerken CPU kullanımı genellikle yok denecek kadar düşüktür. GPU gerekip gerekmediği aslında LLM katmanına ilişkin bir sorudur.

Bu kararı iki ayrı konu olarak değerlendirin. Metin makinenizden dışarı çıkamıyorsa modeli bellekte tutacak RAM kapasitesi için ve kullanılabilir hız elde etmek amacıyla modeli çalıştıracak bir GPU için bütçe ayırın. Yalnızca otomasyon istiyorsanız modeli token başına kiralayın ve bütçeyi bunun yerine uptime ve yedeklemelere ayırın. 2026 yılında self-host edilen agent'ların çoğu hosted model çağırır. Bu nedenle çalıştırma maliyetleri daha düşüktür.

Kendi AI agent’ınızı self-host edebilir misiniz?

Evet. Agent, self-host edilmesi en anlamlı katmandır; çünkü veri ve kimlik bilgileriniz döngünün içinde bulunur. 2 GB RAM’e, bir service manager’a ve dış ağa erişime sahip küçük bir VPS, gerçek bir agent çalıştırabilir. Döngünün kontrolünü elinizde tutmak istiyorsanız VPS üzerinde kendiniz oluşturma yolunu seçin. Hazır bir çözümle başlamak istiyorsanız self-host edilebilen hazır agent’lardan birini dağıtın.

Assistant’ı self-host etmek kolaydır: bir container ve bir sertifika yeterlidir. Modeli self-host etmek ise maliyetlidir. CPU üzerinde token’ların çok yavaş üretildiğini gördükten sonra birçok kişi bu yaklaşımı bırakır. Verilerin sunucudan ayrılamadığı veya kullanım hacminizin token başına ücretlendirmeyi pahalı hale getirdiği durumlarda model ağırlıklarını self-host edin. Diğer durumlarda agent’ın bir API çağırmasına izin verin ve önemli bileşenleri yerel tutun.

ChatGPT bir AI agent mıdır?

Bir chat ürünü, herhangi bir aracı çağırıp sonuç üzerinden sizden önce onay istemeden işlem yapabildiği anda agent haline gelir. Bu ölçüte göre browsing, code execution veya connector özelliklerine sahip hosted assistant'lar agent'tır. Sizin açınızdan fark, bu döngünün nerede çalıştığı ve hangi kimlik bilgilerini kullandığıdır. Hosted bir üründe her ikisi de sağlayıcıya aittir. Kendi sunucunuzda ise bunların sorumluluğu, döngünün sabaha karşı saat üçte gerçekleştirdiği işlemler dahil, size aittir.

Reaktif, planlama tabanlı ve çok ajanlı

Derlemelerde yedi farklı ajan türü sıralanır. Bu türlerin çoğu pazarlama amaçlı sınıflandırmalardır. Kodunuzu etkileyen iki ayrım vardır; maliyeti etkileyen bir ayrım daha bulunur. Reaktif ajan bir aracı çağırır, yanıtı okur ve yanıt verir. Planlama tabanlı ajan önce bir plan oluşturur, ardından bu planı adım adım uygular. Bu yaklaşım uzun süren görevlerde daha iyi sonuç verir, ancak plan her adımda yeniden gönderildiği için daha fazla token tüketir. Çok ajanlı yapıda bir ajan diğer ajanları başlatabilir. Bu yapı token tüketimini ve hata olasılıklarını aynı anda artırır. Bu nedenle yalnızca alt görevler gerçekten bağımsız olduğunda, örneğin dört kaynağın aynı anda aranmasında, tercih edilmelidir. Reaktif yapıyla başlanmalıdır. Çalışmalar uzadığında planlama eklenmelidir. Çok ajanlı yapıya en son başvurulmalıdır. Daha geniş çerçeve için 2026'da AI ajanları hakkında öğrenmeye değer konular bölümüne bakılabilir.

Gerçekte hangi katmanda çalıştığınızı nasıl anlarsınız

Sunucuda, belleği hangi süreçlerin kullandığını denetleyin.

free -h
ps -eo rss,comm --sort=-rss | head -5

En üst satırda birkaç gigabayt RSS (resident set size, bir sürecin gerçekten kullandığı bellek) kullanan ollama veya llama-server varsa modeli barındırıyorsunuz demektir. Hiçbir süreç birkaç yüz megabaytı aşmıyor ve API faturanız artmaya devam ediyorsa bir agent veya assistant barındırıyor, modeli ise kiralıyorsunuz demektir. Her şey bir tarayıcı sekmesinde gerçekleştiği için bu liste boşsa bir assistant kullanıcısısınız. Bu, sizin adınıza işlem yapan bir yazılıma ihtiyaç duyana kadar geçerli ve uygun bir kullanım şeklidir.

Hangisini çalıştırmak istiyorsunuz?

FAQ

Bir AI agent, fazladan adımlar eklenmiş bir LLM midir?

Fazladan adımlar ürünün kendisidir. Bir LLM metni metne dönüştürür ve bunun dışında bir işlem yapmaz. Bir agent, LLM'in etrafına çağırabileceği araçlar ve bu araçları çağırmaya devam eden bir döngü ekler. Bu araçlar kimlik bilgilerini taşıdığı için çıktı bir dosyayı, veritabanını veya çalışan bir servisi değiştirebilir. Bu nedenle bir agent'ın sürekli açık kalan bir makineye, service manager'a ve secrets policy'ye ihtiyacı vardır. Bir LLM ise yanıt verirken ağırlıklarını tutacak kadar belleğe ihtiyaç duyar.

Bir AI agent çalıştırmak için GPU gerekir mi?

Agent için gerekmez. Döngü; HTTP istekleri, JSON işleme ve subprocess çağrılarından oluşur. Ağ yanıtını beklerken bunların tümünü herhangi bir CPU yönetebilir. GPU yalnızca model ağırlıklarını kendiniz barındırdığınızda ve saniyede birkaç token'dan fazlasını üretmek istediğinizde gerekir. Hosted bir model çağıran agent, GPU olmadan küçük bir VPS üzerinde rahatça çalışır.

Bir VPS, AI agent için ne kadar RAM gerektirir?

Agent hosted bir model çağırıyorsa yaklaşık 2 GB yeterlidir. Çünkü runtime, bağımlılıkları ve küçük bir yerel veritabanı bu bellekte tutulur. Ağırlıkları kendiniz barındırıyorsanız model için gereken belleği bunun üzerine ekleyin: yalnızca qwen3:8b yaklaşık 8 GB ister. Bu nedenle all-in-one bir sunucu bu seviyeden başlar ve seçilen model büyüdükçe daha fazla RAM gerektirir.

Bir AI assistant'ı self-host edip konuşmalarımı gizli tutabilir miyim?

Evet, ancak sonucu belirleyen bir koşul vardır. Open WebUI gibi self-host edilen bir front end, hesapları ve geçmişi sunucunuzda tutar. Konuşmaların gerçekten gizli kalması için arkasındaki modelin de yerel olması gerekir. Aynı front end'i hosted bir API'ye yönlendirirseniz metin her mesajda sunucunuzdan çıkar. Bu durumda geçmiş sizde kalır, ancak gizlilik korunmaz.

AI agent ile chatbot arasındaki fark nedir?

Bir chatbot yanıt verir ve durur. Bir agent sıradaki işlemi belirler, bir tool çağırır, sonucu okur ve iş tamamlanana veya bir limit işlemi durdurana kadar yeniden karar verir. Pratik ölçüt şudur: Yazılım, yanıt ile işlem arasında bir insanın düğmeye basmasına gerek kalmadan bir şeyi değiştirebiliyorsa bu bir agent'tır. Dolayısıyla agent'ın ilgili hosting altyapısına ve gerekli guardrail'lere ihtiyacı vardır.