KI-Agenten von Grund auf lernen: Der 6-Stufen-Plan
Lernen Sie KI-Agenten systematisch durch praktische Projekte. Wir behandeln die Schleifenlogik, Werkzeuge, Speicher und Sicherheit ohne Frameworks, damit Sie das Prinzip verstehen.
Der Pfad in sechs Stufen
Um KI-Agenten von Grund auf zu erlernen, durchlaufen Sie der Reihe nach sechs Stufen: die Konzepte, Ihre erste Schleife, Werkzeuge, Speicher, Schleifendesign und Sicherheit. In jeder Stufe bauen Sie eigenhändig ein konkretes Element. Das Überspringen von Stufen ist der häufigste Grund für Lernblockaden, da ein Framework genau den Teil verbirgt, den Sie verstehen müssen.
Ein KI-Agent ist eine Schleife um ein Sprachmodell, das Werkzeuge aufrufen darf. Dieser Satz umfasst das gesamte Thema. Alles Weitere sind Details darüber, was in die Schleife gehört, worauf die Werkzeuge zugreifen dürfen und wie Sie die Schleife bei Fehlern stoppen. Wenn Sie die Schleife jemand anderem erklären können, haben Sie das Thema verstanden. Wenn Sie nur Frameworks aufzählen können, ist dies nicht der Fall.
Der folgende Plan setzt voraus, dass Sie durch praktisches Bauen lernen. Lesen Sie eine Stufe, bauen Sie das kleine Projekt, provozieren Sie absichtlich einen Fehler und fahren Sie dann fort. Eine Stufe, die Sie nur gelesen haben, haben Sie nicht absolviert.
Was Sie vor Stufe 1 tatsächlich benötigen
Die Liste der ehrlichen Voraussetzungen ist kurz und kürzer, als die meisten Kursseiten vermuten lassen.
- Sie können Python oder TypeScript auf dem Niveau eines Skripts mit fünfzig Zeilen lesen und schreiben.
- Sie fühlen sich in einer Linux-Shell sicher: ein Paket installieren, eine Datei bearbeiten, ein Log lesen.
- Sie besitzen einen API-Key für ein gehostetes Modell oder eine Maschine, die ein lokales Modell ausführen kann.
Das ist die gesamte Liste. Sie benötigen keine Theorie zum maschinellen Lernen und Sie müssen kein Modell trainiert haben. Nichts bei der Arbeit mit Agenten beinhaltet Gradienten oder Trainingsdaten. Eine Grafikkarte ist nur dann relevant, wenn Sie sich entscheiden, das Modell selbst auszuführen; dies ist eine separate Fähigkeit, die Sie später unter Hosting von Ollama auf einem VPS zum Selbst-Hosting eines LLM erlernen können.
Was oft unterschätzt wird, ist der Shell-Teil. Agenten scheitern an Berechtigungen, Pfaden, Umgebungsvariablen und Prozessen, die im Stillen abbrechen. Wenn ein Stack-Trace zu PATH oder ein Datei-Modus dazu führt, dass Sie das Terminal schließen, verbringen Sie zuerst ein Wochenende mit den Linux-Grundlagen. Das wird Ihnen später einen Monat Arbeit ersparen.
Stufe 1: Was ein Agent ist und was er nicht ist
Beginnen Sie mit einem einzelnen API-Aufruf ohne Schleife. Senden Sie einen Prompt, geben Sie die Antwort aus und betrachten Sie die Token-Anzahl in der Antwort. Sie verstehen nun die Einheit für Kosten und die Einheit für Latenz.
Lernen Sie anschließend die Werkzeugnutzung (Tool Use), das einzige wirklich neue Konzept in diesem gesamten Bereich. Sie beschreiben dem Modell eine Funktion anhand eines Namens, einer Beschreibung und eines JSON-Schemas (JavaScript Object Notation) für deren Eingabewerte. Das Modell führt selbst nichts aus. Es antwortet mit einer strukturierten Anforderung: Rufen Sie run_command mit diesen Argumenten auf. Ihr Code führt die Funktion aus, sendet die Ausgabe als Nachricht zurück und fragt das Modell erneut. Das Modell ist ein Planer, der Text liest und Text schreibt. Ihr Code ist die Komponente, die die Aktionen ausführt.
Ein Chatbot endet nach einer Antwort. Ein Agent wiederholt diesen Austausch, bis das Modell keine Werkzeuge mehr anfordert. Diese Wiederholung ist der gesamte Unterschied, und deshalb unterscheiden sich auch die Fehlerbilder. Ein Chatbot gibt einmal eine falsche Antwort. Ein Agent handelt mehrfach auf Basis einer falschen Antwort, bevor dies jemand bemerkt.
Stufe 2: Schreiben Sie die Schleife selbst, einmalig
Beginnen Sie nicht mit einem Framework. Schreiben Sie etwa dreißig Zeilen Python, damit Sie die Struktur des Ganzen selbst bestimmen.
sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/agent
source ~/agent/bin/activate
pip install anthropic
export ANTHROPIC_API_KEY=your-key-hereimport subprocess
import anthropic
client = anthropic.Anthropic()
tools = [{
"name": "run_command",
"description": "Run a read only shell command and return its output.",
"input_schema": {
"type": "object",
"properties": {"command": {"type": "string"}},
"required": ["command"],
},
}]
messages = [{"role": "user", "content": "How much disk space is free here?"}]
while True:
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
tools=tools,
messages=messages,
)
if response.stop_reason != "tool_use":
break
messages.append({"role": "assistant", "content": response.content})
results = []
for block in response.content:
if block.type == "tool_use":
done = subprocess.run(
block.input["command"], shell=True,
capture_output=True, text=True, timeout=10,
)
results.append({
"type": "tool_result",
"tool_use_id": block.id,
"content": done.stdout or done.stderr,
})
messages.append({"role": "user", "content": results})
print(next(b.text for b in response.content if b.type == "text"))Führen Sie es mit python3 agent.py aus. Ein erfolgreicher Durchlauf gibt einen Absatz aus, der Ihre Dateisysteme und deren freien Speicherplatz nennt, da das Modell df -h angefordert hat, Ihr Code dies ausführte und der zweite Durchlauf diese Tabelle in einen Satz umwandelte. Wenn keine Ausgabe erfolgt, endete die Schleife, bevor ein Textblock eintraf. Fügen Sie print(response.stop_reason) innerhalb der Schleife hinzu und beobachten Sie, wie sich die Werte ändern.
Brechen Sie es nun absichtlich. Löschen Sie die Zeile tool_use_id und lesen Sie den Fehler, da ein Werkzeugergebnis ohne übereinstimmende ID von der API abgelehnt wird; dies ist der häufigste Anfängerfehler überhaupt. Stellen Sie eine Frage, die zwei Befehle erfordert, und beobachten Sie, wie die Schleife zweimal durchläuft. Stellen Sie eine unmögliche Frage und beobachten Sie, ob das System aufgibt oder in einer Endlosschleife hängen bleibt.
Eine Warnung zu diesem Beispiel. Es leitet die Modellausgabe mit shell=True direkt an eine Shell weiter, was auf einer Testmaschine, die Sie neu aufsetzen können, akzeptabel ist, aber überall sonst falsch. Stufe 6 behebt dies. Die Konzepte unterhalb der Schleife werden ausführlicher unter Einen eigenen KI-Agenten auf einem VPS erstellen behandelt.
Stufe 3: Werkzeuge, die der Agent noch nicht besaß
Ihr run_command-Werkzeug funktioniert, aber ein echter Agent benötigt Werkzeuge, die über die lokale Umgebung hinausreichen: ein Ticketsystem, eine Datenbank, ein Repository. Für jeden Dienst und jeden Agenten einen eigenen Wrapper zu schreiben, ist nicht skalierbar.
Das Model Context Protocol (MCP) ist die Antwort, auf die sich die Branche geeinigt hat. Ein MCP-Server stellt eine Reihe von Werkzeugen über einen Standardtransport bereit, und jeder MCP-fähige Agent kann diese ohne individuellen Anpassungsaufwand nutzen. Der Referenz-Dateisystem-Server lässt sich mit einem einzigen Befehl starten:
npx -y @modelcontextprotocol/server-filesystem /home/you/projectsDies erfordert eine installierte Node-Umgebung. Das Verzeichnis-Argument definiert den einzigen Pfad, auf den der Server zugreift. Dies ist das Sicherheitsmodell im Kleinen: Der Server bestimmt die Grenze, nicht das Modell. Verbinden Sie einen Client damit, erhält Ihr Agent Lese- und Schreibzugriff auf Dateien, ohne dass Sie diesen Code selbst schreiben mussten. Der korrekte Betrieb unter einem Dienstkonto sowie die Erläuterung der Transportoptionen werden in Betrieb von MCP-Servern auf einem VPS für KI-Coding-Agenten behandelt.
Die Lektion dieser Stufe ist, dass das Design der Werkzeuge die eigentliche Arbeit darstellt. Eine vage Beschreibung zwingt das Modell zum Raten. Ein Werkzeug, das vierzigtausend Zeichen zurückgibt, vergiftet das Kontextfenster. Ein Werkzeug, das Dinge löschen kann, wird irgendwann Dinge löschen.
Stufe 4: Speicher, der meist nur aus Dateien besteht
Anfänger greifen hier zu einer Vektordatenbank. Tun Sie das nicht, zumindest noch nicht.
Ein Agent besitzt zwischen den Aufrufen kein Gedächtnis. Sie senden jedes Mal das gesamte Gespräch erneut, weshalb eine lange Sitzung pro Durchlauf mehr kostet als eine kurze. Der Speicher unterteilt sich daher in zwei Probleme. Das erste ist das, was aktuell in das Kontextfenster passt; dies verwalten Sie durch Zusammenfassungen, durch das Kürzen alter Tool-Ausgaben und durch das Caching des stabilen Präfixes Ihres Prompts, wodurch Sie nur einen Bruchteil des Preises dafür zahlen. Das zweite ist das, was einen Neustart überdauert, also die Speicherung.
Für das zweite Problem ist eine einfache Markdown-Datei, die der Agent lesen und schreiben kann, für fast jedes erste Projekt besser als eine Vektordatenbank. Geben Sie ihm eine Datei, nennen Sie ihm das Format, weisen Sie ihn an, diese Datei vor dem Start zu lesen und sie zu aktualisieren, wenn er etwas lernt. Sie erhalten den Großteil des Nutzens und können die Datei öffnen, um zu sehen, was Ihr Agent glaubt. Greifen Sie erst zu Embeddings und Retrieval, wenn die Notizen nicht mehr in das Kontextfenster passen, und nicht vorher.
Stufe 5: Die Schleife ist das Produkt
Sie können inzwischen einen Agenten erstellen, der funktioniert, während Sie ihn beobachten. Stufe 5 besteht darin, ihn auch dann funktionieren zu lassen, wenn Sie dies nicht tun.
Vier Fragen entscheiden darüber, ob ein unbeaufsichtigter Agent sicher allein gelassen werden kann. Was löst ihn aus, damit er nicht ohne Grund läuft? Innerhalb welcher Grenzen operiert er, damit ein Fehler gering bleibt? Wie wird das Ergebnis verifiziert, da ein Agent, der seine eigenen Hausaufgaben bewertet, immer besteht? Welches Budget begrenzt ihn, sei es in Token oder in der tatsächlichen Zeitdauer? Die bewusste Gestaltung dieser vier Punkte ist die Disziplin, die in Schleifen-Engineering und was diese Definition abdeckt beschrieben wird.
Die Übung: Nehmen Sie Ihren Agenten aus Stufe 2, geben Sie ihm eine Aufgabe, die vier oder fünf Schritte erfordert, und fügen Sie ein hartes Iterationslimit hinzu. Entfernen Sie anschließend das Limit und beobachten Sie, was eine unbegrenzte Schleife mit Ihrer Token-Rechnung anstellt. Führen Sie dies einmal mit einem kleinen Budget durch, damit Ihnen dies nie versehentlich mit einem großen Budget passiert.
Stufe 6: Sicherheit, Geheimnisse und Kosten
Diese Stufe ist nicht optional. Sie steht nur deshalb am Ende, weil das Risiko erst spürbar wird, wenn ein funktionierendes System vorliegt.
Führen Sie den Agenten als eigenen, nicht privilegierten Benutzer aus. Nutzen Sie niemals root oder Ihr eigenes Benutzerkonto, damit der Schadensradius auf ein Verzeichnis und nicht auf die gesamte Maschine begrenzt bleibt. Halten Sie Anmeldedaten außerhalb der Reichweite des Modells. Alles, was sich im Kontextfenster befindet, kann über einen Tool-Aufruf ausgegeben werden. Die Lösung besteht in kurzlebigen Tokens, die hinter einem Hilfsprogramm verwaltet werden, wie in Geheimnisse von Ihren KI-Agenten fernhalten beschrieben. Setzen Sie eine harte Obergrenze für die Kosten. Eine unbeaufsichtigte Schleife verursacht bei jeder Iteration Kosten, ohne dass dies jemand bemerkt. Die Limits und Batch-Verfahren, die den Betrieb kontrollierbar halten, finden Sie in Kostenkontrolle für KI-Agenten auf einem ständig laufenden VPS.
Kosten erfordern eine konkrete Zahl. Stand Juli 2026 berechnet Claude Opus 5 5 USD pro Million Eingabe-Tokens und 25 USD pro Million Ausgabe-Tokens. Ein gesprächiger Agent, der einen wachsenden Gesprächsverlauf erneut sendet, kann bei einer einzigen Aufgabe einige hunderttausend Tokens verbrauchen. Prompt-Caching und die Verwendung eines kleineren Modells für Routineaufgaben verändern diese Kalkulation weitaus stärker als jede Anpassung des Prompts.
Auch Prompt-Injection gehört in diesen Bereich. Wenn Ihr Agent eine Webseite, ein Issue-Tracking-System oder einen Posteingang liest, schreibt jeder, der diesen Text verfasst hat, gleichzeitig Anweisungen für Ihren Agenten. Die Verteidigung besteht nicht in einem clevereren System-Prompt. Sie besteht in der Abgrenzung der Berechtigungen, denn ein Agent, der kein Repository löschen kann, lässt sich auch nicht dazu überreden, eines zu löschen.
Welchem Lehrplan sollten Sie folgen?
Wählen Sie einen Lehrplan aus und schließen Sie diesen ab, anstatt in sechs verschiedene hineinzuschnuppern. Das Microsoft ai-agents-for-beginners Repository ist das vollständigste kostenlose Angebot; es handelt sich um einen Kurs mit achtzehn Lektionen, der bis Juli 2026 über 70.000 Sterne erhalten hat und sich präzise auf die oben genannten Stufen abbilden lässt. Zusammenfassungen von trendigen Agent-Repositories sind nützlich, um einen Überblick über das Angebot zu erhalten, eignen sich jedoch weniger als Lehrplan, da eine nach Sternen sortierte Liste die Popularität widerspiegelt und nicht die didaktische Reihenfolge.
Wenn Sie ein echtes Projekt für praktische Übungen suchen, ist ein Coding-Agent das beste erste Ziel: Das Feedback erfolgt unmittelbar, die Werkzeuge sind offensichtlich und Fehler lassen sich kostengünstig rückgängig machen. Einen KI-Coding-Agenten auf einem VPS ausführen führt Sie Schritt für Schritt durch ein solches Projekt. Wenn Sie lieber funktionierende Systeme untersuchen möchten, anstatt von Grund auf neu zu bauen, zeigt der Vergleich in die besten selbst gehosteten KI-Agenten, wie verschiedene Projekte denselben Kreislauf unterschiedlich lösen.
Wie lange dauert das?
Für Personen mit Programmiererfahrung nehmen die Phasen 1 und 2 einen Abend in Anspruch. Phase 3 erfordert ein Wochenende, wobei der Großteil der Zeit in die Beschreibung der Werkzeuge statt in das Protokoll fließt. Die Phasen 4 und 5 benötigen einige Wochen im produktiven Einsatz, da man erst durch die Beobachtung der Fehler lernt, was der Agent vergisst. Phase 6 endet nie wirklich, da jede neue Funktion, die Sie hinzufügen, den Prozess erneut öffnet.
Zwei Monate mit konsequenter Arbeit an den Abenden führen die meisten Anwender zu einem funktionierenden, begrenzten und nützlichen Agenten. Diejenigen, die ein Jahr benötigen, haben meist mehr gelesen als gebaut.
FAQ
Muss ich Machine Learning beherrschen, um einen KI-Agenten zu bauen?
Nein. Einen Agenten zu bauen bedeutet, ein Modell über eine API aufzurufen und dessen Tool-Anfragen mit echten Funktionen zu verknüpfen; das ist gewöhnliche Anwendungsentwicklung. Sie kommen nie mit Training, Gradienten oder Datensätzen in Berührung. Die Fähigkeiten, die darüber entscheiden, ob Ihr Agent funktioniert, sind das Schema-Design für Tools, die Fehlerbehandlung und Linux-Berechtigungen. Die Theorie des Machine Learning wird erst relevant, wenn Sie ein Modell feinabstimmen (fine-tuning), was eine andere Aufgabe mit anderen Voraussetzungen ist.
Sollte ich mit einem Framework wie LangChain oder CrewAI beginnen?
Schreiben Sie zuerst eine einfache Schleife (raw loop) und nutzen Sie erst danach ein Framework. Ein Framework ersetzt die dreißig Zeilen aus Stufe 2 durch ein Konfigurationsobjekt; das ist praktisch, wenn Sie wissen, was es ersetzt, aber verwirrend, wenn Sie es nicht wissen. Wenn sich Ihr Agent fehlerhaft verhält, müssen Sie die Nachrichtenliste und die Tool-Ergebnisse direkt analysieren, was deutlich schwieriger ist, wenn Sie diese noch nie gesehen haben. Nach einer selbst geschriebenen Schleife spart Ihnen ein Framework Zeit, anstatt den Mechanismus zu verbergen.
Wie viel kostet es, KI-Agenten zu erlernen?
Weniger als die meisten erwarten, sofern Sie das Budget begrenzen. Ein gehosteter API-Key und ein kleiner VPS decken alles in diesen sechs Stufen ab. Das eigentliche Risiko ist nicht der Stundensatz, sondern eine unbegrenzte Schleife, die bei jeder Iteration Kosten verursacht, während Sie schlafen. Legen Sie am ersten Tag ein hartes Ausgabenlimit für Ihr API-Konto fest, fügen Sie jeder Schleife, die Sie schreiben, ein Iterationslimit hinzu und verwenden Sie für Routineaufgaben ein günstigeres Modell. Wenn Sie das Modell lokal ausführen, entfallen die Token-Kosten, dafür steigen die Hardware-Anforderungen.
Was ist der Unterschied zwischen einem KI-Agenten und einem Chatbot?
Ein Chatbot antwortet einmalig. Ein Agent wiederholt einen Zyklus: Das Modell fragt ein Tool an, Ihr Code führt es aus, das Ergebnis wird zurückgegeben und das Modell entscheidet, was als Nächstes zu tun ist. Diese Wiederholung ermöglicht es einem Agenten, eine Aufgabe in mehreren Schritten zu erledigen; genau deshalb benötigen Agenten auch Grenzen, die Chatbots nicht brauchen. Eine falsche Antwort eines Chatbots ist ein schlechter Absatz. Eine falsche Antwort eines Agenten ist ein schlechter Absatz plus alles, was er daraufhin unternommen hat.