SSD Nodes Learn Hosting plans →
Anleitungen Matt ConnorVon Matt Connor

Kolibri-1 selbst hosten: Was Aleph Alphas Modell braucht

Kolibri-1 steht unter Apache 2.0, braucht aber rund 78 GB FP8-Gewichte und eine H200 oder zwei H100. Was der Betrieb mit vLLM in Euro kostet und wann ein kleineres Modell reicht.

Kolibri-1 selbst hosten: die kurze Antwort

Kolibri-1 selbst zu hosten ist möglich, aber nicht auf einem gewöhnlichen VPS. Aleph Alpha aus Heidelberg veröffentlicht das Modell unter Apache 2.0. Die Gewichte im FP8-Format sind rund 78 GB groß. Der offizielle Weg ist vLLM auf mindestens einer H200 oder auf zwei Grafikkarten mit je 80 GB Speicher. Einen offiziellen Weg für CPU, GGUF, llama.cpp oder Ollama gibt es nicht.

Für viele Leser in Deutschland zählt vor allem eine Frage: Bleiben die Daten im eigenen Haus? Mit Kolibri-1 geht das, und die Lizenz steht dem nicht im Weg. Die Hürde ist die Hardware.

Stand der Angaben: Alles hier bezieht sich auf die Model Card von Aleph-Alpha/Kolibri-1 in der Revision e52eb4627d11516b0c01de49210ab5a4e4061444 (Hugging Face, 3. Oktober 2026) und auf das Paket aleph-alpha-inference in Version 1.0.0. Spätere Revisionen können andere Zahlen nennen. Prüfe sie, bevor du Hardware mietest oder kaufst.

Was die Model Card über Kolibri-1 festlegt

  • Architektur: MoE (Mixture of Experts). Das Modell besteht aus vielen Teilnetzen, den Experten. Pro Token rechnen nur wenige davon.
  • Größe: 78 Milliarden Parameter insgesamt, davon 3,46 Milliarden aktiv pro Token. 50 Schichten mit je 384 Experten, von denen pro Token 6 ausgewählt werden.
  • Kontext: 262.144 Token nativ. Per Extrapolation nennt die Card bis zu 1.048.576 Token.
  • Gewichte: FP8 (8-Bit-Gleitkommazahlen) im Format float8_e4m3fn, in Blöcken von 128×128. Embedding und LM-Head liegen in bfloat16. Zusammen sind das laut Card rund 78 GB. Das Repository selbst ist 78,9 GB groß.
  • Trainingsdaten: 62,5 % Englisch, 23,9 % Deutsch und 13,6 % Code, bei 20 Billionen Token Vortraining. Dazu kommt ein Tokenizer, der laut Card auf die deutsche Wortstruktur zugeschnitten ist.
  • Lizenz: Apache 2.0. Das Repository ist nicht gated. Du brauchst also keinen Zugriffsantrag.

Der wichtigste Punkt steckt in den ersten beiden Zeilen. 3,46 Milliarden aktive Parameter bedeuten wenig Rechenarbeit pro Token. Der Speicherbedarf richtet sich aber nach allen 78 Milliarden Parametern. Der Router wählt für jedes Token andere Experten aus. Deshalb müssen alle Experten jederzeit im Grafikspeicher liegen. Ein MoE-Modell rechnet also wie ein kleines Modell und belegt Speicher wie ein großes.

Auch der Tokenizer hat einen praktischen Effekt. Ein Tokenizer zerlegt Text in Token. Passt er schlecht zur Sprache, zerfällt ein langes deutsches Wort in viele kleine Stücke. Das kostet Kontext und Rechenzeit. Ein auf Deutsch zugeschnittener Tokenizer braucht für denselben Text weniger Token.

Die Benchmark-Zahlen der Card

Aleph Alpha nennt für das nachtrainierte Modell zwei Gesamtwerte. Es sind Zahlen aus der eigenen Auswertung des Herstellers, nicht aus einem unabhängigen Test.

ChartOverall-Werte laut Model Card (Post-Training)
The data behind this chart
[
  {
    "label": "Deutsch (Overall DE)",
    "overall": 70.8
  },
  {
    "label": "Englisch (Overall EN)",
    "overall": 75.5
  }
]

Auf Deutsch erreicht Kolibri-1 laut Card 70.8 Punkte, auf Englisch 75.5. Auch dieses Modell ist auf Englisch also etwas stärker. Ob es für deine Aufgaben reicht, zeigt nur ein Test mit deinen eigenen Dokumenten.

Was sich gegenüber Pharia geändert hat

Die frühere Modellreihe von Aleph Alpha hieß Pharia. Die Card von Pharia-1-LLM-7B-control nennt die Open Aleph License. Sie erlaubt nicht-kommerzielle Forschung und Lehre. Für kommerzielle Nutzung musste man Aleph Alpha direkt kontaktieren. Kolibri-1 steht dagegen unter Apache 2.0. Du darfst das Modell also im Unternehmen einsetzen und auch verändert weitergeben, solange du den Lizenztext und die Hinweise mitlieferst.

Welche GPU braucht Kolibri-1?

Die Card nennt zwei Stufen. Minimum: 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 oder 1× B300. Empfohlen: 2× H100 SXM5, 2× H200, 1× B200 oder 1× B300.

Warum reicht eine einzelne H100 nicht? Die Rechnung ist einfach. Ziehe die Gewichte vom Grafikspeicher ab, dem VRAM (video random access memory). Was übrig bleibt, braucht vLLM vor allem für den KV-Cache. Der KV-Cache speichert für jedes Token im Kontext die Schlüssel und Werte (keys und values) der Attention-Schichten. Ohne ihn kann das Modell keinen Kontext halten.

ChartVRAM minus FP8-Gewichte, gerundete Überschlagsrechnung in GB
The data behind this chart
[
  {
    "config": "1\u00d7 H100 80 GB",
    "vram_gb": 80,
    "gewichte_gb": 79,
    "rest_gb": 1
  },
  {
    "config": "1\u00d7 H200",
    "vram_gb": 141,
    "gewichte_gb": 79,
    "rest_gb": 62
  },
  {
    "config": "2\u00d7 A100 80 GB",
    "vram_gb": 160,
    "gewichte_gb": 79,
    "rest_gb": 81
  },
  {
    "config": "2\u00d7 H100 SXM5",
    "vram_gb": 160,
    "gewichte_gb": 79,
    "rest_gb": 81
  },
  {
    "config": "2\u00d7 H200",
    "vram_gb": 282,
    "gewichte_gb": 79,
    "rest_gb": 203
  }
]

Eine H100 hat 80 GB, die Gewichte belegen 79 GB. Rechnerisch bleibt 1 GB übrig. Das reicht für keinen sinnvollen Kontext. Eine H200 lässt 62 GB frei, zwei H200 lassen 203 GB frei. Die echte Reserve ist kleiner. vLLM nutzt standardmäßig nur 90 % des Grafikspeichers (--gpu-memory-utilization 0.9), und auch die Aktivierungen brauchen Platz. Die Werte sind gerundete Überschlagsrechnungen, keine Messung.

Zwei Eigenschaften der Architektur entlasten den KV-Cache. Erstens kombiniert Kolibri-1 laut Card Schichten mit Sliding-Window-Attention und Schichten mit voller Attention im Verhältnis 4:1. Eine Sliding-Window-Schicht speichert nur die Token eines festen Fensters. Deshalb wächst ihr Cache nicht mit der vollen Kontextlänge. Zweitens empfiehlt die Card --kv-cache-dtype fp8. Damit belegt jeder Cache-Eintrag halb so viel Speicher wie in 16 Bit. Die Schichten mit voller Attention wachsen trotzdem mit jedem Token. Bei 262.144 Token wird das auf einer einzelnen H200 eng.

Warum ein normaler VPS Kolibri-1 nicht ausführen kann

Aleph Alpha veröffentlicht nur den Weg über vLLM mit GPU. Die Card nennt weder CPU-Betrieb noch GGUF, llama.cpp oder Ollama. Ein gewöhnlicher CPU-VPS hat keinen Grafikspeicher. Damit fehlt die Grundlage für diesen Weg.

Auf Hugging Face gibt es Stand Oktober 2026 trotzdem zwei GGUF-Umwandlungen aus der Community. Die Q4_K_M-Datei ist etwa 47,5 GB groß und würde rechnerisch in einen Server mit 64 GB RAM passen. Beide Repositories sagen aber selbst: Das normale llama.cpp kennt die Architektur kolibri1 nicht. Du brauchst eine gepatchte Version auf einem bestimmten Commit. Getestet haben die Autoren nur kurze Durchläufe auf der CPU. Kontexte über 8.192 Token und die Qualität im Vergleich zum Original gelten als ungeprüft. Für Firmendaten ist das keine Grundlage. Es ist ein Experiment.

Wie viel RAM ein Modell in welcher Quantisierung braucht, rechnet der Leitfaden zur Frage, wie groß ein LLM für deinen RAM sein darf Schritt für Schritt vor. Warum hier vLLM das Werkzeug ist, erklärt der Vergleich von Ollama und vLLM: vLLM ist für viele parallele Anfragen auf GPUs gebaut, Ollama für den einfachen Start mit quantisierten Modellen.

Kolibri-1 mit vLLM installieren

Du brauchst einen Linux-Server mit passender NVIDIA-GPU und installiertem Treiber. Worauf du bei der Miete achten solltest, steht in dem Überblick zu VPS mit GPU. Prüfe zuerst, was die Maschine wirklich hat:

nvidia-smi --query-gpu=name,memory.total --format=csv

Die Ausgabe nennt pro Karte den Namen und den Speicher in MiB. Eine H100 sollte rund 81.000 MiB melden, eine H200 rund 143.000 MiB. Meldet der Befehl keinen Treiber, ist der NVIDIA-Treiber nicht installiert. Dann findet auch vLLM keine GPU.

Lege dann eine eigene Python-Umgebung an. Das Paket zieht vLLM und PyTorch in festen Versionsbereichen nach. In einer eigenen Umgebung stört das keine anderen Programme auf dem Server.

sudo apt update && sudo apt install -y python3-venv
python3 -m venv ~/kolibri
source ~/kolibri/bin/activate
pip install 'aleph-alpha-inference==1.0.0'
pip show vllm aleph-alpha-inference

Die Card schreibt pip install 'aleph-alpha-inference>=1'. Hier ist die Version fest auf 1.0.0 gesetzt. So ändert eine spätere Version dein Setup nicht unbemerkt. Version 1.0.0 verlangt Python 3.10 oder neuer und vLLM ab 0.29.0, aber unter 0.30.0. pip show sollte also eine vLLM-Version 0.29.x anzeigen. Das Paket ist ein Plugin für vLLM. Es meldet die Parser kolibri1 für Reasoning und Tool-Aufrufe an. Ohne das Plugin kennt vLLM diese Namen nicht.

Aleph Alpha bietet außerdem ein Container-Image an: ghcr.io/aleph-alpha/aleph-alpha-inference. Wer GPU-Server mit Containern betreibt, kann diesen Weg nehmen.

vLLM-Telemetrie abschalten

vLLM sendet standardmäßig anonyme Nutzungsstatistiken. Wenn das Ziel ist, dass nichts den Server verlässt, schalte das vor dem Start ab:

export VLLM_NO_USAGE_STATS=1
export DO_NOT_TRACK=1

Den Server starten

Der Befehl folgt der Card, mit zwei Ergänzungen: einer festen Revision und einer Bindung an localhost.

vllm serve Aleph-Alpha/Kolibri-1 \
  --revision e52eb4627d11516b0c01de49210ab5a4e4061444 \
  --host 127.0.0.1 --port 8000 \
  --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

--revision legt fest, welcher Stand der Gewichte geladen wird. Ohne die Option lädt vLLM den aktuellen Stand von main. Ändert Aleph Alpha das Repository, ändert sich dein Modell beim nächsten Download. --host 127.0.0.1 macht die API nur lokal erreichbar. Ohne diese Option lauscht vLLM auf allen Netzwerkschnittstellen. Port 8000 ist dann offen, sobald die Firewall ihn durchlässt.

Bei zwei GPUs ergänzt du --tensor-parallel-size 2. Diese Option verteilt jede Schicht auf beide Karten. Ohne sie nutzt vLLM nur eine GPU, und auf eine einzelne 80-GB-Karte passen die Gewichte nicht.

Beim ersten Start lädt vLLM rund 79 GB von Hugging Face nach ~/.cache/huggingface. Plane dafür und für die Python-Umgebung genug freien Plattenplatz ein. Nach dem ersten erfolgreichen Download kannst du mit export HF_HUB_OFFLINE=1 jeden weiteren Kontakt zu Hugging Face unterbinden. Die Gewichte kommen dann nur noch aus dem lokalen Cache.

Reicht der Speicher nicht für den vollen Kontext von 262.144 Token, startet vLLM nicht. Die Fehlermeldung verweist dann darauf, dass der KV-Cache für die maximale Sequenzlänge zu klein ist. Setze in diesem Fall eine kleinere Grenze, zum Beispiel --max-model-len 65536. Den erweiterten Kontext bis 1.048.576 Token startet die Card mit --max-model-len 1048576 und --hf-overrides '{"max_position_embeddings": 1048576}'. Das braucht deutlich mehr Speicher und gehört auf die empfohlenen Konfigurationen.

Prüfen, ob das Modell antwortet

Sobald das Log meldet, dass der Server auf Port 8000 läuft, teste die OpenAI-kompatible API:

curl http://127.0.0.1:8000/v1/models
curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "Aleph-Alpha/Kolibri-1", "messages": [{"role": "user", "content": "Was ist die Hauptstadt von Frankreich?"}], "chat_template_kwargs": {"enable_thinking": false}}'

Der erste Aufruf sollte Aleph-Alpha/Kolibri-1 als Modell auflisten. Der zweite sollte JSON liefern, in dem choices[0].message.content Paris nennt. enable_thinking: false schaltet den Denkmodus für diese Anfrage ab. Standardmäßig ist er an. Laut Card wirkt auch reasoning_effort mit dem Wert none. Als Sampling empfiehlt die Card temperature=1.0, top_p=0.97 und top_k=128.

Für den Zugriff von deinem Rechner aus brauchst du keinen offenen Port. Ein SSH-Tunnel reicht:

ssh -L 8000:127.0.0.1:8000 user@dein-server

Danach erreichst du die API auf deinem Rechner unter http://127.0.0.1:8000. Sollen andere Dienste im Netz zugreifen, setze zusätzlich --api-key und stelle einen Reverse Proxy mit TLS (transport layer security) davor.

Was kostet eine Stunde Kolibri-1 in Euro?

Die Preise für GPU-Miete schwanken stark nach Anbieter und Region. Die Rechnung unten nutzt zwei Annahmen, Stand Oktober 2026: 3,50 Euro pro Stunde für eine H200 und 2,50 Euro pro Stunde für eine H100 SXM5, jeweils on demand und ohne Mehrwertsteuer. Spezialisierte GPU-Anbieter liegen teils darunter, Hyperscaler in EU-Regionen oft deutlich darüber. Setze deine eigenen Angebote ein. Der Rechenweg bleibt gleich.

ChartGPU-Miete pro Monat, Annahmen Stand Oktober 2026, ohne MwSt.
The data behind this chart
[
  {
    "plan": "1\u00d7 H200, rund um die Uhr",
    "eur_pro_stunde": 3.5,
    "stunden_pro_monat": 730,
    "eur_pro_monat": 2555
  },
  {
    "plan": "2\u00d7 H100 SXM5, rund um die Uhr",
    "eur_pro_stunde": 5,
    "stunden_pro_monat": 730,
    "eur_pro_monat": 3650
  },
  {
    "plan": "1\u00d7 H200, nur B\u00fcrozeit",
    "eur_pro_stunde": 3.5,
    "stunden_pro_monat": 176,
    "eur_pro_monat": 616
  }
]

Ein Monat hat im Mittel 730 Stunden. Läuft eine H200 rund um die Uhr, kostet sie 2555 Euro im Monat. Die empfohlene Variante mit zwei H100 kommt auf 3650 Euro. Wer die Maschine nur zur Bürozeit laufen lässt, also 8 Stunden an 22 Arbeitstagen und damit 176 Stunden, zahlt 616 Euro. Dafür lädt jeder Start die Gewichte neu in den Grafikspeicher, und das dauert einige Minuten.

Ab wann lohnt sich das gegenüber API-Token?

Die Card nennt Stand Oktober 2026 keine gehostete API für Kolibri-1. Ein Vergleich mit Token-Preisen heißt also: Kolibri-1 auf eigener GPU gegen ein anderes Modell über eine API. Für die Rechnung gelten zwei angenommene Preise pro Million Token, gemischt aus Ein- und Ausgabe: 0,50 Euro für ein günstiges Modell und 2 Euro für ein teureres.

ChartBreak-even: so viele API-Token kostet die GPU-Miete pro Monat
The data behind this chart
[
  {
    "plan": "1\u00d7 H200, rund um die Uhr",
    "mio_token_bei_0_50_eur": 5110,
    "mio_token_bei_2_eur": 1277.5,
    "token_pro_sekunde_bei_0_50_eur": 1944
  },
  {
    "plan": "2\u00d7 H100 SXM5, rund um die Uhr",
    "mio_token_bei_0_50_eur": 7300,
    "mio_token_bei_2_eur": 1825,
    "token_pro_sekunde_bei_0_50_eur": 2778
  },
  {
    "plan": "1\u00d7 H200, nur B\u00fcrozeit",
    "mio_token_bei_0_50_eur": 1232,
    "mio_token_bei_2_eur": 308,
    "token_pro_sekunde_bei_0_50_eur": 1944
  }
]

Bei 0,50 Euro pro Million Token deckt die H200 im Dauerbetrieb ihre Kosten erst ab 5110 Millionen Token im Monat. Das sind im Schnitt 1944 Token pro Sekunde, Tag und Nacht ohne Pause. Bei 2 Euro pro Million Token sinkt die Schwelle für die Bürozeit-Variante auf 308 Millionen Token. Ob eine einzelne Karte diesen Durchsatz mit deinem Mix aus Prompt-Länge und Antwortlänge schafft, musst du messen. Die Rechnung sagt nur, ab welchem Volumen sich die Frage überhaupt stellt.

Die ausführliche Methode mit Auslastung und Leerlauf steht in der Break-even-Rechnung GPU-Server gegen API-Token. Für Kolibri-1 kommt ein Punkt hinzu, den keine Tabelle abbildet. Wer Kolibri-1 wegen der Daten selbst hosten will, vergleicht oft gar nicht mit einer API. Dürfen Dokumente das Haus nicht verlassen, scheidet die API aus. Dann lautet die echte Frage: GPU mieten in einem EU-Rechenzentrum mit Auftragsverarbeitungsvertrag (AVV) oder eigene Hardware kaufen. Auch eine gemietete GPU steht bei einem Dritten. Nach der DSGVO (Datenschutz-Grundverordnung) ist das eine Auftragsverarbeitung und kein Betrieb im eigenen Haus.

Wann ein kleineres lokales Modell die ehrliche Antwort ist

Kolibri-1 lohnt sich, wenn du seine Stärken brauchst. Laut Card gehören Tool-Aufrufe und Dokumentenverarbeitung mit langem Kontext dazu. 262.144 Token fassen einen ganzen Vertragsordner in einer einzigen Anfrage. Sind deine Aufgaben kürzer, sieht die Rechnung anders aus.

Für das Sortieren von E-Mails oder kurze Zusammenfassungen reicht oft ein Modell mit 7 bis 14 Milliarden Parametern. Auf 4 Bit quantisiert läuft es mit Ollama auf einem CPU-VPS mit 16 bis 32 GB RAM. Das ist langsamer als eine GPU, aber für einige hundert Anfragen am Tag genug. Wie das geht, zeigt die Anleitung, Ollama auf einem VPS selbst zu hosten. Die Kosten liegen dann bei einem normalen Server-Monatspreis und nicht bei einer GPU-Stundenrechnung.

Das naheliegende kleine Modell aus demselben Haus wäre Pharia-1-LLM-7B-control. Seine Lizenz erlaubt aber nur nicht-kommerzielle Forschung und Lehre. Für den Einsatz im Unternehmen ist es deshalb keine Lösung.

Ehrlich entscheiden kannst du nur mit einem Test. Nimm 50 echte Aufgaben aus deinem Alltag. Lass sie von Kolibri-1 auf einer stundenweise gemieteten GPU lösen und von einem kleinen Modell auf dem CPU-VPS. Vergleiche dann die Antworten. Ein paar Stunden Testmiete kosten wenig im Vergleich zu einem falschen Hardwarekauf.

Wie dieselbe Frage bei einem anderen offenen Modell ausfällt, zeigt was es braucht, Kimi K3 selbst zu hosten. Der Vergleich hilft beim Einordnen: Kolibri-1 gehört mit rund 78 GB Gewichten zu den Modellen, die noch auf eine einzelne Karte passen.

FAQ

Darf ich Kolibri-1 kommerziell nutzen?

Ja. Kolibri-1 steht laut Model Card unter Apache 2.0. Du darfst es im Unternehmen einsetzen und auch verändert weitergeben, wenn du den Lizenztext und die Hinweise beilegst. Das unterscheidet Kolibri-1 von der früheren Pharia-Reihe: Die Card von Pharia-1-LLM-7B-control nennt die Open Aleph License, die nur nicht-kommerzielle Forschung und Lehre erlaubt.

Läuft Kolibri-1 mit Ollama oder auf der CPU?

Nicht offiziell. Aleph Alpha veröffentlicht nur den Weg über vLLM auf NVIDIA-GPUs, mit dem Plugin aleph-alpha-inference. Es gibt GGUF-Dateien aus der Community, etwa 47,5 GB in Q4_K_M. Sie brauchen ein gepatchtes llama.cpp, weil das normale llama.cpp die Architektur kolibri1 nicht kennt. Die Autoren selbst nennen die Qualität und lange Kontexte ungeprüft.

Reicht eine einzelne H100 mit 80 GB für Kolibri-1?

Nein. Die FP8-Gewichte belegen schon rund 78 GB. Für den KV-Cache, der den Kontext hält, bleibt praktisch nichts übrig. Die Card nennt als Minimum unter anderem zwei H100 SXM5 oder eine H200. Bei zwei Karten startest du vLLM mit --tensor-parallel-size 2.

Wie schalte ich den Denkmodus von Kolibri-1 ab?

Der Denkmodus ist standardmäßig an. Pro Anfrage schaltest du ihn mit "chat_template_kwargs": {"enable_thinking": false} im JSON-Body ab. Laut Card wirkt auch reasoning_effort mit dem Wert none. Ist der Modus an, trennt --reasoning-parser kolibri1 den Denktext von der eigentlichen Antwort.

#llm#self-hosting#gpu#vllm#open-models#aleph-alpha