SSD Nodes Learn Hosting plans →
Anleitungen Matt ConnorVon Matt Connor · Aktualisiert 2026-10-04

Zanus AI oder eigener KI-Server: Was lohnt sich?

Lohnt sich Zanus AI oder ist ein eigener GPU-Server günstiger? Wir vergleichen die No-Code-Appliance mit dem Aufbau eines Stacks aus LLMs und Vektordatenbanken unter Linux.

Was Zanus AI mit Stand September 2026 anbietet

Zanus AI vertreibt einen privaten KI-Server für Unternehmen. Die Frage hinter den meisten Suchanfragen dazu lautet, was der Eigenbau eines solchen privaten KI-Servers kostet. Kurz gefasst: Das Gerät ist eine No-Code-Box, deren Preis auf Anfrage erfolgt, die vorkonfiguriert geliefert wird und vollständig ohne Internetverbindung betrieben werden kann. Die Do-it-yourself-Variante besteht aus einem gemieteten GPU-Server (Graphics Processing Unit), auf dem Open-Weight-LLMs (Large Language Models) hinter einem Inference-Server, einer Chat-Oberfläche, einem Vektorspeicher und einem Agenten-Framework laufen. Dies erfordert eine Person, die Linux bedienen kann. Welcher Weg der richtige ist, hängt von vier Faktoren ab: Wer übernimmt die technische Umsetzung, wo darf die Datenhaltung erfolgen, können Sie eine 6-kW-Maschine betreiben und wie viele Token verbrauchen Sie tatsächlich pro Tag.

Alle Informationen zu Zanus stammen von zanusai.com mit Stand September 2026. Das Unternehmen beschreibt sich selbst als „eine privat geführte amerikanische C-Corp, spezialisiert auf High-Tech-KI-Lösungen und Engineering, mit Hauptsitz in Pompano Beach, Florida“, was laut eigener Webseite im Großraum Fort Lauderdale liegt. Es gibt an, dass Hardware und Software „in den USA entworfen und montiert“ werden.

Das Produkt besteht aus drei Ebenen. Front Office AI ist „die KI-Belegschaft, mit der Ihre Kunden sprechen“: Telefon, Web-Chat, Angebote und Buchungen. Back Office AI ist „das KI-Betriebssystem, auf dem Ihr Unternehmen läuft“, beschrieben als „15+ Module. Kein Coding. Integriert.“ Zu den auf der Seite genannten Modulen gehören ein Vektorspeicher, KI-Chat, Kunden, Lieferanten, Kalender, Aufgaben, Automatisierungen, Web-Chatbots und eine API (Application Programming Interface). Auf die Frage „Benötigen wir einen Entwickler?“ antwortet die Seite mit „Nein.“ Die dritte Ebene, Private On-Premises AI, ist dasselbe System auf Zanus-Hardware in Ihrem Gebäude. Es läuft unter „Zanus OS“, wird als „vollständiges Eigentum: Hardware + unbefristete Softwarelizenzen“ verkauft und ist „Air-Gap-fähig“, wobei Updates per USB erfolgen, wenn das Gerät vom Internet getrennt bleibt.

Zu den Modellen gibt die Server-Seite an, dass die Box „die führenden Open-Weight-Familien“ ausführt, die „bei der Konfiguration mit Ihnen ausgewählt und dimensioniert“ werden, und dass man „Modelle jederzeit austauschen oder hinzufügen kann: neue Gewichte sind ein Download“. Die Seite nennt weder die Familien, die GPUs, den RAM noch die Speichergröße, abgesehen von „RAID 10 NVMe“. Zum Stromverbrauch: Es wird ein „Standard-50A-Stromkreis bei 115/220V“ benötigt, das Gerät zieht „maximal 6 kW“ unter Volllast. Die Seite beschreibt die Einheit als leise und bürotauglich, ein Serverraum sei nicht erforderlich. Zum Preis: Die Box wird „auf Anfrage“ (RFQ) angeboten und „basierend auf GPU-Speicher (Modelle), RAM/Kontext und Token pro Tag“ dimensioniert. Es gibt keinen öffentlichen Preis für die Hardware. Die gehosteten Front-Office-Pläne listen mit Stand September 2026 feste jährliche Preise von 4.900 USD bis 49.900 USD auf, dabei handelt es sich jedoch um Cloud-Instanzen im Zanus-Rechenzentrum, nicht um das Gerät selbst. Die Lieferzeit wird mit etwa drei Wochen für die vorkonfigurierte Einheit angegeben.

Dies ist die öffentliche Spezifikation. Die folgenden Abschnitte enthalten keine weiteren Informationen oder Spekulationen.

So sieht der gleiche private KI-Server aus, wenn Sie ihn selbst aufbauen

Die Appliance bündelt vier Komponenten, die Sie mieten und selbst zusammenstellen können: eine GPU, einen Inference-Server zum Laden von Modellen mit offenen Gewichten, eine Chat-Oberfläche für Benutzer sowie einen Vektorspeicher mit einer Automatisierungsschicht, die Ihre Dokumente in Antworten umwandelt. Der Linux-Teil ist an einem Nachmittag erledigt. Die Geschäftsmodule benötigen Wochen; diese Lücke ist der eigentliche Unterschied zwischen den beiden Wegen.

Wählen Sie zuerst die Hardware. Ein reiner CPU-VPS (Virtual Private Server) mit 16 GB bis 32 GB RAM führt 7B- und 8B-Modelle für ein oder zwei Personen gleichzeitig aus, mit Geschwindigkeiten, die Sie in Tokens pro Sekunde messen sollten, bevor sich jemand darauf verlässt. Eine gemietete GPU mit 24 GB VRAM (dem Speicher auf der Grafikkarte) führt 8B-Modelle schnell genug für ein kleines Team aus und bietet Platz für Modelle bis etwa 30B bei 4-Bit-Quantisierung; 48 GB bis 80 GB entsprechen der 70B-Klasse. Welche Modelle auf welche Karte passen, wird unter welche KI-Modelle Sie bei welcher Speichergröße selbst hosten können erläutert.

Installieren Sie den Inference-Server. Die Linux-Installation von Ollama besteht aus einer Zeile; die vollständige Anleitung finden Sie unter Ausführen von Ollama auf einem VPS zum Selbst-Hosting eines LLM:

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -v

systemctl status ollama sollte als active (running) gelesen werden. Auf einem Rechner ohne GPU gibt das Installationsprogramm WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode. aus und fährt fort, was für Tests in Ordnung, für Benutzer jedoch langsam ist.

Laden Sie ein Modell und sprechen Sie mit der API. Der Dienst lauscht nur auf Port 11434 auf der Loopback-Adresse:

ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
  -d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'

Eine erfolgreiche Antwort ist ein JSON-Objekt mit einem response-Feld und "done":true. Eine Antwort von {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"}, mit Ihren eigenen zwei Werten, bedeutet, dass die Gewichte nicht in den RAM passen. Wählen Sie in diesem Fall ein kleineres Modell oder eine geringere Quantisierung.

Fügen Sie die Chat-Oberfläche hinzu. Open WebUI ist die übliche Wahl; die README-Datei enthält einen Befehl für den Fall, dass Ollama auf demselben Host läuft:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Navigieren Sie zu Port 3000 auf der Server-Adresse, erstellen Sie das erste Konto (dieses wird zum Administrator) und öffnen Sie die Modellliste. Wenn die Liste leer ist, liegt die Ursache in der oben genannten Loopback-Bindung: Innerhalb des Containers wird host.docker.internal zur Docker-Bridge-Adresse des Hosts aufgelöst, und Ollama lauscht nur auf 127.0.0.1, weshalb die Verbindung abgelehnt wird. docker logs open-webui zeigt Cannot connect to host host.docker.internal:11434. Beheben Sie dies mit einem systemd-Override:

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama

0.0.0.0 bedeutet alle Schnittstellen, einschließlich der öffentlichen. Ab diesem Punkt ist die API aus dem Internet erreichbar, sofern die Firewall Port 11434 nicht blockiert. Da die API kein eigenes Passwort besitzt, sollten Sie den Ollama-API-Endpunkt absichern, bevor Sie ein einziges Firmendokument laden. Wenn Ihnen Open WebUI zu umfangreich ist, gibt es leichtere Open WebUI-Alternativen, die denselben Port nutzen.

Fügen Sie den Vektorspeicher hinzu. Qdrant läuft als einzelner Container. Binden Sie ihn an Loopback, da nur die Anwendungen auf dem Server darauf zugreifen sollten:

docker run -d --name qdrant --restart always \
  -p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
  -v qdrant_storage:/qdrant/storage \
  qdrant/qdrant
curl http://127.0.0.1:6333/collections

Die Prüfung liefert bei einer frischen Installation {"result":{"collections":[]},"status":"ok"} sowie ein Zeitfeld. Open WebUI verfügt über einen integrierten Dokumentenspeicher, der für eine kleine Bibliothek ausreicht; Qdrant ist für Fälle gedacht, in denen ein Agent-Framework Embeddings direkt abfragen muss.

Wenn mehr als eine Handvoll Personen gleichzeitig darauf zugreifen, ersetzen Sie Ollama durch vLLM, das Anfragen über Benutzer hinweg auf der GPU bündelt. Das offizielle Image enthält die vollständige Installation:

docker run -d --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 127.0.0.1:8000:8000 --ipc=host \
  vllm/vllm-openai:latest --model Qwen/Qwen3-8B

Wenn Docker antwortet, dass es could not select device driver mit GPU-Funktionen ist, ist das NVIDIA Container Toolkit nicht installiert. Docker hat somit keine Möglichkeit, die Karte an den Container weiterzureichen. Installieren Sie das Toolkit, starten Sie Docker neu und führen Sie den Befehl erneut aus. Wann welcher Server zu bevorzugen ist, wird unter Ollama versus vLLM behandelt.

Die letzte Schicht ist das, was die Appliance als Module bezeichnet. Auf dem gemieteten Weg handelt es sich um ein Agent-Framework, das aus dem Vektorspeicher liest, das Modell aufruft, Aktionen in Ihren anderen Systemen ausführt und protokolliert, was es getan hat. Die Kandidaten und deren Stärken werden unter die besten selbst gehosteten KI-Agenten verglichen. Wenn der Agent Benutzer über Sitzungen hinweg wiedererkennen soll, bietet ein selbst gehosteter Mem0-Speicherserver diese Funktion. Nichts davon existiert, bevor Sie es konfigurieren – und genau das ist der Teil der Appliance, für den Sie tatsächlich bezahlen.

Kosten: Ein Angebot im Vergleich zur monatlichen Rechnung

Es gibt keine Zanus-Nummer, die hier eingetragen werden könnte, und das Erfinden einer solchen wäre mehr als nutzlos. Die Website gibt jedoch an, wie das Angebot bemessen wird: anhand des GPU-Speichers für die Modelle, des RAM für den Kontext sowie der Token pro Tag. Dies sind dieselben Variablen, die auch den Preis des gemieteten Pfades bestimmen, sodass Sie zumindest Ihre Seite des Vergleichs fundiert aufbauen können.

Auf der Mietseite bestehen die Kosten aus einer festen monatlichen Miete für die GPU zuzüglich der Arbeitszeit der Person, die sie betreibt. Die Miete ändert sich nicht, egal ob die Karte im Leerlauf ist oder unter Volllast läuft. Das macht den Vergleich mit einer Pay-per-Token-API zu einem Break-even-Problem: Teilen Sie die monatliche Miete durch den Mischpreis pro Million Token der API, die Sie andernfalls nutzen würden. Das Ergebnis ist die Anzahl der Token pro Monat, die Sie tatsächlich durch das System schleusen müssen, damit der Besitz der GPU günstiger ist als das Mieten von Token. Unterhalb dieses Volumens ist die API finanziell überlegen. Die Berechnung, inklusive der Fallstricke bei Leerlaufzeiten und Batch-Größen, finden Sie unter GPU VPS versus API-Token: Wo liegt der Break-even.

Bei der Appliance-Seite stellt sich die Situation anders dar: Es handelt sich um eine Investitionsausgabe, eine dauerhafte Softwarelizenz, Stromkosten und die gleiche Bemessung der Token pro Tag, die bereits bei der Angebotserstellung für Sie durchgeführt wurde. Ein Angebot, das auf das heutige Volumen zugeschnitten ist, stellt gleichzeitig eine Obergrenze dar. Ein Wachstum darüber hinaus erfordert ein neues Angebot, während eine gemietete GPU lediglich eine Tarifänderung bedeutet.

Wer übernimmt die technische Umsetzung

Das Verkaufsargument der Appliance lautet, dass dies niemand tun muss. „Kein Programmieren. Integriert.“ und „Brauchen wir einen Entwickler? Nein.“ sind der Kernpunkt. Dennoch führen Sie eine Änderung der Geschäftsprozesse durch, da das Personal neue Werkzeuge erlernen muss und jemand das Wissen hochladen sowie das Telefonmenü erstellen muss. Niemand muss jedoch wissen, was eine systemd-Unit ist.

Der gemietete Pfad erfordert eine Person, die alle oben genannten Befehle ohne Hilfe ausführen und diese Tätigkeit fortsetzen kann. Konkret ist diese Person verantwortlich für die Betriebssystem-Updates, die Docker-Images, die Firewall- und TLS-Zertifikate (Transport Layer Security), die Backups des Vektorspeichers und des Chatverlaufs, die Modell-Updates sowie das Monitoring, das meldet, wenn der GPU-Treiber nach einem Kernel-Update nicht mehr funktioniert. Planen Sie einen Tag für die Erstinstallation und danach einige Stunden pro Monat ein. Planen Sie dann die eigentliche Arbeit ein: Nichts auf dem gemieteten Pfad wird mit einer Kundentabelle, einer Lieferantenliste, einem Kalender oder einem Buchungsablauf geliefert. Jedes dieser Elemente ist eine Integration, die Sie gegen Ihre bestehenden Systeme schreiben, oder ein Agent-Framework, das Sie konfigurieren und dann verteidigen müssen, wenn es sich unerwartet verhält. Wenn niemand im Team diesen Job übernehmen möchte, ist die Antwort „kein Entwickler“ mehr wert als jede Hardwarespezifikation.

Wo die Daten liegen

Das stärkste Argument für die Appliance ist ihre physische Präsenz. Aussagen wie „Ihre Daten verlassen niemals das Haus“ oder „Daten bleiben physisch in Ihrem Gebäude“ beschreiben ein Gerät, das Sie vom Netzwerk trennen können und das dennoch funktionsfähig bleibt. Für eine Arztpraxis oder eine Anwaltskanzlei mit vertraglichen Auflagen zur lokalen Datenspeicherung ist dies das entscheidende Kriterium, das kein VPS erfüllen kann.

Für den gemieteten Weg gilt: Ein VPS ist ein Computer im Rechenzentrum eines Drittanbieters. Ihre Prompts, Dokumente, die Antworten des Modells und der Vektor-Index werden im RAM eines Hosts verarbeitet, der dem Anbieter gehört, und liegen auf einem Datenträger, auf den der Anbieter physischen Zugriff hat. „Private AI“ auf einem VPS bedeutet lediglich, dass die Daten vor dem Modellanbieter und dem öffentlichen Internet geschützt sind, mehr nicht. Ihr Hosting-Anbieter kann weiterhin darauf zugreifen, und ein Kunde oder Auditor, der nach dem Speicherort der Daten fragt, erhält den Namen einer Stadt statt der Bezeichnung eines Raums in Ihrem Gebäude. Eine Verschlüsselung im Ruhezustand (Encryption at rest) schützt den Datenträger bei einem Diebstahl. Sie schützt jedoch nicht den Arbeitsspeicher, während das Modell eine Antwort generiert.

Die mittlere Lösung besteht in eigener Hardware in einem gemieteten Rack oder einem dedizierten Server, den Sie mit niemandem teilen. Dies bewahrt die Freiheit bei der Modellwahl und die monatlichen Kosten des gemieteten Weges, schließt jedoch einen Großteil der physischen Sicherheitslücke. Gleichzeitig kehrt damit der Aspekt zurück, den die Appliance eliminiert: Jemand muss die Maschine aufbauen und warten.

Stromversorgung und Platzbedarf

Eine 6 kW-Maschine ist kein Büro-PC. Eine Standard-Steckdose in den USA ist für einen 15 A- oder 20 A-Stromkreis ausgelegt; die Seite verlangt einen 50 A-Stromkreis, wie er für einen Elektroherd oder ein Schnellladegerät für Elektrofahrzeuge verwendet wird. Ein Elektriker ist daher Teil der Installation. Die Website gibt an, dass das Gehäuse leise und bürotauglich ist und die Spitzenlast nur während des Betriebs erreicht. Der Stromverbrauch im Leerlauf wird nicht veröffentlicht.

Strom ist der einzige Betriebskostenfaktor, den man beziffern kann, da es sich um eine einfache Rechnung handelt. Bei 6 kW entspricht jede Stunde unter Volllast 6 kWh:

ChartElectricity for a 6 kW appliance by daily full-load hours, at 0.15 USD per kWh
The data behind this chart
[
  {
    "label": "1 h/day at full load",
    "kwh_per_month": 180,
    "cost_usd_month": 27
  },
  {
    "label": "4 h/day at full load",
    "kwh_per_month": 720,
    "cost_usd_month": 108
  },
  {
    "label": "8 h/day at full load",
    "kwh_per_month": 1440,
    "cost_usd_month": 216
  },
  {
    "label": "24 h/day at full load",
    "kwh_per_month": "4,320",
    "cost_usd_month": 648
  }
]

Ein Gerät, das eine Stunde pro Tag arbeitet, kostet bei 0,15 USD pro kWh etwa 27 USD pro Monat. Ein Gerät, das rund um die Uhr unter Volllast läuft, verbraucht 4,320 kWh und kostet etwa 648 USD. Die Angabe des Herstellers lautet „etwa 1 USD pro Stunde“ bei Volllast, was auf einen etwas höheren Tarif hindeutet, als die Tabelle annimmt; verwenden Sie daher Ihren eigenen Tarif. Die gesamte Energie verlässt die Maschine als Wärme, etwa 20.000 BTU (British Thermal Units) pro Stunde bei Spitzenlast, die von der Klimaanlage des Raums abgeführt werden muss.

Beim Mietmodell sind Strom und Kühlung in der Miete enthalten, und das Rechenzentrum des Anbieters stellt den Stromkreis bereit. Der Nachteil ist, dass Sie den Zähler nicht sehen können: Ein GPU-Plan kostet das Gleiche, egal ob er eine Stunde am Tag oder 24 Stunden arbeitet.

Modellwahl

Das Gerät wird mit Modellen ausgeliefert, die bei der Konfiguration gemeinsam mit Ihnen aus den "führenden Open-Weight-Familien" ausgewählt wurden. Die Seite gibt an, dass neue Gewichte heruntergeladen werden können. Welche Familien unterstützt werden, wie ein Austausch innerhalb von Zanus OS erfolgt, ob ein Modell außerhalb der Liste des Herstellers geladen werden kann und wer den Austausch durchführt, ist nicht öffentlich dokumentiert. Klären Sie dies daher vor Vertragsabschluss.

Der gemietete Pfad führt alles aus, für das veröffentlichte Gewichte vorliegen und das über genügend Arbeitsspeicher verfügt. Eine neue Open-Weight-Veröffentlichung ist ein ollama pull oder ein Hugging Face-Repository-Name, der am Tag der Veröffentlichung an vLLM übergeben wird. Wenn Sie eine bestimmte Quantisierung oder ein eigenes Fine-Tuning wünschen, importieren Sie die GGUF-Datei selbst in Ollama. Der Haken besteht auch in der anderen Richtung: Sie sind selbst für die Evaluierung verantwortlich. Niemand hat das Modell auf Ihre Dokumente oder Ihre Token pro Tag dimensioniert. Der erste Monat dient daher dazu, herauszufinden, welches Modell bei welcher Geschwindigkeit ausreicht und welche Quantisierung Ihr Arbeitsspeicher zulässt.

Der private KI-Antwortdienst: ein Modul gegen ein Projekt

Ein Großteil des Datenverkehrs zum Thema "privater KI-Server" zielt eigentlich auf eine telefonische Empfangskraft ab. Behandeln Sie diesen Anwendungsfall daher separat.

Auf Seiten von Zanus ist der Telefon-Agent Front Office AI. Die Seite gibt an, dass er "jeden Anruf in Ihrem Menü mit den von Ihnen gewählten Stimmen rund um die Uhr in bis zu 40 Sprachen beantwortet". Er verfügt über ein IVR-Menü (Interactive Voice Response), das Sie selbst erstellen. Das Produkt wird als gehosteter Mandant vertrieben, wobei im höchsten Tarif ein On-Premises-Pfad verfügbar ist. Welche Sprachmodelle verwendet werden und wie hoch die Antwortlatenz ist, wird nicht veröffentlicht.

Beim gemieteten Pfad ist ein Sprach-Agent ein separates Projekt, das sich vom oben genannten Chat-Stack unterscheidet und komplexer ist. Er benötigt vier zusätzliche Komponenten: einen Telefonie-Einstiegspunkt (einen SIP-Trunk, wobei SIP für Session Initiation Protocol steht, oder eine Telefonie-API, die Ihnen das Audiosignal bereitstellt), Speech-to-Text (STT), das LLM und Text-to-Speech (TTS). Diese müssen so verkettet sein, dass ein Anrufer eine Antwort innerhalb von etwa einer Sekunde nach Beendigung eines Satzes hört. Jedes Glied in der Kette erhöht die Verzögerung, daher müssen die Modelle klein sein und die GPU muss sich in unmittelbarer Nähe befinden. Die STT- und TTS-Hälften, die lokal laufenden Engines und deren Geschwindigkeit finden Sie unter selbst gehostetes Speech-to-Text und Text-to-Speech auf einem VPS. Rechnen Sie damit, dass der Telefon-Agent mehr Zeit in Anspruch nimmt als der gesamte oben genannte Chat-Stack, und erwarten Sie, dass die erste Version Anrufer unterbricht. Wenn die Empfangskraft das einzige Ziel ist, sind das Modul der Appliance oder ein gehostetes Sprachprodukt der kürzere Weg, während der Chat-Server in diesem Fall nur ablenkt.

Die Entscheidungsregel

Kaufen Sie die Hardware, wenn alle vier Bedingungen erfüllt sind: Ein Vertrag oder eine Regulierungsbehörde schreibt vor, dass die Daten im Gebäude bleiben, kein Mitarbeiter Linux betreiben möchte, Sie über einen 50 A Stromkreis verfügen oder diesen installieren können und die Module auf der Seite zu Ihrer tatsächlichen Arbeit passen. Der Angebotspreis ist die Kostenersparnis für den Wegfall eines Ingenieurs. Lassen Sie sich die Modellliste und das Austauschverfahren schriftlich geben, bevor Sie unterschreiben.

Mieten und bauen Sie selbst, wenn eine Person den Server allein verwalten kann, die Daten bei einem von Ihnen geprüften Hosting-Anbieter liegen dürfen, Sie das Modell selbst wählen möchten und Ihre Auslastung so stabil ist, dass ein monatlicher GPU-Preis günstiger ist als die Token-Abrechnung beim oben genannten Break-even-Punkt. Sie erhalten jedes Open-Weight-Modell am Tag der Veröffentlichung und eine Rechnung, die Sie im nächsten Monat anpassen können. Sie erhalten zudem jede Integration als Eigenleistung.

Nutzen Sie eine API, wenn die Auslastung schwankend oder gering ist, die Daten nicht sensibel sind, niemand etwas selbst betreiben möchte und die Lösung noch in dieser Woche funktionieren muss. Unterhalb des Break-even-Volumens ist dies günstiger und der Start erfolgt immer schneller. Fügen Sie später eine selbst gehostete Ebene hinzu, falls die Token-Rechnung oder die Datenrichtlinie Sie dazu zwingen.

FAQ

Was verkauft Zanus AI eigentlich?

Stand September 2026 beschreibt zanusai.com drei Ebenen. Front Office AI verwaltet Telefonate, Web-Chats, Angebote und Buchungen. Back Office AI umfasst "15+ Module. Kein Coding erforderlich. Integriert." Private On-Premises AI ist dieselbe Software auf Zanus-Hardware, die mit "Zanus OS" in Ihrem Gebäude betrieben wird und als vollständig erworbenes, Air-Gap-fähiges System verkauft wird. Der Preis der Hardware erfolgt auf Anfrage (RFQ). Sie benötigt einen 50 A Stromkreis und verbraucht bis zu 6 kW. Der Hauptsitz des Unternehmens befindet sich in Pompano Beach, Florida.

Wie viel kostet ein privater Zanus AI Server?

Es gibt keinen öffentlichen Preis für die Hardware. Die Server-Seite gibt "Preis auf Anfrage" an, basierend auf GPU-Speicher, RAM und Ihren Tokens pro Tag. Die gehosteten Front-Office-Pläne listen Stand September 2026 jährliche Pauschalpreise auf, diese laufen jedoch im Zanus-Rechenzentrum und sind ein Abonnement, daher bepreisen sie nicht die Hardware. Um einen Vergleich anzustellen, bewerten Sie den Mietpfad mit denselben Variablen und berechnen Sie den Break-Even gegenüber API-Tokens.

Kann ich einen privaten KI-Server auf einem VPS ohne GPU aufbauen?

Ja, für eine kleine Anzahl von Benutzern und kleine Modelle. Ein reiner CPU-VPS mit 16 GB bis 32 GB RAM führt 7B- und 8B-Modelle über Ollama mit einigen Tokens pro Sekunde aus, was ausreicht, um einen Dokumenten-Assistenten zu testen. Es reicht nicht für ein Team, das ihn gleichzeitig nutzt, oder für einen Sprach-Agenten, bei dem die Antwortzeit entscheidend ist. Messen Sie die Tokens pro Sekunde auf Ihrem Plan, bevor sich jemand darauf verlässt.

Ist ein selbst gehostetes LLM auf einem VPS wirklich privat?

Es ist privat gegenüber dem Modellanbieter und dem öffentlichen Internet, vorausgesetzt, die Firewall blockiert Port 11434 und das Chat-Interface befindet sich hinter TLS. Der Hosting-Anbieter ist die Ausnahme: Dessen Mitarbeiter können auf den Datenträger zugreifen, und der Host führt das Modell im Arbeitsspeicher aus. Wenn ein Vertrag vorschreibt, dass die Daten in Ihrem Gebäude bleiben müssen, erfüllt ein VPS diese Anforderung nicht. Eigene Hardware in Ihrem Büro oder in einem gemieteten Rack tut dies hingegen.

Beinhaltet der Do-it-yourself-Pfad eine Telefonzentrale?

Nicht von Haus aus. Ein Sprach-Agent ist ein separates Projekt: ein Telefonie-Einstiegspunkt, Speech-to-Text, das LLM und Text-to-Speech, die so eng miteinander verknüpft sind, dass ein Anrufer eine Antwort in etwa einer Sekunde hört. Dies ist der schwierigste Teil des Mietpfads und der Bereich, in dem das Modul des Geräts oder ein gehostetes Sprachprodukt die meiste Zeit spart.

#zanus#private-ai#self-hosted-llm#ollama#gpu#ai-appliance