SSD Nodes Learn Hosting plans →
Guías Matt ConnorPor Matt Connor · Actualizado 2026-09-15

Zanus AI o montar tu propio servidor privado de IA

Compara el appliance privado sin código de Zanus AI, con precio bajo cotización, frente a una GPU alquilada y descubre cuándo conviene una API.

Qué vende Zanus AI en septiembre de 2026

Zanus AI vende un servidor de IA privado para empresas. La pregunta que subyace a la mayoría de las búsquedas es cuánto cuesta construir por cuenta propia un servidor de IA privado equivalente. La versión resumida es la siguiente: el dispositivo es una solución sin código, con precio bajo cotización, que llega configurada y puede funcionar sin ninguna conexión a Internet. La versión autogestionada consiste en un servidor con GPU (unidad de procesamiento gráfico) alquilada que ejecuta LLM (modelos de lenguaje grandes) de pesos abiertos detrás de un servidor de inferencia, una interfaz de chat, un almacén vectorial y un framework de agentes. Requiere una persona capaz de administrar Linux. La opción adecuada depende de cuatro factores: quién realiza la ingeniería, dónde pueden almacenarse los datos, si puede alimentar una máquina de 6 kW y cuántos tokens usa realmente al día.

Toda la información sobre Zanus incluida aquí procede de zanusai.com, consultado en septiembre de 2026. La empresa se describe como «una C-Corp estadounidense de propiedad privada especializada en soluciones y servicios de ingeniería de IA de alta tecnología, con sede en Pompano Beach, Florida». En su propia página sitúa la empresa en el área metropolitana de Fort Lauderdale. También afirma que su hardware y su software están «diseñados y ensamblados en EE. UU.».

El producto tiene tres capas. Front Office AI es «la plantilla de IA con la que hablan sus clientes»: teléfono, chat web, presupuestos y reservas. Back Office AI es «el sistema operativo de IA que ejecuta su empresa», descrito como «más de 15 módulos. Sin código. Integrado». Entre los módulos mencionados en la página se incluyen un almacén vectorial, chat de IA, clientes, proveedores, calendario, tareas, automatizaciones, chatbots web y una API (interfaz de programación de aplicaciones). A la pregunta «¿Necesitamos un desarrollador?», la página responde «No». La tercera capa, Private On-Premises AI, es el mismo sistema ejecutándose en hardware de Zanus dentro de las instalaciones de la empresa. Ejecuta «Zanus OS», se vende como «propiedad total: hardware + licencias de software permanentes» y tiene capacidad de aislamiento de red («air-gap»). Cuando se mantiene desconectado de Internet, las actualizaciones se instalan mediante USB.

En cuanto a los modelos, la página del servidor indica que el equipo ejecuta «las principales familias de pesos abiertos», «seleccionadas y dimensionadas con usted durante la configuración». También indica que puede «cambiar o añadir modelos en cualquier momento: los nuevos pesos se descargan». No especifica las familias, las GPU, la RAM ni la capacidad de almacenamiento, más allá de «RAID 10 NVMe». En cuanto a la alimentación eléctrica, necesita un «circuito estándar de 50 A a 115/220 V» y consume «6 kW como máximo» a plena carga. La página describe la unidad como silenciosa y adecuada para oficinas, sin necesidad de una sala de servidores. En cuanto al precio, el equipo se ofrece «por RFQ» (solicitud de presupuesto) y se dimensiona según la memoria de GPU (modelos), la RAM/el contexto y los tokens diarios. No existe un precio público para el hardware. Los planes de Front Office alojado sí muestran precios anuales fijos, de 4.900 a 49.900 $ al año en septiembre de 2026, pero corresponden a instancias en la nube del centro de datos de Zanus, no al dispositivo. El plazo de entrega indicado es de aproximadamente tres semanas, con la configuración realizada.

Esa es la especificación pública. El contenido siguiente no añade información ni hace suposiciones más allá de ella.

Qué aspecto tiene el mismo servidor de IA privado cuando lo crea usted

El dispositivo agrupa cuatro componentes que puede alquilar y montar por su cuenta: una GPU, un servidor de inferencia que carga modelos de pesos abiertos, una interfaz de chat para los usuarios y un almacén vectorial con una capa de automatización que convierte sus documentos en respuestas. La parte de Linux se configura en una tarde. Los módulos de negocio requieren semanas, y esa diferencia es la verdadera distinción entre ambos enfoques.

Elija primero el equipo. Un VPS (servidor privado virtual) que sólo use CPU, con 16 GB a 32 GB de RAM, ejecuta modelos 7B y 8B para una o dos personas a la vez, a velocidades que debe medir en tokens por segundo antes de que alguien dependa de ellos. Una GPU alquilada con 24 GB de VRAM (la memoria de la tarjeta gráfica) ejecuta modelos 8B con suficiente rapidez para un equipo pequeño y admite modelos de hasta aproximadamente 30B con 4 bits; entre 48 GB y 80 GB corresponde a la clase 70B. Qué modelos caben en cada tarjeta se explica en qué modelos de IA puede alojar por su cuenta con cada tamaño de memoria.

Instale el servidor de inferencia. La instalación de Ollama en Linux es una sola línea, y el procedimiento completo está en ejecutar Ollama en un VPS para alojar un LLM por su cuenta:

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -v

systemctl status ollama debería mostrar active (running). En una máquina sin GPU, el instalador muestra WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode. y continúa. Esto sirve para realizar pruebas, pero resulta lento para los usuarios.

Descargue un modelo y consulte la API. El servicio escucha en el puerto 11434, sólo en la dirección de loopback:

ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
  -d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'

Una respuesta correcta es un objeto JSON con un campo response y "done":true. Una respuesta {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"}, con sus propios dos valores, indica que los pesos no caben en la RAM. Elija un modelo más pequeño o una cuantización menor.

Añada la interfaz de chat. Open WebUI es la opción habitual, y su README incluye un comando para el caso en que Ollama se ejecute en el mismo host:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Acceda al puerto 3000 en la dirección del servidor, cree la primera cuenta (se convierte en la cuenta de administrador) y abra la lista de modelos. Si la lista está vacía, la causa es la vinculación a loopback anterior: dentro del contenedor, host.docker.internal se resuelve en la dirección del puente Docker del host, y Ollama sólo escucha en 127.0.0.1, por lo que se rechaza la conexión. docker logs open-webui muestra Cannot connect to host host.docker.internal:11434. Corríjalo con una anulación de systemd:

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama

0.0.0.0 significa todas las interfaces, incluida la pública. Desde este momento, la API es accesible desde Internet salvo que el firewall bloquee el puerto 11434, y la API no tiene contraseña propia. Por tanto, proteja el endpoint de la API de Ollama antes de cargar un solo documento de la empresa. Si Open WebUI consume más recursos de los que desea, existen alternativas más ligeras a Open WebUI que se conectan al mismo puerto.

Añada el almacén vectorial. Qdrant se ejecuta como un solo contenedor. Vincúlelo a loopback, porque sólo las aplicaciones del equipo deben acceder a él:

docker run -d --name qdrant --restart always \
  -p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
  -v qdrant_storage:/qdrant/storage \
  qdrant/qdrant
curl http://127.0.0.1:6333/collections

La comprobación devuelve {"result":{"collections":[]},"status":"ok"} y un campo de tiempo en una instalación nueva. Open WebUI tiene un almacén de documentos integrado suficiente para una biblioteca pequeña; Qdrant se utiliza cuando un framework de agentes necesita consultar embeddings directamente.

Si lo van a utilizar más de unas pocas personas a la vez, sustituya Ollama por vLLM, que agrupa las solicitudes de varios usuarios en la GPU. La imagen oficial contiene toda la instalación:

docker run -d --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 127.0.0.1:8000:8000 --ipc=host \
  vllm/vllm-openai:latest --model Qwen/Qwen3-8B

Si Docker responde que could not select device driver con capacidades de GPU, NVIDIA Container Toolkit no está instalado. Por tanto, Docker no puede asignar la tarjeta al contenedor. Instale el toolkit y reinicie Docker. Después, ejecute de nuevo el comando. La elección de cada servidor se explica en Ollama frente a vLLM.

La última capa es la que el dispositivo denomina módulos. En el enfoque alquilado, es un framework de agentes que lee del almacén vectorial, llama al modelo, ejecuta acciones en sus otros sistemas y registra lo que hizo. Los candidatos y sus usos principales se comparan en los mejores agentes de IA autoalojados. Si el agente necesita recordar a los usuarios entre sesiones, un servidor de memoria Mem0 autoalojado le proporciona esa capacidad. Nada de esto existe hasta que lo configura, y esa es la parte del dispositivo por la que realmente está pagando.

Coste: una cotización frente a una factura mensual

No hay ningún número de Zanus que se pueda incluir aquí, e inventar uno sería peor que no incluir ninguno. Lo que el sitio sí indica es cómo se calcula la cotización: según la memoria de GPU necesaria para los modelos, la RAM necesaria para el contexto y la cantidad de tokens diarios. Esas son las mismas variables que determinan el precio de la opción alquilada, así que al menos puede preparar una comparación honesta desde su lado.

En la opción alquilada, el coste consiste en un alquiler mensual fijo de la GPU más el tiempo de la persona que la administra. El alquiler no cambia tanto si la tarjeta permanece inactiva como si funciona al máximo. Por eso, la comparación con una API de pago por token es un problema de punto de equilibrio: divida el alquiler mensual entre el precio combinado por millón de tokens de la API que usaría en su lugar. El resultado es la cantidad de tokens mensuales que debe procesar realmente el equipo antes de que comprar la GPU sea más barato que alquilar tokens. Por debajo de ese volumen, la API cuesta menos. La aritmética, incluidas las dificultades relacionadas con el tiempo de inactividad y el tamaño de los lotes, se explica en GPU VPS frente a tokens de API: dónde se sitúa el punto de equilibrio.

En el caso del dispositivo, la estructura es diferente: una compra de capital, una licencia de software permanente, electricidad y el mismo cálculo del volumen diario de tokens, realizado al preparar la cotización. Una cotización ajustada al volumen actual también establece un límite máximo. Superarlo requiere otra cotización, mientras que una GPU alquilada sólo requiere cambiar de plan.

Quién se encarga de la ingeniería

La propuesta del appliance es que nadie tenga que hacerlo. «Zero coding. Built in.» y «Do we need a developer? No.» son el objetivo principal. Aun así, hay que gestionar un cambio en los procesos de la empresa: el personal debe aprender a usar herramientas nuevas y alguien debe cargar la base de conocimientos y redactar el menú telefónico. Pero nadie tiene que saber qué es una unidad de systemd.

La opción alquilada requiere una persona capaz de ejecutar sin ayuda todos los comandos anteriores y de seguir haciéndolo después. En concreto, esa persona se encarga de las actualizaciones del sistema operativo, las imágenes de Docker, el firewall y los certificados TLS (seguridad de la capa de transporte), las copias de seguridad del almacén vectorial y del historial de chats, las actualizaciones del modelo y la monitorización que avisa de que el controlador de GPU se rompió después de una actualización del kernel. Reserve un día para la primera instalación y unas horas al mes a partir de entonces. Después, reserve tiempo para el trabajo real: la opción alquilada no incluye una tabla de clientes, una lista de proveedores, un calendario ni un flujo de reservas. Cada uno de esos elementos requiere una integración que debe desarrollar con los sistemas existentes, o un framework de agentes que debe configurar y supervisar cuando haga algo inesperado. Si nadie del personal quiere asumir ese trabajo, la respuesta de «no hace falta un desarrollador» vale más que cualquier especificación de hardware.

Dónde residen los datos

La principal ventaja del appliance es física. «Tus datos nunca salen» y «mantiene los datos físicamente dentro de tu edificio» describen una máquina que puedes desconectar de la red y seguir utilizando. Para una clínica o un bufete de abogados cuyo contrato establece que los datos deben permanecer en sus instalaciones, ese es el factor decisivo, y ningún VPS lo iguala.

Dicho claramente, en la opción alquilada: un VPS es un equipo ubicado en el centro de datos de otra persona. Tus prompts, tus documentos, las respuestas del modelo y el índice vectorial se procesan en la RAM de un host propiedad del proveedor, y permanecen en un disco al que el proveedor puede acceder físicamente. La «IA privada» en un VPS significa que los datos son privados frente al proveedor del modelo y frente a Internet público, pero nada más. Tu proveedor de hosting aún puede acceder al sistema, y un cliente o auditor que pregunte dónde están los datos recibirá el nombre de una ciudad, no el de una sala de tu edificio. El cifrado en reposo protege el disco si alguien lo extrae. No protege lo que está en la memoria mientras el modelo genera una respuesta.

La opción intermedia consiste en usar tu propio hardware en un rack alquilado o un servidor dedicado que nadie más comparta. Esto conserva la libertad para elegir el modelo y el coste mensual de la opción alquilada, y al mismo tiempo reduce la mayor parte de la diferencia física. También recupera la parte que elimina el appliance: alguien tiene que montar el equipo.

Energía y espacio

Una máquina de 6 kW no es un PC de oficina. Un enchufe de pared estándar en Estados Unidos corresponde a un circuito de 15 A o 20 A; la página solicita un circuito de 50 A, que es el que se usa para una cocina eléctrica o un cargador rápido de vehículos eléctricos. Por tanto, la instalación requiere un electricista. El sitio indica que el equipo es silencioso y adecuado para una oficina, y que sólo alcanza su consumo máximo mientras trabaja. El consumo en reposo no está publicado.

La electricidad es el único coste operativo que se puede cuantificar directamente, porque se calcula con una operación aritmética. A 6 kW, cada hora a plena carga equivale a 6 kWh:

ChartElectricity for a 6 kW appliance by daily full-load hours, at 0.15 USD per kWh
The data behind this chart
[
  {
    "label": "1 h/day at full load",
    "kwh_per_month": 180,
    "cost_usd_month": 27
  },
  {
    "label": "4 h/day at full load",
    "kwh_per_month": 720,
    "cost_usd_month": 108
  },
  {
    "label": "8 h/day at full load",
    "kwh_per_month": 1440,
    "cost_usd_month": 216
  },
  {
    "label": "24 h/day at full load",
    "kwh_per_month": "4,320",
    "cost_usd_month": 648
  }
]

Un equipo que funciona una hora al día cuesta aproximadamente 27 USD al mes con una tarifa de 0.15 USD por kWh. Uno que funciona a plena carga durante todo el día consume 4,320 kWh y cuesta aproximadamente 648 USD. La cifra del propio proveedor es «aproximadamente 1 USD por hora» a plena carga, lo que implica una tarifa algo superior a la que supone la tabla. Por tanto, use su propia tarifa. Toda esa energía sale de la máquina en forma de calor: aproximadamente 20,000 BTU (unidades térmicas británicas) por hora en el pico de consumo. El aire acondicionado de la sala debe evacuar ese calor.

En la opción de alquiler, la electricidad y la refrigeración están incluidas en el alquiler, y el centro de datos del proveedor se encarga del circuito. La contrapartida es que no puede consultar el contador: un plan de GPU cuesta lo mismo tanto si se usa una hora al día como si funciona 24 horas.

Elección del modelo

El appliance incluye modelos elegidos contigo durante la configuración, procedentes de «las principales familias de modelos con pesos abiertos», y la página indica que los nuevos pesos se descargan. No se documentan públicamente las familias disponibles, cómo se cambia el modelo dentro de Zanus OS, si se puede cargar un modelo ajeno a la lista del proveedor ni quién realiza el cambio. Pregúntalo antes de firmar.

La opción de alquiler ejecuta cualquier modelo cuyos pesos estén publicados y para el que haya memoria suficiente. Una nueva versión con pesos abiertos es un ollama pull o el nombre de un repositorio de Hugging Face que se pasa a vLLM el día de su publicación. Si quieres una cuantización específica o un ajuste fino propio, importa tú mismo el archivo GGUF en Ollama. La contrapartida funciona en ambos sentidos: también debes encargarte de la evaluación. Nadie dimensionó el modelo para tus documentos ni para tus tokens diarios. Por eso, el primer mes se dedica a averiguar qué modelo ofrece una calidad suficiente a qué velocidad y qué cuantización admite tu memoria.

El servicio privado de respuestas con IA: un módulo frente a un proyecto

Gran parte del tráfico relacionado con un "servidor privado de IA" busca en realidad una recepcionista telefónica, así que conviene tratar ese caso por separado.

En Zanus, el agente telefónico es Front Office AI. La página indica que "responde todas las llamadas de su menú, con las voces que elija, 24/7 en hasta 40 idiomas", con un menú IVR (respuesta de voz interactiva) que usted redacta. Se comercializa como un tenant alojado y el plan superior incluye una opción local. No se publican los modelos de voz que utiliza ni la latencia de sus respuestas.

En la opción alquilada, un agente de voz es un proyecto separado de la pila de chat anterior y más complejo. Necesita cuatro componentes adicionales: un punto de entrada de telefonía (un troncal SIP, donde SIP es el protocolo de inicio de sesión, o una API de telefonía que le entregue el audio), conversión de voz a texto (STT), el LLM y conversión de texto a voz (TTS), todos encadenados para que la persona que llama escuche una respuesta aproximadamente un segundo después de terminar una frase. Cada componente añade latencia, por lo que los modelos deben ser pequeños y la GPU debe estar cerca. Las partes STT y TTS, con los motores que se ejecutan localmente y la velocidad de cada uno, se describen en conversión de voz a texto y de texto a voz autoalojada en un VPS. Espere que el agente telefónico tarde más que toda la pila de chat anterior y que la primera versión interrumpa a las personas que llaman. Si sólo necesita la recepcionista, el módulo del appliance o un producto de voz alojado es el camino más corto, y el servidor de chat es una distracción.

La regla de decisión

Compre el equipo cuando se cumplan las cuatro condiciones: un contrato o un organismo regulador exige que los datos permanezcan en el edificio; nadie del personal administrará Linux; dispone de un circuito de 50 A o puede instalarlo; y los módulos de la página corresponden al trabajo que realmente realiza. El presupuesto es el precio de no tener un ingeniero. Antes de firmar, obtenga por escrito la lista de modelos y el procedimiento para sustituirlos.

Alquile y monte la solución cuando una persona pueda hacerse cargo del servidor, los datos puedan residir en un proveedor de alojamiento que haya evaluado, quiera elegir el modelo por su cuenta y el uso sea lo bastante estable para que una GPU mensual resulte más económica que el coste de los tokens en el punto de equilibrio anterior. Tendrá todos los modelos de pesos abiertos el día de su lanzamiento y una factura que podrá cambiar el mes siguiente. También tendrá que encargarse de todas las integraciones.

Use una API cuando el uso sea intermitente o reducido, los datos no sean confidenciales, nadie quiera administrar la infraestructura y necesite tenerlo funcionando esta semana. Por debajo del volumen de equilibrio, es más barato y siempre permite empezar más rápido. Añada más adelante una capa autoalojada si el coste de los tokens o la política de datos le lleva a hacerlo.

FAQ

¿Qué vende realmente Zanus AI?

A fecha de septiembre de 2026, zanusai.com describe tres capas. Front Office AI gestiona llamadas telefónicas, chat web, presupuestos y reservas. Back Office AI ofrece «más de 15 módulos. Sin programación. Integrado». Private On-Premises AI es el mismo software en hardware de Zanus, con «Zanus OS», dentro de sus instalaciones. Se vende como una solución totalmente propiedad del cliente y compatible con redes aisladas. El precio del hardware se obtiene mediante RFQ. Necesita un circuito de 50 A y consume hasta 6 kW. La empresa tiene su sede en Pompano Beach, Florida.

¿Cuánto cuesta un servidor privado de Zanus AI?

No hay un precio público para el hardware. La página del servidor indica «Price by RFQ». La configuración depende de la memoria de la GPU, la RAM y el número de tokens diarios. Los planes alojados de Front Office muestran precios anuales fijos a fecha de septiembre de 2026, pero se ejecutan en el centro de datos de Zanus y son una suscripción. Por tanto, no indican el precio del equipo. Para comparar, calcule el coste de la opción alquilada con las mismas variables y determine el punto de equilibrio frente al coste de los tokens de API.

¿Puedo crear un servidor privado de IA en una VPS sin GPU?

Sí, para pocos usuarios y modelos pequeños. Una VPS con sólo CPU y entre 16 GB y 32 GB de RAM ejecuta modelos 7B y 8B mediante Ollama a unos pocos tokens por segundo. Esto basta para probar un asistente de documentos. No basta para un equipo que lo use de forma simultánea ni para un agente de voz, donde el tiempo de respuesta es importante. Mida los tokens por segundo en su plan antes de que alguien dependa del servicio.

¿Un LLM autoalojado en una VPS es realmente privado?

Es privado frente al proveedor del modelo y frente a Internet pública, siempre que el firewall bloquee el puerto 11434 y la interfaz de chat esté detrás de TLS. El proveedor de alojamiento es la excepción: su personal puede acceder al disco y su host ejecuta el modelo en memoria. Si un contrato exige que los datos permanezcan en sus instalaciones, una VPS no cumple ese requisito. Su propio hardware, en su oficina o en un rack alquilado, sí lo cumple.

¿La opción de hacerlo uno mismo incluye una recepcionista telefónica?

No de forma predeterminada. Un agente de voz es un proyecto independiente: un punto de entrada de telefonía, conversión de voz a texto, el LLM y conversión de texto a voz, encadenados con suficiente rapidez para que la persona que llama oiga una respuesta en aproximadamente un segundo. Es la parte más difícil de la opción alquilada y aquella en la que el módulo del appliance o un producto de voz alojado ahorra más tiempo.

#zanus#private-ai#self-hosted-llm#ollama#gpu#ai-appliance