SSD Nodes Learn Hosting plans →
가이드 Matt Connor작성자 Matt Connor · 업데이트됨 2026-09-15

Zanus AI 도입 vs 프라이빗 AI 서버 직접 구축 비교

Zanus AI의 노코드 어플라이언스 도입과 직접 GPU 서버를 구축하는 방식의 비용 및 운영 효율을 분석합니다. 엔지니어링 인력 유무와 데이터 보안 요구사항에 따라 어떤 선택이 유리한지 실질적인 기준을 제시합니다.

2026년 9월 기준 Zanus AI의 판매 제품

Zanus AI는 기업용 프라이빗 AI 서버를 판매하며, 이와 관련된 검색의 대부분은 동일한 성능의 프라이빗 AI 서버를 직접 구축할 때 드는 비용에 관한 것입니다. 요약하자면, 이 장비는 코딩이 필요 없는 박스 형태의 제품으로 견적을 통해 가격이 결정되며, 인터넷 연결 없이도 완전히 독립적으로 운영할 수 있습니다. 직접 구축하는 방식은 렌트한 GPU(graphics processing unit) 서버에서 오픈 웨이트 LLM(large language models)을 구동하고, 그 뒤에 추론 서버, 채팅 인터페이스, 벡터 저장소, 에이전트 프레임워크를 구성하는 방식이며, 이를 운영할 수 있는 Linux 숙련자가 한 명 필요합니다. 어떤 경로를 선택할지는 엔지니어링을 누가 담당할지, 데이터 저장 위치에 대한 규정, 6 kW 전력을 공급할 수 있는지, 그리고 하루에 실제로 사용하는 토큰 수가 얼마인지에 따라 결정됩니다.

Zanus에 관한 이 내용은 2026년 9월 기준 zanusai.com의 정보를 바탕으로 합니다. 해당 기업은 스스로를 "플로리다주 폼파노 비치에 본사를 둔, 첨단 AI 솔루션 및 엔지니어링 전문 미국 비상장 C-Corp"라고 설명하며, 자사 페이지에서 이를 포트로더데일 광역권으로 분류합니다. 또한 하드웨어와 소프트웨어는 "미국에서 설계 및 조립"된다고 명시합니다.

제품은 세 가지 계층으로 구성됩니다. Front Office AI는 "고객이 대화하는 AI 인력"으로, 전화, 웹 채팅, 견적 및 예약 기능을 제공합니다. Back Office AI는 "회사가 운영되는 AI 운영 체제"이며 "15개 이상의 모듈이 코딩 없이 내장"되어 있다고 설명합니다. 페이지에 명시된 모듈로는 벡터 저장소, AI 채팅, 고객 관리, 공급업체 관리, 캘린더, 작업 관리, 자동화, 웹 챗봇, API(application programming interface)가 있습니다. "개발자가 필요한가요?"라는 질문에 페이지는 "아니요"라고 답합니다. 세 번째 계층인 Private On-Premises AI는 동일한 시스템을 귀사의 건물 내 Zanus 하드웨어에서 구동하는 방식입니다. 이 시스템은 "Zanus OS"를 실행하며 "하드웨어와 영구 소프트웨어 라이선스를 완전히 소유"하는 형태로 판매됩니다. 또한 "에어갭(air-gap) 환경을 지원"하여 인터넷 연결 없이 USB를 통해 업데이트를 수행할 수 있습니다.

모델과 관련하여 서버 페이지는 이 박스가 "구성 시 고객과 함께 선택하고 크기를 조정한 주요 오픈 웨이트 모델군"을 실행하며, "언제든지 모델을 교체하거나 추가할 수 있고, 새로운 웨이트는 다운로드하여 적용"할 수 있다고 설명합니다. 모델군, GPU, RAM 또는 "RAID 10 NVMe" 외의 저장 용량에 대해서는 구체적으로 명시하지 않습니다. 전력의 경우 "115/220V에서 표준 50A 회로"가 필요하며 최대 부하 시 "최대 6 kW"를 소비합니다. 페이지에서는 이 장비가 소음이 없고 사무실 환경에 적합하여 별도의 서버실이 필요 없다고 설명합니다. 가격의 경우, 박스는 "RFQ(견적 요청)" 방식이며 "GPU 메모리(모델), RAM/컨텍스트, 일일 토큰 사용량에 따라 크기가 결정"됩니다. 하드웨어에 대한 공개된 가격은 없습니다. 호스팅되는 Front Office 플랜은 2026년 9월 기준 연간 4,900달러에서 49,900달러 사이의 고정 가격을 명시하고 있으나, 이는 장비가 아닌 Zanus 데이터 센터의 클라우드 테넌트 비용입니다. 배송은 구성 완료까지 약 3주가 소요되는 것으로 안내됩니다.

위 내용은 공개된 사양입니다. 아래의 내용은 이에 추가되거나 추측된 정보가 없습니다.

직접 구축하는 동일한 사설 AI 서버의 모습

이 어플라이언스는 직접 임대하고 조립할 수 있는 네 가지 요소로 구성됩니다. GPU, 오픈 웨이트 모델을 로드하는 추론 서버, 사용자를 위한 채팅 인터페이스, 그리고 문서를 답변으로 변환하는 자동화 계층을 갖춘 벡터 저장소입니다. Linux 환경 구성은 반나절이면 충분합니다. 비즈니스 모듈을 구축하는 데는 몇 주가 소요되며, 이 차이가 두 경로 사이의 실질적인 간극입니다.

먼저 장비를 선택하십시오. 16GB에서 32GB RAM을 갖춘 CPU 전용 VPS(가상 사설 서버)는 한두 명의 사용자가 7B 및 8B 모델을 동시에 실행하기에 적합하며, 누군가 의존하기 전에 초당 토큰 수로 측정해야 하는 속도를 제공합니다. 24GB VRAM(그래픽 카드 메모리)을 갖춘 임대 GPU는 소규모 팀이 8B 모델을 충분히 빠르게 실행할 수 있게 하며, 4비트 양자화 시 약 30B 크기의 모델까지 수용합니다. 48GB에서 80GB는 70B급 모델을 위한 사양입니다. 어떤 모델이 어떤 카드에 적합한지는 각 메모리 크기별로 직접 호스팅 가능한 AI 모델에서 확인할 수 있습니다.

추론 서버를 설치하십시오. Ollama의 Linux 설치는 한 줄의 명령어로 가능하며, 전체 과정은 LLM을 직접 호스팅하기 위해 VPS에서 Ollama 실행하기에 설명되어 있습니다.

curl -fsSL https://ollama.com/install.sh | sh
sudo systemctl status ollama
ollama -v

systemctl status ollamaactive (running)으로 읽어야 합니다. GPU가 없는 장비에서 설치 프로그램은 WARNING: No NVIDIA/AMD GPU detected. Ollama will run in CPU-only mode.을 출력하고 계속 진행하는데, 이는 테스트용으로는 괜찮지만 사용자에게는 느리게 느껴질 것입니다.

모델을 가져와 API와 통신하십시오. 서비스는 루프백 주소의 11434 포트에서만 대기합니다.

ollama pull qwen3:8b
curl http://127.0.0.1:11434/api/generate \
  -d '{"model":"qwen3:8b","prompt":"Reply with one word: ready","stream":false}'

정상적인 응답은 response 필드와 "done":true을 포함하는 JSON 객체입니다. 두 개의 수치가 포함된 {"error":"model requires more system memory (6.4 GiB) than is available (3.8 GiB)"}라는 응답은 가중치가 RAM에 맞지 않는다는 의미이므로, 더 작은 모델이나 더 낮은 양자화 버전을 선택하십시오.

채팅 인터페이스를 추가하십시오. Open WebUI가 일반적인 선택이며, Ollama가 동일한 호스트에서 실행되는 경우 README에서 한 줄의 명령어를 제공합니다.

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

서버 주소의 3000 포트로 접속하여 첫 번째 계정을 생성(관리자 계정이 됩니다)하고 모델 목록을 여십시오. 목록이 비어 있다면 원인은 위에서 언급한 루프백 바인딩 때문입니다. 컨테이너 내부에서 host.docker.internal는 호스트의 Docker 브리지 주소로 해석되는데, Ollama는 127.0.0.1에서만 대기하고 있으므로 연결이 거부됩니다. docker logs open-webuiCannot connect to host host.docker.internal:11434을 보여줍니다. systemd 오버라이드를 사용하여 이를 수정하십시오.

sudo systemctl edit ollama
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
sudo systemctl daemon-reload
sudo systemctl restart ollama

0.0.0.0는 공용 인터페이스를 포함한 모든 인터페이스를 의미합니다. 이 시점부터 방화벽이 11434 포트를 차단하지 않는 한 인터넷에서 API에 접근할 수 있습니다. API 자체에는 비밀번호가 없으므로, 회사 문서를 로드하기 전에 Ollama API 엔드포인트를 보호하십시오. Open WebUI가 너무 무겁게 느껴진다면 동일한 포트와 통신하는 더 가벼운 Open WebUI 대안을 사용할 수 있습니다.

벡터 저장소를 추가하십시오. Qdrant는 하나의 컨테이너로 실행됩니다. 서버 내부의 애플리케이션만 접근할 수 있도록 루프백에 바인딩하십시오.

docker run -d --name qdrant --restart always \
  -p 127.0.0.1:6333:6333 -p 127.0.0.1:6334:6334 \
  -v qdrant_storage:/qdrant/storage \
  qdrant/qdrant
curl http://127.0.0.1:6333/collections

설치가 완료된 후 확인을 수행하면 {"result":{"collections":[]},"status":"ok"}과 타이밍 필드가 반환됩니다. Open WebUI에는 소규모 라이브러리에 충분한 내장 문서 저장소가 있으며, Qdrant는 에이전트 프레임워크가 임베딩을 직접 쿼리해야 할 때 사용합니다.

한 번에 여러 명의 사용자가 사용할 예정이라면 Ollama를 vLLM으로 교체하십시오. vLLM은 GPU에서 사용자 간 요청을 배치 처리합니다. 공식 이미지는 전체 설치를 포함합니다.

docker run -d --runtime nvidia --gpus all \
  -v ~/.cache/huggingface:/root/.cache/huggingface \
  -p 127.0.0.1:8000:8000 --ipc=host \
  vllm/vllm-openai:latest --model Qwen/Qwen3-8B

Docker가 GPU 기능을 사용할 수 없다는 의미의 could not select device driver을 반환한다면, NVIDIA Container Toolkit이 설치되지 않은 것입니다. 따라서 Docker는 컨테이너에 카드를 전달할 방법이 없습니다. 툴킷을 설치하고 Docker를 재시작한 뒤 명령어를 다시 실행하십시오. 각 서버를 언제 선택해야 하는지는 Ollama 대 vLLM에서 다룹니다.

마지막 계층은 어플라이언스에서 모듈이라고 부르는 부분입니다. 직접 임대하는 방식에서는 벡터 저장소에서 읽고, 모델을 호출하며, 다른 시스템에 대해 작업을 수행하고, 수행한 내용을 기록하는 에이전트 프레임워크가 이 역할을 합니다. 후보군과 각 장점은 최고의 직접 호스팅 AI 에이전트에서 비교하며, 에이전트가 세션 간에 사용자를 기억해야 한다면 직접 호스팅하는 Mem0 메모리 서버를 통해 기능을 구현할 수 있습니다. 이 모든 것은 직접 구성하기 전까지는 존재하지 않으며, 바로 그 부분이 여러분이 어플라이언스에 대해 비용을 지불하는 이유입니다.

비용: 견적과 월별 청구서 비교

여기에 기입할 Zanus 번호는 없으며, 임의로 생성하는 것은 무의미할 뿐만 아니라 오히려 해롭습니다. 이 사이트에서 명시하는 견적 산정 방식은 모델을 위한 GPU 메모리, 컨텍스트를 위한 RAM, 그리고 일일 토큰 사용량에 기반합니다. 이는 임대 경로의 가격을 결정하는 변수와 동일하므로, 최소한 비교의 한 축을 정직하게 구성할 수는 있습니다.

임대 측면에서의 비용은 GPU에 대한 고정 월 임대료와 이를 운영하는 인력의 시간에 따라 결정됩니다. 임대료는 카드가 유휴 상태인지 최대 부하 상태인지와 관계없이 변하지 않습니다. 따라서 토큰당 과금되는 API와의 비교는 손익분기점 문제로 귀결됩니다. 월 임대료를 대체제로 고려 중인 API의 백만 토큰당 혼합 가격으로 나누면, GPU를 소유하는 것이 임대보다 저렴해지는 월간 최소 토큰 처리량이 나옵니다. 이 처리량 미만에서는 API를 사용하는 것이 경제적입니다. 유휴 시간과 배치 크기에 관한 함정을 포함한 계산식은 GPU VPS 대 API 토큰: 손익분기점 산출에서 확인할 수 있습니다.

어플라이언스 측면의 비용 구조는 다릅니다. 자본 지출, 영구 소프트웨어 라이선스, 전기 요금, 그리고 견적 시점에 미리 산정된 일일 토큰 처리량이 포함됩니다. 현재의 사용량에 맞춰진 견적은 곧 상한선이기도 합니다. 사용량이 이를 초과하면 다시 견적을 받아야 하지만, 임대형 GPU는 요금제 변경만으로 대응이 가능합니다.

엔지니어링은 누가 담당하는가

이 어플라이언스의 핵심은 아무도 담당할 필요가 없다는 점입니다. "코딩 불필요. 내장형."과 "개발자가 필요한가? 아니오."라는 문구가 이 제품의 존재 이유입니다. 물론 직원이 새로운 도구를 익히고 누군가는 지식 데이터를 업로드하며 전화 메뉴를 작성해야 하므로 비즈니스 프로세스 변경은 여전히 수행해야 합니다. 하지만 그 누구도 systemd unit이 무엇인지 알 필요는 없습니다.

임대 방식(rented path)을 선택하면 위의 모든 명령어를 도움 없이 수행하고 이를 지속적으로 관리할 수 있는 사람이 한 명 필요합니다. 구체적으로 그 담당자는 운영체제 업데이트, Docker 이미지, 방화벽 및 TLS(전송 계층 보안) 인증서, 벡터 저장소와 대화 기록 백업, 모델 업데이트, 그리고 커널 업데이트 후 GPU 드라이버가 손상되었음을 알려주는 모니터링을 전담합니다. 초기 설치에 하루, 그 이후에는 매달 몇 시간을 할애하십시오. 그다음 진짜 업무를 고려해야 합니다. 임대 방식의 그 어떤 솔루션도 고객 테이블, 공급업체 목록, 캘린더, 예약 흐름을 기본으로 제공하지 않습니다. 이 각각은 기존 시스템과 연동하여 직접 작성해야 하는 통합 작업이거나, 설정 후 예기치 않은 동작을 보일 때 방어해야 하는 에이전트 프레임워크입니다. 만약 직원 중 누구도 이 업무를 맡으려 하지 않는다면, "개발자 불필요"라는 답변은 그 어떤 하드웨어 사양보다 더 큰 가치를 지닙니다.

데이터가 저장되는 위치

이 어플라이언스의 가장 강력한 장점은 물리적 특성에 있습니다. "데이터가 외부로 나가지 않음"과 "데이터를 건물 내부에 물리적으로 보관"한다는 설명은 네트워크에서 분리해도 계속 사용할 수 있는 장비를 의미합니다. 데이터가 사내에 보관되어야 한다는 계약을 맺은 병원이나 법률 사무소의 경우, 이 점이 의사결정의 핵심이며 어떤 VPS도 이를 대체할 수 없습니다.

임대 방식에 대해 명확히 설명하자면, VPS는 타인의 데이터 센터에 있는 컴퓨터입니다. 사용자의 프롬프트, 문서, 모델의 답변, 벡터 인덱스는 공급자가 소유한 호스트의 RAM에서 처리되며, 공급자가 물리적으로 접근할 수 있는 디스크에 저장됩니다. VPS에서의 "Private AI"는 모델 공급자와 공용 인터넷으로부터 비공개라는 의미일 뿐 그 이상은 아닙니다. 호스팅 공급자는 여전히 데이터에 접근할 수 있으며, 데이터 위치를 묻는 고객이나 감사인에게는 귀하의 건물 내 특정 방이 아닌 도시 이름만을 알려주게 됩니다. 저장 데이터 암호화는 디스크가 탈취될 경우 이를 보호하지만, 모델이 답변하는 동안 메모리에 있는 데이터까지 보호하지는 못합니다.

중간 단계는 임대한 랙에 직접 하드웨어를 설치하거나, 타인과 공유하지 않는 전용 서버를 사용하는 것입니다. 이 방식은 임대 방식의 모델 자유도와 월 비용을 유지하면서도 물리적 보안 격차를 대부분 해소합니다. 다만, 이 방식은 어플라이언스가 제거했던 번거로움을 다시 가져옵니다. 즉, 누군가는 직접 장비를 구축해야 합니다.

전력 및 공간

6 kW급 장비는 일반 사무용 PC가 아닙니다. 미국 표준 벽면 콘센트는 15 A 또는 20 A 회로를 사용하지만, 이 장비는 전기 레인지나 고속 전기차 충전기에 사용되는 50 A 회로를 요구하므로 설치 시 전기 기술자의 작업이 필요합니다. 제조사 측은 이 장비가 소음이 적고 사무 환경에 적합하며 작업 중에만 최대 전력을 소비한다고 설명합니다. 유휴 상태의 전력 소비량은 공개되지 않았습니다.

전기 요금은 산술적으로 계산할 수 있는 유일한 운영 비용입니다. 6 kW 장비가 최대 부하로 1시간 작동하면 6 kWh를 소비합니다.

ChartElectricity for a 6 kW appliance by daily full-load hours, at 0.15 USD per kWh
The data behind this chart
[
  {
    "label": "1 h/day at full load",
    "kwh_per_month": 180,
    "cost_usd_month": 27
  },
  {
    "label": "4 h/day at full load",
    "kwh_per_month": 720,
    "cost_usd_month": 108
  },
  {
    "label": "8 h/day at full load",
    "kwh_per_month": 1440,
    "cost_usd_month": 216
  },
  {
    "label": "24 h/day at full load",
    "kwh_per_month": "4,320",
    "cost_usd_month": 648
  }
]

하루에 1시간 작동하는 장비의 월간 비용은 kWh당 0.15 USD 기준으로 약 27 USD입니다. 24시간 내내 최대 부하로 작동하는 장비는 4,320 kWh를 소비하며 약 648 USD의 비용이 발생합니다. 제조사가 제시한 최대 부하 시 "시간당 약 1달러"라는 수치는 이 표에서 가정한 요금보다 다소 높은 단가를 의미하므로, 실제 본인의 전기 요금 단가를 적용하십시오. 소비된 모든 에너지는 열로 방출되며, 최대 부하 시 시간당 약 20,000 BTU(영국 열량 단위)의 열이 발생하므로 이를 실내 에어컨으로 제거해야 합니다.

임대 방식을 선택하면 전력 및 냉방 비용이 임대료에 포함되며, 데이터 센터 제공업체가 회로를 관리합니다. 이 경우 전력 사용량을 직접 확인할 수 없다는 단점이 있습니다. GPU 플랜은 하루 1시간을 사용하든 24시간을 사용하든 동일한 비용이 청구됩니다.

모델 선택

이 어플라이언스는 구성 단계에서 사용자와 협의하여 선택한 "주요 오픈 웨이트 제품군" 모델을 탑재하여 출시됩니다. 해당 페이지에는 새로운 웨이트는 다운로드 방식으로 제공된다고 명시되어 있습니다. 어떤 제품군이 포함되는지, Zanus OS 내부에서 교체는 어떻게 이루어지는지, 공급업체 목록에 없는 모델을 로드할 수 있는지, 그리고 교체 작업은 누가 수행하는지에 대한 공개된 문서가 없으므로 계약 전에 반드시 문의하십시오.

임대 방식의 경우, 공개된 웨이트가 있고 이를 수용할 충분한 메모리가 있다면 어떤 모델이든 실행할 수 있습니다. 새로운 오픈 웨이트 릴리스는 출시 당일 vLLM에 전달되는 ollama pull 또는 Hugging Face 저장소 이름으로 처리됩니다. 특정 양자화 모델이나 직접 미세 조정(fine-tune)한 모델을 사용하려면 GGUF 파일을 Ollama로 직접 가져오기를 수행하면 됩니다. 이 방식에는 주의할 점도 있습니다. 모델 평가 역시 사용자의 책임이라는 것입니다. 사용자의 문서 분량이나 일일 토큰 처리량에 맞춰 모델 크기를 산정해 주는 주체가 없으므로, 첫 달은 어떤 모델이 적절한 속도와 성능을 내는지, 그리고 어떤 수준의 양자화를 메모리 용량 내에서 감당할 수 있는지 파악하는 데 시간을 할애해야 합니다.

개인용 AI 응답 서비스: 프로젝트에 대응하는 모듈

"개인용 AI 서버"로 유입되는 트래픽 중 상당수는 사실 전화 응대 서비스를 찾고 있으므로, 이 경우는 별도로 다루어야 합니다.

Zanus 측의 전화 에이전트는 Front Office AI입니다. 해당 페이지에 따르면 이 서비스는 "사용자가 선택한 음성으로, 최대 40개 언어를 사용하여 24시간 내내 메뉴의 모든 전화를 응답"하며, 사용자가 직접 작성하는 IVR(대화형 음성 응답) 메뉴를 제공합니다. 이 서비스는 호스팅된 테넌트 형태로 판매되며, 최상위 플랜에서는 온프레미스 경로를 지원합니다. 어떤 음성 모델을 사용하는지, 응답 지연 시간은 어느 정도인지는 공개되어 있지 않습니다.

임대 경로에서 음성 에이전트는 앞서 언급한 채팅 스택과는 별개의 프로젝트이며, 구현 난이도가 더 높습니다. 여기에는 네 가지 추가 요소가 필요합니다. 전화 통신 진입점(SIP 트렁크, 여기서 SIP는 세션 개시 프로토콜을 의미함, 또는 오디오를 전달하는 전화 통신 API), 음성 인식(STT), LLM, 그리고 음성 합성(TTS)이 필요합니다. 이 모든 요소는 발신자가 문장을 마친 후 약 1초 이내에 응답을 들을 수 있도록 연결되어야 합니다. 모든 연결 단계마다 지연 시간이 추가되므로 모델은 작아야 하며 GPU는 물리적으로 가까운 곳에 있어야 합니다. 로컬에서 실행되는 엔진과 각 엔진의 속도를 포함한 STT 및 TTS 관련 내용은 VPS에서 자체 호스팅하는 음성 인식 및 음성 합성에서 확인할 수 있습니다. 전화 에이전트는 앞서 언급한 전체 채팅 스택보다 더 많은 시간이 소요될 것으로 예상해야 하며, 첫 번째 버전에서는 발신자의 말을 끊는 현상이 발생할 수 있음을 염두에 두어야 합니다. 만약 응대 서비스만 필요한 경우라면, 어플라이언스 모듈이나 호스팅된 음성 제품을 사용하는 것이 더 빠른 길이며, 채팅 서버 구축은 오히려 불필요한 작업이 될 수 있습니다.

의사결정 규칙

다음 네 가지 조건이 모두 충족될 때 장비를 구매합니다: 계약이나 규제 기관이 데이터의 사내 보관을 요구하는 경우, 운영 인력 중 Linux를 다룰 사람이 없는 경우, 50 A 회로를 이미 갖추었거나 설치할 예정인 경우, 그리고 해당 페이지의 모듈이 실제 수행하는 작업과 일치하는 경우입니다. 견적가는 엔지니어를 고용하지 않는 대가입니다. 계약서에 서명하기 전에 모델 목록과 교체 절차를 서면으로 확보하십시오.

한 사람이 서버를 전담할 수 있고, 검증된 호스팅 제공업체에 데이터를 저장해도 되며, 직접 모델을 선택하고 싶고, 월간 GPU 비용이 위에서 언급한 손익분기점의 토큰 비용보다 저렴할 정도로 사용량이 일정하다면 대여 후 구축하는 방식을 택하십시오. 이 경우 오픈 웨이트 모델이 출시되는 당일에 바로 사용할 수 있으며, 다음 달에 비용을 조정할 수 있는 청구서를 받게 됩니다. 단, 모든 통합 작업은 직접 수행해야 합니다.

사용량이 불규칙하거나 적고, 데이터가 민감하지 않으며, 아무도 직접 운영하고 싶어 하지 않고, 이번 주 내로 작동해야 한다면 API를 사용하십시오. 손익분기점 미만의 사용량에서는 API가 더 저렴하며, 시작 속도 또한 항상 빠릅니다. 토큰 비용이나 데이터 정책으로 인해 필요성이 생기면 나중에 자체 호스팅 계층을 추가하십시오.

FAQ

Zanus AI는 실제로 무엇을 판매합니까?

2026년 9월 기준으로 zanusai.com은 세 가지 계층을 설명합니다. Front Office AI는 전화, 웹 채팅, 견적 및 예약을 처리합니다. Back Office AI는 "15개 이상의 모듈. 코딩 불필요. 내장형."입니다. Private On-Premises AI는 귀하의 건물 내에서 "Zanus OS"를 실행하는 Zanus 하드웨어상의 동일한 소프트웨어이며, 완전 소유 및 에어갭(air-gap) 환경이 가능하도록 판매됩니다. 하드웨어 가격은 RFQ(견적 요청)를 통해 책정됩니다. 이 하드웨어는 50 A 회로가 필요하며 최대 6 kW의 전력을 소비합니다. 본사는 플로리다주 폼파노 비치에 있습니다.

Zanus AI 프라이빗 서버의 가격은 얼마입니까?

하드웨어에 대한 공개 가격은 없습니다. 서버 페이지에는 GPU 메모리, RAM, 그리고 일일 토큰 사용량을 기준으로 "RFQ를 통한 가격 책정"이라고 명시되어 있습니다. 호스팅되는 Front Office 플랜은 2026년 9월 기준으로 연간 정액 가격을 나열하고 있지만, 이는 Zanus 데이터 센터에서 실행되는 구독 서비스이므로 장비 가격을 책정하지 않습니다. 비교를 위해 동일한 변수를 사용하여 임대 경로의 가격을 책정하고 API 토큰 대비 손익분기점을 계산하십시오.

GPU가 없는 VPS에서 프라이빗 AI 서버를 구축할 수 있습니까?

네, 소수의 사용자와 작은 모델의 경우 가능합니다. 16 GB에서 32 GB의 RAM을 갖춘 CPU 전용 VPS는 Ollama를 통해 7B 및 8B 모델을 초당 몇 토큰의 속도로 실행할 수 있으며, 이는 문서 보조 도구를 테스트하기에 충분합니다. 하지만 여러 팀원이 동시에 사용하거나 응답 시간이 중요한 음성 에이전트용으로는 충분하지 않습니다. 누군가 이 서비스에 의존하기 전에 플랜의 초당 토큰 처리량을 측정하십시오.

VPS에서 직접 호스팅하는 LLM은 정말로 비공개입니까?

방화벽이 11434 포트를 차단하고 채팅 인터페이스가 TLS 뒤에 있다면 모델 공급업체와 공용 인터넷으로부터 비공개 상태가 유지됩니다. 단, 호스팅 제공업체는 예외입니다. 제공업체 직원은 디스크에 접근할 수 있으며, 호스트는 메모리에서 모델을 실행합니다. 데이터가 반드시 귀하의 건물 내에 있어야 한다는 계약 조건이 있다면 VPS는 이를 충족하지 못합니다. 귀하의 사무실이나 임대 랙에 있는 자체 하드웨어만이 이를 충족합니다.

직접 구축(DIY) 경로에 전화 응대 기능이 포함되어 있습니까?

기본적으로는 포함되어 있지 않습니다. 음성 에이전트는 별도의 프로젝트입니다. 전화 통신 진입점, 음성-텍스트 변환(STT), LLM, 텍스트-음성 변환(TTS)을 호출자가 약 1초 내에 응답을 들을 수 있을 만큼 긴밀하게 연결해야 합니다. 이는 임대 경로에서 가장 어려운 부분이며, 어플라이언스의 모듈이나 호스팅된 음성 제품이 가장 많은 시간을 절약해 주는 영역입니다.

#zanus#private-ai#self-hosted-llm#ollama#gpu#ai-appliance