Claude zelf hosten? Dit is het eerlijke antwoord
Claude-gewichten zijn niet openbaar, dus u kunt het model niet op uw eigen server draaien. Ontdek wat wel kan: open modellen, een gateway en Claude Code.
Kunt u Claude zelf hosten? Nee, en dit is waarom
U kunt Claude niet zelf hosten. Anthropic publiceert de modelgewichten niet. Er is dus geen bestand om te downloaden, geen container om uit te voeren en geen licentie waarmee u het model op uw eigen hardware kunt aanbieden. Elke Claude-aanvraag gaat naar de API van Anthropic of naar een gehoste partner zoals Amazon Bedrock, Google Vertex AI of Microsoft Foundry. Het uitvoeren van Claude op een machine die u bezit, is geen configuratieprobleem. Het benodigde artefact bestaat eenvoudigweg niet buiten Anthropic.
Dat is het korte antwoord. Het langere antwoord is dat de meeste mensen die deze vraag stellen, de gewichten niet echt willen. Ze willen een van drie dingen die allemaal haalbaar zijn op een server die u beheert: een capabel model dat lokaal draait, een gateway die hun API-sleutels beheert en hun uitgaven beperkt, of een coding agent die op hun eigen systeem draait in plaats van op hun laptop. Deze handleiding behandelt alle drie, inclusief de opdrachten.
Wat "self-hosted Claude" meestal betekent
Zoekopdrachten naar "self-hosted Claude" verwijzen meestal naar enkele verschillende wensen. Daarvoor zijn verschillende oplossingen nodig.
Sommige mensen willen privacy. Zij willen niet dat prompts hun netwerk verlaten. Alleen een lokaal model met open gewichten lost dat op, omdat elke Claude-aanvraag per definitie een aanvraag aan Anthropic is.
Sommige mensen willen de kosten beheersen. Zij zijn bang dat een agent zonder limiet credits verbruikt. Een gateway lost dat op en werkt met Claude, zodat u de modelkwaliteit behoudt.
Sommige mensen willen niet afhankelijk zijn van een laptop. Zij willen dat een agent blijft werken terwijl zij de laptop dichtklappen. Een VPS lost dat op en Claude Code werkt daar probleemloos op.
Sommige mensen zoeken naar "self-hosted OpenRouter". Ook dat is een gateway. Het gebruikelijke antwoord is LiteLLM.
Bepaal welke situatie op u van toepassing is, want de juiste implementatie verschilt per geval.
Zelf een open model hosten met Ollama
Als er geen enkele prompt uw server mag verlaten, gebruikt u een open-weightsmodel. De modelreeksen die momenteel daadwerkelijk bruikbaar zijn op een gehuurde server zijn Llama, Qwen, Mistral, Gemma en DeepSeek. Voor al deze modellen zijn gewichten beschikbaar die u kunt downloaden en uitvoeren.
Ollama is de snelste manier om te beginnen. Het installatiescript bestaat uit één regel en configureert een systemd-service op Ubuntu.
curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollamasystemctl status ollama moet active (running) weergeven. Haal vervolgens een model op en gebruik het.
ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."De eerste pull downloadt meerdere gigabytes. Het model moet daarom eerst in het RAM of het GPU-geheugen passen voordat het iets kan beantwoorden. Een globale richtlijn voor gekwantiseerde modellen: een model met 8 miljard parameters heeft ongeveer 6 GB vrije ruimte nodig, een model met 14 miljard parameters ongeveer 10 GB, en een model met 70 miljard parameters heeft meer geheugen nodig dan de meeste algemene VPS-abonnementen bieden. Als de server te weinig geheugen heeft, beëindigt de kernel het proces en ziet u Error: llama runner process has terminated, met een melding over onvoldoende geheugen in dmesg. Controleer free -h voordat u het model de schuld geeft.
Ollama biedt ook een HTTP API op 127.0.0.1:11434. Daardoor is het bruikbaar voor andere software en niet alleen als chattoepassing.
curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'Laat die poort aan localhost gebonden. Een open Ollama-poort op een openbaar IP-adres is een gratis GPU voor iedereen die deze vindt. De volledige configuratie, inclusief de systemd-unit, GPU-detectie en het plaatsen van een reverse proxy ervoor, wordt behandeld in de handleiding voor het uitvoeren van Ollama op een VPS. Als u meer dan één gebruiker tegelijk bedient, lees dan eerst de vergelijking van Ollama en vLLM, omdat het ontwerp van Ollama met één gegevensstroom al een knelpunt wordt voordat de hardware dat wordt.
Wees eerlijk over het verschil. Een goed open model op een middelgrote VPS is daadwerkelijk bruikbaar voor samenvatten, classificeren, opstellen en eenvoudige extractie. Bij lange redeneerstappen, grote codebases en agentisch gebruik van tools komt het niet in de buurt van een gehost model aan de frontier, en geen enkele hoeveelheid promptoptimalisatie dicht dat verschil. Kies het lokale model voor taken waarin het goed is en betaal voor het gehoste model wanneer de moeilijkheid dat vereist.
Voer uw eigen gateway uit met LiteLLM
Dit is de "self-hosted OpenRouter" waarnaar mensen zoeken. Een gateway bevindt zich tussen uw applicaties en elke modelprovider. Uw applicaties gebruiken één sleutel die naar uw server verwijst. De echte providersleutels bevinden zich alleen op die server. U kunt de uitgaven per sleutel beperken, verschillende applicaties naar verschillende modellen routeren en elk verzoek op één plaats loggen.
LiteLLM is een gebruikelijke keuze omdat het een OpenAI-compatibele API aanbiedt en via dezelfde endpoint proxying naar Anthropic, Ollama en de meeste andere providers mogelijk maakt. Voer het uit in Docker met een configuratiebestand.
model_list:
- model_name: claude
litellm_params:
model: anthropic/claude-sonnet-5
api_key: os.environ/ANTHROPIC_API_KEY
- model_name: local
litellm_params:
model: ollama/qwen3:8b
api_base: http://127.0.0.1:11434Sla dit op als litellm_config.yaml en start de proxy. Deze luistert op poort 4000.
docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
-e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
-e LITELLM_MASTER_KEY=sk-1234 \
-p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
--config /app/config.yamlLITELLM_MASTER_KEY is de beheerdersreferentie. Behandel deze daarom als een root-wachtwoord en gebruik niet de voorbeeldwaarde in een productieomgeving. Roep de proxy precies aan zoals u een gehoste API zou aanroepen.
curl http://localhost:4000/v1/chat/completions \
-H 'Authorization: Bearer sk-1234' \
-H 'Content-Type: application/json' \
-d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'Een gezonde respons is normale JSON met een array choices. Een 401 betekent dat de header Authorization niet overeenkomt met uw hoofdsleutel. Een 400 waarin het model wordt genoemd, betekent dat model in uw verzoek niet overeenkomt met een model_name in het configuratiebestand.
De reden om dit te bouwen in plaats van Anthropic rechtstreeks aan te roepen, is de uitgavenlimiet. Maak per applicatie een afzonderlijke virtuele sleutel aan, elk met een eigen budget.
curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'Met die sleutel kan maximaal honderd dollar worden uitgegeven en kan slechts één model worden bereikt. Verder niets. Wanneer een agent zich om drie uur 's nachts misdraagt, blijft de impact beperkt tot één sleutel in plaats van uw volledige account. Dat patroon, samen met de monitoring eromheen, wordt behandeld in agentkosten op een VPS onder controle houden. Als u nog beslist of u überhaupt per token wilt betalen, werkt de vergelijking van API- en abonnementskosten de berekening uit.
Let op wat de gateway niet doet. De gateway maakt Claude niet lokaal en verbergt uw prompts niet voor Anthropic. Verzoeken verlaten uw server nog steeds richting de provider. Wat u krijgt, is controle over sleutels, uitgaven, routering en logs.
Claude Code uitvoeren op uw eigen VPS
De derde wens is het eenvoudigst te vervullen. Claude Code is een client. Deze draait overal waar u Node.js installeert en communiceert via HTTPS met de API. Door de client op een server te plaatsen die u zelf beheert, blijft de agent werken nadat u uw laptop hebt uitgeschakeld. Ook blijft de mogelijke impact beperkt tot een systeem dat u opnieuw kunt opbouwen, in plaats van uw hoofdcomputer.
npm install -g @anthropic-ai/claude-code
claude --versionVoer de client uit binnen tmux, zodat een verbroken SSH-verbinding een lange taak niet beëindigt. Deze configuratie, inclusief sessiebeheer, wordt beschreven in Claude Code uitvoeren op een VPS met tmux. Geef de agent een eigen gebruiker zonder verhoogde rechten. Lees de veiligheidsregels voor het uitvoeren van Claude Code op een server voordat u de agent schrijftoegang geeft tot gegevens die u wilt beschermen.
Hiermee host u de agent zelf, niet het model. Het is belangrijk dit onderscheid duidelijk te maken, omdat deze twee vaak met elkaar worden verward. U beheert het proces, het bestandssysteem, uitgaand netwerkverkeer en de logboeken. Anthropic beheert nog steeds de inferentie.
Wat elke optie u werkelijk kost
Prijzen veranderen, dus beschouw deze bedragen als een indicatie en niet als een offerte. In juli 2026 kost Claude Sonnet 5 $3 per miljoen invoertokens en $15 per miljoen uitvoertokens. Claude Opus 5 kost $5 en $25. Een lokaal model kost niets per token. In plaats daarvan betaalt u de maandelijkse serverkosten, ongeacht of u de server gebruikt.
Het omslagpunt ligt lager dan veel mensen verwachten. Een VPS met voldoende geheugen om een bruikbaar open model uit te voeren, kost elke maand daadwerkelijk geld. Meestal staat die server ongebruikt. Als uw gebruik in pieken verloopt, is de gehoste API meestal goedkoper. Als uw gebruik constant is of uw gegevens uw netwerk niet mogen verlaten, biedt een lokaal model op beide punten voordelen.
De meest realistische oplossing voor de meeste teams is een combinatie. Voer lokaal een open model uit voor werk met een hoog volume en een lage moeilijkheidsgraad. Stuur moeilijke verzoeken door naar een gehost frontier-model. Plaats een gateway voor beide modellen, zodat de toepassingen niet hoeven te weten welk model wordt gebruikt. Zo kunt u de verdeling aanpassen zonder de toepassingscode te wijzigen. Deze architectuur is de praktische versie van "self-hosted Claude". In tegenstelling tot de letterlijke versie bestaat deze wel. Als u ook de volledige agentstack zelf wilt uitvoeren, behandelt het overzicht van self-hosted AI-agents welke opties beschikbaar zijn.
FAQ
Kan ik de modelgewichten van Claude downloaden en lokaal uitvoeren?
Nee. Anthropic heeft voor geen enkel Claude-model gewichten uitgebracht en er is geen licentie die self-hosting toestaat. Alles wat online wordt aangeboden als een downloadbaar "Claude-model" is óf een ander model met een misleidende naam, óf een wrapper die de API aanroept. Als er een API key nodig is, draait het niet lokaal.
Welk open model komt het dichtst bij Claude?
Er is geen exacte overeenkomst en de koplopers veranderen om de paar maanden. De open-weightfamilies die het testen waard zijn, zijn Llama, Qwen, Mistral, Gemma en DeepSeek. Voor samenvattingen, classificatie en eenvoudige codebewerkingen is een goed open model met 8 tot 14 miljard parameters daadwerkelijk bruikbaar. Bij langdurige redeneringen met meerdere stappen en agentisch gebruik van tools is de kloof met een gehost frontiermodel nog steeds groot. Test met uw eigen prompts in plaats van op een leaderboard te vertrouwen.
Is LiteLLM een self-hosted OpenRouter?
Functioneel gezien wel, voor routing en keybeheer. LiteLLM draait op uw server, biedt één OpenAI-compatibel endpoint en fungeert als proxy voor Anthropic, Ollama en de meeste andere providers. U krijgt bestedingslimieten per key, modelrouting en één centrale plaats om logs te lezen. Het biedt geen lokale inference: aanvragen aan Claude gaan nog steeds naar Anthropic.
Blijft mijn code privé als ik Claude Code op mijn eigen server uitvoer?
Nee. Claude Code verzendt de inhoud van de bestanden die het leest naar de Anthropic API, ongeacht waar het proces wordt uitgevoerd. Een VPS biedt isolatie van de agent, maar geen privacy van de inhoud. Geef de agent een speciale gebruiker zonder bevoorrechte rechten, houd deze weg van inloggegevens en niet-gerelateerde repositories en behandel alles wat de agent kan lezen als inhoud die de server verlaat.