SSD Nodes Learn 8GB de RAM — $66/an
Guides Matt ConnorPar Matt Connor · Mis à jour le 2026-08-02

Pouvez-vous héberger Claude vous-même ? La vraie réponse

Les poids de Claude ne sont pas publics : aucun serveur à vous ne peut l’exécuter. Découvrez les modèles open source, une gateway et Claude Code à self-hoster.

Pouvez-vous héberger Claude vous-même ? Non, et voici pourquoi

Vous ne pouvez pas héberger Claude vous-même. Anthropic ne publie pas les poids du modèle. Il n’existe donc aucun fichier à télécharger, aucun conteneur à exécuter et aucune licence vous autorisant à le servir depuis votre propre matériel. Chaque requête Claude est envoyée à l’API d’Anthropic ou à un partenaire hébergé tel qu’Amazon Bedrock, Google Vertex AI ou Microsoft Foundry. L’exécuter sur une machine qui vous appartient n’est pas un problème de configuration. L’artefact n’existe tout simplement pas en dehors d’Anthropic.

C’est la réponse courte. La réponse plus complète est que la plupart des personnes qui posent cette question ne veulent pas réellement les poids. Elles veulent l’une des trois choses suivantes, toutes réalisables sur un serveur que vous contrôlez : exécuter localement un modèle capable, utiliser une passerelle qui conserve leurs clés d’API et limite leurs dépenses, ou disposer d’un agent de programmation sur leur propre machine plutôt que sur leur ordinateur portable. Ce guide couvre ces trois possibilités, avec les commandes.

Ce que signifie généralement « self-hosted Claude »

Les recherches sur « self-hosted Claude » correspondent généralement à plusieurs besoins différents. Ils nécessitent des réponses différentes.

Certaines personnes recherchent la confidentialité. Elles ne veulent pas que leurs prompts quittent leur réseau. Seul un modèle local open weight répond à ce besoin, car toute requête Claude est par définition envoyée à Anthropic.

D’autres recherchent la maîtrise des coûts. Elles craignent qu’un agent incontrôlé épuise leurs crédits. Un gateway répond à ce besoin et fonctionne avec Claude. Vous conservez donc la qualité du modèle.

D’autres encore veulent ne plus dépendre d’un laptop. Elles veulent un agent qui continue à fonctionner lorsqu’elles ferment le capot. Un VPS répond à ce besoin, et Claude Code y fonctionne sans problème.

Certaines personnes recherchent l’équivalent de « self-hosted OpenRouter ». Il s’agit également d’un gateway. La solution habituelle est LiteLLM.

Déterminez lequel de ces besoins correspond au vôtre, car l’architecture appropriée diffère dans chaque cas.

Héberger vous-même un modèle open source avec Ollama

Si vous devez empêcher toute sortie de prompt de votre serveur, exécutez un modèle à poids ouverts. Les familles réellement utilisables aujourd’hui sur un serveur loué sont Llama, Qwen, Mistral, Gemma et DeepSeek. Elles publient toutes des poids que vous pouvez télécharger et exécuter.

Ollama est le moyen le plus rapide de commencer. Le script d’installation tient sur une ligne et configure un service systemd sur Ubuntu.

curl -fsSL https://ollama.com/install.sh | sh
systemctl status ollama

systemctl status ollama doit afficher active (running). Téléchargez ensuite un modèle et utilisez-le.

ollama pull qwen3:8b
ollama run qwen3:8b "Summarise what a reverse proxy does in two sentences."

Le premier pull télécharge plusieurs gigaoctets. Le modèle doit donc tenir dans la RAM ou dans la mémoire du GPU avant de pouvoir répondre. Pour les modèles quantifiés, retenez cette règle approximative : un modèle de 8 milliards de paramètres nécessite environ 6 GB de mémoire libre, un modèle de 14 milliards de paramètres environ 10 GB, et un modèle de 70 milliards de paramètres nécessite plus de mémoire que la plupart des offres VPS généralistes n’en fournissent. Si la machine manque de mémoire, le processus est tué par le kernel et vous voyez Error: llama runner process has terminated, avec une ligne indiquant un manque de mémoire dans dmesg. Vérifiez free -h avant d’accuser le modèle.

Ollama fournit également une API HTTP sur 127.0.0.1:11434. Elle permet à d’autres logiciels de l’utiliser, au lieu de le limiter à un simple outil de chat.

curl http://127.0.0.1:11434/api/generate -d '{"model":"qwen3:8b","prompt":"ping","stream":false}'

Laissez ce port lié à localhost. Un port Ollama ouvert sur une IP publique fournit gratuitement un GPU à quiconque le découvre. La configuration complète, notamment l’unité systemd, la détection du GPU et le placement d’un reverse proxy devant Ollama, est décrite dans le guide pour exécuter Ollama sur un VPS. Si vous servez plusieurs utilisateurs simultanément, lisez d’abord la comparaison entre Ollama et vLLM, car l’architecture à flux unique d’Ollama devient le goulot d’étranglement bien avant le matériel.

Soyez honnête sur les limites. Un bon modèle open source sur un VPS de taille moyenne est réellement utile pour résumer, classifier, rédiger et effectuer des extractions simples. Pour le raisonnement long en plusieurs étapes, les grandes bases de code et l’utilisation d’outils par des agents, il est loin d’atteindre un modèle hébergé de pointe. Aucun réglage de prompt ne comble cet écart. Choisissez le modèle local pour les tâches auxquelles il convient et payez un modèle hébergé lorsque la difficulté est réelle.

Exécuter votre propre gateway avec LiteLLM

C’est le « OpenRouter auto-hébergé » que les utilisateurs recherchent. Une gateway se place entre vos applications et chaque fournisseur de modèles. Vos applications utilisent une seule clé, configurée vers votre serveur. Les véritables clés des fournisseurs restent uniquement sur ce serveur. Vous pouvez plafonner les dépenses par clé, diriger différentes applications vers différents modèles et journaliser chaque requête au même endroit.

LiteLLM est un choix courant, car il fournit une API compatible avec OpenAI et sert de proxy vers Anthropic, Ollama et la plupart des autres fournisseurs via le même endpoint. Exécutez-le dans Docker avec un fichier de configuration.

model_list:
  - model_name: claude
    litellm_params:
      model: anthropic/claude-sonnet-5
      api_key: os.environ/ANTHROPIC_API_KEY
  - model_name: local
    litellm_params:
      model: ollama/qwen3:8b
      api_base: http://127.0.0.1:11434

Enregistrez cela sous litellm_config.yaml, puis démarrez le proxy. Il écoute sur le port 4000.

docker run -v $(pwd)/litellm_config.yaml:/app/config.yaml \
  -e ANTHROPIC_API_KEY=$ANTHROPIC_API_KEY \
  -e LITELLM_MASTER_KEY=sk-1234 \
  -p 4000:4000 docker.litellm.ai/berriai/litellm:latest \
  --config /app/config.yaml

LITELLM_MASTER_KEY est l’identifiant d’administration. Traitez-le comme un mot de passe root et ne déployez pas la valeur d’exemple. Appelez le proxy exactement comme vous appelleriez une API hébergée.

curl http://localhost:4000/v1/chat/completions \
  -H 'Authorization: Bearer sk-1234' \
  -H 'Content-Type: application/json' \
  -d '{"model": "claude","messages": [{"role": "user","content": "Say hello in five words."}]}'

Une réponse saine est un JSON normal contenant un tableau choices. Un 401 signifie que l’en-tête Authorization ne correspond pas à votre clé principale. Un 400 qui nomme le modèle signifie que le model de votre requête ne correspond à aucun model_name du fichier de configuration.

L’intérêt de construire cette solution plutôt que d’appeler directement Anthropic est le plafonnement des dépenses. Créez une clé virtuelle distincte pour chaque application, avec son propre budget.

curl 'http://0.0.0.0:4000/key/generate' \
--header 'Authorization: Bearer sk-1234' \
--header 'Content-Type: application/json' \
--data-raw '{"models": ["claude"], "max_budget": 100}'

Cette clé peut dépenser cent dollars et accéder à un seul modèle, et à rien d’autre. Lorsqu’un agent se comporte mal à trois heures du matin, l’impact est limité à une clé au lieu de concerner tout votre compte. Ce modèle, ainsi que la surveillance associée, est présenté dans contrôler les coûts des agents sur un VPS. Si vous déterminez encore s’il est pertinent de payer à l’usage, la comparaison des coûts entre API et abonnement détaille les calculs.

Notez ce que la gateway ne fait pas. Elle ne rend pas Claude local et ne masque pas vos prompts à Anthropic. Les requêtes quittent toujours votre serveur pour atteindre le fournisseur. Vous gagnez en revanche le contrôle des clés, des dépenses, du routage et des logs.

Exécuter Claude Code sur votre propre VPS

Le troisième souhait est le plus facile à exaucer. Claude Code est un client. Il s’exécute partout où vous installez Node.js et communique avec l’API via HTTPS. L’installer sur un serveur que vous possédez permet à l’agent de continuer à fonctionner après l’extinction de votre ordinateur portable. Son rayon d’impact se limite ainsi à une machine que vous pouvez reconstruire, plutôt qu’à votre machine principale.

npm install -g @anthropic-ai/claude-code
claude --version

Exécutez-le dans tmux afin qu’une déconnexion SSH n’interrompe pas une tâche longue. Cette configuration, notamment la gestion des sessions, est présentée dans exécuter Claude Code sur un VPS avec tmux. Attribuez à l’agent son propre utilisateur non privilégié. Lisez également les règles de sécurité pour exécuter Claude Code sur un serveur avant de lui accorder un accès en écriture à des éléments importants.

Vous hébergez vous-même l’agent, pas le modèle. Il est important de le préciser, car ces deux notions sont souvent confondues. Vous contrôlez le processus, le système de fichiers, les connexions réseau sortantes et les logs. Anthropic contrôle toujours l’inférence.

Ce que chaque option vous coûte réellement

Les prix évoluent. Considérez donc ces montants comme des ordres de grandeur, et non comme un devis. En juillet 2026, Claude Sonnet 5 est facturé $3 par million de tokens d’entrée et $15 par million de tokens de sortie. Claude Opus 5 est facturé $5 et $25. Un modèle local ne coûte rien par token. Il vous coûte à la place le prix mensuel du serveur, qu’il soit utilisé ou non.

Le seuil de rentabilité est plus bas que prévu. Un VPS disposant de suffisamment de mémoire pour exécuter un modèle open source utile coûte réellement de l’argent chaque mois, et reste la plupart du temps inactif. Si votre utilisation est irrégulière, l’API hébergée est généralement moins chère. Si votre utilisation est constante, ou si vos données ne peuvent pas quitter votre réseau, le modèle local est avantageux sur les deux plans.

La réponse mixte est celle que retiennent la plupart des équipes. Exécutez un modèle open source en local pour les tâches à fort volume et faible difficulté. Acheminez les requêtes complexes vers un modèle frontier hébergé. Placez une gateway devant les deux modèles afin que les applications n’aient pas besoin de savoir lequel elles utilisent, et afin de pouvoir modifier la répartition sans toucher au code applicatif. Cette architecture est la version pratique de « Claude auto-hébergé ». Contrairement à la version littérale, elle existe. Si vous souhaitez également exécuter vous-même toute la stack d’agents, le récapitulatif des agents IA auto-hébergés présente les solutions disponibles.

FAQ

Puis-je télécharger les poids du modèle Claude et l’exécuter localement ?

Non. Anthropic n’a jamais publié les poids d’un modèle Claude et aucune licence n’autorise l’auto-hébergement. Tout ce qui est présenté en ligne comme un « modèle Claude » téléchargeable est soit un autre modèle au nom trompeur, soit un wrapper qui appelle l’API. S’il nécessite une clé d’API, il ne s’exécute pas localement.

Quel est le modèle open source le plus proche de Claude ?

Il n’existe pas de correspondance exacte et les modèles en tête changent tous les quelques mois. Les familles de modèles à poids ouverts qui méritent d’être testées sont Llama, Qwen, Mistral, Gemma et DeepSeek. Pour la synthèse, la classification et les modifications de code simples, un bon modèle open source de 8 à 14 milliards de paramètres est réellement utile. Pour le raisonnement en plusieurs étapes sur de longs contenus et l’utilisation d’outils par des agents, l’écart avec un modèle frontier hébergé reste important. Testez vos propres prompts au lieu de vous fier à un leaderboard.

LiteLLM est-il un OpenRouter auto-hébergé ?

Fonctionnellement, oui, pour le routage et la gestion des clés. LiteLLM s’exécute sur votre serveur, expose un endpoint compatible avec l’API OpenAI et sert de proxy vers Anthropic, Ollama et la plupart des autres fournisseurs. Vous bénéficiez de plafonds de dépenses par clé, du routage des modèles et d’un emplacement unique pour consulter les logs. En revanche, il ne fournit pas d’inférence locale : les requêtes vers Claude transitent toujours par Anthropic.

L’exécution de Claude Code sur mon propre serveur protège-t-elle la confidentialité de mon code ?

Non. Claude Code envoie le contenu des fichiers qu’il lit à l’API Anthropic, quel que soit l’endroit où le processus s’exécute. Un VPS vous fournit l’isolation de l’agent, mais pas la confidentialité du contenu. Exécutez-le avec un utilisateur dédié sans privilèges, empêchez-le d’accéder aux identifiants et aux dépôts sans rapport, et considérez tout ce qu’il peut lire comme du contenu qui quitte le serveur.