Claudeの代わりにオープンモデルを使う方法
Claudeの料金はProが月額$20、Maxが月額$100からです。コーディングや長文、文章作成をVPSで自分で実行する場合に、どのオープンウェイトモデルが現実的かを比較します。
短い答え
Claude のプランの代わりにオープンモデルを実行する方法は、業務によって有効な場合と失敗する場合があります。この違いは予測できます。オープンウェイトモデルとは、重みを自分でダウンロードして実行できるモデルです。現在のモデルは、長い文書の読み取りや自分の言語での文章作成を十分にこなせるため、多くの人はその作業への支払いをやめています。監督下でコーディングループも実行できます。ただし、最も難しい推論には対応できません。また、無料でもありません。月額課金の GPU (graphics processing unit) サーバーは、置き換えるサブスクリプションより高くなることが多いためです。可能ならプランを購入してください。このページでは、プランを利用できない場合、または価格に見合わないと判断した場合に、自分で管理するハードウェア上で何を実行できるかを説明します。
料金と、何を置き換えることになるか
2026年8月時点で、Claude Proは月額$20です。1年分を前払いすると月額$17になります。Maxは月額$100から始まり、Proより上位の利用レベルを2つ提供します。Teamは1席あたり月額$25、年払いでは1席あたり月額$20です。より厳しい制限付きの無料プランもあります。料金は以上です。料金設定の理由は、それぞれのページで確認してください。必要なプランでは価格ではなく利用量で各プランを比較し、Proのページでは実際にどの制限が問題になるかを説明しています。作業がコーディングであれば、各プランでClaude Codeにかかる料金を読むべきです。
月額サブスクリプションが合わない場合は、ハードウェアを検討する前に月額ではなくトークン単位で支払う方法を確認してください。API(application programming interface)には月額の最低料金がないため、週に2時間アシスタントを使う人なら、どのサブスクリプションよりも安く済む可能性があります。入力トークンと出力トークンは別々に課金されるため、推測ではなく計算する価値があります。
移行によって何を失うのかを明確にしてください。ホスト型の最先端モデルは、依存関係のある長い処理手順でも整合性を維持し、独自のツールエラーから復旧して処理が停止するのを防ぎます。自分のマシンへ移行すると、メッセージ単位の上限がなく、データがマシンの外へ出ないという利点と引き換えに、その機能を失います。また、モデルのバージョンが固定されます。1つのモデルに合わせてプロンプトを調整した後は、この点が重要になります。
タスク単位で比較し、リーダーボードだけで判断しない
ベンチマーク表は、自分が実際に行うタスクとは異なるタスクの平均値でモデルを順位付けしています。あるモデルがコーディングベンチマークで最上位になっても、ロシア語の契約書を読む用途には適さない場合があります。そこで、自分の利用内容を作業ごとに分け、それぞれを個別に評価します。サブスクリプション料金を支払う主な用途は、エージェントによるコーディングループ、長文書の読解、翻訳と文章作成、未知の問題に対する難しい推論の4つです。最初の3つについては、現在でも実用的なオープンな選択肢があります。4つ目については、まだありません。
オープンモデルでエージェント型のコーディングループを実行できますか?
エージェント型のループとは、モデルがファイルを読み、コマンドを実行し、出力を読み、再び編集する処理を、各ステップで承認を求めずに何度も繰り返すことです。オープンモデルでも実行できますが、監督が必要です。その理由は意見ではなく、算術で説明できます。各ステップの誤りが次のステップの入力になるため、ループ全体で誤りが累積します。1 回のステップで 10 回中 9 回正しいモデルでも、20 ステップ後には過半数の確率で誤ります。ホスト型の frontier model でもこの問題は解消しません。1 ステップあたりの正答率が高い状態から始まるだけで、ループが長くなるほど、その差が広がります。そのため、ローカル環境では、最後に確認を入れる短いループが適しています。1 ファイル、1 関数、1 つの failing test を対象にし、それを通過させます。
ローカルのコーディング環境でよく使われるモデルは 2 つです。Ollama をインストールして、いずれか 1 つを pull します。
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3-coderqwen3-coder は、token ごとに 3.3B パラメータをアクティブ化し、256K の context window を持つ 30B mixture-of-experts model として公開されています。ollama run devstral では、Mistral の 24B agentic coding model を Apache 2.0 licence で利用できます。公開時の context window は 128K です。これらはベンダーが公開している数値であり、こちらで測定した値ではありません。それぞれに必要な hardware と quantisation(quantisation は weights を低い精度で保存して model を小さくし、その代わりに一部の accuracy を失う処理です)については、実際に self-host できるモデルで測定結果を確認できます。VPS で Qwen 3 model を実行する方法では、手順を順番に説明しています。
Ollama は http://localhost:11434/v1/ で OpenAI-compatible endpoint を公開するため、多くのコーディングツールでは base URL を 1 つ変更するだけで接続できます。クライアントライブラリでは API key の field も必要ですが、server はその値を無視します。範囲が限定された要求では、良好な結果を期待できます。たとえば、この function を書く、この config を変換する、この stack trace を説明する、この file の tests を書く、といった要求です。一方、範囲が開かれた要求では、結果が弱くなります。たとえば、40 個の file のどこかで発生している問題の原因を探す要求です。後者は、まさに長いループであり、各ステップの誤りが積み重なります。
ローカルマシンで長い文書を読む
この作業は、ローカルモデルが有料モデルに最も近い性能を発揮しやすい分野です。文中にすでにある情報を探して要約する作業であり、新しい内容を作り出す必要がないためです。また、データを手元に置く理由が最も明確な作業でもあります。契約書、診療記録、社内報告書、秘密保持契約の対象となる文書などが該当します。
ここで問題になるのはコンテキストウィンドウです。この問題はエラーを出さずに発生します。Ollama のデフォルトのコンテキストウィンドウは 4096 tokens です。40 ページの文書を入力すると、その上限を超えた部分はモデルが見る前に破棄されます。そのため、最初の数ページだけを流暢に要約し、エラーはどこにも表示されないという結果になります。サイズを明示的に設定します。
OLLAMA_CONTEXT_LENGTH=32768 ollama serve同じ値はリクエストごとに num_ctx として設定できます。対話形式では /set parameter num_ctx を使用できます。公開されているコンテキストウィンドウは上限であり、保証値ではありません。メモリ使用量は KV cache(それまでの各 token の key と value を保存する領域)に応じて増加します。そのため、長い入力を処理すると、weights の読み込み後に残った GPU メモリを消費します。メモリが不足するとプロセスが終了するか、system memory にあふれて処理が大幅に遅くなります。非常に長い入力の中央付近にある事実については、精度も低下します。実用的には、文書を分割し、チャンクごとに質問して、回答を自分で統合します。
自分の言語で翻訳と文書作成をテストする
オープンモデルを選ぶ根拠として、これは最も強いものです。また、英語のベンチマークが最も参考にならないケースでもあります。実際に書く言語でテストしてください。同じ内容でも、ほとんどのトークナイザーは英語よりロシア語のテキストを単語あたり多くのトークンに分割します。そのため、同じ長さの英語文書よりもロシア語文書のほうが早くコンテキストウィンドウを使い切り、生成にも時間がかかります。これはトークナイザーの特性であり、モデルの能力に対する評価ではありません。
比較する前に、固定したテストセットを作成してください。自分の業務で実際に使った文書を20件用意し、それぞれについて受け入れ可能な出力を決めます。すべての候補を同じ20件に対して実行し、結果を自分で確認してください。どのリーダーボードでも、これを代わりに測定することはできません。結果は、分野固有の語彙と文体に左右されるためです。
オープンモデルをロシア語向けにファインチューニングしたモデルは公開されており、その中には Vikhr ファミリーもあります。特化型のファインチューニングモデルが、現行の汎用モデルを上回るとは限りません。新しい多言語ベースモデルのほうが、ロシア語向けに調整された古いモデルよりロシア語で優れている場合があります。ベースモデルの改善幅が、ファインチューニングによる追加効果を上回ることがあるためです。両方を20件の文書で実行し、その結果で判断してください。
コスト差が埋まらない領域
有料の選択肢を残す価値があるのは、難しい推論です。依存関係の長い手順、書いた本人ではないコード内での設計判断、要件自体が曖昧な問題では、小規模なオープンモデルが最も高くつく形で失敗します。流暢で自信のある回答を返しますが、回答の中盤が誤っています。読みやすい誤答は、無回答よりもコストがかかります。誤りの箇所を見つけるために、すべての行を確認しなければならないからです。
有効な構成は、使い分けです。処理量の多い作業は、自分で運用するモデルに任せます。難しいケースは、従量課金のキーに回します。月に数回呼び出すだけなら費用はごくわずかで、その場合は 作業に適したモデルを選ぶこと が他のどの場面よりも重要です。主に利用上限を理由に Max を使っているなら、まず 実際の利用量を把握してください。その判断と今回の判断は同じだからです。
ハードウェアに毎月かかる実際の費用
ここで判断できます。GPU VPS は月額課金のため、5 時間だけ使っても 500 時間使っても、1 か月分の料金がかかります。アイドル時の割引はありません。GPU インスタンスは Pro サブスクリプションより月額料金がかなり高いため、切り替えた時点では不利で、差額を回収する必要があります。実際に契約するインスタンスの月額料金をプラン料金で割ります。答えが 5 なら、その切り替えによって、サブスクリプションでは提供できない価値を得る必要があります。たとえば、データを自分のマシンに保持できることや、メッセージごとの上限なしでエージェントを一晩中実行できることです。GPU VPS と API トークンの損益分岐点では、計算式と具体例を説明しています。トークン料金の代わりに月額プラン料金を使う場合も、同じ計算が成り立ちます。
数字を動かす方法は 2 つあります。1 つ目は時間単位で借り、ジョブが終わったらインスタンスを停止する方法です。バッチ処理に適しています。ただし、インスタンスを停止している間もプロバイダーがディスク料金を請求するか確認してください。この料金は見落とされがちです。2 つ目は、GPU 料金が一切かからない通常の CPU VPS で、より小さいモデルを実行する方法です。CPU による生成は遅いため、対話的なコーディングループには向きません。しかし、400 件のドキュメントを要約する夜間ジョブなら、処理中に誰かが待つ必要はありません。通常の VPS にかかる費用で、この場合の下限を確認できます。
配信: まずは Ollama、ユーザーが複数なら vLLM
まず Ollama から始めます。コマンド1つで済み、モデルの取得と実行を行い、既存のツールがすでに使用している API に対応しているためです。実際には、一度に1人へ配信する構成になります。同じサーバーに複数のユーザーや複数のエージェントからリクエストが届く場合は、vLLM に切り替えます。vLLM はリクエストをバッチ処理し、プロンプト間で GPU がアイドル状態になるのを防ぎます。
uv pip install vllm --torch-backend=auto
vllm serve Qwen/Qwen2.5-1.5B-Instruct選択したモデル ID に置き換えます。vLLM は port 8000 で待ち受け、同じ OpenAI-compatible な形式で配信するため、移行しても base URL より上の設定を変更する必要はありません。
セキュリティ上、1点注意が必要です。この設定ミスが原因で、これらのサーバーが外部から発見されます。Ollama はデフォルトで port 11434 の 127.0.0.1 に bind し、認証機能を一切持ちません。公開 IP を持つマシンで OLLAMA_HOST を 0.0.0.0 に設定すると、認証のないモデルサーバーをインターネットへ公開することになります。その port をスキャンする第三者が GPU の処理時間を消費でき、ツールが送信した内容も読み取れる可能性があります。localhost 上に限定し、SSH トンネルまたは VPN 経由で接続してください。または、認証情報を要求するリバースプロキシを前段に置いてください。port 8000 の vLLM にも同じ対策が必要です。
port で応答するようになれば、残りは通常の接続設定です。VPS 上で独自のエージェントを構築する と n8n ワークフローからエージェントを実行する は、どちらもローカルエンドポイントに接続できます。必要なのは base URL とモデル名だけです。
1 週間で判断する方法
- アシスタントを実際に使っている作業を書き出し、それぞれに具体的な例を1つ付けます。
- 無料枠を含め、現在利用できる環境でその例を実行し、回答を保存します。
- GPU サーバーを時間単位で1晩借り、候補モデルを1つ提供して、同じ例を実行します。
- 月額費用をベンチマーク表ではなく、保存した回答と比較します。
この1週間の検証を行った人の多くは、移行ではなく作業の分担に落ち着きます。処理量の多い作業は自分でホストするモデルに移し、難しい質問は有料 API に残します。難しい質問への回答品質を維持したまま、月額費用を抑えられます。
FAQ
オープンモデルは日常のコーディングで Claude Code の代わりになりますか?
短く、範囲が明確なタスクであれば、なります。関数の作成、設定ファイルの変換、エラーの説明、テストの生成などは、ローカルのコーディングモデルで処理できます。http://localhost:11434/v1/ の OpenAI互換エンドポイントを通じて、エディターからモデルを利用できます。多数のファイルにまたがる長時間の自律的なループ処理では、性能が劣ります。各ステップのエラーが次のステップに影響し、処理の方向がずれるためです。タスクを短く保ち、照合用のテストを用意し、すべての差分を確認してください。
最初に実行するオープンモデルはどれですか?
コードには ollama run qwen3-coder または ollama run devstral を使用します。一般的なテキストや翻訳には、gemma4 または qwen3.5 など、現行の汎用モデルから始めてください。ハードウェアで許容できる速度で動作する中で、最も大きいサイズを選びます。その後はモデルカードを読み続けず、各モデルに自分の文書を20件処理させてください。判断を決めるのはベンダーの表ではなく、使用する言語と分野です。
GPU VPS は Claude のプランより安くなりますか?
価格だけで比較すると、通常はなりません。月額の GPU インスタンスは Pro サブスクリプションの数倍かかり、使用しなくても同じ料金が発生します。サブスクリプションでは提供されない要件がある場合は、GPU VPS が有利です。たとえば、データをマシンの外へ出さないこと、メッセージ上限なしで一晩中ジョブを実行すること、使用量に応じて変動しない固定料金などです。何かを契約する前に、損益分岐点のページにある式で計算してください。
ローカルモデルは英語と同じ程度にロシア語を処理できますか?
現行の多言語オープンモデルは、ロシア語の下書き作成と翻訳を実用的な水準で処理できます。ただし、英語とは異なる点が2つあります。多くの tokenizer はキリル文字の1語あたりにより多くの token を使用するため、同じ文書でもコンテキストウィンドウを早く消費し、生成速度も低下します。また、英語のベンチマークスコアはそのまま適用できません。英語のランキングで上位のモデルが、ロシア語のテキストでは劣る場合があります。自分の文書でテストし、ファインチューニング済みのロシア語モデルが必ず優れていると考えずに、最新の汎用モデルと比較してください。