Ollamaはその評判を、オープンモデルをダウンロードし、ローカルで実行し、データをクラウドに置かないという、わかりやすい価値提案に基づいて築き上げました。
その説明は今でも当てはまりますが、もはや全体像を捉えていません。
2026年8月31日、Ollamaはトークンごとの価格設定に基づくクラウドプランを導入しました。数日前には、Claude Desktop経由でOllamaモデルを実行するサポートを追加しました。このプラットフォームは現在、元のローカルソフトウェアに加えて、クラウド推論、Web検索、コーディングエージェント統合、有料チームアカウントを提供しています。
OllamaはローカルAIから離れたわけではありません。ローカルハードウェアがあらゆるユーザーニーズを満たせなくなった時点からビジネスを構築しています。
ローカルOllamaは引き続き無料

コアとなるOllamaソフトウェアは、MITライセンスの下で引き続き利用可能です。ユーザーはモデルをダウンロードし、プロンプトごとにOllamaに支払うことなく、自身のハードウェアで実行できます。
このアプリケーションは、モデルのダウンロード、ストレージ、ハードウェア検出を処理します。また、ローカルAPIを公開しているため、他のアプリケーションがインストールされたモデルを使用できます。
このアプローチは、プライベートドキュメント分析、オフラインアシスタント、ソフトウェア開発、および従量課金APIでは高額になる可能性のある実験に役立ちます。モデルをローカルで実行すると、ユーザーはモデル選択、システムプロンプト、ストレージに対するより多くの制御を得られます。
コストは依然としてかかりますが、それはOllamaの使用料金ではありません。より大きなモデルは、より多くのメモリ、ストレージ、電力を必要とします。小さなモデルは通常のラップトップで実行できるかもしれませんが、大規模な推論またはマルチモーダルモデルは、高価なGPUまたはワークステーションを必要とする場合があります。
ローカルAIは、コストをクラウドトークンからハードウェアに移行させます。
Ollama Cloudは計算を変える
Ollama Cloudは、個人用コンピュータでは快適に実行するには大きすぎるモデルのために作成されました。ユーザーは、推論をデータセンターハードウェアに移行しながら、同じコマンドラインツールとAPIを維持できます。
その利便性は、元の提案の2つの重要な部分、つまり価格とデータの場所を変更します。
クラウドの使用量はトークンで測定されます。含まれる割り当てが使い果たされると、ユーザーは各モデルの公開レートで購入できます。未使用の月次クレジットは繰り越されません。
Ollamaによると、この変更は予測可能性の低いGPU時間課金を置き換え、以前の5時間および週制限を削除します。個人用ハードウェアでのモデル実行は無制限のままです。
結果としてハイブリッド製品が生まれます。Ollamaは、使用方法に応じて、無料のローカルソフトウェア、従量課金モデルAPI、または月額クラウドサブスクリプションになります。
Ollamaはデータをローカルに保持しますか?
ローカルモデルのみが、推論プロセス全体をユーザーのデバイス上に保持します。モデル名にクラウド指定が付いている場合、リクエストはOllamaのインフラストラクチャによって処理されます。同社によると、クラウドのプロンプトと応答はログに記録されず、保持されず、トレーニングにも使用されません。公開されているドキュメントによると、コンピューティングは主に米国とヨーロッパでホストされており、シンガポールは限られたQwenモデルグループに使用されています。
これはローカル処理ではなく、ゼロデータ保持ポリシーです。
ソースコード、法的資料、顧客記録、または内部研究を扱うビジネスにとって、この区別は重要です。リクエストはプロバイダーのプライバシーポリシーによって保護される可能性がありますが、それでも会社のネットワーク境界を越える可能性があります。
Ollamaは、設定設定を通じてクラウド機能を無効にすることをユーザーに許可しています。これにより、クラウドモデルとOllamaのWeb検索サービスへのアクセスも削除されます。ローカル専用環境を必要とするチームは、すべてリクエストがマシン上に留まることを前提とするのではなく、この設定を確認する必要があります。
Claude DesktopでOllamaモデルを実行可能に
Ollamaは8月25日にClaude Desktopサポートを追加しました。ユーザーはOllamaをサードパーティゲートウェイとして設定し、ローカルモデルまたはOllama Cloudでホストされているモデルのいずれかを選択できます。
この取り決めは誤解される可能性があります。
Claude Desktopインターフェース内で実行されているモデルが、必ずしもClaudeモデルであるとは限りません。Anthropicがアプリケーションインターフェースを提供し、Ollamaが選択されたモデルと推論ルートを提供します。したがって、出力品質、コンテキスト処理、およびツールサポートは、使用されているOllamaモデルに依存します。
このアップデートは、AIインターフェースとAIプロバイダーを分離するため重要です。ユーザーは、その下のモデルを変更しながら、使い慣れたワークスペースを維持できます。
同様のパターンが開発者市場全体に現れています。Ollamaは現在、Codex、Claude Code、OpenCodeなどのコーディングエージェントと連携しています。その`ollama launch`コマンドは、開発者が各モデルプロバイダーを中心にワークフローを再構築する必要なく、これらのツールを設定するのに役立ちます。
OpenAI互換性により切り替えが容易になるが、完璧ではない
OllamaはOpenAI API形式の一部をサポートしています。既存のアプリケーションは、サポートされているリクエストをOllamaエンドポイントに向け、ローカルまたはクラウドのオープンモデルを使用できます。
互換性レイヤーには、チャット補完、ストリーミング、埋め込み、ビジョン入力、ツール呼び出し、およびResponses APIの一部が含まれます。Ollamaは実験的な画像生成エンドポイントも導入しました。
「互換性がある」ということは、同一であることを意味しません。一部のOpenAIフィールドとステートフル関数は完全にサポートされておらず、モデルの動作は大幅に異なる場合があります。開発者は、本番エンドポイントを置き換える前に、ツール呼び出し、構造化出力、コンテキスト長、およびエラー処理をテストする必要があります。
実用的な利点は、移行の摩擦が低いことです。企業は、アプリケーション全体を書き直すことなく、オープンモデルをテストできます。
モデルライブラリはLlama 3を超えて拡大
Ollamaの古い説明では、Llama 3、Gemma 2、Phi-3、Qwen 2.5に焦点を当てることがよくありました。これらのモデルは引き続き利用可能ですが、ライブラリは拡大しています。
最近追加されたものには、Gemma 4、Qwen 3.8、GLM 5.3、NVIDIA Nemotron 3.5 Lightning、Muse Glimmer、および新しいDeepSeekおよびKimiモデルが含まれます。一部は、単純なチャットではなく、コーディングエージェント、マルチモーダル入力、または長時間実行されるツール使用のために設計されています。
すべてのモデルをローカルでダウンロードして実行できるわけではありません。一部の最大のリリースは、Ollama Cloudでのみ利用可能です。ユーザーは、ライブラリ内のすべてがローカルで無制限であると仮定するのではなく、モデルタグ、ダウンロードサイズ、およびライセンスを確認する必要があります。
Ollama自身のソフトウェアはMITライセンスを使用していますが、個々のモデルは作成者が選択したライセンスを保持します。オープンウェイトは、自動的に無制限の商用利用を許可するわけではありません。
Ollamaのビジネスモデルがより明確に
Ollamaは2026年7月に8,800万ドルの資金調達ラウンドを発表しました。同社によると、現在890万人の開発者にサービスを提供しており、Fortune 500企業の85%で使用されています。これらの採用率はOllamaからのものであり、独立して監査されていませんが、その商業的野心の規模を示しています。
この戦略にはいくつかの部分があります。ローカルソフトウェアは開発者をエコシステムに引き込みます。API互換性により、Ollamaの採用が容易になります。統合により、確立されたコーディングツールに接続されます。クラウド推論は、自身のハードウェアが提供できる以上のコンピューティングを必要とするユーザーから収益を得ます。
これは珍しいことではありません。オープンソースインフラストラクチャ企業は、コアソフトウェアをアクセス可能に保ちながら、ホスティング、スケール、および管理機能に対して料金を請求することがよくあります。
緊張関係はポジショニングにあります。Ollamaは、従量課金制のクラウドAIの代替として人気を博しました。今では、その独自のクラウドが、別のトークン請求を正当化するのに十分なパフォーマンス、プライバシー、およびモデル選択を提供することをユーザーに納得させる必要があります。
Ollamaは何になったのか
Ollamaは依然としてローカルAIを容易にします。それはその最も強力な製品上の利点であり続けています。
変わったのは、ローカルハードウェアの容量がなくなった後に利用可能になったパスです。ユーザーは、より大きなモデル、Web検索、またはクラウドコンピューティングにアクセスするために、Ollama環境を離れる必要がなくなりました。多くの同じツールを維持しながら、ローカルとホストされた推論間を移動できます。
その利便性には、元のローカル専用のストーリーでは必要なかった選択肢が伴います。ユーザーは今、各モデルがどこで実行されるか、クラウドトークンがどのように請求されるか、そして各リクエストにどのプライバシーポリシーが適用されるかを知る必要があります。
Ollamaはもはや単にAIクラウドを回避する方法ではありません。それは、クラウドが必要な時期を決定するレイヤーになることを目指しています。
AIインフラストラクチャ、クラウドコンピューティング、およびデジタル市場の重複に関心のある読者は、Tapbitでさらに調査を見つけることができます。Tapbitユーザーはサインインでき、プラットフォームを探索しているユーザーはアカウントを作成できます。
よくある質問
Ollamaは無料ですか?
Ollamaは、モデルがユーザー自身のハードウェアで実行される場合、無料です。Ollama Cloudには無料のスターター利用枠がありますが、追加のクラウド推論には料金がかかります。
Ollamaはトークンごとに課金しますか?
ローカル推論には、トークンごとのOllama料金はかかりません。クラウドモデルは公開されているトークンごとの価格を使用し、月次利用クレジットは有料プランに含まれています。
Ollama Proの料金はいくらですか?
Ollama Proは、2026年8月31日に公開された価格設定に基づき、月額20ドルまたは年額200ドルです。月額60ドルのクラウド利用クレジットが含まれています。

