Ollama ist nicht mehr nur lokale KI: Cloud-Preise, Datenschutz und das Open-Model-Geschäftsmodell

Victor Ramirez – Tapbit Learn Technical AnalystVictor Ramirez|8 Min. Lesezeit

Wichtigste Erkenntnisse

- Ollama hat am 31. August 2026 Cloud-Pläne mit nutzungsbasierter Abrechnung pro Token eingeführt und seine Kernsoftware lokal weiterhin kostenlos unter der MIT-Lizenz angeboten.

- Das neue Ollama Cloud bietet Inferenz ohne Datenspeicherung für Modelle, die zu groß sind, um sie bequem auf persönlichen Computern auszuführen.

- Claude Desktop und verschiedene Coding-Agenten unterstützen jetzt die Integration mit Ollama für lokale und Cloud-gehostete Open-Modelle.

- Ollama Pro kostet 20 US-Dollar pro Monat oder 200 US-Dollar pro Jahr und beinhaltet Cloud-Nutzungsguthaben im Wert von 60 US-Dollar pro Monat.

Ollama Cloud-Plattform

Ollama baute seinen Ruf auf einem einfachen Wertversprechen auf: Laden Sie ein Open-Model herunter, führen Sie es lokal aus und halten Sie Ihre Daten aus der Cloud heraus.

Diese Beschreibung gilt immer noch, aber sie erfasst nicht mehr das vollständige Bild.

Am 31. August 2026 führte Ollama Cloud-Pläne auf Basis der nutzungsbasierten Abrechnung pro Token ein. Tage zuvor wurde die Unterstützung für die Ausführung von Ollama-Modellen über Claude Desktop hinzugefügt. Die Plattform bietet jetzt Cloud-Inferenz, Websuche, Integrationen mit Coding-Agenten und kostenpflichtige Teamkonten neben der ursprünglichen lokalen Software.

Ollama hat sich nicht von lokaler KI abgewandt – es baut ein Geschäft um den Punkt auf, an dem lokale Hardware nicht mehr alle Benutzerbedürfnisse erfüllt.

Lokales Ollama ist weiterhin kostenlos

 

Die Kernsoftware von Ollama bleibt unter der MIT-Lizenz verfügbar. Benutzer können Modelle herunterladen und auf ihrer eigenen Hardware ausführen, ohne Ollama für jede Anfrage bezahlen zu müssen.

Die Anwendung kümmert sich um Modelldownloads, Speicherung und Hardwareerkennung. Sie stellt auch eine lokale API bereit, sodass andere Anwendungen das installierte Modell nutzen können.

Dieser Ansatz funktioniert gut für die Analyse privater Dokumente, Offline-Assistenten, Softwareentwicklung und Experimente, die über eine nutzungsbasierte API teuer werden würden. Die lokale Ausführung eines Modells gibt Benutzern auch mehr Kontrolle über die Modellauswahl, System-Prompts und die Speicherung.

Es fallen immer noch Kosten an, nur keine Ollama-Nutzungsrechnung. Größere Modelle erfordern mehr Speicher, Speicherplatz und Strom. Ein kleines Modell kann auf einem normalen Laptop laufen, während ein großes Reasoning- oder multimodales Modell eine teure GPU oder Workstation erfordern kann.

Lokale KI verlagert die Kosten von Cloud-Tokens auf Hardware.

Ollama Cloud ändert die Berechnung

Ollama Cloud wurde für Modelle entwickelt, die nicht bequem auf persönlichen Computern laufen. Sie ermöglicht es Benutzern, dieselben Befehlszeilentools und APIs zu verwenden, während die Inferenz auf Rechenzentrumshardware verlagert wird.

Diese Bequemlichkeit ändert zwei wichtige Teile des ursprünglichen Angebots: Preis und Datenspeicherort.

Die Cloud-Nutzung wird in Tokens gemessen. Sobald das enthaltene Kontingent aufgebraucht ist, können Benutzer weitere Nutzung zu den veröffentlichten Preisen für jedes Modell erwerben. Nicht genutzte monatliche Credits verfallen.

Ollama gibt an, dass die Änderung die weniger vorhersehbare Abrechnung nach GPU-Zeit ersetzt und die bisherigen Beschränkungen von fünf Stunden und wöchentlichen Limits aufhebt. Die Ausführung von Modellen auf persönlicher Hardware bleibt unbegrenzt.

Das Ergebnis ist ein Hybridprodukt. Ollama kann je nach Nutzung kostenlose lokale Software, eine Pay-as-you-go-Modell-API oder ein monatliches Cloud-Abonnement sein.

Speichert Ollama Daten lokal?

Nur lokale Modelle halten den gesamten Inferenzprozess auf dem Gerät des Benutzers. Wenn ein Modellname eine Cloud-Bezeichnung trägt, wird die Anfrage von der Infrastruktur von Ollama verarbeitet. Das Unternehmen gibt an, dass Cloud-Prompts und -Antworten nicht protokolliert, gespeichert oder zum Training verwendet werden. Die veröffentlichte Dokumentation besagt, dass die Rechenleistung hauptsächlich in den Vereinigten Staaten und Europa gehostet wird, wobei Singapur für eine begrenzte Gruppe von Qwen-Modellen verwendet wird.

Das ist eine Zero-Data-Retention-Richtlinie, keine lokale Verarbeitung.

Die Unterscheidung ist wichtig für Unternehmen, die mit Quellcode, juristischen Materialien, Kundenakten oder internen Forschungsarbeiten arbeiten. Eine Anfrage kann durch die Datenschutzrichtlinie eines Anbieters geschützt sein und dennoch die Netzwerkgrenze eines Unternehmens überschreiten.

Ollama ermöglicht es Benutzern, seine Cloud-Funktionen über Konfigurationseinstellungen zu deaktivieren. Dies schränkt auch den Zugriff auf Cloud-Modelle und den Websuchdienst von Ollama ein. Teams, die eine reine lokale Umgebung benötigen, sollten diese Einstellung überprüfen, anstatt davon auszugehen, dass jede Anfrage auf dem Rechner bleibt.

Claude Desktop kann jetzt Ollama-Modelle ausführen

Ollama hat am 25. August die Unterstützung für Claude Desktop hinzugefügt. Benutzer können Ollama als Drittanbieter-Gateway konfigurieren und entweder ein lokales Modell oder eines, das in der Ollama Cloud gehostet wird, auswählen.

Diese Konfiguration kann missverstanden werden.

Ein Modell, das innerhalb der Claude Desktop-Oberfläche ausgeführt wird, ist nicht unbedingt ein Claude-Modell. Anthropic stellt die Anwendungsoberfläche bereit, während Ollama das ausgewählte Modell und die Inferenzroute liefert. Die Ausgabequalität, die Kontextbehandlung und die Tool-Unterstützung hängen daher vom verwendeten Ollama-Modell ab.

Das Update ist wichtig, da es die KI-Schnittstelle vom KI-Anbieter trennt. Benutzer können eine vertraute Arbeitsumgebung beibehalten und gleichzeitig das zugrunde liegende Modell ändern.

Ein ähnliches Muster zeichnet sich im Entwicklermarkt ab. Ollama arbeitet jetzt mit Codex, Claude Code, OpenCode und anderen Coding-Agenten zusammen. Sein Befehl `ollama launch` hilft bei der Konfiguration dieser Tools, ohne dass Entwickler ihre Workflows für jeden Modell-Anbieter neu erstellen müssen.

OpenAI-Kompatibilität erleichtert den Wechsel, ist aber nicht perfekt

Ollama unterstützt Teile des OpenAI API-Formats. Bestehende Anwendungen können unterstützte Anfragen an einen Ollama-Endpunkt richten und lokale oder Cloud-Open-Modelle verwenden.

Die Kompatibilitätsschicht umfasst Chat-Vervollständigungen, Streaming, Embeddings, Vision-Input, Tool-Aufrufe und Teile der Responses API. Ollama hat auch einen experimentellen Endpunkt für die Bilderzeugung eingeführt.

„Kompatibel“ bedeutet nicht identisch. Einige OpenAI-Felder und zustandsbehaftete Funktionen werden nicht vollständig unterstützt, und das Modellverhalten kann erheblich abweichen. Entwickler müssen immer noch Tool-Aufrufe, strukturierte Ausgaben, Kontextlänge und Fehlerbehandlung testen, bevor sie einen Produktionsendpunkt ersetzen.

Der praktische Vorteil ist eine geringere Migrationsreibung. Ein Unternehmen kann ein Open-Model testen, ohne seine gesamte Anwendung neu schreiben zu müssen.

Die Modellbibliothek reicht über Llama 3 hinaus

 

Ältere Erklärungen zu Ollama konzentrieren sich oft auf Llama 3, Gemma 2, Phi-3 und Qwen 2.5. Diese Modelle bleiben verfügbar, aber die Bibliothek wurde erweitert.

Neuere Ergänzungen umfassen Gemma 4, Qwen 3.8, GLM 5.3, NVIDIA Nemotron 3.5 Lightning, Muse Glimmer und neuere DeepSeek- und Kimi-Modelle. Einige sind für Coding-Agenten, multimodale Eingaben oder lang andauernde Tool-Nutzung konzipiert, anstatt für einfachen Chat.

Nicht jedes Modell kann heruntergeladen und lokal ausgeführt werden. Einige der größten Veröffentlichungen sind nur über Ollama Cloud verfügbar. Benutzer sollten das Modell-Tag, die Download-Größe und die Lizenz überprüfen, anstatt anzunehmen, dass alles in der Bibliothek sowohl lokal als auch uneingeschränkt ist.

Die Software von Ollama selbst verwendet die MIT-Lizenz, aber einzelne Modelle behalten die von ihren Erstellern gewählten Lizenzen. Offene Gewichte bedeuten nicht automatisch eine uneingeschränkte kommerzielle Nutzung.

Ollamas Geschäftsmodell wird klarer

Ollama kündigte im Juli 2026 eine Finanzierungsrunde in Höhe von 88 Millionen US-Dollar an. Das Unternehmen gibt an, derzeit 8,9 Millionen Entwickler zu bedienen und in 85 % der Fortune-500-Unternehmen eingesetzt zu werden. Diese Nutzungszahlen stammen von Ollama und wurden nicht unabhängig geprüft, zeigen aber das Ausmaß seiner kommerziellen Ambitionen.

Die Strategie hat mehrere Teile: Lokale Software bringt Entwickler in das Ökosystem. API-Kompatibilität erleichtert die Einführung von Ollama. Integrationen verbinden es mit etablierten Coding-Tools. Cloud-Inferenz monetarisiert Benutzer, die mehr Rechenleistung benötigen, als ihre eigene Hardware bereitstellen kann.

Das ist nicht ungewöhnlich. Open-Source-Infrastrukturunternehmen bieten oft die Kernsoftware zugänglich an und berechnen gleichzeitig Hosting-, Skalierungs- und Verwaltungsfunktionen.

Die Spannung liegt in der Positionierung. Ollama wurde als Alternative zu nutzungsbasierter Cloud-KI populär. Es muss die Benutzer nun davon überzeugen, dass seine eigene Cloud genügend Leistung, Datenschutz und Modellauswahl bietet, um eine weitere Token-Rechnung zu rechtfertigen.

Was Ollama geworden ist

Ollama macht lokale KI immer noch einfacher. Das bleibt sein stärkster Produktvorteil.

Was sich geändert hat, ist der verfügbare Weg, nachdem die lokale Hardware an ihre Grenzen stößt. Benutzer müssen die Ollama-Umgebung nicht mehr verlassen, um auf größere Modelle, Websuche oder Cloud-Computing zuzugreifen. Sie können zwischen lokaler und gehosteter Inferenz wechseln und dabei viele der gleichen Tools verwenden.

Diese Bequemlichkeit bringt Entscheidungen mit sich, die die ursprüngliche reine lokale Geschichte nicht erforderte. Benutzer müssen nun wissen, wo jedes Modell ausgeführt wird, wie Cloud-Tokens abgerechnet werden und welche Datenschutzrichtlinie für jede Anfrage gilt.

Ollama ist nicht mehr nur ein Weg, die KI-Cloud zu vermeiden. Es versucht, die Schicht zu werden, die entscheidet, wann die Cloud notwendig ist.

Leser, die sich für die Überschneidungen zwischen KI-Infrastruktur, Cloud Computing und digitalen Märkten interessieren, finden weitere Recherchen auf Tapbit. Tapbit-Benutzer können sich anmelden, während diejenigen, die die Plattform erkunden, ein Konto erstellen können.

Häufig gestellte Fragen

Ist Ollama kostenlos?

Ollama ist kostenlos, wenn Modelle auf der Hardware des Benutzers ausgeführt werden. Ollama Cloud bietet eine kostenlose Anfangsnutzung, berechnet aber zusätzliche Cloud-Inferenz.

Berechnet Ollama pro Token?

Lokale Inferenz ist nicht mit einer Ollama-Gebühr pro Token verbunden. Cloud-Modelle verwenden veröffentlichte Preise pro Token, wobei monatliche Nutzungsguthaben in kostenpflichtigen Plänen enthalten sind.

Wie viel kostet Ollama Pro?

Ollama Pro kostet 20 US-Dollar pro Monat oder 200 US-Dollar pro Jahr gemäß der am 31. August 2026 veröffentlichten Preisgestaltung. Es beinhaltet monatliche Cloud-Nutzungsguthaben im Wert von 60 US-Dollar.

Haftungsausschluss

Der Handel mit Kryptowährungen birgt ein erhebliches Verlustrisiko. Die Preise sind äußerst volatil und können sich schnell ändern. Protokollintegrationen, Token-Nutzungsmöglichkeiten und Roadmap-Zeitpläne können sich ändern. Dieser Artikel dient nur zu Informationszwecken und stellt keine Anlageberatung dar. Führen Sie stets Ihre eigene Recherche durch (DYOR) und investieren Sie niemals mehr, als Sie sich leisten können, vollständig zu verlieren.

Meistern Sie den Kryptomarkt

Erhalten Sie Expertenressourcen, Tutorials und die neuesten Krypto-Trends. Melden Sie sich an, um mit Ihrem Trading zu beginnen.