Ollama non è più solo IA locale: prezzi cloud, privacy e il business dei modelli aperti

Victor Ramirez – Tapbit Learn Technical AnalystVictor Ramirez|8 min di lettura

Punti Chiave

- Ollama ha lanciato piani cloud con prezzi per token il 31 agosto 2026, mantenendo il suo software locale principale gratuito sotto licenza MIT.

- Il nuovo Ollama Cloud offre inferenza a zero conservazione dei dati per modelli troppo grandi per essere eseguiti comodamente su personal computer.

- Claude Desktop e vari agenti di codifica ora supportano l'integrazione con Ollama per modelli aperti ospitati localmente e nel cloud.

- Ollama Pro ha un prezzo di $20 al mese o $200 all'anno, fornendo $60 in crediti di utilizzo cloud mensili.

Piattaforma cloud Ollama

Ollama ha costruito la sua reputazione su una proposta di valore semplice: scarica un modello aperto, eseguilo localmente e tieni i tuoi dati fuori dal cloud.

Questa descrizione è ancora valida, ma non cattura più l'intera immagine.

Il 31 agosto 2026, Ollama ha introdotto piani cloud basati su prezzi per token. Giorni prima, ha aggiunto il supporto per l'esecuzione di modelli Ollama tramite Claude Desktop. La piattaforma ora offre inferenza cloud, ricerca web, integrazioni con agenti di codifica e account team a pagamento accanto al software locale originale.

Ollama non ha abbandonato l'IA locale: sta costruendo un business attorno al punto in cui l'hardware locale non soddisfa più tutte le esigenze degli utenti.

Ollama Locale è Ancora Gratuito

 

Il software Ollama principale rimane disponibile sotto licenza MIT. Gli utenti possono scaricare modelli ed eseguirli sul proprio hardware senza pagare Ollama per ogni prompt.

L'applicazione gestisce il download dei modelli, l'archiviazione e il rilevamento dell'hardware. Espone anche un'API locale, in modo che altre applicazioni possano utilizzare il modello installato.

Questo approccio funziona bene per l'analisi di documenti privati, assistenti offline, sviluppo software ed esperimenti che diventerebbero costosi tramite un'API a consumo.

C'è ancora un costo, solo non una fattura per l'utilizzo di Ollama. Modelli più grandi richiedono più memoria, archiviazione ed elettricità. Un modello piccolo può funzionare su un normale laptop, mentre un modello di ragionamento o multimodale di grandi dimensioni può richiedere una costosa GPU o workstation.

L'IA locale sposta il costo dai token cloud all'hardware.

Ollama Cloud Cambia il Calcolo

Ollama Cloud è stato creato per modelli che non rientrano comodamente sui personal computer. Permette agli utenti di mantenere gli stessi strumenti da riga di comando e API mentre spostano l'inferenza su hardware di data center.

Questa comodità cambia due parti importanti della proposta originale: prezzo e posizione dei dati.

L'utilizzo del cloud viene misurato in token. Una volta esaurita la franchigia inclusa, gli utenti possono acquistare ulteriore utilizzo alla tariffa pubblicata per ciascun modello. I crediti mensili non utilizzati non vengono riportati.

Ollama afferma che la modifica sostituisce la fatturazione del tempo GPU meno prevedibile e rimuove i precedenti limiti di cinque ore e settimanali. L'esecuzione di modelli su hardware personale rimane illimitata.

Il risultato è un prodotto ibrido. Ollama può essere un software locale gratuito, un'API a consumo o un abbonamento cloud mensile a seconda di come viene utilizzato.

Ollama Conserva i Dati Localmente?

Solo i modelli locali mantengono l'intero processo di inferenza sul dispositivo dell'utente. Quando un nome di modello porta una designazione cloud, la richiesta viene elaborata dall'infrastruttura di Ollama. L'azienda afferma che i prompt e le risposte cloud non vengono registrati, conservati o utilizzati per l'addestramento. La sua documentazione pubblicata afferma che il calcolo è ospitato principalmente negli Stati Uniti e in Europa, con Singapore utilizzato per un gruppo limitato di modelli Qwen.

Questa è una politica di zero conservazione dei dati, non di elaborazione locale.

La distinzione è importante per le aziende che lavorano con codice sorgente, materiale legale, registri dei clienti o ricerche interne. Una richiesta può essere protetta dalla politica sulla privacy di un provider e comunque attraversare il confine di rete di un'azienda.

Ollama consente agli utenti di disabilitare le sue funzioni cloud tramite impostazioni di configurazione. Facendo ciò si rimuove anche l'accesso ai modelli cloud e al servizio di ricerca web di Ollama. I team che richiedono un ambiente solo locale dovrebbero verificare questa impostazione piuttosto che presumere che ogni richiesta rimanga sulla macchina.

Claude Desktop Ora Può Eseguire Modelli Ollama

Ollama ha aggiunto il supporto per Claude Desktop il 25 agosto. Gli utenti possono configurare Ollama come gateway di terze parti e scegliere un modello locale o uno ospitato su Ollama Cloud.

Questo accordo può essere frainteso.

Un modello in esecuzione all'interno dell'interfaccia di Claude Desktop non è necessariamente un modello Claude. Anthropic fornisce l'interfaccia dell'applicazione, mentre Ollama fornisce il modello selezionato e il percorso di inferenza. La qualità dell'output, la gestione del contesto e il supporto degli strumenti dipendono quindi dal modello Ollama utilizzato.

L'aggiornamento è importante perché separa l'interfaccia AI dal provider AI. Gli utenti possono mantenere un ambiente di lavoro familiare cambiando il modello sottostante.

Un modello simile sta apparendo nel mercato degli sviluppatori. Ollama ora funziona con Codex, Claude Code, OpenCode e altri agenti di codifica. Il suo comando di avvio `ollama` aiuta a configurare questi strumenti senza richiedere agli sviluppatori di ricostruire i loro flussi di lavoro attorno a ciascun provider di modelli.

La Compatibilità OpenAI Rende il Passaggio Più Facile, Non Perfetto

Ollama supporta parti dell'API OpenAI. Le applicazioni esistenti possono puntare le richieste supportate verso un endpoint Ollama e utilizzare modelli aperti locali o cloud.

Il livello di compatibilità include completamenti di chat, streaming, embedding, input visivo, chiamate di strumenti e parti dell'API Responses. Ollama ha anche introdotto un endpoint sperimentale per la generazione di immagini.

"Compatibile" non significa identico. Alcuni campi e funzioni stateful di OpenAI non sono completamente supportati e il comportamento del modello può differire sostanzialmente. Gli sviluppatori devono ancora testare le chiamate agli strumenti, l'output strutturato, la lunghezza del contesto e la gestione degli errori prima di sostituire un endpoint di produzione.

Il vantaggio pratico è un minore attrito nella migrazione. Un'azienda può testare un modello aperto senza riscrivere la sua intera applicazione.

La Libreria Modelli è Andata Oltre Llama 3

 

Spiegazioni più vecchie di Ollama si concentrano spesso su Llama 3, Gemma 2, Phi-3 e Qwen 2.5. Quei modelli rimangono disponibili, ma la libreria si è espansa.

Le aggiunte recenti includono Gemma 4, Qwen 3.8, GLM 5.3, NVIDIA Nemotron 3.5 Lightning, Muse Glimmer e i più recenti modelli DeepSeek e Kimi. Alcuni sono progettati per agenti di codifica, input multimodale o uso prolungato di strumenti piuttosto che per semplici chat.

Non tutti i modelli possono essere scaricati ed eseguiti localmente. Alcune delle versioni più grandi sono disponibili solo tramite Ollama Cloud. Gli utenti dovrebbero controllare il tag del modello, la dimensione del download e la licenza invece di presumere che tutto nella libreria sia sia locale che illimitato.

Il software di Ollama stesso utilizza la licenza MIT, ma i singoli modelli conservano le licenze scelte dai loro creatori. I pesi aperti non concedono automaticamente un uso commerciale illimitato.

Il Modello di Business di Ollama Sta Diventando Più Chiaro

Ollama ha annunciato un round di finanziamento da 88 milioni di dollari nel luglio 2026. L'azienda afferma di servire ora 8,9 milioni di sviluppatori ed essere utilizzata nell'85% delle aziende Fortune 500. Queste cifre di adozione provengono da Ollama e non sono state verificate in modo indipendente, ma mostrano la portata delle sue ambizioni commerciali.

La strategia ha diverse parti: il software locale porta gli sviluppatori nell'ecosistema. La compatibilità API rende Ollama più facile da adottare. Le integrazioni lo collegano a strumenti di codifica consolidati. L'inferenza cloud monetizza gli utenti che necessitano di più calcolo di quanto il loro hardware possa fornire.

Questo non è insolito. Le aziende di infrastrutture open-source spesso mantengono il software principale accessibile mentre fanno pagare per l'hosting, la scalabilità e le funzionalità amministrative.

La tensione risiede nel posizionamento. Ollama è diventato popolare come alternativa all'IA cloud a consumo. Ora deve convincere gli utenti che il suo cloud offre prestazioni, privacy e scelta di modelli sufficienti a giustificare un'altra fattura per token.

Cosa è Diventato Ollama

Ollama rende ancora più facile l'IA locale. Questo rimane il suo più forte vantaggio di prodotto.

Ciò che è cambiato è il percorso disponibile dopo che l'hardware locale esaurisce lo spazio. Gli utenti non devono più lasciare l'ambiente Ollama per accedere a modelli più grandi, ricerca web o calcolo cloud. Possono passare dall'inferenza locale a quella ospitata mantenendo molti degli stessi strumenti.

Questa comodità comporta scelte che la storia originale solo locale non richiedeva. Gli utenti ora devono sapere dove viene eseguito ciascun modello, come vengono fatturati i token cloud e quale politica sulla privacy si applica a ciascuna richiesta.

Ollama non è più semplicemente un modo per evitare il cloud AI. Sta cercando di diventare lo strato che decide quando il cloud è necessario.

I lettori interessati alla sovrapposizione tra infrastruttura AI, cloud computing e mercati digitali possono trovare ulteriori ricerche su Tapbit. Gli utenti Tapbit possono accedere, mentre coloro che esplorano la piattaforma possono creare un account.

Domande Frequenti

Ollama è gratuito?

Ollama è gratuito quando i modelli vengono eseguiti sull'hardware dell'utente. Ollama Cloud ha un utilizzo iniziale gratuito ma addebita per l'inferenza cloud aggiuntiva.

Ollama addebita per token?

L'inferenza locale non comporta una commissione Ollama per token. I modelli cloud utilizzano prezzi per token pubblicati, con crediti di utilizzo mensili inclusi nei piani a pagamento.

Quanto costa Ollama Pro?

Ollama Pro costa $20 al mese o $200 all'anno secondo i prezzi pubblicati il 31 agosto 2026. Include $60 in crediti di utilizzo cloud mensili.

Dichiarazione di non responsabilità

Il trading di criptovalute comporta un rischio significativo di perdita. I prezzi sono altamente volatili e possono cambiare rapidamente. Le integrazioni di protocollo, le utilità dei token e le tempistiche del roadmap sono soggette a modifiche. Questo articolo è solo a scopo informativo e non costituisce un consiglio di investimento. Effettua sempre la tua ricerca (DYOR) e non investire mai più di quanto puoi permetterti di perdere completamente.

Padroneggia il Mercato delle Criptovalute

Ottieni risorse di esperti, tutorial e le ultime tendenze crypto. Registrati per iniziare a fare trading.