Ollama construiu sua reputação em uma proposta de valor direta: baixe um modelo aberto, execute-o localmente e mantenha seus dados fora da nuvem.
Essa descrição ainda se mantém, mas não captura mais o quadro completo.
Em 31 de agosto de 2026, Ollama introduziu planos de nuvem baseados em preços por token. Dias antes, adicionou suporte para executar modelos Ollama via Claude Desktop. A plataforma agora oferece inferência na nuvem, pesquisa na web, integrações com agentes de codificação e contas pagas para equipes, além do software local original.
Ollama não abandonou a IA local — está construindo um negócio em torno do ponto em que o hardware local não atende mais a todas as necessidades do usuário.
Ollama Local Ainda é Gratuito

O software Ollama principal permanece disponível sob a licença MIT. Os usuários podem baixar modelos e executá-los em seu próprio hardware sem pagar a Ollama por cada prompt.
O aplicativo lida com downloads de modelos, armazenamento e detecção de hardware. Ele também expõe uma API local, para que outros aplicativos possam usar o modelo instalado.
Essa abordagem funciona bem para análise de documentos privados, assistentes offline, desenvolvimento de software e experimentos que se tornariam caros através de uma API medida. Executar um modelo localmente também dá aos usuários mais controle sobre a seleção do modelo, prompts do sistema e armazenamento.
Ainda há um custo, apenas não uma conta de uso do Ollama. Modelos maiores exigem mais memória, armazenamento e eletricidade. Um modelo pequeno pode rodar em um laptop comum, enquanto um modelo grande de raciocínio ou multimodal pode exigir uma GPU ou estação de trabalho cara.
A IA local transfere o custo de tokens de nuvem para hardware.
Ollama Cloud Muda o Cálculo
Ollama Cloud foi criado para modelos que não cabem confortavelmente em computadores pessoais. Ele permite que os usuários mantenham as mesmas ferramentas de linha de comando e APIs, movendo a inferência para hardware de data center.
Essa conveniência muda duas partes importantes da proposta original: preço e localização dos dados.
O uso da nuvem é medido em tokens. Uma vez que a cota incluída seja esgotada, os usuários podem comprar mais uso à taxa publicada para cada modelo. Créditos mensais não utilizados não são acumulados.
Ollama afirma que a mudança substitui a cobrança de tempo de GPU menos previsível e remove os limites anteriores de cinco horas e semanais. Executar modelos em hardware pessoal permanece ilimitado.
O resultado é um produto híbrido. Ollama pode ser um software local gratuito, uma API de modelo paga conforme o uso ou uma assinatura mensal de nuvem, dependendo de como é usado.
Ollama Mantém os Dados Locais?
Apenas modelos locais mantêm todo o processo de inferência no dispositivo do usuário. Quando um nome de modelo carrega uma designação de nuvem, a solicitação é processada pela infraestrutura do Ollama. A empresa afirma que prompts e respostas na nuvem não são registrados, retidos ou usados para treinamento. Sua documentação publicada afirma que a computação é hospedada principalmente nos Estados Unidos e Europa, com Singapura usada para um grupo limitado de modelos Qwen.
Essa é uma política de retenção zero de dados, não processamento local.
A distinção é importante para empresas que trabalham com código-fonte, material legal, registros de clientes ou pesquisa interna. Uma solicitação pode ser protegida pela política de privacidade de um provedor e ainda assim cruzar a fronteira da rede de uma empresa.
Ollama permite que os usuários desabilitem suas funções de nuvem através de configurações. Fazer isso também remove o acesso a modelos de nuvem e ao serviço de pesquisa na web do Ollama. Equipes que exigem um ambiente exclusivamente local devem verificar essa configuração em vez de assumir que cada solicitação permanece na máquina.
Claude Desktop Agora Pode Executar Modelos Ollama
Ollama adicionou suporte ao Claude Desktop em 25 de agosto. Os usuários podem configurar o Ollama como um gateway de terceiros e escolher um modelo local ou um hospedado no Ollama Cloud.
Esse arranjo pode ser mal compreendido.
Um modelo rodando dentro da interface do Claude Desktop não é necessariamente um modelo Claude. A Anthropic fornece a interface do aplicativo, enquanto Ollama fornece o modelo selecionado e a rota de inferência. A qualidade da saída, o manuseio de contexto e o suporte a ferramentas, portanto, dependem do modelo Ollama em uso.
A atualização é importante porque separa a interface de IA do provedor de IA. Os usuários podem manter um espaço de trabalho familiar enquanto mudam o modelo por baixo dele.
Um padrão semelhante está aparecendo em todo o mercado de desenvolvedores. Ollama agora funciona com Codex, Claude Code, OpenCode e outros agentes de codificação. Seu comando de inicialização `ollama` ajuda a configurar essas ferramentas sem exigir que os desenvolvedores reconstruam seus fluxos de trabalho em torno de cada provedor de modelo.
Compatibilidade com OpenAI Facilita a Troca, Mas Não é Perfeita
Ollama suporta partes do formato da API OpenAI. Aplicações existentes podem apontar solicitações suportadas para um endpoint Ollama e usar modelos abertos locais ou na nuvem.
A camada de compatibilidade inclui completações de chat, streaming, embeddings, entrada de visão, chamadas de ferramentas e partes da API de Respostas. Ollama também introduziu um endpoint experimental de geração de imagens.
“Compatível” não significa idêntico. Alguns campos e funções com estado do OpenAI não são totalmente suportados, e o comportamento do modelo pode diferir substancialmente. Os desenvolvedores ainda precisam testar chamadas de ferramentas, saída estruturada, comprimento de contexto e tratamento de erros antes de substituir um endpoint de produção.
A vantagem prática é menor atrito na migração. Uma empresa pode testar um modelo aberto sem reescrever toda a sua aplicação.
A Biblioteca de Modelos Ultrapassou o Llama 3
Explicações mais antigas do Ollama frequentemente se concentram em Llama 3, Gemma 2, Phi-3 e Qwen 2.5. Esses modelos permanecem disponíveis, mas a biblioteca se expandiu.
Adições recentes incluem Gemma 4, Qwen 3.8, GLM 5.3, NVIDIA Nemotron 3.5 Lightning, Muse Glimmer e modelos mais novos de DeepSeek e Kimi. Alguns são projetados para agentes de codificação, entrada multimodal ou uso de ferramentas de longa duração, em vez de chat simples.
Nem todo modelo pode ser baixado e executado localmente. Algumas das maiores versões estão disponíveis apenas através do Ollama Cloud. Os usuários devem verificar a tag do modelo, o tamanho do download e a licença, em vez de assumir que tudo na biblioteca é local e irrestrito.
O próprio software do Ollama usa a licença MIT, mas modelos individuais retêm as licenças escolhidas por seus criadores. Pesos abertos não concedem automaticamente uso comercial irrestrito.
O Modelo de Negócios do Ollama Está Ficando Mais Claro
Ollama anunciou uma rodada de financiamento de US$ 88 milhões em julho de 2026. A empresa afirma que agora atende a 8,9 milhões de desenvolvedores e é usada em 85% das empresas da Fortune 500. Esses números de adoção vêm do Ollama e não foram auditados independentemente, mas mostram a escala de suas ambições comerciais.
A estratégia tem várias partes: o software local atrai desenvolvedores para o ecossistema. A compatibilidade da API torna o Ollama mais fácil de adotar. As integrações o conectam a ferramentas de codificação estabelecidas. A inferência na nuvem monetiza usuários que precisam de mais computação do que seu próprio hardware pode fornecer.
Isso não é incomum. Empresas de infraestrutura de código aberto geralmente mantêm o software principal acessível enquanto cobram por hospedagem, escala e recursos administrativos.
A tensão reside no posicionamento. Ollama se tornou popular como uma alternativa à IA na nuvem medida. Agora, deve convencer os usuários de que sua própria nuvem oferece desempenho, privacidade e escolha de modelos suficientes para justificar outra conta de token.
O Que Ollama Se Tornou
Ollama ainda torna a IA local mais fácil. Essa continua sendo sua vantagem de produto mais forte.
O que mudou é o caminho disponível depois que o hardware local fica sem espaço. Os usuários não precisam mais sair do ambiente Ollama para acessar modelos maiores, pesquisa na web ou computação em nuvem. Eles podem alternar entre inferência local e hospedada, mantendo muitas das mesmas ferramentas.
Essa conveniência vem com escolhas que a história original exclusivamente local não exigia. Os usuários agora precisam saber onde cada modelo é executado, como os tokens da nuvem são cobrados e qual política de privacidade se aplica a cada solicitação.
Ollama não é mais simplesmente uma maneira de evitar a nuvem de IA. Ele está tentando se tornar a camada que decide quando a nuvem é necessária.
Leitores que acompanham a sobreposição entre infraestrutura de IA, computação em nuvem e mercados digitais podem encontrar mais pesquisas em Tapbit. Usuários do Tapbit podem fazer login, enquanto aqueles que exploram a plataforma podem criar uma conta.
Perguntas Frequentes
Ollama é gratuito?
Ollama é gratuito quando os modelos são executados no hardware do usuário. Ollama Cloud tem uso inicial gratuito, mas cobra por inferência adicional na nuvem.
Ollama cobra por token?
A inferência local não tem taxa por token do Ollama. Modelos na nuvem usam preços por token publicados, com créditos de uso mensais incluídos nos planos pagos.
Quanto custa o Ollama Pro?
Ollama Pro custa US$ 20 por mês ou US$ 200 por ano, de acordo com os preços publicados em 31 de agosto de 2026. Ele inclui US$ 60 em créditos de uso na nuvem por mês.

