Rodar um modelo localmente é um download, e o download fica. Toda ferramenta que facilita a inferência local também facilita testar mais um modelo, e nenhuma delas diz quanto o último mês de testes acumulou. Nos Macs que varremos, a categoria de modelos de IA é o maior item individual para qualquer pessoa que passou uma tarde com o Ollama, e é a que mais surpreende, porque nada nas ferramentas mostra um total.

Este artigo cobre onde cada ferramenta guarda seus arquivos, qual o tamanho deles, por que os testes os multiplicam e quais você pode apagar sem perder nada que não possa recuperar.

Qual o tamanho de um modelo

O tamanho segue a contagem de parâmetros e a quantização. Como regra geral para os formatos que essas ferramentas baixam:

Tamanho do modelo 4 bits (Ollama, MLX, maioria dos GGUF) 8 bits 16 bits (safetensors do Hugging Face como publicados)
1 a 3B 1 a 2 GB 2 a 3.5 GB 2.5 a 7 GB
7 a 9B 4 a 5.5 GB 8 a 9.5 GB 14 a 18 GB
12 a 14B 7 a 9 GB 13 a 15 GB 25 a 30 GB
27 a 35B 16 a 20 GB 32 a 36 GB 55 a 70 GB
70B 38 a 43 GB 70 a 75 GB 130 a 145 GB

Os tamanhos são apenas dos pesos, arredondados, em setembro de 2026. Um modelo do Hugging Face que nunca foi quantizado está na coluna de 16 bits, e é por isso que um único modelo 8B sem quantização ocupa mais espaço do que três de 4 bits.

Outros arquivos que vêm junto: o Whisper large tem cerca de 3 GB, modelos de imagem como Stable Diffusion e Flux ficam entre 4 e 25 GB por checkpoint, modelos de embedding têm de 0.3 a 2 GB cada, e modelos de visão e linguagem trazem um segundo encoder de 1 a 2 GB.

Onde cada ferramenta os coloca

Ollama guarda tudo em ~/.ollama/models. Os pesos são blobs endereçados por conteúdo, e um manifesto por tag aponta para eles, então duas tags do mesmo arquivo subjacente o compartilham. Duas quantizações do mesmo modelo, não. ollama list mostra o tamanho de cada modelo e ollama rm remove um deles, e não há comando que mostre quanto pesa a pasta inteira.

LM Studio guarda os arquivos GGUF e MLX baixados em ~/.lmstudio/models (versões antigas usavam ~/.cache/lm-studio/models), organizados por publicador e modelo. Cada download é um arquivo completo. Testar os builds Q4, Q5 e Q8 de um modelo são três cópias inteiras.

Hugging Face é a que surpreende as pessoas. As bibliotecas transformers, diffusers, sentence-transformers e huggingface_hub baixam tudo para ~/.cache/huggingface/hub, uma pasta por repositório, com um snapshot por revisão. Baixe um modelo, depois baixe de novo após o autor publicar uma correção, e você tem dois snapshots. Carregue um modelo num script uma vez e ele fica lá para sempre. huggingface-cli scan-cache imprime tudo com tamanhos, e huggingface-cli delete-cache guia você na remoção de revisões. Os datasets vão para ~/.cache/huggingface/datasets e podem ser maiores que os modelos.

MLX no Apple silicon usa o mesmo cache do hub do Hugging Face para modelos mlx-community. Se você converteu um modelo por conta própria com mlx_lm.convert, a saída foi parar onde você apontou, muitas vezes uma pasta de projeto, e os pesos originais de 16 bits continuam no cache do hub. Uma conversão é o tamanho completo do modelo outra vez.

Todo o resto. Ambientes Python puxam o PyTorch com 2 a 4 GB por venv, e um Mac com alguns projetos de ML tem vários deles. O model runner do Docker e a imagem Docker do Ollama mantêm cópias próprias dentro da imagem de disco do Docker. Checkpoints do Jupyter e pastas .ipynb_checkpoints guardam cópias de notebooks, pequenas individualmente e numerosas.

Por que os testes incham tudo

Uma tarde de avaliação se parece com isto. Você baixa o Llama 3.1 8B no Ollama para comparar com o Qwen 2.5 7B, 9 GB. Um deles é lento, então você testa o build Q8 no LM Studio, mais 8 GB. Um artigo menciona um modelo de raciocínio 14B, 9 GB. Você quer gerar embeddings de alguns documentos, então um script baixa um modelo de embedding e, como você copiou o exemplo, a versão de 16 bits do modelo de chat com que ele foi demonstrado, 15 GB. Você testa o MLX porque deveria ser mais rápido neste Mac, e a conversão de 4 bits são outros 4.5 GB ao lado do original de 16 bits do qual ela foi feita.

Isso dá cerca de 46 GB, cinco ferramentas e um modelo que você ainda usa. Nada nessa sequência foi um erro. É assim que a avaliação funciona. A diferença em relação a um cache de build é que a ferramenta não vai limpar isso para você, e os arquivos são grandes o suficiente para que um punhado deles seja a diferença entre um disco folgado e um disco cheio.

Nas configurações que varremos, o Mac de um desenvolvedor focado em IA carrega 80 GB ou mais nessa categoria. Um engenheiro de Python e ML que usa modelos locais de vez em quando ainda carrega 40 a 50 GB. Veja a tabela completa por configuração.

O que é seguro apagar

Tudo isso volta com um download, e é por isso que o Cache Goblin classifica cada modelo como Restaurável em vez de Seguro: ele lista os modelos, mostra o tamanho de cada um e pergunta antes de movê-los para o Lixo. Nada num modelo baixado é único do seu Mac.

As exceções são arquivos que você criou. Um fine-tune que você treinou, adaptadores LoRA, um modelo que você converteu com configurações que teria de descobrir de novo, um GGUF que você mesmo quantizou com um imatrix. Eles ficam ao lado dos downloads e parecem iguais, e o Cache Goblin trata quaisquer pesos dentro de uma pasta de projeto que você mexeu recentemente como seus e os mostra sem oferecer a remoção.

Uma ordem prática:

  1. ollama list e remova os modelos que você testou uma vez. Mantenha o que você de fato usa.
  2. huggingface-cli scan-cache e apague revisões antigas e qualquer coisa que você não lembra de ter baixado. Esse costuma ser o maior número.
  3. Procure na pasta de modelos do LM Studio quantizações duplicadas de um mesmo modelo e mantenha uma.
  4. Verifique no cache do hub se há um original de 16 bits de um modelo que você só roda como conversão MLX de 4 bits.
  5. Apague ambientes Python de projetos que terminaram. O PyTorch são alguns gigabytes por cópia.

Ou execute uma varredura. O Cache Goblin lista os modelos do Ollama, LM Studio, Hugging Face e MLX por nome e tamanho num só lugar, com o total que as ferramentas nunca mostram, e o botão Restaurável remove os que você escolher.

Baixe o Cache Goblin grátis para Mac e veja o que sua tarde de testes deixou para trás.