Faire tourner un modèle en local, c’est un téléchargement, et le téléchargement reste. Chaque outil qui rend l’inférence locale facile rend aussi facile d’essayer un modèle de plus, et aucun ne vous dit ce que le dernier mois d’essais a fini par peser. Sur les Mac que nous scannons, la catégorie des modèles d’IA est le plus gros poste pour quiconque a passé un après-midi avec Ollama, et c’est celui qui surprend le plus, parce que rien dans les outils n’affiche un total.
Cet article explique où chaque outil garde ses fichiers, leur taille, pourquoi les tests les multiplient, et lesquels vous pouvez supprimer sans perdre quoi que ce soit d’irrécupérable.
La taille d’un modèle
La taille dépend du nombre de paramètres et de la quantification. En règle générale, pour les formats que ces outils téléchargent :
| Taille du modèle | 4 bits (Ollama, MLX, la plupart des GGUF) | 8 bits | 16 bits (safetensors Hugging Face tels que publiés) |
|---|---|---|---|
| 1 à 3B | 1 à 2 GB | 2 à 3.5 GB | 2.5 à 7 GB |
| 7 à 9B | 4 à 5.5 GB | 8 à 9.5 GB | 14 à 18 GB |
| 12 à 14B | 7 à 9 GB | 13 à 15 GB | 25 à 30 GB |
| 27 à 35B | 16 à 20 GB | 32 à 36 GB | 55 à 70 GB |
| 70B | 38 à 43 GB | 70 à 75 GB | 130 à 145 GB |
Les tailles concernent les poids seuls, arrondies, en septembre 2026. Un modèle Hugging Face qui n’a jamais été quantifié correspond à la colonne 16 bits, ce qui explique qu’un seul modèle 8B non quantifié prenne plus de place que trois modèles en 4 bits.
D’autres fichiers voyagent avec eux : Whisper large fait environ 3 GB, les modèles d’image comme Stable Diffusion et Flux pèsent 4 à 25 GB par checkpoint, les modèles d’embedding font 0.3 à 2 GB chacun, et les modèles vision-langage embarquent un second encodeur de 1 à 2 GB.
Où chaque outil les range
Ollama garde tout sous ~/.ollama/models. Les poids sont des blobs adressés par contenu, et un manifeste par tag pointe vers eux, si bien que deux tags du même fichier sous-jacent le partagent. Deux quantifications du même modèle, non. ollama list affiche la taille de chaque modèle et ollama rm en supprime un, et il n’existe aucune commande qui montre ce que pèse le dossier entier.
LM Studio garde les fichiers GGUF et MLX téléchargés sous ~/.lmstudio/models (les anciennes versions utilisaient ~/.cache/lm-studio/models), organisés par éditeur et par modèle. Chaque téléchargement est un fichier complet. Essayer les builds Q4, Q5 et Q8 d’un même modèle, c’est trois copies complètes.
Hugging Face est celui qui surprend. Les bibliothèques transformers, diffusers, sentence-transformers et huggingface_hub téléchargent toutes dans ~/.cache/huggingface/hub, un dossier par dépôt, avec un snapshot par révision. Récupérez un modèle, puis récupérez-le à nouveau après que l’auteur a poussé un correctif, et vous avez deux snapshots. Chargez un modèle dans un script une seule fois et il est là pour de bon. huggingface-cli scan-cache affiche le tout avec les tailles, et huggingface-cli delete-cache vous guide pour supprimer des révisions. Les datasets vont dans ~/.cache/huggingface/datasets et peuvent être plus gros que les modèles.
MLX sur Apple silicon utilise le même cache du hub Hugging Face pour les modèles mlx-community. Si vous avez converti un modèle vous-même avec mlx_lm.convert, le résultat a atterri là où vous l’avez indiqué, souvent un dossier de projet, et les poids 16 bits d’origine sont toujours dans le cache du hub. Une conversion, c’est à nouveau la taille complète du modèle.
Tout le reste. Les environnements Python embarquent PyTorch à 2 à 4 GB par venv, et un Mac avec quelques projets de ML en a quelques-uns. Le model runner de Docker et l’image Docker d’Ollama gardent leurs propres copies dans l’image disque de Docker. Les checkpoints Jupyter et les dossiers .ipynb_checkpoints contiennent des copies de notebooks, petites une par une et nombreuses.
Pourquoi les tests font gonfler le tout
Un après-midi d’évaluation ressemble à ceci. Vous récupérez Llama 3.1 8B dans Ollama pour le comparer à Qwen 2.5 7B, 9 GB. L’un des deux est lent, alors vous essayez le build Q8 dans LM Studio, 8 GB de plus. Un article mentionne un modèle de raisonnement 14B, 9 GB. Vous voulez vectoriser des documents, alors un script télécharge un modèle d’embedding et, parce que vous avez copié l’exemple, la version 16 bits du modèle de chat avec lequel il était présenté, 15 GB. Vous essayez MLX parce que ce devrait être plus rapide sur ce Mac, et la conversion 4 bits ajoute 4.5 GB à côté de l’original 16 bits dont elle est issue.
Cela fait environ 46 GB, cinq outils, et un seul modèle que vous utilisez encore. Rien dans cette séquence n’était une erreur. C’est ainsi que fonctionne l’évaluation. La différence avec un cache de build, c’est que l’outil ne le nettoiera pas pour vous, et que les fichiers sont assez gros pour qu’une poignée d’entre eux fasse l’écart entre un disque confortable et un disque plein.
Sur les configurations que nous scannons, le Mac d’un développeur orienté IA porte 80 GB ou plus dans cette catégorie. Un ingénieur Python et ML qui utilise des modèles locaux à l’occasion en porte encore 40 à 50 GB. Voir le tableau complet par configuration.
Ce qui peut être supprimé sans risque
Tout revient avec un téléchargement, et c’est pourquoi Cache Goblin classe chaque modèle comme Restaurable plutôt que Sûr : il les liste, affiche la taille de chacun, et demande confirmation avant de les déplacer vers la Corbeille. Rien dans un modèle téléchargé n’est propre à votre Mac.
Les exceptions sont les fichiers que vous avez créés. Un fine-tune que vous avez entraîné, des adaptateurs LoRA, un modèle converti avec des réglages qu’il faudrait retrouver, un GGUF que vous avez quantifié vous-même avec une imatrix. Ils vivent à côté des téléchargements et leur ressemblent, et Cache Goblin considère tout poids situé dans un dossier de projet que vous avez touché récemment comme le vôtre et l’affiche sans proposer de le supprimer.
Un ordre pratique :
ollama list, puis supprimez les modèles essayés une seule fois. Gardez celui que vous appelez vraiment.huggingface-cli scan-cache, puis supprimez les anciennes révisions et tout ce dont vous ne vous souvenez pas avoir téléchargé. C’est généralement le plus gros chiffre.- Cherchez dans le dossier des modèles de LM Studio les quantifications en double d’un même modèle et n’en gardez qu’une.
- Vérifiez dans le cache du hub s’il reste un original 16 bits d’un modèle que vous n’exécutez jamais autrement qu’en conversion MLX 4 bits.
- Supprimez les environnements Python des projets terminés. PyTorch, c’est quelques gigaoctets par copie.
Ou lancez un scan. Cache Goblin liste les modèles Ollama, LM Studio, Hugging Face et MLX par nom et par taille au même endroit, avec le total que les outils ne vous montrent jamais, et le bouton Restaurable supprime ceux que vous choisissez.
Téléchargez Cache Goblin gratuitement pour Mac et voyez ce que votre après-midi de tests a laissé derrière lui.