Ein Modell lokal auszuführen ist ein Download, und der Download bleibt. Jedes Werkzeug, das lokale Inferenz einfach macht, macht es auch einfach, noch ein Modell auszuprobieren, und keines davon sagt Ihnen, was sich im letzten Monat des Ausprobierens angesammelt hat. Auf den Macs, die wir scannen, ist die Kategorie KI-Modelle der größte Einzelposten bei allen, die einen Nachmittag mit Ollama verbracht haben, und es ist die Kategorie, die am meisten überrascht, weil nichts in den Werkzeugen eine Gesamtsumme zeigt.

Dieser Artikel behandelt, wo jedes Werkzeug seine Dateien ablegt, wie groß sie sind, warum Tests sie vervielfachen und welche Sie löschen können, ohne etwas zu verlieren, das Sie nicht zurückbekommen.

Wie groß ein Modell ist

Die Größe folgt aus Parameterzahl und Quantisierung. Als Faustregel für die Formate, die diese Werkzeuge laden:

Modellgröße 4-Bit (Ollama, MLX, die meisten GGUF) 8-Bit 16-Bit (Hugging Face safetensors wie veröffentlicht)
1 bis 3B 1 bis 2 GB 2 bis 3.5 GB 2.5 bis 7 GB
7 bis 9B 4 bis 5.5 GB 8 bis 9.5 GB 14 bis 18 GB
12 bis 14B 7 bis 9 GB 13 bis 15 GB 25 bis 30 GB
27 bis 35B 16 bis 20 GB 32 bis 36 GB 55 bis 70 GB
70B 38 bis 43 GB 70 bis 75 GB 130 bis 145 GB

Die Größen gelten nur für die Gewichte, gerundet, Stand September 2026. Ein Modell von Hugging Face, das nie quantisiert wurde, entspricht der 16-Bit-Spalte. Deshalb belegt ein unquantisiertes 8B-Modell mehr Platz als drei 4-Bit-Modelle.

Weitere Dateien, die mitkommen: Whisper large hat etwa 3 GB, Bildmodelle wie Stable Diffusion und Flux liegen bei 4 bis 25 GB pro Checkpoint, Embedding-Modelle bei je 0.3 bis 2 GB, und Vision-Language-Modelle bringen einen zweiten Encoder mit 1 bis 2 GB mit.

Wo jedes Werkzeug sie ablegt

Ollama legt alles unter ~/.ollama/models ab. Gewichte sind inhaltsadressierte Blobs, und ein Manifest pro Tag zeigt darauf, sodass zwei Tags derselben zugrunde liegenden Datei diese teilen. Zwei Quantisierungen desselben Modells tun das nicht. ollama list zeigt die Größe jedes Modells und ollama rm entfernt eines, und es gibt keinen Befehl, der zeigt, wie viel der ganze Ordner wiegt.

LM Studio legt heruntergeladene GGUF- und MLX-Dateien unter ~/.lmstudio/models ab (ältere Versionen nutzten ~/.cache/lm-studio/models), sortiert nach Herausgeber und Modell. Jeder Download ist eine vollständige Datei. Die Q4-, Q5- und Q8-Builds eines Modells auszuprobieren ergibt drei vollständige Kopien.

Hugging Face ist das Werkzeug, das die Leute überrascht. Die Bibliotheken transformers, diffusers, sentence-transformers und huggingface_hub laden alle nach ~/.cache/huggingface/hub, ein Ordner pro Repository, mit einem Snapshot pro Revision. Laden Sie ein Modell, und laden Sie es erneut, nachdem der Autor eine Korrektur veröffentlicht hat, haben Sie zwei Snapshots. Laden Sie ein Modell einmal in einem Skript, bleibt es für immer dort. huggingface-cli scan-cache gibt das Ganze mit Größen aus, und huggingface-cli delete-cache führt Sie durch das Entfernen von Revisionen. Datensätze landen unter ~/.cache/huggingface/datasets und können größer sein als die Modelle.

MLX auf Apple Silicon nutzt für mlx-community-Modelle denselben Hugging-Face-Hub-Cache. Wenn Sie ein Modell selbst mit mlx_lm.convert konvertiert haben, landete die Ausgabe dort, wohin Sie gezeigt haben, oft in einem Projektordner, und die ursprünglichen 16-Bit-Gewichte liegen weiterhin im Hub-Cache. Eine Konvertierung ist noch einmal die volle Größe des Modells.

Alles andere. Python-Umgebungen ziehen PyTorch mit 2 bis 4 GB pro venv, und ein Mac mit ein paar ML-Projekten hat ein paar davon. Der Model Runner von Docker und das Ollama-Docker-Image halten eigene Kopien im Disk-Image von Docker. Jupyter-Checkpoints und .ipynb_checkpoints-Ordner enthalten Kopien von Notebooks, einzeln klein und zahlreich.

Warum Tests das aufblähen

Ein Nachmittag Evaluation sieht so aus. Sie laden Llama 3.1 8B in Ollama, um es mit Qwen 2.5 7B zu vergleichen, 9 GB. Eines davon ist langsam, also probieren Sie den Q8-Build in LM Studio, 8 GB mehr. Ein Paper erwähnt ein 14B-Reasoning-Modell, 9 GB. Sie wollen einige Dokumente einbetten, also lädt ein Skript ein Embedding-Modell und, weil Sie das Beispiel kopiert haben, die 16-Bit-Version des Chat-Modells, mit dem es vorgeführt wurde, 15 GB. Sie probieren MLX, weil es auf diesem Mac schneller sein sollte, und die 4-Bit-Konvertierung sind weitere 4.5 GB neben dem 16-Bit-Original, aus dem sie erstellt wurde.

Das sind etwa 46 GB, fünf Werkzeuge und ein Modell, das Sie noch benutzen. Nichts in dieser Abfolge war ein Fehler. So funktioniert Evaluation. Der Unterschied zu einem Build-Cache ist, dass das Werkzeug nicht für Sie aufräumt, und dass die Dateien groß genug sind, dass eine Handvoll davon die Lücke zwischen einer bequemen und einer vollen Festplatte ausmacht.

Auf den Setups, die wir scannen, trägt der Mac eines KI-orientierten Entwicklers 80 GB oder mehr in dieser Kategorie. Ein Python- und ML-Engineer, der lokale Modelle gelegentlich nutzt, trägt immer noch 40 bis 50 GB. Siehe die vollständige Tabelle nach Setup.

Was sich gefahrlos löschen lässt

Alles davon kommt mit einem Download zurück. Deshalb stuft Cache Goblin jedes Modell als Wiederherstellbar ein und nicht als Sicher: Es listet sie auf, zeigt die Größe jedes Modells und fragt nach, bevor es sie in den Papierkorb legt. Nichts an einem heruntergeladenen Modell ist einzigartig für Ihren Mac.

Die Ausnahmen sind Dateien, die Sie selbst erstellt haben. Ein Fine-Tune, das Sie trainiert haben, LoRA-Adapter, ein Modell, das Sie mit Einstellungen konvertiert haben, die Sie erneut herausfinden müssten, ein GGUF, das Sie selbst mit einer imatrix quantisiert haben. Diese liegen neben den Downloads und sehen genauso aus, und Cache Goblin behandelt alle Gewichte in einem Projektordner, den Sie kürzlich angefasst haben, als Ihre und zeigt sie an, ohne anzubieten, sie zu entfernen.

Eine praktische Reihenfolge:

  1. ollama list und die Modelle entfernen, die Sie einmal ausprobiert haben. Behalten Sie das, das Sie tatsächlich aufrufen.
  2. huggingface-cli scan-cache und alte Revisionen sowie alles löschen, an dessen Download Sie sich nicht erinnern. Das ist meist die größte Zahl.
  3. Im Modellordner von LM Studio nach doppelten Quantisierungen eines Modells suchen und eine behalten.
  4. Im Hub-Cache nach einem 16-Bit-Original eines Modells suchen, das Sie nur als 4-Bit-MLX-Konvertierung ausführen.
  5. Python-Umgebungen für beendete Projekte löschen. PyTorch hat ein paar Gigabyte pro Kopie.

Oder führen Sie einen Scan aus. Cache Goblin listet Modelle von Ollama, LM Studio, Hugging Face und MLX nach Name und Größe an einem Ort auf, mit der Gesamtsumme, die die Werkzeuge Ihnen nie zeigen, und die Schaltfläche Wiederherstellbar entfernt die, die Sie auswählen.

Cache Goblin kostenlos für Mac laden und sehen, was Ihr Testnachmittag hinterlassen hat.