Wie viel RAM ein KI-Mini-PC braucht, hängt an einer einzigen Frage: Welches Modell willst du ausführen? Genau das entscheidet, ob 64 GB nötig sind. Für einen persönlichen Assistenten, Programmierhilfe und die Suche in einer überschaubaren Dokumentensammlung reichen meist 32 GB. Auf 64 GB solltest du erst dann gehen, wenn du Modelle der 30B-Klasse nutzen willst, mit langen Prompts arbeitest, mehrere Programme gleichzeitig offen hast oder größere Dokumentbestände durchsuchst. Mini PCs teilen sich den Speicher zudem anders auf als Desktops mit dedizierter Grafikkarte – deshalb greifen die üblichen Kaufregeln hier nicht.
Warum der Arbeitsspeicher als Erstes limitiert
Der RAM in einem KI-Mini-PC hat eine Aufgabe, die vor allem anderen kommt: Modellgewichte, Laufzeitumgebung und Betriebssystem müssen irgendwo Platz finden, bevor sich ein Modell überhaupt öffnen lässt. Die CPU-Geschwindigkeit zählt erst danach. Ein schnellerer Prozessor hilft dir nicht – ein 70B-Modell lädt schlicht nicht fertig, wenn der Arbeitsspeicher voll ist.
Das dreht die Reihenfolge beim Kauf um. Wähle zuerst die Größe des Modells, das du ausführen willst. Schaffe dann Platz für das Modell selbst, für den Verlauf deiner Unterhaltungen und für die Programme, die du ohnehin offen hast. Auf einem kleinen Rechner beeinflusst der RAM nicht nur das Multitasking, sondern entscheidet mit, welche Modelle überhaupt möglich sind.
Unified Memory: wie ein Mini PC den Speicher teilt
Ein Desktop mit eigener Grafikkarte hält zwei getrennte Speicher-Pools: CPU, normale Programme und das Betriebssystem nutzen den System-RAM, die Grafikkarte hat ihren eigenen, schnellen VRAM. Dieser separate Speicher lässt die GPU arbeiten, ohne den Arbeitsspeicher des Systems zu belegen.
Bei integrierter Grafik geht das nicht. Die Grafikeinheit der meisten Mini PCs bezieht ihren Speicher aus dem System-RAM – man spricht von Unified oder Shared Memory. Betriebssystem, Modell, Kontext-Cache und integrierte GPU schöpfen alle aus demselben Pool.
Auf einem Mini PC bedeutet mehr RAM also direkt mehr Raum für die integrierte Grafik – und das kann den Unterschied ausmachen, ob sich ein größeres Modell öffnen lässt oder gar nicht erst startet. Der Kompromiss heißt Geschwindigkeit: Dedizierter VRAM verarbeitet intensive Generierung in der Regel schneller. Shared Memory hat trotzdem seine Berechtigung, weil es in einem kleineren und wirtschaftlicheren Gerät deutlich mehr Kapazität bietet.
Der Haken ist bekannt: Wird ein Modell zu groß für den GPU-zugänglichen Teil, arbeiten CPU und Grafikeinheit abwechselnd daran. Das Modell öffnet zwar, gibt aber langsamer aus als eines, das im schnelleren Grafikpfad bleibt.

Wie viel Speicher braucht ein KI-Modell?
Bevor du rechnest, musst du Quantisierung verstehen. Ein Mini PC kann ein großes Modell selten in voller FP16-Präzision ausführen. Stattdessen speichert eine quantisierte Q4-Version jede Zahl in nur vier Bit – das verkleinert das Modell und liefert für die meisten Alltagsaufgaben weiterhin brauchbare Ergebnisse.
Als grobe Faustregel belegen Q4-Gewichte etwa 0,5 bis 0,6 GB pro Milliarde Parameter. Das sind nur die Modellgewichte. Betriebssystem und Inferenzprogramm brauchen ebenfalls Platz, und jede Unterhaltung baut einen KV-Cache auf. Eine kurze Frage kostet wenig Cache, umfangreiche Recherche oder Dokumentensuche kann viel Zusatzspeicher belegen. Der Arbeitsspeicherbedarf insgesamt wächst also – die Gewichte selbst bleiben gleich groß.
Was füllt deinen RAM beim Ausführen eines lokalen Modells
Nicht nur das Modell — auch das Betriebssystem und der wachsende Kontext brauchen Platz
Gesamter System-RAM
Betriebssystem
Modellgewichte
feste Größe (Modell + Quantisierung)
KV-Cache
wächst mit Kontext / Konversation
Frei
Reserve
Warum das wichtig ist
Ein Modell, dessen Gewichte „passen“, kann trotzdem den Speicher sprengen: lange Prompts, mehrstufige Chats und Dokumentsuche (RAG) lassen den KV-Cache wachsen. Plane immer Reserve ein — bemiss den RAM nie nur an den Modellgewichten.
Die folgende Tabelle ist nur als Orientierung gedacht. Das Ergebnis schwankt je nach Quantisierung, Runner, Kontexteinstellungen und Speicherzuteilung.
| Modellgröße | Q4-Speicher | Empfohlener RAM | In der Praxis |
|---|---|---|---|
| 7B–8B |
~4–5 GB VRAM / 8–10 GB CPU bzw. Shared Memory |
16 GB | Solider Einstieg für Chat, Zusammenfassungen und leichte Code-Hilfe |
| 13B–14B | ~8–11 GB | 16–32 GB | Mit Windows und Kontext-Cache wird 16 GB eng – 32 GB ist besser |
| 30B–34B | ~18–20 GB | 32 GB+ | Auf Shared-Memory-Systemen möglich, aber langsamer als kleinere Modelle |
| 70B | ~40–48 GB |
64 GB knapp 128 GB besser |
64 GB erfordert Feinjustierung und lässt kaum Spielraum |
Bei reinem CPU- oder Shared-Memory-Betrieb planst du am besten rund das Doppelte des reinen Gewichtswerts ein. Betriebssystem, Runner, Cache, Grafikzuteilung, Speicherfragmentierung und normale Programme fordern diesen Zusatz. Wenn du erst alles schließen musst, um ein Modell zu laden, macht die Arbeit am Gerät wenig Freude.
RAM-Guide für lokale KI: der Schnellüberblick
Wenn du KI-Modelle lokal betreiben willst, kannst du deinen Speicherbedarf in einem Satz zusammenfassen: Wähle den RAM nach dem größten Modell, das du regelmäßig nutzen willst. Die folgende Tabelle übersetzt typische Vorhaben direkt in eine Empfehlung – als schneller Einstieg, bevor es weiter unten ins Detail geht.
| Was du lokal machen willst | Modellklasse | Empfohlener RAM |
|---|---|---|
| Offline-Assistent, Chat, Zusammenfassungen | 7B–8B | 16 GB |
| Coding-Hilfe, längere Prompts, kleine Dokumentsuche | 13B–14B | 32 GB |
| Größere Modelle (30B), Retrieval, Multitasking | 30B | 64 GB |
| 70B-Modelle lokal im Alltag | 70B | 128 GB |
Kurz gesagt: 16 GB ist der Einstieg, 32 GB der Sweet Spot für die meisten, 64 GB der Schritt zu größeren Modellen und 128 GB die Wahl für regelmäßige 70B-Arbeit. Warum das so ist, zeigen die nächsten Abschnitte.
Was geht mit 16, 32, 64 und 128 GB?
16 GB – genug für den Einstieg
16 GB fasst viele Q4-Modelle mit 7B und 8B. Das ist gut, um offline kurze Schreibaufgaben, einfache Code-Erklärungen oder Dokumentzusammenfassungen zu erledigen und ein Gefühl für Ollama & Co. zu bekommen. Wie du ein Modell danach Schritt für Schritt einrichtest, zeigt dir unser Guide Lokale KI installieren. Es ist eher ein Einstiegspunkt als eine Reserve.
Der Spielraum schwindet schnell: Ein großes Browserfenster, eine Vektordatenbank, ein langer Prompt oder eine weitere speicherhungrige App – und der Rechner geht auf Anschlag. Spätestens wenn du deinen normalen Arbeitsbereich parallel offen halten willst, wird es eng.
32 GB – der Sweet Spot für die meisten
Für die meisten ist 32 GB im KI-Mini-PC das beste Preis-Leistungs-Verhältnis. Damit laufen 13B–14B-Modelle deutlich komfortabler, mit reichlich Platz für kleinere. Auch lange Prompts und einfache Dokumentsuchen werden angenehmer, und du kannst den Mini PC weiterhin wie einen normalen Arbeitsrechner nutzen.
Ein quantisiertes 30B-Modell ist gelegentlich möglich, kommt auf einem Shared-Memory-System aber nah an die Grenze. Wenn du ohnehin nur Code-Hilfe oder ein allgemeines Chat-Werkzeug willst, gibt es kaum einen Grund, über 32 GB hinauszugehen.
64 GB – mehr Raum für größere Aufgaben
64 GB ist die richtige Größe, wenn du viele kleinere Modelle bereithalten oder auf 30B aufsteigen willst. Sie erlaubt längere Kontexte und den Aufbau von Dokument-Retrieval, ohne den Rest des Rechners auszubremsen – und gibt der integrierten Grafik mehr Spielraum, weil diese sich den RAM teilt.
64 GB kann ein Q4-70B-Modell öffnen. Angenehm nutzbar ist das aber nicht zwangsläufig: kürzerer Kontext, straffere Quantisierung oder eine Aufteilung zwischen CPU und GPU werden nötig – und die Antworten kommen langsamer. Sieh 64 GB nicht als stabile Dauerlösung für 70B, sondern als Möglichkeit, 70B auszuprobieren.
Ein zusätzliches Argument für 64 GB: Es kann wirtschaftlicher sein, als den ganzen Mini PC zu früh ersetzen zu müssen – die richtige Wahl ist es aber trotzdem nicht für jeden.
128 GB – für 70B im Alltag
128 GB richtet sich an alle, die 70B-Modelle regelmäßig ausführen, ein breiteres Spektrum an Mixture-of-Experts-Optionen nutzen, mehrere Dienste parallel betreiben, mit vielen Dokumenten arbeiten oder entwickeln, ohne den PC lahmzulegen. Die meisten Einstiegs-Mini-PCs schaffen so viel Speicher nicht, einige High-End-Modelle schon.
128 GB brauchst du nicht, wenn du vor allem einen 7B- oder 14B-Assistenten nutzt. Für schwere, wiederkehrende Workloads lohnt es sich – bleiben deine Modelle klein und füllst du den vorhandenen Speicher selten, sind 32 oder 64 GB meist die wirtschaftlichere Wahl.
Ein Modell laden ≠ es flüssig nutzen
Wie schnell Text erscheint, siehst du an den Tokens pro Sekunde (tok/s). Ein geladenes Modell kann trotzdem quälend langsam sein – etwa durch Aufteilung zwischen CPU und GPU, einen großen Kontext-Cache oder ineffiziente Software. Für eine Zusammenfassung, die im Hintergrund fertig wird, sind 1–3 tok/s in Ordnung. Im Live-Chat ist Warten dagegen zäh.
Die folgenden Werte sind illustrativ, keine gemessenen Ergebnisse eines bestimmten Geräts. Sie gehen von Q4-Modellen auf einem dafür geeigneten AMD-Ryzen-AI-Mini-PC aus und variieren mit Chip, Speicherbandbreite, Promptlänge, Kontextgröße, Runner und GPU-Offload.
| Modellgröße | Ausgabetempo (Q4) & Praxisgefühl |
|---|---|
| 7B | ~35–45 tok/s – flott genug für Chat und kurze Code-Aufgaben |
| 13B | ~20–30 tok/s – angenehm für Alltag-Chat und Coding |
| 30B | ~12–18 tok/s – spürbar langsamer, aber nutzbar |
| 70B | ~5–9 tok/s – nur für geduldige Batch-Arbeit, zu langsam für Live-Chat |
Vor dem Kauf zählen zwei Dinge: Der Rechner muss das Modell öffnen können – und schnell genug antworten. Wer Kapazität über Tempo stellt, muss mit Wartezeit leben.
RAM ist nicht alles: NPU, Bandbreite und Aufrüstbarkeit
So wichtig der Speicher ist – er ist nicht der einzige Faktor. Neuere AMD-Ryzen-AI-Chips bringen eine NPU mit, sofern die Software sie nutzt. Schnellere Antworten sind aber nicht garantiert, nur weil ein „NPU“-Logo auf dem Prozessor prangt: Viele Textprogramme setzen weiter auf CPU und integrierte Grafik.
Bei Shared Memory zählt die Bandbreite. Achte auf Dual-Channel-Bestückung, weil sich CPU und integrierte Grafik denselben RAM teilen. Auch die Aufrüstbarkeit ist ein Thema: Fest verlöteter Speicher lässt sich nicht erweitern, SO-DIMM-Steckplätze schon. Und eine NVMe-SSD ersetzt keinen RAM, beschleunigt aber das Laden von Dateien und die Dokumentsuche.
Mit zwei Speicher-Slots, XDNA-2-NPU, Radeon-890M-Grafik und wahlweise Ryzen AI 9 HX 370 oder HX 470 ist der GEEKOM A9 Max eine kompakte Option. Brauchst du mehr Speicher, prüfe die genaue Version, die in deiner Region verkauft wird.

FAQ
Reichen 32 GB für einen KI-Mini-PC?
Für die meisten ja. Damit laufen quantisierte 7B- bis 14B-Modelle, Offline-Assistenten, Coding und die Suche in kleineren Dokumentbeständen gut. Eng wird es bei 30B-Modellen, sehr langen Kontexten oder vielen speicherhungrigen Diensten.
Läuft ein 70B-Modell mit 64 GB?
Ja, aber nur knapp: Mit Q4 und sorgfältigen Einstellungen lädt es – allerdings langsam. Für regelmäßige 70B-Arbeit statt gelegentlichem Ausprobieren solltest du zu einem 128-GB-Gerät greifen.
Ist Shared System-RAM dasselbe wie dedizierter VRAM?
Nicht ganz. Shared RAM gibt der integrierten Grafik einen größeren Pool und erhöht so die Kapazität – die Spitzengeschwindigkeit von dediziertem VRAM auf einer separaten Grafikkarte erreichst du damit aber nicht.
Macht die NPU eines Mini PCs Textmodelle schneller?
Nicht von allein. Für Tempo zählen auch Runner, Modellformat, CPU, integrierte Grafik und Speicherbandbreite. Prüfe, ob deine Software die Hardware wirklich unterstützt, bevor du die NPU zum Kaufkriterium machst.
Fazit: Erst das Modell, dann den Speicher
Die Regel ist einfach: Entscheide zuerst, welches Modell du ausführen willst, und bemesse dann den RAM deines KI Mini PCs so, dass er es bequem fasst. Stimmt diese Reihenfolge, ergibt sich die passende Kapazität – 32, 64 oder 128 GB – ganz von selbst.
























