KI-Mini-PC mit 64 GB RAM – brauchst du wirklich so viel?

Contents
KI-Mini-PC mit 64 GB RAM – brauchst du wirklich so viel?

Wie viel RAM ein KI-Mini-PC braucht, hängt an einer einzigen Frage: Welches Modell willst du ausführen? Genau das entscheidet, ob 64 GB nötig sind. Für einen persönlichen Assistenten, Programmierhilfe und die Suche in einer überschaubaren Dokumentensammlung reichen meist 32 GB. Auf 64 GB solltest du erst dann gehen, wenn du Modelle der 30B-Klasse nutzen willst, mit langen Prompts arbeitest, mehrere Programme gleichzeitig offen hast oder größere Dokumentbestände durchsuchst. Mini PCs teilen sich den Speicher zudem anders auf als Desktops mit dedizierter Grafikkarte – deshalb greifen die üblichen Kaufregeln hier nicht.

Warum der Arbeitsspeicher als Erstes limitiert

Der RAM in einem KI-Mini-PC hat eine Aufgabe, die vor allem anderen kommt: Modellgewichte, Laufzeitumgebung und Betriebssystem müssen irgendwo Platz finden, bevor sich ein Modell überhaupt öffnen lässt. Die CPU-Geschwindigkeit zählt erst danach. Ein schnellerer Prozessor hilft dir nicht – ein 70B-Modell lädt schlicht nicht fertig, wenn der Arbeitsspeicher voll ist.

Das dreht die Reihenfolge beim Kauf um. Wähle zuerst die Größe des Modells, das du ausführen willst. Schaffe dann Platz für das Modell selbst, für den Verlauf deiner Unterhaltungen und für die Programme, die du ohnehin offen hast. Auf einem kleinen Rechner beeinflusst der RAM nicht nur das Multitasking, sondern entscheidet mit, welche Modelle überhaupt möglich sind.

Mehr lesen: Was ist RAM? So beeinflusst der Arbeitsspeicher die Leistung Ihres Computers

Unified Memory: wie ein Mini PC den Speicher teilt

Ein Desktop mit eigener Grafikkarte hält zwei getrennte Speicher-Pools: CPU, normale Programme und das Betriebssystem nutzen den System-RAM, die Grafikkarte hat ihren eigenen, schnellen VRAM. Dieser separate Speicher lässt die GPU arbeiten, ohne den Arbeitsspeicher des Systems zu belegen.

Bei integrierter Grafik geht das nicht. Die Grafikeinheit der meisten Mini PCs bezieht ihren Speicher aus dem System-RAM – man spricht von Unified oder Shared Memory. Betriebssystem, Modell, Kontext-Cache und integrierte GPU schöpfen alle aus demselben Pool.

Auf einem Mini PC bedeutet mehr RAM also direkt mehr Raum für die integrierte Grafik – und das kann den Unterschied ausmachen, ob sich ein größeres Modell öffnen lässt oder gar nicht erst startet. Der Kompromiss heißt Geschwindigkeit: Dedizierter VRAM verarbeitet intensive Generierung in der Regel schneller. Shared Memory hat trotzdem seine Berechtigung, weil es in einem kleineren und wirtschaftlicheren Gerät deutlich mehr Kapazität bietet.

Der Haken ist bekannt: Wird ein Modell zu groß für den GPU-zugänglichen Teil, arbeiten CPU und Grafikeinheit abwechselnd daran. Das Modell öffnet zwar, gibt aber langsamer aus als eines, das im schnelleren Grafikpfad bleibt.

Wie ein Mini-PC den Arbeitsspeicher nutzt - Unified vs. dediziert

Wie viel Speicher braucht ein KI-Modell?

Bevor du rechnest, musst du Quantisierung verstehen. Ein Mini PC kann ein großes Modell selten in voller FP16-Präzision ausführen. Stattdessen speichert eine quantisierte Q4-Version jede Zahl in nur vier Bit – das verkleinert das Modell und liefert für die meisten Alltagsaufgaben weiterhin brauchbare Ergebnisse.

Als grobe Faustregel belegen Q4-Gewichte etwa 0,5 bis 0,6 GB pro Milliarde Parameter. Das sind nur die Modellgewichte. Betriebssystem und Inferenzprogramm brauchen ebenfalls Platz, und jede Unterhaltung baut einen KV-Cache auf. Eine kurze Frage kostet wenig Cache, umfangreiche Recherche oder Dokumentensuche kann viel Zusatzspeicher belegen. Der Arbeitsspeicherbedarf insgesamt wächst also – die Gewichte selbst bleiben gleich groß.

Was füllt deinen RAM beim Ausführen eines lokalen Modells

Was füllt deinen RAM beim Ausführen eines lokalen Modells

Nicht nur das Modell — auch das Betriebssystem und der wachsende Kontext brauchen Platz

Gesamter System-RAM


Betriebssystem

Modellgewichte

feste Größe (Modell + Quantisierung)

KV-Cache

wächst mit Kontext / Konversation

Frei

Reserve

KV-Cache wächst mit längeren Prompts und Chats →

Warum das wichtig ist

Ein Modell, dessen Gewichte „passen“, kann trotzdem den Speicher sprengen: lange Prompts, mehrstufige Chats und Dokumentsuche (RAG) lassen den KV-Cache wachsen. Plane immer Reserve ein — bemiss den RAM nie nur an den Modellgewichten.

Die folgende Tabelle ist nur als Orientierung gedacht. Das Ergebnis schwankt je nach Quantisierung, Runner, Kontexteinstellungen und Speicherzuteilung.

Modellgröße Q4-Speicher Empfohlener RAM In der Praxis
7B–8B ~4–5 GB
VRAM / 8–10 GB CPU bzw. Shared Memory
16 GB Solider Einstieg für Chat, Zusammenfassungen und leichte Code-Hilfe
13B–14B ~8–11 GB 16–32 GB Mit Windows und Kontext-Cache wird 16 GB eng – 32 GB ist besser
30B–34B ~18–20 GB 32 GB+ Auf Shared-Memory-Systemen möglich, aber langsamer als kleinere Modelle
70B ~40–48 GB 64 GB knapp
128 GB besser
64 GB erfordert Feinjustierung und lässt kaum Spielraum

Bei reinem CPU- oder Shared-Memory-Betrieb planst du am besten rund das Doppelte des reinen Gewichtswerts ein. Betriebssystem, Runner, Cache, Grafikzuteilung, Speicherfragmentierung und normale Programme fordern diesen Zusatz. Wenn du erst alles schließen musst, um ein Modell zu laden, macht die Arbeit am Gerät wenig Freude.

RAM-Guide für lokale KI: der Schnellüberblick

Wenn du KI-Modelle lokal betreiben willst, kannst du deinen Speicherbedarf in einem Satz zusammenfassen: Wähle den RAM nach dem größten Modell, das du regelmäßig nutzen willst. Die folgende Tabelle übersetzt typische Vorhaben direkt in eine Empfehlung – als schneller Einstieg, bevor es weiter unten ins Detail geht.

Was du lokal machen willst Modellklasse Empfohlener RAM
Offline-Assistent, Chat, Zusammenfassungen 7B–8B 16 GB
Coding-Hilfe, längere Prompts, kleine Dokumentsuche 13B–14B 32 GB
Größere Modelle (30B), Retrieval, Multitasking 30B 64 GB
70B-Modelle lokal im Alltag 70B 128 GB

Kurz gesagt: 16 GB ist der Einstieg, 32 GB der Sweet Spot für die meisten, 64 GB der Schritt zu größeren Modellen und 128 GB die Wahl für regelmäßige 70B-Arbeit. Warum das so ist, zeigen die nächsten Abschnitte.

Was geht mit 16, 32, 64 und 128 GB?

16 GB – genug für den Einstieg

16 GB fasst viele Q4-Modelle mit 7B und 8B. Das ist gut, um offline kurze Schreibaufgaben, einfache Code-Erklärungen oder Dokumentzusammenfassungen zu erledigen und ein Gefühl für Ollama & Co. zu bekommen. Wie du ein Modell danach Schritt für Schritt einrichtest, zeigt dir unser Guide Lokale KI installieren. Es ist eher ein Einstiegspunkt als eine Reserve.

Der Spielraum schwindet schnell: Ein großes Browserfenster, eine Vektordatenbank, ein langer Prompt oder eine weitere speicherhungrige App – und der Rechner geht auf Anschlag. Spätestens wenn du deinen normalen Arbeitsbereich parallel offen halten willst, wird es eng.

32 GB – der Sweet Spot für die meisten

Für die meisten ist 32 GB im KI-Mini-PC das beste Preis-Leistungs-Verhältnis. Damit laufen 13B–14B-Modelle deutlich komfortabler, mit reichlich Platz für kleinere. Auch lange Prompts und einfache Dokumentsuchen werden angenehmer, und du kannst den Mini PC weiterhin wie einen normalen Arbeitsrechner nutzen.

Ein quantisiertes 30B-Modell ist gelegentlich möglich, kommt auf einem Shared-Memory-System aber nah an die Grenze. Wenn du ohnehin nur Code-Hilfe oder ein allgemeines Chat-Werkzeug willst, gibt es kaum einen Grund, über 32 GB hinauszugehen.

64 GB – mehr Raum für größere Aufgaben

64 GB ist die richtige Größe, wenn du viele kleinere Modelle bereithalten oder auf 30B aufsteigen willst. Sie erlaubt längere Kontexte und den Aufbau von Dokument-Retrieval, ohne den Rest des Rechners auszubremsen – und gibt der integrierten Grafik mehr Spielraum, weil diese sich den RAM teilt.

64 GB kann ein Q4-70B-Modell öffnen. Angenehm nutzbar ist das aber nicht zwangsläufig: kürzerer Kontext, straffere Quantisierung oder eine Aufteilung zwischen CPU und GPU werden nötig – und die Antworten kommen langsamer. Sieh 64 GB nicht als stabile Dauerlösung für 70B, sondern als Möglichkeit, 70B auszuprobieren.

Ein zusätzliches Argument für 64 GB: Es kann wirtschaftlicher sein, als den ganzen Mini PC zu früh ersetzen zu müssen – die richtige Wahl ist es aber trotzdem nicht für jeden.

128 GB – für 70B im Alltag

128 GB richtet sich an alle, die 70B-Modelle regelmäßig ausführen, ein breiteres Spektrum an Mixture-of-Experts-Optionen nutzen, mehrere Dienste parallel betreiben, mit vielen Dokumenten arbeiten oder entwickeln, ohne den PC lahmzulegen. Die meisten Einstiegs-Mini-PCs schaffen so viel Speicher nicht, einige High-End-Modelle schon.

128 GB brauchst du nicht, wenn du vor allem einen 7B- oder 14B-Assistenten nutzt. Für schwere, wiederkehrende Workloads lohnt es sich – bleiben deine Modelle klein und füllst du den vorhandenen Speicher selten, sind 32 oder 64 GB meist die wirtschaftlichere Wahl.

Ein Modell laden ≠ es flüssig nutzen

Wie schnell Text erscheint, siehst du an den Tokens pro Sekunde (tok/s). Ein geladenes Modell kann trotzdem quälend langsam sein – etwa durch Aufteilung zwischen CPU und GPU, einen großen Kontext-Cache oder ineffiziente Software. Für eine Zusammenfassung, die im Hintergrund fertig wird, sind 1–3 tok/s in Ordnung. Im Live-Chat ist Warten dagegen zäh.

Die folgenden Werte sind illustrativ, keine gemessenen Ergebnisse eines bestimmten Geräts. Sie gehen von Q4-Modellen auf einem dafür geeigneten AMD-Ryzen-AI-Mini-PC aus und variieren mit Chip, Speicherbandbreite, Promptlänge, Kontextgröße, Runner und GPU-Offload.

Modellgröße Ausgabetempo (Q4) & Praxisgefühl
7B ~35–45 tok/s – flott genug für Chat und kurze Code-Aufgaben
13B ~20–30 tok/s – angenehm für Alltag-Chat und Coding
30B ~12–18 tok/s – spürbar langsamer, aber nutzbar
70B ~5–9 tok/s – nur für geduldige Batch-Arbeit, zu langsam für Live-Chat

Vor dem Kauf zählen zwei Dinge: Der Rechner muss das Modell öffnen können – und schnell genug antworten. Wer Kapazität über Tempo stellt, muss mit Wartezeit leben.

RAM ist nicht alles: NPU, Bandbreite und Aufrüstbarkeit

So wichtig der Speicher ist – er ist nicht der einzige Faktor. Neuere AMD-Ryzen-AI-Chips bringen eine NPU mit, sofern die Software sie nutzt. Schnellere Antworten sind aber nicht garantiert, nur weil ein „NPU“-Logo auf dem Prozessor prangt: Viele Textprogramme setzen weiter auf CPU und integrierte Grafik.

Bei Shared Memory zählt die Bandbreite. Achte auf Dual-Channel-Bestückung, weil sich CPU und integrierte Grafik denselben RAM teilen. Auch die Aufrüstbarkeit ist ein Thema: Fest verlöteter Speicher lässt sich nicht erweitern, SO-DIMM-Steckplätze schon. Und eine NVMe-SSD ersetzt keinen RAM, beschleunigt aber das Laden von Dateien und die Dokumentsuche.

Mit zwei Speicher-Slots, XDNA-2-NPU, Radeon-890M-Grafik und wahlweise Ryzen AI 9 HX 370 oder HX 470 ist der GEEKOM A9 Max eine kompakte Option. Brauchst du mehr Speicher, prüfe die genaue Version, die in deiner Region verkauft wird.

GEEKOM A9 Max

FAQ

Reichen 32 GB für einen KI-Mini-PC?

Für die meisten ja. Damit laufen quantisierte 7B- bis 14B-Modelle, Offline-Assistenten, Coding und die Suche in kleineren Dokumentbeständen gut. Eng wird es bei 30B-Modellen, sehr langen Kontexten oder vielen speicherhungrigen Diensten.

Läuft ein 70B-Modell mit 64 GB?

Ja, aber nur knapp: Mit Q4 und sorgfältigen Einstellungen lädt es – allerdings langsam. Für regelmäßige 70B-Arbeit statt gelegentlichem Ausprobieren solltest du zu einem 128-GB-Gerät greifen.

Ist Shared System-RAM dasselbe wie dedizierter VRAM?

Nicht ganz. Shared RAM gibt der integrierten Grafik einen größeren Pool und erhöht so die Kapazität – die Spitzengeschwindigkeit von dediziertem VRAM auf einer separaten Grafikkarte erreichst du damit aber nicht.

Macht die NPU eines Mini PCs Textmodelle schneller?

Nicht von allein. Für Tempo zählen auch Runner, Modellformat, CPU, integrierte Grafik und Speicherbandbreite. Prüfe, ob deine Software die Hardware wirklich unterstützt, bevor du die NPU zum Kaufkriterium machst.

Fazit: Erst das Modell, dann den Speicher

Die Regel ist einfach: Entscheide zuerst, welches Modell du ausführen willst, und bemesse dann den RAM deines KI Mini PCs so, dass er es bequem fasst. Stimmt diese Reihenfolge, ergibt sich die passende Kapazität – 32, 64 oder 128 GB – ganz von selbst.

Bild von GEEKOM
GEEKOM

GEEKOM hat seine Forschungs- und Entwicklungszentrale in Taiwan und mehrere Niederlassungen in vielen Ländern weltweit. Die Mitglieder unseres Kernteams sind das technische Rückgrat, das bereits für Inventec, Quanta und andere renommierte Unternehmen tätig war. Wir verfügen über solide Kapazitäten für F&E und Innovation. Wir streben ständig nach Spitzenleistungen auf dem Gebiet der Technologieprodukte.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Mein Warenkorb
zuletzt angesehen
Kategorien