Du willst eine leistungsstarke KI wie ChatGPT nutzen, aber ohne Cloud, ohne Abo und ohne dass deine Daten den Schreibtisch verlassen? Mit gpt-oss-120b hat OpenAI ein offenes Sprachmodell veröffentlicht, das du komplett lokal auf deinem eigenen Rechner betreiben kannst. In dieser Anleitung zeigen wir dir Schritt für Schritt, wie du das Modell mit dem kostenlosen Programm LM Studio unter Windows installierst. Du brauchst dafür keine Programmierkenntnisse.
Eine eigene KI, die offline auf deinem PC läuft und mit der du wie mit ChatGPT chatten kannst.
Deine Texte, Dokumente und Fragen bleiben auf deinem Gerät, gut für den Datenschutz.
Über eine lokale API können auch andere Programme deine KI nutzen.
Kurz erklärt: die wichtigsten Begriffe
Keine Sorge, du musst nicht alles verstehen, um loszulegen. Diese Begriffe begegnen dir aber in der Anleitung:
Warum gpt-oss-120b auf dem GEEKOM A9 Mega?
Große Sprachmodelle brauchen vor allem eines: sehr viel schnellen Arbeitsspeicher. gpt-oss-120b belegt laut LM Studio rund 65 GB. Normale PCs und die meisten Grafikkarten haben dafür viel zu wenig Speicher.
Der GEEKOM A9 Mega mit AMD Ryzen AI Max+ 395 löst das Problem mit 128 GB gemeinsamem Arbeitsspeicher (Unified Memory): Prozessor und Grafikeinheit greifen auf denselben großen Speicher zu. Davon kannst du bis zu 96 GB der Grafik zuweisen (AMD). Das reicht für gpt-oss-120b mit genug Luft für Windows und längere Gespräche.
Dazu kommt die clevere Bauweise des Modells: gpt-oss-120b hat zwar rund 117 Milliarden Parameter, nutzt pro Antwort aber nur etwa 5,1 Milliarden davon („Mixture of Experts“). Deshalb antwortet es trotz seiner Größe flott.
Nutze dort das kleinere Modell gpt-oss-20b. Die Schritte sind identisch, du suchst in Schritt 4 nur nach „gpt-oss-20b“.
Bevor du startest: die Checkliste
Schritt 1: AMD-Grafiktreiber aktualisieren
Der Treiber ist die Verbindung zwischen Windows und der Grafikeinheit. Ein aktueller Treiber ist die wichtigste Voraussetzung dafür, dass die KI schnell läuft.
- Öffne die App AMD Software: Adrenalin Edition (Suchfeld der Taskleiste: „AMD Software“). Ist sie nicht installiert, lade den Treiber von der AMD-Supportseite herunter.
- Klicke auf Nach Updates suchen und installiere die neueste empfohlene Version.
- Starte Windows neu.
- Öffne den Task-Manager (Tastenkombination Strg + Umschalt + Esc), wechsle zu Leistung und prüfe, ob dort AMD Radeon als GPU aufgeführt ist.
Schritt 2: der Grafik genug Speicher zuweisen
Standardmäßig bekommt die Grafikeinheit nur einen kleinen Teil der 128 GB. Damit das große Modell komplett auf der Grafik laufen kann, erhöhst du diesen Anteil einmalig.
- Öffne AMD Software: Adrenalin Edition.
- Gehe zu Leistung → Tuning → System und suche den Eintrag Variable Graphics Memory.
- Wähle Benutzerdefiniert und stelle 96 GB ein.
- Starte den PC neu. Die Einstellung wird erst nach dem Neustart aktiv.
Schritt 3: LM Studio installieren und einrichten
- Öffne die Website lmstudio.ai und lade die Version für Windows (x64) herunter.
- Starte die heruntergeladene Datei und folge dem Installationsassistenten.
- Öffne LM Studio nach der Installation.
Speicherort festlegen (wichtig, bevor du etwas herunterlädst): LM Studio speichert Modelle standardmäßig auf Laufwerk C:. Ein 65-GB-Modell kann das Systemlaufwerk schnell füllen.
- Öffne in LM Studio den Bereich My Models (Ordnersymbol in der linken Leiste).
- Ändere den Models Directory auf eine SSD mit genug freiem Platz, zum Beispiel D:\LMStudio\Models.
Schritt 4: gpt-oss-120b herunterladen
- Klicke in der linken Leiste auf die Lupe (Discover).
- Gib in das Suchfeld ein: gpt-oss-120b
- Wähle den offiziellen Eintrag openai/gpt-oss-120b. Achte darauf, dass OpenAI als Herausgeber angezeigt wird.
- Klicke auf Download.
Jetzt heißt es warten. So lange dauert der Download von rund 65 GB ungefähr:
| Internetgeschwindigkeit | Downloadzeit |
|---|---|
| 50 Mbit/s | ca. 3 Stunden |
| 100 Mbit/s | ca. 1,5 Stunden |
| 250 Mbit/s | ca. 35 Minuten |
| 1.000 Mbit/s (Glasfaser) | ca. 10 Minuten |
Schritt 5: das Modell zum ersten Mal laden
Das Modell liegt jetzt auf deiner SSD. Damit du damit chatten kannst, muss LM Studio es in den Arbeitsspeicher laden.
- Klicke in der linken Leiste auf das Sprechblasen-Symbol (Chat).
- Klicke oben in der Mitte auf Select a model to load und wähle gpt-oss-120b.
- Aktiviere den Schalter Manually choose model load parameters, damit du die Einstellungen siehst.
- Stelle die Werte wie in der Tabelle ein und klicke auf Load Model.
| Einstellung in LM Studio | Empfohlener Wert | Was bewirkt das? |
|---|---|---|
| GPU Offload | MaximumRegler ganz nach rechts | Die Grafik übernimmt die gesamte Rechenarbeit. |
| Context Length | 32768 | Die KI merkt sich rund 24.000 Wörter pro Gespräch. Ein sicherer Startwert. |
| Flash Attention | An | Spart Speicher und beschleunigt lange Gespräche. |
| Offload KV Cache to GPU Memory | An | Das „Kurzzeitgedächtnis“ der KI liegt im schnellen Grafikspeicher. |
Das erste Laden dauert je nach SSD eine bis zwei Minuten. Danach siehst du oben den Modellnamen und ein Eingabefeld.
Warum nicht gleich die maximale Kontextlänge?
gpt-oss-120b beherrscht bis zu rund 131.000 Token Kontext. Je größer der Kontext, desto mehr Speicher reserviert LM Studio aber schon beim Laden. Starte deshalb mit 32.768 und erhöhe erst, wenn alles stabil läuft:
- 32K: Standard für Chats, E-Mails und kurze Dokumente
- 64K: für lange PDFs, Verträge oder Protokolle
- 128K: nur bei Bedarf und nachdem du im Task-Manager geprüft hast, dass genug Speicher frei ist
Schritt 6: prüfen, ob die Grafik wirklich mitrechnet
Der häufigste Fehler bei Einsteigern: Die KI läuft, aber nur auf dem Prozessor. Das ist bis zu zehnmal langsamer. So prüfst du es in einer Minute:
- Öffne den Task-Manager und gehe zu Leistung → GPU.
- Stelle eines der Diagramme per Klick auf den kleinen Pfeil auf Compute um, falls verfügbar.
- Schreibe im LM-Studio-Chat eine längere Frage und beobachte das Diagramm während der Antwort.
Schritt 7: dein erster Chat
Gib zum Beispiel diese Frage ein:
Antwortet die KI sinnvoll auf Deutsch, ist die Installation abgeschlossen. Glückwunsch, du betreibst jetzt eine eigene KI komplett offline.
Denkaufwand einstellen
gpt-oss-120b kann unterschiedlich gründlich „nachdenken“, bevor es antwortet. In LM Studio findest du dafür die Einstellung Reasoning Effort:
| Stufe | Geeignet für |
|---|---|
| Low | Schnelle Antworten, einfache Fragen, Umformulieren von Texten |
| Medium | Empfohlener Standard für die meisten Aufgaben |
| High | Komplexe Aufgaben wie Mathematik, Programmieren oder Analysen. Dauert länger. |
Schritt 8 (optional): die KI für andere Programme freigeben
Dieser Schritt ist nur interessant, wenn du deine lokale KI in eigene Skripte, Automatisierungen oder Programme einbinden willst. Für den normalen Chat kannst du ihn überspringen.
LM Studio bietet eine Schnittstelle, die genauso funktioniert wie die von OpenAI. Viele Programme, die eigentlich ChatGPT nutzen, können so stattdessen deine lokale KI verwenden (LM Studio Doku).
- Klicke in der linken Leiste auf Developer (Symbol mit spitzen Klammern).
- Prüfe, dass gpt-oss-120b geladen ist.
- Lass den Port auf 1234 und schalte den Server über Status: Running ein.
Test in der PowerShell (Windows-Taste drücken, „PowerShell“ eingeben, öffnen):
curl.exe http://localhost:1234/v1/models
Erscheint eine Liste mit dem Modellnamen, läuft die Schnittstelle. Eine erste Anfrage stellst du so:
$body = @{
model = "openai/gpt-oss-120b"
messages = @(
@{
role = "user"
content = "Beschreibe den GEEKOM A9 Mega in einem Satz."
}
)
max_tokens = 200
} | ConvertTo-Json -Depth 5
Invoke-RestMethod -Uri "http://localhost:1234/v1/chat/completions" `
-Method Post `
-ContentType "application/json; charset=utf-8" `
-Body $body
Für Python-Nutzer
Installiere zuerst Python für Windows und aktiviere bei der Installation „Add python.exe to PATH“. Danach in der PowerShell:
py -m pip install openai
Speichere dieses Skript als test_ki.py und starte es mit py test_ki.py:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1234/v1",
api_key="lm-studio"
)
antwort = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=[
{
"role": "user",
"content": "Stell dich in drei Sätzen vor."
}
],
max_tokens=300,
)
print(antwort.choices[0].message.content)
Schritt 9 (optional): Zugriff von anderen Geräten im Heimnetz
Standardmäßig ist deine KI nur auf dem A9 Mega selbst erreichbar. Das ist die sicherste Einstellung. Möchtest du sie vom Laptop oder einem anderen PC im selben Netzwerk nutzen:
- Aktiviere auf der Developer-Seite Serve on Local Network.
- Schalte die Authentifizierung ein und lege einen API-Schlüssel fest.
- Erlaube LM Studio in der Windows-Firewall nur für private Netzwerke, nicht für öffentliche.
- Auf dem anderen Gerät nutzt du die Adresse http://IP-DES-A9-MEGA:1234/v1, zum Beispiel http://192.168.178.50:1234/v1.
Fehlerbehebung: die häufigsten Probleme
| Problem | Wahrscheinliche Ursache | Lösung |
|---|---|---|
| Modell lässt sich nicht laden | Zu wenig freier Speicher | Andere Programme schließen, Kontextlänge auf 32768 setzen, nur ein Modell gleichzeitig laden. Prüfen, ob Schritt 2 (96 GB) aktiv ist. |
| Antworten sehr langsam, GPU bei 0 % | KI läuft nur auf dem Prozessor | AMD-Treiber aktualisieren (Schritt 1), GPU Offload auf Maximum stellen, in LM Studio mit Strg + Umschalt + R die Runtime aktualisieren. |
| Wird im Laufe des Gesprächs langsamer | Gespräch sehr lang, Kontext voll | Neuen Chat beginnen, Flash Attention einschalten. |
| Seltsame Formatierung oder Zeichen | Einstellungen verändert | In den Modelleinstellungen auf Standardwerte zurücksetzen. |
| Windows reagiert träge | Kontextlänge zu hoch | Kontextlänge senken und im Task-Manager die Speicherauslastung prüfen. |
FAQ: gpt-oss-120b lokal nutzen
Ist gpt-oss-120b kostenlos?
Ja. Das Modell steht unter der Apache-2.0-Lizenz und darf privat wie gewerblich kostenlos genutzt werden. Auch LM Studio ist kostenlos.
Brauche ich nach der Installation noch Internet?
Nein. Nach dem Download läuft gpt-oss-120b komplett offline. Deine Eingaben werden nicht an OpenAI oder andere Server übertragen.
Ist die lokale KI DSGVO-konform?
Da alle Daten auf deinem Gerät bleiben, entfällt die Übertragung an einen Cloud-Anbieter. Das ist ein großer Vorteil für den Datenschutz, etwa bei Kundendaten oder internen Dokumenten. Ob deine konkrete Nutzung alle Anforderungen erfüllt, hängt aber vom Einsatzzweck ab. Im Unternehmen solltest du das mit deinem Datenschutzbeauftragten abstimmen.
Wie gut ist gpt-oss-120b im Vergleich zu ChatGPT?
gpt-oss-120b gehört zu den stärksten offenen Modellen und eignet sich gut für Texte, Zusammenfassungen, Analysen und Programmieraufgaben. Die neuesten Cloud-Modelle sind bei manchen Aufgaben weiterhin überlegen und haben Zugriff auf aktuelle Informationen aus dem Internet, die eine lokale KI nicht hat.
Funktioniert die Anleitung auch mit weniger Arbeitsspeicher?
Für gpt-oss-120b brauchst du etwa 65 GB freien Speicher für das Modell. Mit 64 GB RAM oder weniger nutze stattdessen gpt-oss-20b. Die Schritte bleiben gleich.
Fazit
Mit LM Studio und dem GEEKOM A9 Mega betreibst du in rund einer halben Stunde plus Download-Zeit eine der leistungsfähigsten offenen KIs komplett lokal. Die wichtigsten Punkte für einen reibungslosen Start: aktueller AMD-Treiber, 96 GB Grafikspeicher zuweisen, GPU Offload auf Maximum und mit 32K Kontext beginnen. So bleibt deine KI schnell, stabil und deine Daten bleiben bei dir.
























