gpt-oss-120b lokal installieren: Schritt-für-Schritt-Anleitung für Windows

Contents
Mini PC mit LM Studio: gpt-oss-120b Schritt für Schritt lokal unter Windows installieren

Du willst eine leistungsstarke KI wie ChatGPT nutzen, aber ohne Cloud, ohne Abo und ohne dass deine Daten den Schreibtisch verlassen? Mit gpt-oss-120b hat OpenAI ein offenes Sprachmodell veröffentlicht, das du komplett lokal auf deinem eigenen Rechner betreiben kannst. In dieser Anleitung zeigen wir dir Schritt für Schritt, wie du das Modell mit dem kostenlosen Programm LM Studio unter Windows installierst. Du brauchst dafür keine Programmierkenntnisse.

Das hast du am Ende dieser Anleitung
Eine eigene KI auf deinem PC

Eine eigene KI, die offline auf deinem PC läuft und mit der du wie mit ChatGPT chatten kannst.

Mehr Datenschutz

Deine Texte, Dokumente und Fragen bleiben auf deinem Gerät, gut für den Datenschutz.

Optional: Lokale Schnittstelle (API)

Über eine lokale API können auch andere Programme deine KI nutzen.

Auf einen Blick
Schwierigkeit
Einsteiger (Schritte 1–7), Fortgeschrittene (Schritte 8–9, optional)
Zeitaufwand
ca. 30 Minuten Einrichtung plus Download-Zeit (siehe Schritt 4)
Kosten
keine, LM Studio und gpt-oss-120b sind kostenlos
Getestetes Gerät
GEEKOM A9 Mega mit AMD Ryzen AI Max+ 395 und 128 GB Arbeitsspeicher

Kurz erklärt: die wichtigsten Begriffe

Keine Sorge, du musst nicht alles verstehen, um loszulegen. Diese Begriffe begegnen dir aber in der Anleitung:

Begriff
Was bedeutet das?
Sprachmodell (LLM)
Das „Gehirn“ der KI. Eine große Datei, die gelernt hat, Texte zu verstehen und zu schreiben.
gpt-oss-120b
Ein offenes Sprachmodell von OpenAI. „120b“ steht für rund 120 Milliarden Parameter, also eine sehr große und fähige KI.
LM Studio
Ein kostenloses Programm mit Chat-Oberfläche, das Sprachmodelle herunterlädt und auf deinem PC ausführt.
GPU-Offload
Die Grafikeinheit übernimmt die Rechenarbeit. Das macht die KI deutlich schneller als ein reiner Betrieb über den Prozessor.
Kontextlänge
Wie viel Text sich die KI in einem Gespräch „merken“ kann. Mehr Kontext braucht mehr Arbeitsspeicher.
Token
Die Einheit, in der KI Text verarbeitet. Grob gilt: 1 Token entspricht etwa ¾ eines Wortes.
API
Eine Schnittstelle, über die andere Programme mit deiner KI sprechen können. Für den normalen Chat brauchst du sie nicht.

Warum gpt-oss-120b auf dem GEEKOM A9 Mega?

Große Sprachmodelle brauchen vor allem eines: sehr viel schnellen Arbeitsspeicher. gpt-oss-120b belegt laut LM Studio rund 65 GB. Normale PCs und die meisten Grafikkarten haben dafür viel zu wenig Speicher.

Der GEEKOM A9 Mega mit AMD Ryzen AI Max+ 395 löst das Problem mit 128 GB gemeinsamem Arbeitsspeicher (Unified Memory): Prozessor und Grafikeinheit greifen auf denselben großen Speicher zu. Davon kannst du bis zu 96 GB der Grafik zuweisen (AMD). Das reicht für gpt-oss-120b mit genug Luft für Windows und längere Gespräche.

Dazu kommt die clevere Bauweise des Modells: gpt-oss-120b hat zwar rund 117 Milliarden Parameter, nutzt pro Antwort aber nur etwa 5,1 Milliarden davon („Mixture of Experts“). Deshalb antwortet es trotz seiner Größe flott.

Achtung
Diese Anleitung gilt für den A9 Mega mit Ryzen AI Max+ 395 und 128 GB RAM. Die Variante mit Ryzen AI Max+ 388 und 64 GB hat nicht genug Speicher für gpt-oss-120b.

Nutze dort das kleinere Modell gpt-oss-20b. Die Schritte sind identisch, du suchst in Schritt 4 nur nach „gpt-oss-20b“.

Bevor du startest: die Checkliste

Voraussetzung
Warum?
Erledigt?

Schritt 1: AMD-Grafiktreiber aktualisieren

Der Treiber ist die Verbindung zwischen Windows und der Grafikeinheit. Ein aktueller Treiber ist die wichtigste Voraussetzung dafür, dass die KI schnell läuft.

  1. Öffne die App AMD Software: Adrenalin Edition (Suchfeld der Taskleiste: „AMD Software“). Ist sie nicht installiert, lade den Treiber von der AMD-Supportseite herunter.
  2. Klicke auf Nach Updates suchen und installiere die neueste empfohlene Version.
  3. Starte Windows neu.
  4. Öffne den Task-Manager (Tastenkombination Strg + Umschalt + Esc), wechsle zu Leistung und prüfe, ob dort AMD Radeon als GPU aufgeführt ist.
✓ Checkpoint
Im Task-Manager unter „Leistung“ erscheint eine AMD-Radeon-GPU. Weiter mit Schritt 2.

Schritt 2: der Grafik genug Speicher zuweisen

Standardmäßig bekommt die Grafikeinheit nur einen kleinen Teil der 128 GB. Damit das große Modell komplett auf der Grafik laufen kann, erhöhst du diesen Anteil einmalig.

  1. Öffne AMD Software: Adrenalin Edition.
  2. Gehe zu Leistung → Tuning → System und suche den Eintrag Variable Graphics Memory.
  3. Wähle Benutzerdefiniert und stelle 96 GB ein.
  4. Starte den PC neu. Die Einstellung wird erst nach dem Neustart aktiv.
Tipp
Mit 96 GB für die Grafik bleiben 32 GB für Windows und deine Programme. Das reicht für den normalen Betrieb problemlos. Wenn du den PC später vor allem für andere Aufgaben nutzt, kannst du den Wert wieder senken.
✓ Checkpoint
Nach dem Neustart zeigt der Task-Manager unter „Leistung → GPU“ deutlich mehr dedizierten GPU-Speicher an.

Schritt 3: LM Studio installieren und einrichten

  1. Öffne die Website lmstudio.ai und lade die Version für Windows (x64) herunter.
  2. Starte die heruntergeladene Datei und folge dem Installationsassistenten.
  3. Öffne LM Studio nach der Installation.

Speicherort festlegen (wichtig, bevor du etwas herunterlädst): LM Studio speichert Modelle standardmäßig auf Laufwerk C:. Ein 65-GB-Modell kann das Systemlaufwerk schnell füllen.

  1. Öffne in LM Studio den Bereich My Models (Ordnersymbol in der linken Leiste).
  2. Ändere den Models Directory auf eine SSD mit genug freiem Platz, zum Beispiel D:\LMStudio\Models.
Tipp
Hat dein A9 Mega nur ein Laufwerk, ist C: in Ordnung, solange nach dem Download noch mindestens 30 GB frei bleiben.
✓ Checkpoint
LM Studio ist geöffnet und der Speicherort für Modelle liegt auf einem Laufwerk mit mindestens 100 GB freiem Platz.

Schritt 4: gpt-oss-120b herunterladen

  1. Klicke in der linken Leiste auf die Lupe (Discover).
  2. Gib in das Suchfeld ein: gpt-oss-120b
  3. Wähle den offiziellen Eintrag openai/gpt-oss-120b. Achte darauf, dass OpenAI als Herausgeber angezeigt wird.
  4. Klicke auf Download.

Jetzt heißt es warten. So lange dauert der Download von rund 65 GB ungefähr:

Internetgeschwindigkeit Downloadzeit
50 Mbit/s ca. 3 Stunden
100 Mbit/s ca. 1,5 Stunden
250 Mbit/s ca. 35 Minuten
1.000 Mbit/s (Glasfaser) ca. 10 Minuten
Tipp
Deine aktuelle Geschwindigkeit findest du zum Beispiel über die Breitbandmessung der Bundesnetzagentur. Nutze für den Download am besten ein LAN-Kabel statt WLAN.
✓ Checkpoint
Unter „My Models“ erscheint gpt-oss-120b ohne Fortschrittsbalken. Der Download ist abgeschlossen.

Schritt 5: das Modell zum ersten Mal laden

Das Modell liegt jetzt auf deiner SSD. Damit du damit chatten kannst, muss LM Studio es in den Arbeitsspeicher laden.

  1. Klicke in der linken Leiste auf das Sprechblasen-Symbol (Chat).
  2. Klicke oben in der Mitte auf Select a model to load und wähle gpt-oss-120b.
  3. Aktiviere den Schalter Manually choose model load parameters, damit du die Einstellungen siehst.
  4. Stelle die Werte wie in der Tabelle ein und klicke auf Load Model.
Einstellung in LM Studio Empfohlener Wert Was bewirkt das?
GPU Offload MaximumRegler ganz nach rechts Die Grafik übernimmt die gesamte Rechenarbeit.
Context Length 32768 Die KI merkt sich rund 24.000 Wörter pro Gespräch. Ein sicherer Startwert.
Flash Attention An Spart Speicher und beschleunigt lange Gespräche.
Offload KV Cache to GPU Memory An Das „Kurzzeitgedächtnis“ der KI liegt im schnellen Grafikspeicher.

Das erste Laden dauert je nach SSD eine bis zwei Minuten. Danach siehst du oben den Modellnamen und ein Eingabefeld.

Warum nicht gleich die maximale Kontextlänge?

gpt-oss-120b beherrscht bis zu rund 131.000 Token Kontext. Je größer der Kontext, desto mehr Speicher reserviert LM Studio aber schon beim Laden. Starte deshalb mit 32.768 und erhöhe erst, wenn alles stabil läuft:

  • 32K: Standard für Chats, E-Mails und kurze Dokumente
  • 64K: für lange PDFs, Verträge oder Protokolle
  • 128K: nur bei Bedarf und nachdem du im Task-Manager geprüft hast, dass genug Speicher frei ist
✓ Checkpoint
Das Modell ist geladen, oben steht „gpt-oss-120b“ und unten ist ein Eingabefeld sichtbar.

Schritt 6: prüfen, ob die Grafik wirklich mitrechnet

Der häufigste Fehler bei Einsteigern: Die KI läuft, aber nur auf dem Prozessor. Das ist bis zu zehnmal langsamer. So prüfst du es in einer Minute:

  1. Öffne den Task-Manager und gehe zu Leistung → GPU.
  2. Stelle eines der Diagramme per Klick auf den kleinen Pfeil auf Compute um, falls verfügbar.
  3. Schreibe im LM-Studio-Chat eine längere Frage und beobachte das Diagramm während der Antwort.
✓ Checkpoint
Die GPU-Auslastung steigt deutlich an, während die KI antwortet, und die Antwort erscheint zügig Wort für Wort. Bleibt die GPU bei nahezu 0 % und die Prozessorauslastung ist hoch, springe zur Fehlerbehebung.

Schritt 7: dein erster Chat

Gib zum Beispiel diese Frage ein:

Beispiel-Frage
Stell dich kurz vor und erkläre mir in drei Schritten, wie ich einen Umzug plane.

Antwortet die KI sinnvoll auf Deutsch, ist die Installation abgeschlossen. Glückwunsch, du betreibst jetzt eine eigene KI komplett offline.

Denkaufwand einstellen

gpt-oss-120b kann unterschiedlich gründlich „nachdenken“, bevor es antwortet. In LM Studio findest du dafür die Einstellung Reasoning Effort:

Stufe Geeignet für
Low Schnelle Antworten, einfache Fragen, Umformulieren von Texten
Medium Empfohlener Standard für die meisten Aufgaben
High Komplexe Aufgaben wie Mathematik, Programmieren oder Analysen. Dauert länger.
Tipp
Die übrigen Einstellungen wie Temperature oder Top P musst du nicht anfassen. LM Studio übernimmt die passenden Standardwerte des Modells automatisch.

Schritt 8 (optional): die KI für andere Programme freigeben

Dieser Schritt ist nur interessant, wenn du deine lokale KI in eigene Skripte, Automatisierungen oder Programme einbinden willst. Für den normalen Chat kannst du ihn überspringen.

LM Studio bietet eine Schnittstelle, die genauso funktioniert wie die von OpenAI. Viele Programme, die eigentlich ChatGPT nutzen, können so stattdessen deine lokale KI verwenden (LM Studio Doku).

  1. Klicke in der linken Leiste auf Developer (Symbol mit spitzen Klammern).
  2. Prüfe, dass gpt-oss-120b geladen ist.
  3. Lass den Port auf 1234 und schalte den Server über Status: Running ein.

Test in der PowerShell (Windows-Taste drücken, „PowerShell“ eingeben, öffnen):

curl.exe http://localhost:1234/v1/models

Erscheint eine Liste mit dem Modellnamen, läuft die Schnittstelle. Eine erste Anfrage stellst du so:

$body = @{
  model = "openai/gpt-oss-120b"
  messages = @(
    @{
      role = "user"
      content = "Beschreibe den GEEKOM A9 Mega in einem Satz."
    }
  )
  max_tokens = 200
} | ConvertTo-Json -Depth 5

Invoke-RestMethod -Uri "http://localhost:1234/v1/chat/completions" `
  -Method Post `
  -ContentType "application/json; charset=utf-8" `
  -Body $body

Für Python-Nutzer

Installiere zuerst Python für Windows und aktiviere bei der Installation „Add python.exe to PATH“. Danach in der PowerShell:

py -m pip install openai

Speichere dieses Skript als test_ki.py und starte es mit py test_ki.py:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio"
)

antwort = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=[
        {
            "role": "user",
            "content": "Stell dich in drei Sätzen vor."
        }
    ],
    max_tokens=300,
)

print(antwort.choices[0].message.content)
Tipp
Der Wert „lm-studio“ bei api_key ist nur ein Platzhalter. Solange du keine Authentifizierung einschaltest, prüft LM Studio ihn nicht.

Schritt 9 (optional): Zugriff von anderen Geräten im Heimnetz

Standardmäßig ist deine KI nur auf dem A9 Mega selbst erreichbar. Das ist die sicherste Einstellung. Möchtest du sie vom Laptop oder einem anderen PC im selben Netzwerk nutzen:

  1. Aktiviere auf der Developer-Seite Serve on Local Network.
  2. Schalte die Authentifizierung ein und lege einen API-Schlüssel fest.
  3. Erlaube LM Studio in der Windows-Firewall nur für private Netzwerke, nicht für öffentliche.
  4. Auf dem anderen Gerät nutzt du die Adresse http://IP-DES-A9-MEGA:1234/v1, zum Beispiel http://192.168.178.50:1234/v1.
Tipp
Die IP-Adresse deines A9 Mega findest du in der Benutzeroberfläche deines Routers, bei einer FRITZ!Box unter „Heimnetz → Netzwerk“.
Achtung
Gib Port 1234 niemals per Portfreigabe im Router ins Internet frei. Für den Zugriff von unterwegs nutze ein VPN, zum Beispiel WireGuard auf der FRITZ!Box.

Fehlerbehebung: die häufigsten Probleme

Problem Wahrscheinliche Ursache Lösung
Modell lässt sich nicht laden Zu wenig freier Speicher Andere Programme schließen, Kontextlänge auf 32768 setzen, nur ein Modell gleichzeitig laden. Prüfen, ob Schritt 2 (96 GB) aktiv ist.
Antworten sehr langsam, GPU bei 0 % KI läuft nur auf dem Prozessor AMD-Treiber aktualisieren (Schritt 1), GPU Offload auf Maximum stellen, in LM Studio mit Strg + Umschalt + R die Runtime aktualisieren.
Wird im Laufe des Gesprächs langsamer Gespräch sehr lang, Kontext voll Neuen Chat beginnen, Flash Attention einschalten.
Seltsame Formatierung oder Zeichen Einstellungen verändert In den Modelleinstellungen auf Standardwerte zurücksetzen.
Windows reagiert träge Kontextlänge zu hoch Kontextlänge senken und im Task-Manager die Speicherauslastung prüfen.

FAQ: gpt-oss-120b lokal nutzen

Ist gpt-oss-120b kostenlos?

Ja. Das Modell steht unter der Apache-2.0-Lizenz und darf privat wie gewerblich kostenlos genutzt werden. Auch LM Studio ist kostenlos.

Brauche ich nach der Installation noch Internet?

Nein. Nach dem Download läuft gpt-oss-120b komplett offline. Deine Eingaben werden nicht an OpenAI oder andere Server übertragen.

Ist die lokale KI DSGVO-konform?

Da alle Daten auf deinem Gerät bleiben, entfällt die Übertragung an einen Cloud-Anbieter. Das ist ein großer Vorteil für den Datenschutz, etwa bei Kundendaten oder internen Dokumenten. Ob deine konkrete Nutzung alle Anforderungen erfüllt, hängt aber vom Einsatzzweck ab. Im Unternehmen solltest du das mit deinem Datenschutzbeauftragten abstimmen.

Wie gut ist gpt-oss-120b im Vergleich zu ChatGPT?

gpt-oss-120b gehört zu den stärksten offenen Modellen und eignet sich gut für Texte, Zusammenfassungen, Analysen und Programmieraufgaben. Die neuesten Cloud-Modelle sind bei manchen Aufgaben weiterhin überlegen und haben Zugriff auf aktuelle Informationen aus dem Internet, die eine lokale KI nicht hat.

Funktioniert die Anleitung auch mit weniger Arbeitsspeicher?

Für gpt-oss-120b brauchst du etwa 65 GB freien Speicher für das Modell. Mit 64 GB RAM oder weniger nutze stattdessen gpt-oss-20b. Die Schritte bleiben gleich.

Fazit

Mit LM Studio und dem GEEKOM A9 Mega betreibst du in rund einer halben Stunde plus Download-Zeit eine der leistungsfähigsten offenen KIs komplett lokal. Die wichtigsten Punkte für einen reibungslosen Start: aktueller AMD-Treiber, 96 GB Grafikspeicher zuweisen, GPU Offload auf Maximum und mit 32K Kontext beginnen. So bleibt deine KI schnell, stabil und deine Daten bleiben bei dir.

Bild von GEEKOM
GEEKOM

GEEKOM hat seine Forschungs- und Entwicklungszentrale in Taiwan und mehrere Niederlassungen in vielen Ländern weltweit. Die Mitglieder unseres Kernteams sind das technische Rückgrat, das bereits für Inventec, Quanta und andere renommierte Unternehmen tätig war. Wir verfügen über solide Kapazitäten für F&E und Innovation. Wir streben ständig nach Spitzenleistungen auf dem Gebiet der Technologieprodukte.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Mein Warenkorb
zuletzt angesehen
Kategorien