Wissen · Lokale KI
GPT-OSS 120B lokal betreiben: welche Hardware es braucht
Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten
Die professionelle On-Prem-Klasse: höchste offene Qualität auf einer einzelnen 80-GB-Karte.
GPT-OSS 120B ist OpenAIs grosses offenes Modell und die übliche Obergrenze dessen, was ein Betrieb noch im eigenen Haus betreibt: rund 65 GB Modelldatei, passend für eine 80-GB-Profi-Karte oder ein System mit 96 bis 128 GB gemeinsamem Speicher. Dazu zählen neben grossen Macs inzwischen auch kompakte Ryzen-AI-Max+- und NVIDIA-GB10-Systeme. Für die meisten KMU ist das der übernächste Schritt, nicht der erste.
Auf einen Blick
Was GPT-OSS 120B an Hardware braucht
Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.
Anschaffen
ab etwa CHF 3'200 128-GB-Komplettsystem; Profi-GPU deutlich höherMieten
stundenweise GPU-Server mit 80-GB-Karte, der übliche EinstiegPassende Anwendungsfälle im Rechner
Früher fast nur Server-Klasse, heute auch ein Testfall für 128-GB-Systeme: grosse Macs, Ryzen AI Max+ und NVIDIA GB10 bringen genug Kapazität auf den Schreibtisch. Runtime-Kompatibilität und Tempo müssen vor dem Kauf mit exakt diesem Modell geprüft werden.
Tempo-Erwartung: Auf einer 80-GB-Profi-Karte zügig, dank MoE trotz der Grösse. Systeme mit 96 bis 128 GB gemeinsamem Speicher können es tragen, antworten wegen geringerer Bandbreite aber nicht automatisch schnell.
So starten Sie: die Befehle zum Kopieren
Ollama installieren (kostenlos, ollama.com), dann im Terminal:
ollama pull gpt-oss:120b ollama run gpt-oss:120b
Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.
Zum Nachschlagen
GPT-OSS 120B: alle Angaben im Detail
Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.
| Modellklasse | High-End (120B, MoE) · GPT-OSS (OpenAI, offene Modelle) |
| Parameter | 117 Milliarden gesamt, rund 5,1 aktiv je Token |
| Modelldatei | rund 65 GB (MXFP4) |
| Grafikspeicher (VRAM) | 80 GB VRAM oder 96–128 GB gemeinsamer Speicher |
| Arbeitsspeicher (RAM) | 96–128 GB |
| Apple (gemeinsamer Speicher) | ab 96 GB, eher 128 GB gemeinsamer Speicher |
| Kontextfenster | bis 128'000 Tokens |
| Lizenz | Apache 2.0, auch kommerziell frei |
| Ollama-Name | gpt-oss:120b |
Einordnung
Wo GPT-OSS 120B zwischen seinen Nachbarn steht
Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.
GPT-OSS 20B — der Einstieg in dieselbe Familie, läuft in 16 GB
Llama 3.3 70B — dichte Alternative in der grossen Klasse
Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»
Ehrlich eingeordnet
Wofür GPT-OSS 120B taugt, und wo die Grenzen liegen
Wofür es sich lohnt
Wer die Qualität der grossen Cloud-Modelle möglichst nah im eigenen Haus will, landet in dieser Klasse: schwere Analysen, anspruchsvolle Agenten-Aufbauten, Aufgaben, an denen die Mittelklasse nachweislich scheitert. Durch die Mixture-of-Experts-Bauweise rechnen je Token nur rund 5 der 117 Milliarden Parameter, deshalb reicht eine einzelne 80-GB-Karte, wo dichte Modelle dieser Grösse mehrere Karten bräuchten. Das ist die Klasse für Betriebe mit hartem Datenschutz-Auftrag und echtem Volumen.
Wo die Grenzen liegen
Die ehrliche Einordnung zuerst: 128 GB Speicherkapazität sind noch kein Tempoversprechen. Gemeinsamer Speicher ist deutlich langsamer als der VRAM einer Profi-GPU, und Runtime, Treiber sowie Prozessorarchitektur entscheiden mit. Die NVIDIA-SGLang-Release-Notes vom 31. August 2026 nennen beispielsweise einen bekannten GPT-OSS-Fehler auf DGX Spark; andere Laufzeiten können sich anders verhalten. Darum das konkrete Modell vor dem Kauf testen. Wer das Volumen nicht dauerhaft hat, mietet diese Stufe zunächst stundenweise. Der Einstieg in dieselbe Modellfamilie beginnt beim GPT-OSS 20B auf Hardware ab 16 GB.
Häufige Fragen
FAQ: GPT-OSS 120B lokal
Welche aktuelle Hardwareklasse passt zu GPT-OSS 120B?
Die rund 65 GB grosse Modelldatei braucht eine 80-GB-Profi-GPU oder 96 bis 128 GB gemeinsamen Speicher. Neben grossen Macs kommen dafür heute auch Ryzen-AI-Max+-Systeme mit 128 GB und NVIDIA-GB10-Systeme infrage. Ob die gewünschte Runtime das Modell auf der Plattform vollständig beschleunigt und schnell genug ausführt, muss vor dem Kauf getestet werden.
Warum reicht eine einzige Karte für 117 Milliarden Parameter?
GPT-OSS 120B ist ein Mixture-of-Experts-Modell: Je Token rechnen nur rund 5 der 117 Milliarden Parameter, und veröffentlicht ist es in MXFP4-Quantisierung mit rund 65 GB Dateigrösse. Dichte Modelle dieser Klasse bräuchten ein Mehrfaches an Speicher und damit mehrere Karten.
Braucht ein KMU GPT-OSS 120B?
Selten als ersten Schritt. Die Stufe lohnt sich, wenn kleinere Modelle an den echten Aufgaben nachweislich scheitern und zugleich ein harter Grund gegen die Cloud besteht, etwa Berufsgeheimnis oder Datenschutz-Auflagen. Der übliche Weg führt über Tests mit der 14B- bis 32B-Klasse; erst deren Scheitern rechtfertigt die Investition in diese Hardware-Liga.
Kaufen oder mieten?
Bei dieser Stufe meist mieten, zumindest zu Beginn: GPU-Server mit 80-GB-Karten lassen sich stundenweise nutzen, damit lässt sich die Qualität am eigenen Fall prüfen, bevor fünfstellige Hardware-Beträge fliessen. Kaufen lohnt sich erst bei dauerhaft hohem Volumen, und ab welchem Punkt genau, ist eine Rechenaufgabe, keine Glaubensfrage.
Primärquellen zum Nachprüfen
- GPT-OSS in der Ollama-Bibliothek: offizielle Dateigrössen
- GPT-OSS 120B auf Hugging Face: Veröffentlichung, Speicherangaben, Lizenz
- AMD: 128B-Modelle auf Ryzen AI Max+ mit 128 GB
- NVIDIA DGX Spark: 128 GB gemeinsamer Speicher und Produktdaten
- NVIDIA SGLang Release Notes: aktueller GPT-OSS-Hinweis für DGX Spark
- Unsere Übersicht aller Modellklassen — verlassen Sie sich nicht auf eine einzige Quelle, auch nicht auf uns
Passt GPT-OSS 120B zu Ihrer Aufgabe?
Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.
Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.
Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.
-
Nachricht senden
Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.
-
Persönliche Antwort
Erste Einschätzung innerhalb von 24 Stunden.
-
Kostenloses Erstgespräch
Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.
Sehen wir keinen Nutzen, sagen wir es Ihnen offen.
Lieber direkt sprechen?
Ihre Anfrage
Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.