Wissen · Lokale KI

GPT-OSS 120B lokal betreiben: welche Hardware es braucht

Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten

Die professionelle On-Prem-Klasse: höchste offene Qualität auf einer einzelnen 80-GB-Karte.

GPT-OSS 120B ist OpenAIs grosses offenes Modell und die übliche Obergrenze dessen, was ein Betrieb noch im eigenen Haus betreibt: rund 65 GB Modelldatei, passend für eine 80-GB-Profi-Karte oder ein System mit 96 bis 128 GB gemeinsamem Speicher. Dazu zählen neben grossen Macs inzwischen auch kompakte Ryzen-AI-Max+- und NVIDIA-GB10-Systeme. Für die meisten KMU ist das der übernächste Schritt, nicht der erste.

Auf einen Blick

Was GPT-OSS 120B an Hardware braucht

Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.

80 GB VRAM oder 96–128 GB gemeinsamer Speicher Grafikspeicher (VRAM)
96–128 GB Arbeitsspeicher (RAM)
65 GB Modelldatei (Q4)

Anschaffen

ab etwa CHF 3'200 128-GB-Komplettsystem; Profi-GPU deutlich höher

Mieten

stundenweise GPU-Server mit 80-GB-Karte, der übliche Einstieg

Passende Anwendungsfälle im Rechner

Früher fast nur Server-Klasse, heute auch ein Testfall für 128-GB-Systeme: grosse Macs, Ryzen AI Max+ und NVIDIA GB10 bringen genug Kapazität auf den Schreibtisch. Runtime-Kompatibilität und Tempo müssen vor dem Kauf mit exakt diesem Modell geprüft werden.

Tempo-Erwartung: Auf einer 80-GB-Profi-Karte zügig, dank MoE trotz der Grösse. Systeme mit 96 bis 128 GB gemeinsamem Speicher können es tragen, antworten wegen geringerer Bandbreite aber nicht automatisch schnell.

So starten Sie: die Befehle zum Kopieren

Ollama installieren (kostenlos, ollama.com), dann im Terminal:

ollama pull gpt-oss:120b
ollama run gpt-oss:120b

Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.

Zum Nachschlagen

GPT-OSS 120B: alle Angaben im Detail

Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.

ModellklasseHigh-End (120B, MoE) · GPT-OSS (OpenAI, offene Modelle)
Parameter117 Milliarden gesamt, rund 5,1 aktiv je Token
Modelldateirund 65 GB (MXFP4)
Grafikspeicher (VRAM)80 GB VRAM oder 96–128 GB gemeinsamer Speicher
Arbeitsspeicher (RAM)96–128 GB
Apple (gemeinsamer Speicher)ab 96 GB, eher 128 GB gemeinsamer Speicher
Kontextfensterbis 128'000 Tokens
LizenzApache 2.0, auch kommerziell frei
Ollama-Namegpt-oss:120b

Einordnung

Wo GPT-OSS 120B zwischen seinen Nachbarn steht

Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.

GPT-OSS 20B — der Einstieg in dieselbe Familie, läuft in 16 GB

Llama 3.3 70B — dichte Alternative in der grossen Klasse

Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»

Ehrlich eingeordnet

Wofür GPT-OSS 120B taugt, und wo die Grenzen liegen

Wofür es sich lohnt

Wer die Qualität der grossen Cloud-Modelle möglichst nah im eigenen Haus will, landet in dieser Klasse: schwere Analysen, anspruchsvolle Agenten-Aufbauten, Aufgaben, an denen die Mittelklasse nachweislich scheitert. Durch die Mixture-of-Experts-Bauweise rechnen je Token nur rund 5 der 117 Milliarden Parameter, deshalb reicht eine einzelne 80-GB-Karte, wo dichte Modelle dieser Grösse mehrere Karten bräuchten. Das ist die Klasse für Betriebe mit hartem Datenschutz-Auftrag und echtem Volumen.

Wo die Grenzen liegen

Die ehrliche Einordnung zuerst: 128 GB Speicherkapazität sind noch kein Tempoversprechen. Gemeinsamer Speicher ist deutlich langsamer als der VRAM einer Profi-GPU, und Runtime, Treiber sowie Prozessorarchitektur entscheiden mit. Die NVIDIA-SGLang-Release-Notes vom 31. August 2026 nennen beispielsweise einen bekannten GPT-OSS-Fehler auf DGX Spark; andere Laufzeiten können sich anders verhalten. Darum das konkrete Modell vor dem Kauf testen. Wer das Volumen nicht dauerhaft hat, mietet diese Stufe zunächst stundenweise. Der Einstieg in dieselbe Modellfamilie beginnt beim GPT-OSS 20B auf Hardware ab 16 GB.

Häufige Fragen

FAQ: GPT-OSS 120B lokal

Welche aktuelle Hardwareklasse passt zu GPT-OSS 120B?

Die rund 65 GB grosse Modelldatei braucht eine 80-GB-Profi-GPU oder 96 bis 128 GB gemeinsamen Speicher. Neben grossen Macs kommen dafür heute auch Ryzen-AI-Max+-Systeme mit 128 GB und NVIDIA-GB10-Systeme infrage. Ob die gewünschte Runtime das Modell auf der Plattform vollständig beschleunigt und schnell genug ausführt, muss vor dem Kauf getestet werden.

Warum reicht eine einzige Karte für 117 Milliarden Parameter?

GPT-OSS 120B ist ein Mixture-of-Experts-Modell: Je Token rechnen nur rund 5 der 117 Milliarden Parameter, und veröffentlicht ist es in MXFP4-Quantisierung mit rund 65 GB Dateigrösse. Dichte Modelle dieser Klasse bräuchten ein Mehrfaches an Speicher und damit mehrere Karten.

Braucht ein KMU GPT-OSS 120B?

Selten als ersten Schritt. Die Stufe lohnt sich, wenn kleinere Modelle an den echten Aufgaben nachweislich scheitern und zugleich ein harter Grund gegen die Cloud besteht, etwa Berufsgeheimnis oder Datenschutz-Auflagen. Der übliche Weg führt über Tests mit der 14B- bis 32B-Klasse; erst deren Scheitern rechtfertigt die Investition in diese Hardware-Liga.

Kaufen oder mieten?

Bei dieser Stufe meist mieten, zumindest zu Beginn: GPU-Server mit 80-GB-Karten lassen sich stundenweise nutzen, damit lässt sich die Qualität am eigenen Fall prüfen, bevor fünfstellige Hardware-Beträge fliessen. Kaufen lohnt sich erst bei dauerhaft hohem Volumen, und ab welchem Punkt genau, ist eine Rechenaufgabe, keine Glaubensfrage.

Passt GPT-OSS 120B zu Ihrer Aufgabe?

Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.

Erstgespräch anfragen

Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.

Daniel Bidoli, Inhaber von Bidoli IT-Services

Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.

  1. Nachricht senden

    Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.

  2. Persönliche Antwort

    Erste Einschätzung innerhalb von 24 Stunden.

  3. Kostenloses Erstgespräch

    Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.

Sehen wir keinen Nutzen, sagen wir es Ihnen offen.

Lieber direkt sprechen?

+41 76 753 37 86 · WhatsApp

Ihre Anfrage

Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.

Antwort in der Regel innerhalb von 24 Stunden.