Wissen · Lokale KI
GPT-OSS 20B lokal betreiben: welche Hardware es braucht
Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten
OpenAIs offenes Modell: 21 Milliarden Parameter, ausgelegt auf Agenten, läuft in 16 GB.
GPT-OSS 20B ist OpenAIs kleineres offenes Modell und der Preis-Leistungs-Tipp der gehobenen Stufe: Als Mixture-of-Experts-Modell rechnet es je Anfrage nur rund 3,6 seiner 21 Milliarden Parameter und läuft dadurch mit rund 14 GB Modelldatei in 16 GB Grafik- oder gemeinsamem Speicher, spürbar schneller als gleich grosse dichte Modelle.
Auf einen Blick
Was GPT-OSS 20B an Hardware braucht
Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.
Anschaffen
CHF 1'500–3'500 einmalig, passender PCMieten
CHF 100–250 pro Monat, GPU-ServerPassende Anwendungsfälle im Rechner
Genau auf 16 GB ausgelegt: Eine 16-GB-Grafikkarte oder ein Apple-Rechner tragen es, und dank der MoE-Bauweise fühlt es sich dabei flott an. Wer das grosse Kontextfenster ausreizen will, nimmt 24 GB.
Tempo-Erwartung: Dank Mixture-of-Experts deutlich schneller als gleich grosse dichte Modelle: auf einer 16-GB-Karte flüssiges bis zügiges Lesetempo.
So starten Sie: die Befehle zum Kopieren
Ollama installieren (kostenlos, ollama.com), dann im Terminal:
ollama pull gpt-oss:20b ollama run gpt-oss:20b
Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.
Zum Nachschlagen
GPT-OSS 20B: alle Angaben im Detail
Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.
| Modellklasse | Gehoben (14–20B), MoE · GPT-OSS (OpenAI, offene Modelle) |
| Parameter | 21 Milliarden gesamt, rund 3,6 aktiv je Token |
| Modelldatei | rund 14 GB (MXFP4) |
| Grafikspeicher (VRAM) | 16 GB |
| Arbeitsspeicher (RAM) | 32 GB |
| Apple (gemeinsamer Speicher) | ab 16 GB möglich, komfortabel 24–32 GB |
| Kontextfenster | bis 128'000 Tokens |
| Lizenz | Apache 2.0, auch kommerziell frei |
| Ollama-Name | gpt-oss:20b |
Einordnung
Wo GPT-OSS 20B zwischen seinen Nachbarn steht
Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.
Qwen3 14B — gleiche Stufe als dichtes Modell, gleichmässige Qualität
Qwen3 32B — mehr Substanz für Planung, braucht 24 GB
GPT-OSS 120B — der grosse Bruder in der On-Prem-Profiklasse
Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»
Ehrlich eingeordnet
Wofür GPT-OSS 20B taugt, und wo die Grenzen liegen
Wofür es sich lohnt
GPT-OSS 20B ist auf agentische Einsätze ausgelegt: Werkzeuge aufrufen, mehrstufige Aufgaben abarbeiten, strukturiert antworten. Zusammen mit dem grossen Kontextfenster von 128'000 Tokens taugt es für Dokumentenauswertung, Auswertungs-Assistenten und die ersten ernsthaften Agenten-Aufbauten, und durch die MoE-Bauweise fühlen sich die Antworten flott an, auch auf bezahlbarer Hardware. Für Betriebe, die mit einem Modell möglichst viel abdecken wollen, ist es einer der ersten Kandidaten zum Testen.
Wo die Grenzen liegen
Die MoE-Bauweise macht das Modell schnell, nicht automatisch klüger: In der Tiefe einzelner Antworten liegt es in unserer Erfahrung gleichauf mit der 14B-Klasse, nicht darüber. Wer vor allem gleichmässige Textqualität sucht, sollte gegen Qwen3 14B testen; wer mehr Substanz für Planung und lange Arbeitsketten braucht, landet bei der 32B-Klasse oder beim grossen Bruder GPT-OSS 120B, der allerdings eine ganz andere Hardware-Liga voraussetzt.
Häufige Fragen
FAQ: GPT-OSS 20B lokal
Warum läuft ein 21-Milliarden-Modell in 16 GB Speicher?
GPT-OSS 20B ist ein Mixture-of-Experts-Modell (MoE): Je Token rechnet nur ein Teil des Modells, rund 3,6 von 21 Milliarden Parametern. Dazu ist es in MXFP4 quantisiert veröffentlicht, die Modelldatei ist damit rund 14 GB gross. Beides zusammen macht es auf 16-GB-Hardware lauffähig und schnell.
Reichen 16 GB VRAM für GPT-OSS 20B?
Ja, genau dafür ist es ausgelegt: Es läuft in 16 GB Grafikspeicher oder gemeinsamem Speicher. Wer das grosse Kontextfenster wirklich ausreizen will, etwa für sehr lange Dokumente, ist mit 24 GB entspannter unterwegs.
Darf ich GPT-OSS geschäftlich nutzen?
Ja. OpenAI hat die GPT-OSS-Modelle unter der Apache-2.0-Lizenz veröffentlicht, sie sind damit auch kommerziell frei nutzbar.
GPT-OSS 20B oder Qwen3 14B?
Beide liegen in derselben Stufe unserer Matrix. GPT-OSS 20B ist schneller und auf agentische Aufgaben ausgelegt, Qwen3 14B liefert als dichtes Modell gleichmässige, planbare Qualität. Der ehrliche Weg ist der Test mit den eigenen Aufgaben: Beide sind gratis, und der Unterschied zeigt sich an Ihren Dokumenten, nicht am Datenblatt.
Primärquellen zum Nachprüfen
- GPT-OSS in der Ollama-Bibliothek: offizielle Dateigrössen
- GPT-OSS 20B auf Hugging Face: Veröffentlichung, Speicherangaben, Lizenz
- Unsere Übersicht aller Modellklassen — verlassen Sie sich nicht auf eine einzige Quelle, auch nicht auf uns
Passt GPT-OSS 20B zu Ihrer Aufgabe?
Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.
Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.
Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.
-
Nachricht senden
Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.
-
Persönliche Antwort
Erste Einschätzung innerhalb von 24 Stunden.
-
Kostenloses Erstgespräch
Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.
Sehen wir keinen Nutzen, sagen wir es Ihnen offen.
Lieber direkt sprechen?
Ihre Anfrage
Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.