Wissen · Lokale KI

GPT-OSS 20B lokal betreiben: welche Hardware es braucht

Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten

OpenAIs offenes Modell: 21 Milliarden Parameter, ausgelegt auf Agenten, läuft in 16 GB.

GPT-OSS 20B ist OpenAIs kleineres offenes Modell und der Preis-Leistungs-Tipp der gehobenen Stufe: Als Mixture-of-Experts-Modell rechnet es je Anfrage nur rund 3,6 seiner 21 Milliarden Parameter und läuft dadurch mit rund 14 GB Modelldatei in 16 GB Grafik- oder gemeinsamem Speicher, spürbar schneller als gleich grosse dichte Modelle.

Auf einen Blick

Was GPT-OSS 20B an Hardware braucht

Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.

16 GB Grafikspeicher (VRAM)
32 GB Arbeitsspeicher (RAM)
14 GB Modelldatei (Q4)

Anschaffen

CHF 1'500–3'500 einmalig, passender PC

Mieten

CHF 100–250 pro Monat, GPU-Server

Genau auf 16 GB ausgelegt: Eine 16-GB-Grafikkarte oder ein Apple-Rechner tragen es, und dank der MoE-Bauweise fühlt es sich dabei flott an. Wer das grosse Kontextfenster ausreizen will, nimmt 24 GB.

Tempo-Erwartung: Dank Mixture-of-Experts deutlich schneller als gleich grosse dichte Modelle: auf einer 16-GB-Karte flüssiges bis zügiges Lesetempo.

So starten Sie: die Befehle zum Kopieren

Ollama installieren (kostenlos, ollama.com), dann im Terminal:

ollama pull gpt-oss:20b
ollama run gpt-oss:20b

Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.

Zum Nachschlagen

GPT-OSS 20B: alle Angaben im Detail

Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.

ModellklasseGehoben (14–20B), MoE · GPT-OSS (OpenAI, offene Modelle)
Parameter21 Milliarden gesamt, rund 3,6 aktiv je Token
Modelldateirund 14 GB (MXFP4)
Grafikspeicher (VRAM)16 GB
Arbeitsspeicher (RAM)32 GB
Apple (gemeinsamer Speicher)ab 16 GB möglich, komfortabel 24–32 GB
Kontextfensterbis 128'000 Tokens
LizenzApache 2.0, auch kommerziell frei
Ollama-Namegpt-oss:20b

Einordnung

Wo GPT-OSS 20B zwischen seinen Nachbarn steht

Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.

Qwen3 14B — gleiche Stufe als dichtes Modell, gleichmässige Qualität

Qwen3 32B — mehr Substanz für Planung, braucht 24 GB

GPT-OSS 120B — der grosse Bruder in der On-Prem-Profiklasse

Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»

Ehrlich eingeordnet

Wofür GPT-OSS 20B taugt, und wo die Grenzen liegen

Wofür es sich lohnt

GPT-OSS 20B ist auf agentische Einsätze ausgelegt: Werkzeuge aufrufen, mehrstufige Aufgaben abarbeiten, strukturiert antworten. Zusammen mit dem grossen Kontextfenster von 128'000 Tokens taugt es für Dokumentenauswertung, Auswertungs-Assistenten und die ersten ernsthaften Agenten-Aufbauten, und durch die MoE-Bauweise fühlen sich die Antworten flott an, auch auf bezahlbarer Hardware. Für Betriebe, die mit einem Modell möglichst viel abdecken wollen, ist es einer der ersten Kandidaten zum Testen.

Wo die Grenzen liegen

Die MoE-Bauweise macht das Modell schnell, nicht automatisch klüger: In der Tiefe einzelner Antworten liegt es in unserer Erfahrung gleichauf mit der 14B-Klasse, nicht darüber. Wer vor allem gleichmässige Textqualität sucht, sollte gegen Qwen3 14B testen; wer mehr Substanz für Planung und lange Arbeitsketten braucht, landet bei der 32B-Klasse oder beim grossen Bruder GPT-OSS 120B, der allerdings eine ganz andere Hardware-Liga voraussetzt.

Häufige Fragen

FAQ: GPT-OSS 20B lokal

Warum läuft ein 21-Milliarden-Modell in 16 GB Speicher?

GPT-OSS 20B ist ein Mixture-of-Experts-Modell (MoE): Je Token rechnet nur ein Teil des Modells, rund 3,6 von 21 Milliarden Parametern. Dazu ist es in MXFP4 quantisiert veröffentlicht, die Modelldatei ist damit rund 14 GB gross. Beides zusammen macht es auf 16-GB-Hardware lauffähig und schnell.

Reichen 16 GB VRAM für GPT-OSS 20B?

Ja, genau dafür ist es ausgelegt: Es läuft in 16 GB Grafikspeicher oder gemeinsamem Speicher. Wer das grosse Kontextfenster wirklich ausreizen will, etwa für sehr lange Dokumente, ist mit 24 GB entspannter unterwegs.

Darf ich GPT-OSS geschäftlich nutzen?

Ja. OpenAI hat die GPT-OSS-Modelle unter der Apache-2.0-Lizenz veröffentlicht, sie sind damit auch kommerziell frei nutzbar.

GPT-OSS 20B oder Qwen3 14B?

Beide liegen in derselben Stufe unserer Matrix. GPT-OSS 20B ist schneller und auf agentische Aufgaben ausgelegt, Qwen3 14B liefert als dichtes Modell gleichmässige, planbare Qualität. Der ehrliche Weg ist der Test mit den eigenen Aufgaben: Beide sind gratis, und der Unterschied zeigt sich an Ihren Dokumenten, nicht am Datenblatt.

Passt GPT-OSS 20B zu Ihrer Aufgabe?

Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.

Erstgespräch anfragen

Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.

Daniel Bidoli, Inhaber von Bidoli IT-Services

Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.

  1. Nachricht senden

    Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.

  2. Persönliche Antwort

    Erste Einschätzung innerhalb von 24 Stunden.

  3. Kostenloses Erstgespräch

    Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.

Sehen wir keinen Nutzen, sagen wir es Ihnen offen.

Lieber direkt sprechen?

+41 76 753 37 86 · WhatsApp

Ihre Anfrage

Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.

Antwort in der Regel innerhalb von 24 Stunden.