Wissen · Lokale KI
Llama 3.3 70B lokal betreiben: welche Hardware es braucht
Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten
Die höchste übliche lokale Qualitätsstufe, für Aufgaben, an denen die Mittelklasse scheitert.
Llama 3.3 70B ist Metas grosses dichtes Modell und die höchste Qualitätsstufe, die im eigenen Haus üblicherweise betrieben wird. Die Modelldatei ist rund 43 GB gross; praktisch braucht es 64 bis 80 GB Grafik- oder gemeinsamen Speicher, also mehrere Karten, eine Profi-Karte oder einen grossen Apple-Rechner.
Auf einen Blick
Was Llama 3.3 70B an Hardware braucht
Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.
Anschaffen
fünfstellig Workstation mit Profi-Speicher, erst nach bestandenem TestMieten
stundenweise GPU-Server, so prüft man die Klasse vor dem KaufPassende Anwendungsfälle im Rechner
Die grosse Klasse: 64 bis 80 GB Grafik- oder gemeinsamer Speicher, also mehrere Karten, eine Profi-Karte oder ein grosser Apple-Rechner. Qualität kostet hier Hardware und Tempo, und beides will vor dem Kauf gemessen sein.
Tempo-Erwartung: Auch auf starker Hardware bedächtig: ein dichtes 70B-Modell ist grob halb so schnell wie ein 32B. Qualität kostet hier Tempo.
So starten Sie: die Befehle zum Kopieren
Ollama installieren (kostenlos, ollama.com), dann im Terminal:
ollama pull llama3.3:70b ollama run llama3.3:70b
Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.
Zum Nachschlagen
Llama 3.3 70B: alle Angaben im Detail
Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.
| Modellklasse | Gross (70–80B) · Llama-Familie (Meta) |
| Parameter | 70,6 Milliarden |
| Modelldatei | rund 43 GB (Q4, GGUF) |
| Grafikspeicher (VRAM) | 64–80 GB |
| Arbeitsspeicher (RAM) | 64–96 GB |
| Apple (gemeinsamer Speicher) | ab 64 GB knapp, komfortabel 96 GB und mehr |
| Kontextfenster | bis 128'000 Tokens |
| Lizenz | Llama-Community-Lizenz (eigene Bedingungen) |
| Ollama-Name | llama3.3:70b |
Einordnung
Wo Llama 3.3 70B zwischen seinen Nachbarn steht
Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.
Qwen3 32B — die Stufe darunter, läuft schon auf einer 24-GB-Karte
GPT-OSS 120B — die MoE-Alternative in der grossen Klasse
Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»
Ehrlich eingeordnet
Wofür Llama 3.3 70B taugt, und wo die Grenzen liegen
Wofür es sich lohnt
Wo die Mittelklasse an schweren Aufgaben scheitert, feinen Formulierungen, komplexen Analysen, langen Gedankengängen, spielt die 70B-Klasse ihre Stärke aus: Sie liefert die höchste lokale Qualität, die sich ohne Rechenzentrum erreichen lässt. Llama 3.3 ist dabei der bewährte Vertreter, mehrsprachig stark, gut dokumentiert und mit einer grossen Gemeinschaft dahinter, was bei Problemen im Betrieb mehr wert ist, als es klingt.
Wo die Grenzen liegen
Die Hardware ist die eine Hürde: Unter 48 GB Speicher läuft nichts Sinnvolles, geplant wird nach unserer Matrix mit 64 bis 80 GB. Die Lizenz ist die andere: Llama steht nicht unter Apache 2.0, sondern unter Metas eigener Community-Lizenz, die kommerzielle Nutzung erlaubt, aber Bedingungen stellt. Für praktisch jedes KMU ist das unkritisch, die Prüfung gehört aber ins Projekt. Und ehrlich verglichen: Die MoE-Alternative GPT-OSS 120B liefert ähnliche Ansprüche bei anderem Profil, ein Vergleichstest lohnt sich, bevor diese Hardware-Klasse angeschafft wird.
Häufige Fragen
FAQ: Llama 3.3 70B lokal
Reicht eine RTX 4090 mit 24 GB für Llama 3.3 70B?
Nein. Die Q4-Modelldatei ist allein rund 43 GB gross und passt nicht in 24 GB Grafikspeicher. Rechnerisch tragen zwei 24-GB-Karten das Modell mit knappem Kontext; geplant wird nach unserer Matrix ehrlicherweise mit 64 bis 80 GB Grafik- oder gemeinsamem Speicher. Wer eine einzelne 24-GB-Karte hat, ist mit Qwen3 32B in der Stufe darunter richtig.
Läuft Llama 3.3 70B auf einem Mac?
Ab 64 GB gemeinsamem Speicher läuft es mit knappem Kontext, komfortabel wird es ab 96 GB, etwa auf einem gut ausgebauten Mac Studio. Das Tempo bleibt bedächtig: Ein dichtes 70B-Modell bewegt bei jeder Antwort sehr viel Speicher, die Bandbreite des Geräts bestimmt das Lesetempo.
Darf ich Llama geschäftlich nutzen?
Für praktisch jedes KMU ja, aber anders als bei Apache-2.0-Modellen steht Llama unter Metas eigener Community-Lizenz mit Bedingungen, unter anderem einer Grössengrenze, die nur Konzerne mit hunderten Millionen Nutzern betrifft. Die Lizenzprüfung für den konkreten Einsatzfall gehört bei uns zur Analyse dazu.
Lohnt sich der Schritt von 32B auf 70B?
Nur mit Nachweis: Erst wenn die 32B-Klasse an den echten Aufgaben scheitert, rechtfertigt der Qualitätsgewinn die grob verdoppelte Hardware und das halbierte Tempo. Der Test kostet nichts, notfalls für ein paar Franken stundenweise auf einem gemieteten GPU-Server, bevor gekauft wird.
Primärquellen zum Nachprüfen
- Llama 3.3 in der Ollama-Bibliothek: offizielle Dateigrössen
- Meta Llama: Modellfamilie und Lizenzbedingungen
- Unsere Übersicht aller Modellklassen — verlassen Sie sich nicht auf eine einzige Quelle, auch nicht auf uns
Passt Llama 3.3 70B zu Ihrer Aufgabe?
Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.
Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.
Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.
-
Nachricht senden
Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.
-
Persönliche Antwort
Erste Einschätzung innerhalb von 24 Stunden.
-
Kostenloses Erstgespräch
Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.
Sehen wir keinen Nutzen, sagen wir es Ihnen offen.
Lieber direkt sprechen?
Ihre Anfrage
Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.