Wissen · Lokale KI

Llama 3.3 70B lokal betreiben: welche Hardware es braucht

Faktencheck: 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Hersteller- und Ollama-Quellen unten

Die höchste übliche lokale Qualitätsstufe, für Aufgaben, an denen die Mittelklasse scheitert.

Llama 3.3 70B ist Metas grosses dichtes Modell und die höchste Qualitätsstufe, die im eigenen Haus üblicherweise betrieben wird. Die Modelldatei ist rund 43 GB gross; praktisch braucht es 64 bis 80 GB Grafik- oder gemeinsamen Speicher, also mehrere Karten, eine Profi-Karte oder einen grossen Apple-Rechner.

Auf einen Blick

Was Llama 3.3 70B an Hardware braucht

Dieselben Einstufungen wie im Hardware-Rechner, hier für dieses eine Modell: Speicher, Anschaffen gegen Mieten, die passenden Anwendungsfälle und die Befehle zum Ausprobieren.

64–80 GB Grafikspeicher (VRAM)
64–96 GB Arbeitsspeicher (RAM)
43 GB Modelldatei (Q4)

Anschaffen

fünfstellig Workstation mit Profi-Speicher, erst nach bestandenem Test

Mieten

stundenweise GPU-Server, so prüft man die Klasse vor dem Kauf

Passende Anwendungsfälle im Rechner

Die grosse Klasse: 64 bis 80 GB Grafik- oder gemeinsamer Speicher, also mehrere Karten, eine Profi-Karte oder ein grosser Apple-Rechner. Qualität kostet hier Hardware und Tempo, und beides will vor dem Kauf gemessen sein.

Tempo-Erwartung: Auch auf starker Hardware bedächtig: ein dichtes 70B-Modell ist grob halb so schnell wie ein 32B. Qualität kostet hier Tempo.

So starten Sie: die Befehle zum Kopieren

Ollama installieren (kostenlos, ollama.com), dann im Terminal:

ollama pull llama3.3:70b
ollama run llama3.3:70b

Q4-Planungswerte aus unserer internen Ollama-Hardware-Matrix, geprüft am 3. September 2026. Auf Apple-Rechnern teilen sich Modell und System den gemeinsamen Speicher, dort zählt die RAM-Angabe. Preise sind grobe Marktgrössenordnungen, keine Offerten.

Zum Nachschlagen

Llama 3.3 70B: alle Angaben im Detail

Geprüft am 3. September 2026. Kontextlänge, Parallelität, Bilddaten und Quantisierung verändern den tatsächlichen Bedarf; jede Zahl lässt sich gegen die Primärquellen unten prüfen.

ModellklasseGross (70–80B) · Llama-Familie (Meta)
Parameter70,6 Milliarden
Modelldateirund 43 GB (Q4, GGUF)
Grafikspeicher (VRAM)64–80 GB
Arbeitsspeicher (RAM)64–96 GB
Apple (gemeinsamer Speicher)ab 64 GB knapp, komfortabel 96 GB und mehr
Kontextfensterbis 128'000 Tokens
LizenzLlama-Community-Lizenz (eigene Bedingungen)
Ollama-Namellama3.3:70b

Einordnung

Wo Llama 3.3 70B zwischen seinen Nachbarn steht

Alle Modellprofile unserer Matrix, vom kleinsten zum grössten. Die Stufe entscheidet über die Hardware, und der ehrliche Weg führt von klein nach gross: erst testen, dann aufrüsten.

Qwen3 32B — die Stufe darunter, läuft schon auf einer 24-GB-Karte

GPT-OSS 120B — die MoE-Alternative in der grossen Klasse

Hardware-Rechner — alle Stufen, Anwendungsfälle und der Umkehr-Modus «Was kann meine Hardware?»

Ehrlich eingeordnet

Wofür Llama 3.3 70B taugt, und wo die Grenzen liegen

Wofür es sich lohnt

Wo die Mittelklasse an schweren Aufgaben scheitert, feinen Formulierungen, komplexen Analysen, langen Gedankengängen, spielt die 70B-Klasse ihre Stärke aus: Sie liefert die höchste lokale Qualität, die sich ohne Rechenzentrum erreichen lässt. Llama 3.3 ist dabei der bewährte Vertreter, mehrsprachig stark, gut dokumentiert und mit einer grossen Gemeinschaft dahinter, was bei Problemen im Betrieb mehr wert ist, als es klingt.

Wo die Grenzen liegen

Die Hardware ist die eine Hürde: Unter 48 GB Speicher läuft nichts Sinnvolles, geplant wird nach unserer Matrix mit 64 bis 80 GB. Die Lizenz ist die andere: Llama steht nicht unter Apache 2.0, sondern unter Metas eigener Community-Lizenz, die kommerzielle Nutzung erlaubt, aber Bedingungen stellt. Für praktisch jedes KMU ist das unkritisch, die Prüfung gehört aber ins Projekt. Und ehrlich verglichen: Die MoE-Alternative GPT-OSS 120B liefert ähnliche Ansprüche bei anderem Profil, ein Vergleichstest lohnt sich, bevor diese Hardware-Klasse angeschafft wird.

Häufige Fragen

FAQ: Llama 3.3 70B lokal

Reicht eine RTX 4090 mit 24 GB für Llama 3.3 70B?

Nein. Die Q4-Modelldatei ist allein rund 43 GB gross und passt nicht in 24 GB Grafikspeicher. Rechnerisch tragen zwei 24-GB-Karten das Modell mit knappem Kontext; geplant wird nach unserer Matrix ehrlicherweise mit 64 bis 80 GB Grafik- oder gemeinsamem Speicher. Wer eine einzelne 24-GB-Karte hat, ist mit Qwen3 32B in der Stufe darunter richtig.

Läuft Llama 3.3 70B auf einem Mac?

Ab 64 GB gemeinsamem Speicher läuft es mit knappem Kontext, komfortabel wird es ab 96 GB, etwa auf einem gut ausgebauten Mac Studio. Das Tempo bleibt bedächtig: Ein dichtes 70B-Modell bewegt bei jeder Antwort sehr viel Speicher, die Bandbreite des Geräts bestimmt das Lesetempo.

Darf ich Llama geschäftlich nutzen?

Für praktisch jedes KMU ja, aber anders als bei Apache-2.0-Modellen steht Llama unter Metas eigener Community-Lizenz mit Bedingungen, unter anderem einer Grössengrenze, die nur Konzerne mit hunderten Millionen Nutzern betrifft. Die Lizenzprüfung für den konkreten Einsatzfall gehört bei uns zur Analyse dazu.

Lohnt sich der Schritt von 32B auf 70B?

Nur mit Nachweis: Erst wenn die 32B-Klasse an den echten Aufgaben scheitert, rechtfertigt der Qualitätsgewinn die grob verdoppelte Hardware und das halbierte Tempo. Der Test kostet nichts, notfalls für ein paar Franken stundenweise auf einem gemieteten GPU-Server, bevor gekauft wird.

Primärquellen zum Nachprüfen

Passt Llama 3.3 70B zu Ihrer Aufgabe?

Das klärt kein Datenblatt, sondern ein Test mit Ihren echten Unterlagen. Im kostenlosen Erstgespräch grenzen wir die Aufgabe ab und sagen ehrlich, ob lokale KI der richtige Weg ist, oder ob es eine einfachere Antwort gibt. Erst messen, dann investieren.

Erstgespräch anfragen

Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.

Daniel Bidoli, Inhaber von Bidoli IT-Services

Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.

  1. Nachricht senden

    Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.

  2. Persönliche Antwort

    Erste Einschätzung innerhalb von 24 Stunden.

  3. Kostenloses Erstgespräch

    Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.

Sehen wir keinen Nutzen, sagen wir es Ihnen offen.

Lieber direkt sprechen?

+41 76 753 37 86 · WhatsApp

Ihre Anfrage

Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.

Antwort in der Regel innerhalb von 24 Stunden.