Wissen · Lokale KI

Ollama: der Einstieg in lokale KI, auf Deutsch erklärt

Ein Befehl lädt das Modell, der zweite startet das Gespräch. Keine Cloud, kein Konto, keine Kreditkarte.

Ollama ist das freie Werkzeug, das lokale Sprachmodelle alltagstauglich gemacht hat: installieren, Modell laden, loslegen, auf Windows, Mac und Linux. Auf dieser Seite steht, was es ist und was nicht, die Befehle, die Sie wirklich brauchen, und der Weg vom ersten Versuch zum Werkzeug fürs ganze Team.

Einordnung

Was Ollama ist, und was nicht

Der Motorträger, nicht der Motor

Ollama ist nicht selbst die KI, sondern das Werkzeug, das offene Modelle wie Qwen3.5, Gemma 4, Llama oder GPT-OSS auf Ihrem Rechner lädt, verwaltet und startet. Es kümmert sich um das Technische, also Download, Speicher, Grafikkarte, und stellt daneben eine Schnittstelle bereit, über die andere Programme das Modell nutzen können. Quelloffen unter MIT-Lizenz, kostenlos, ohne Konto.

Keine Cloud im Tarnanzug

Internet braucht Ollama genau einmal: zum Herunterladen des Modells. Danach passiert alles auf Ihrer Maschine, auf Wunsch vollständig offline; Eingaben, Dokumente und Antworten verlassen den Rechner nicht. Was das Modell kann, hängt an Modell und Hardware, nicht an Ollama, und genau dafür gibt es unseren Hardware-Rechner.

Die Anleitung

In drei Schritten zum ersten Gespräch

Auf einem halbwegs aktuellen Rechner steht das erste laufende Modell in einer Viertelstunde, den Download eingerechnet.

  1. Installieren

    Auf ollama.com den Installer für Windows oder macOS laden und ausführen; unter Linux genügt der dort angegebene Installationsbefehl. Danach läuft Ollama im Hintergrund und wartet auf Befehle im Terminal (Windows: Eingabeaufforderung oder PowerShell).

  2. Modell laden und loslegen

    Der Befehl ollama run qwen3.5:9b erledigt beides: Beim ersten Mal lädt er das Modell (rund 6,6 GB) herunter, danach startet er direkt das Gespräch im Terminal. Tippen, Enter, Antwort, das ist der ganze Zauber. Beenden mit /bye.

  3. Mit einer echten Aufgabe testen

    Nicht mit Witzen und Wissensfragen testen, sondern mit einem echten Dokument, einer echten E-Mail, einer echten Auswertung aus Ihrem Alltag. Die Daten bleiben dabei ohnehin auf Ihrem Rechner, genau das ist ja der Punkt. Ob Qualität und Tempo reichen, entscheidet dieser Test, nicht ein Datenblatt.

Zum Nachschlagen

Die Ollama-Befehle, die Sie wirklich brauchen

Stand 5. September 2026 (Ollama 0.33.3). Mehr braucht der Alltag selten; die vollständige Referenz steht in der offiziellen Dokumentation.

BefehlWas er tut
ollama run qwen3.5:9bStartet das Gespräch mit dem Modell; lädt es beim ersten Aufruf automatisch herunter. Der eine Befehl, der alles kann.
ollama pull gemma4:12bLädt ein Modell nur herunter, ohne es zu starten. Praktisch, um Downloads vorzuziehen.
ollama listZeigt alle heruntergeladenen Modelle samt Grösse: der Überblick über den Platzverbrauch.
ollama psZeigt, welches Modell gerade im Speicher läuft und wie viel es belegt.
ollama rm qwen3:4bLöscht ein Modell von der Platte. Ausprobiertes wieder aufräumen gehört dazu, die Dateien sind gross.
/byeBeendet das laufende Gespräch im Terminal.

Welches Modell zuerst? Stand September 2026

Auf schwächeren Rechnern startet qwen3.5:4b (3,4 GB). Welche Modellklasse Ihre Aufgabe braucht und ob Ihre Hardware reicht, beantwortet der Hardware-Rechner, je Anwendungsfall und im Umkehr-Modus je vorhandenem Rechner.

Praxiswissen

Was man nach der ersten Woche wissen will

Wo die Modelle liegen, und wie viel Platz sie fressen

Alle Modelle liegen im versteckten Ordner .ollama Ihres Benutzerverzeichnisses. Die Dateien sind gross: rund 5 bis 7 GB für die 8B/9B-Klasse, gut 9 GB für 14B, 17 bis 20 GB für 27B bis 32B. Wer fleissig ausprobiert, ist schnell bei zweistelligen Gigabytes; ollama list zeigt den Bestand, ollama rm räumt auf. Auf knappen SSDs gehört das in die Wartungsroutine.

Die eingebaute Schnittstelle

Ollama hört lokal auf Port 11434 und lässt sich darüber von anderen Programmen nutzen: Chat-Oberflächen, Editor-Erweiterungen, eigene Skripte, ganze Abläufe. Das ist der Punkt, an dem aus dem Terminal-Spielzeug ein Baustein für interne Suche, Dokumenten-Workflows und Agenten wird, und der Teil, den wir für Betriebe bauen.

Wenn es zäh läuft

Fast immer ist das Modell zu gross für den Speicher: Dann rechnet der Prozessor statt der Grafikkarte, und aus Lesetempo wird Warten. Die Abhilfe ist ein kleineres Modell (qwen3.5:4b statt qwen3.5:9b) oder der Blick in den Umkehr-Modus des Rechners, der zeigt, was Ihre Hardware wirklich trägt. Erst danach lohnt der Gedanke an neue Hardware.

Ollama oder LM Studio?

LM Studio bietet eine grafische Oberfläche und ist für den allerersten Kontakt bequemer, ist aber kein quelloffenes Projekt. Ollama ist quelloffen, schlanker und über seine Schnittstelle der übliche Unterbau für alles, was angebunden werden soll. Zum Ausprobieren taugen beide; wer Richtung Betriebseinsatz denkt, fährt mit Ollama besser.

Für den Betrieb

Ollama im KMU-Netz sicher betreiben

Ein Rechner im Haus, alle nutzen ihn: Das ist der Punkt, an dem aus dem Versuch ein Werkzeug wird. Vier Dinge gehören dazu, geprüft gegen die offizielle Dokumentation, Stand September 2026.

1. Bind-Adresse: nur so weit öffnen wie nötig

Ab Werk hört Ollama auf 127.0.0.1:11434, also nur auf dem eigenen Rechner. Für das Firmennetz setzt man die Umgebungsvariable OLLAMA_HOST=0.0.0.0:11434 (unter Linux per systemctl edit ollama.service, auf dem Mac per launchctl setenv, unter Windows in den Umgebungsvariablen) und begrenzt in der Firewall, welche Rechner den Port erreichen. Browser-Werkzeuge brauchen zusätzlich OLLAMA_ORIGINS.

2. Zugriffsschutz: Ollama hat keine Anmeldung

Wer den Port erreicht, darf alles: Modelle laden, löschen, Fragen stellen. Darum gehört ein Reverse-Proxy davor (nginx oder Caddy), der TLS liefert und eine Anmeldung oder ein Token verlangt; erst so lässt sich sagen, wer den KI-Server benutzt. Ohne diesen Schritt bleibt der Server im Büro-Netz, nie am Internet.

3. Speicher und Geduld richtig einstellen

OLLAMA_KEEP_ALIVE bestimmt, wie lange ein Modell nach der letzten Anfrage im Grafikspeicher bleibt (ab Werk fünf Minuten); auf einem Team-Server lohnt eine längere Frist, sonst zahlt jede Anfrage die Ladezeit neu. Mehrere Modelle gleichzeitig kosten mehrfach Speicher: Der Rechner zeigt im Expertenmodus, was Parallelität ausmacht.

4. Updates gehören in den Kalender

Ollama erscheint mehrmals im Monat neu (aktuell 0.33.3 vom 2. September 2026); neue Modelle setzen oft eine neue Version voraus, und Sicherheitskorrekturen kommen auf demselben Weg. Ein fester Update-Termin im Monat plus kurzer Funktionstest reicht; wer den Server produktiv nutzt, hält ausserdem fest, welche Modelle in welcher Version freigegeben sind.

Häufige Fragen

FAQ: Ollama

Ist Ollama kostenlos?

Ja, vollständig: Ollama ist quelloffen (MIT-Lizenz), kostet nichts und finanziert sich nicht über Ihre Daten. Auch die Modelle aus der Ollama-Bibliothek sind frei herunterladbar; was deren jeweilige Lizenz für die geschäftliche Nutzung erlaubt, steht bei jedem Modell dabei und gehört vor dem produktiven Einsatz geprüft.

Schickt Ollama meine Eingaben ins Internet?

Nein. Internet braucht Ollama nur einmal, zum Herunterladen der Modelle; das Rechnen selbst passiert vollständig auf Ihrer Maschine, auf Wunsch komplett offline. Ihre Eingaben und Dokumente verlassen den Rechner nicht, genau das ist der Punkt an lokaler KI.

Welches Modell soll ich zuerst laden?

Qwen3.5 9B ist seit 2026 der übliche Einstieg (ollama run qwen3.5:9b, 6,6 GB): gut auf Deutsch, versteht auch Bilder, läuft auf einer 8-GB-Grafikkarte oder einem Apple-Rechner ab 16 GB. Auf schwächeren Rechnern startet man mit Qwen3.5 4B; das bewährte Qwen3 8B läuft unverändert. Welche Modellklasse Ihre konkrete Aufgabe braucht, zeigt unser Hardware-Rechner samt Übersichtstabelle.

Wo speichert Ollama die Modelle, und wie viel Platz brauchen sie?

Im versteckten Ordner .ollama im Benutzerverzeichnis, auf allen Systemen. Die Dateien sind gross: rund 5 bis 7 GB für ein Modell der 8B/9B-Klasse, gut 9 GB für 14B, 17 bis 20 GB für 27B bis 32B. Wer mehrere Modelle ausprobiert, ist schnell bei zweistelligen Gigabytes; mit ollama list sehen Sie den Bestand, mit ollama rm räumen Sie auf.

Kann das ganze Team einen Ollama-Rechner nutzen?

Ja: Ollama bringt eine eingebaute Schnittstelle mit (lokal auf Port 11434), über die sich ein Rechner im Haus als gemeinsamer KI-Server nutzen lässt. Ab Werk hört Ollama nur auf dem eigenen Rechner; für das Netz wird die Bind-Adresse umgestellt, und weil Ollama keine eigene Anmeldung kennt, gehört ein Zugriffsschutz davor. Wie das geht, steht im Abschnitt zum Betrieb im Firmennetz; die Einrichtung ist Projektarbeit, die wir übernehmen.

Ollama oder LM Studio?

Beide führen zum selben Ziel. LM Studio bringt eine grafische Oberfläche mit und ist für den ersten Kontakt bequemer, ist aber kein quelloffenes Projekt. Ollama ist quelloffen, schlanker und über seine Schnittstelle der übliche Unterbau, wenn andere Werkzeuge und eigene Abläufe angebunden werden sollen. Für den Betriebseinsatz mit Anbindung empfehlen wir Ollama; zum blossen Ausprobieren taugen beide.

Quellen zum Nachprüfen

  • ollama.com — Download für Windows, macOS und Linux
  • Ollama auf GitHub — Quellcode, MIT-Lizenz und die vollständige Dokumentation
  • Die Modellbibliothek — alle Modelle samt Grössen und Lizenzen
  • Ollama-FAQ — Bind-Adresse, Origins, Speicherort und Keep-Alive, die Quelle für den Netzbetrieb

Ihr Einstieg

Vom ersten Befehl zum Werkzeug für den Betrieb

Ollama installieren kann jeder, und genau so soll es sein. Der Weg dahinter, also Modellwahl, Anbindung an Ablage und Systeme, Zugriffe und Absicherung, ist Projektarbeit. Im kostenlosen Erstgespräch klären wir, ob sich der Weg für Ihren Betrieb lohnt, und wenn nein, sagen wir das auch.

Erstgespräch anfragen

Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.

Daniel Bidoli, Inhaber von Bidoli IT-Services

Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.

  1. Nachricht senden

    Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.

  2. Persönliche Antwort

    Erste Einschätzung innerhalb von 24 Stunden.

  3. Kostenloses Erstgespräch

    Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.

Sehen wir keinen Nutzen, sagen wir es Ihnen offen.

Lieber direkt sprechen?

+41 76 753 37 86 · WhatsApp

Ihre Anfrage

Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.

Antwort in der Regel innerhalb von 24 Stunden.