Wissen · Lokale KI

Ollama Benchmark: lokale KI auf eigener Hardware sauber messen

Veröffentlicht und geprüft am 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Ollama-Primärquellen unten

Nicht die schnellste Zahl gewinnt, sondern der reproduzierbare Test. Dieses Werkzeug berechnet aus einer Ollama-Antwort das echte Prompt- und Ausgabetempo.

Die Auswertung läuft vollständig in Ihrem Browser. Eingefügter JSON-Inhalt wird weder hochgeladen noch gespeichert. Darunter steht die Testmethode, mit der Ergebnisse zwischen PCs, Macs und 128-GB-Workstations tatsächlich vergleichbar werden.

Die kurze Antwort

Vier Werte statt einer Fantasiezahl

Ausgabetempo

eval_count ÷ eval_duration ergibt die generierten Tokens pro Sekunde. Das ist die Zahl, die beim Lesen der Antwort spürbar wird.

Prompt-Tempo

prompt_eval_count ÷ prompt_eval_duration zeigt, wie schnell das Modell den eingegebenen Text verarbeitet. Lange Dokumente machen diesen Wert wichtig.

Ladezeit

load_duration misst den Kaltstart. Ein aufgewärmtes Modell kann schnell sein und sich nach längerer Pause trotzdem träge anfühlen.

Gesamtdauer

total_duration enthält Laden, Prompt und Ausgabe. Sie ist für den Arbeitsalltag wichtig, aber allein kein fairer Hardwarevergleich.

Kostenloser Auswerter

Ollama-JSON einfügen, Messwerte erhalten

Verwenden Sie die letzte JSON-Antwort eines Aufrufs mit "stream": false. Antworttext darf vorher entfernt werden; für die Berechnung zählen nur die Laufzeitfelder.

Noch keine Daten ausgewertet.

Ausgabe
Prompt
Ladezeit
Gesamtdauer

Messung erzeugen

Ein API-Aufruf mit festen Bedingungen

Modell, Kontext, Temperatur und gewünschte Antwortlänge müssen feststehen. Sonst vergleicht man verschiedene Aufgaben statt verschiedene Hardware.

curl http://localhost:11434/api/generate -d '{
  "model": "qwen3.8:27b",
  "prompt": "Erkläre in 300 Wörtern, wie ein Schweizer KMU Rechnungen prüft.",
  "stream": false,
  "options": {
    "temperature": 0,
    "num_ctx": 8192,
    "num_predict": 400
  }
}'

Die Antwort enthält am Ende unter anderem prompt_eval_count, prompt_eval_duration, eval_count, eval_duration, load_duration und total_duration. Ollama gibt Dauerwerte in Nanosekunden aus.

Tokens/s = Anzahl ÷ (Dauer in Nanosekunden ÷ 1'000'000'000)

Vor dem Vergleich: Mit ollama ps kontrollieren, ob das Modell vollständig auf GPU beziehungsweise gemeinsamem Speicher liegt. Schon kleiner CPU-Offload kann das Ergebnis stark verändern.

Reproduzierbare Methode

So wird aus einem Screenshot ein brauchbarer Benchmark

  1. 01

    System notieren

    CPU, GPU, RAM/VRAM, Betriebssystem, Treiber und Ollama-Version.

  2. 02

    Modell festhalten

    Exakter Tag, Quantisierung, Dateigrösse und Kontextfenster.

  3. 03

    Aufwärmen

    Ein Lauf lädt das Modell. Seine Ladezeit separat protokollieren.

  4. 04

    Dreimal messen

    Denselben Prompt dreimal mit identischen Optionen ausführen.

  5. 05

    Median verwenden

    Der mittlere Wert ist robuster als der beste Einzelwert.

  6. 06

    Qualität prüfen

    Tempo, Richtigkeit, Format und Speicher gemeinsam bewerten.

Vergleiche nur Messungen mit gleicher Modellversion, Quantisierung, Kontextlänge und ungefähr gleicher Ausgabelänge. Hintergrundprogramme, Temperatur und Energiemodus gehören ebenfalls dokumentiert.

Vergleichsvorlage

Diese Angaben gehören zu jedem Ergebnis

BereichPflichtangabeWarum sie zählt
HardwareCPU, GPU/APU, VRAM oder gemeinsamer Speicher, RAMNur so lässt sich das Resultat einordnen.
SoftwareOS, Treiber, Ollama-VersionRuntime- und Treiberupdates verändern Tempo und Kompatibilität.
ModellName, Tag, Quantisierung, DateigrösseEin Q4- und ein Q8-Modell sind kein fairer Vergleich.
Kontextnum_ctx, Prompt-Tokens, Ausgabe-TokensLanger Kontext benötigt mehr Speicher und Zeit.
TempoPrompt tok/s, Ausgabe tok/s, Lade- und GesamtdauerDie Werte beschreiben unterschiedliche Wartezeiten.
AuslastungAusgabe von ollama ps, EnergiemodusCPU-Offload und Stromlimit können den Vergleich entwerten.
QualitätBestanden/nicht bestanden plus begründete BewertungEin schnelles falsches Ergebnis ist kein Produktivitätsgewinn.

Praxis statt Spielprompt

Fünf Tests für Schweizer KMU

Beleg zu JSON

Felder aus Rechnung oder Lieferschein vollständig und schemafest ausgeben.

Dokument mit Quellen

Eine Antwort formulieren und jede Aussage auf eine Fundstelle zurückführen.

Schweizer Schreibweise

Geschäftstext ohne ß, mit korrekten CHF-, Datums- und Adressformaten.

Langer Kontext

Widersprüche und Fristen in einem umfangreichen Reglement finden.

Werkzeugwahl

Aus einer Anfrage das richtige erlaubte Werkzeug und seine Parameter auswählen.

Fehlergrenze

Belegen, ob das Modell bei fehlenden Angaben sauber stoppt statt zu raten.

Stand dieser Seite: Sie veröffentlicht bewusst noch keine eigenen Hardware-Ranglisten. Erst wenn dieselbe Testreihe auf mehreren dokumentierten Systemen gelaufen ist, gehören Resultate hierher. Bis dahin ist die Methode vollständig, die Ergebnistabelle aber ehrlich leer.

Häufige Fragen

FAQ zum Ollama-Benchmark

Wie messe ich Tokens pro Sekunde in Ollama?

Eine nicht gestreamte API-Antwort enthält eval_count und eval_duration. Teilen Sie die Tokenzahl durch die Dauer in Sekunden. Der Auswerter oben übernimmt die Umrechnung aus Nanosekunden.

Warum ist der erste Lauf langsamer?

Beim ersten Lauf muss das Modell geladen werden. load_duration deshalb separat ausweisen. Für das reine Antworttempo vergleicht man aufgewärmte Läufe; im Alltag kann der Kaltstart trotzdem relevant sein.

Reichen Tokens pro Sekunde als Benchmark?

Nein. Tempo sagt nichts über Richtigkeit, Vollständigkeit oder brauchbare strukturierte Ausgaben. Ein sinnvoller Test bewertet Tempo und Qualität mit denselben echten Aufgaben.

Primärquellen

Erst messen, dann investieren

Wir testen Ihren echten Anwendungsfall, nicht einen Werbeprompt

Im Erstgespräch klären wir, welches Ergebnis bestanden sein muss. Erst danach folgen Modelltest, Hardwareklasse und die Entscheidung zwischen Kauf, Miete oder Cloud.

Erstgespräch anfragen

Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.

Daniel Bidoli, Inhaber von Bidoli IT-Services

Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.

  1. Nachricht senden

    Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.

  2. Persönliche Antwort

    Erste Einschätzung innerhalb von 24 Stunden.

  3. Kostenloses Erstgespräch

    Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.

Sehen wir keinen Nutzen, sagen wir es Ihnen offen.

Lieber direkt sprechen?

+41 76 753 37 86 · WhatsApp

Ihre Anfrage

Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.

Antwort in der Regel innerhalb von 24 Stunden.