Wissen · Lokale KI
Ollama Benchmark: lokale KI auf eigener Hardware sauber messen
Veröffentlicht und geprüft am 3. September 2026 Fachlich verantwortlich: Daniel Bidoli Ollama-Primärquellen unten
Nicht die schnellste Zahl gewinnt, sondern der reproduzierbare Test. Dieses Werkzeug berechnet aus einer Ollama-Antwort das echte Prompt- und Ausgabetempo.
Die Auswertung läuft vollständig in Ihrem Browser. Eingefügter JSON-Inhalt wird weder hochgeladen noch gespeichert. Darunter steht die Testmethode, mit der Ergebnisse zwischen PCs, Macs und 128-GB-Workstations tatsächlich vergleichbar werden.
Die kurze Antwort
Vier Werte statt einer Fantasiezahl
Ausgabetempo
eval_count ÷ eval_duration ergibt die generierten Tokens pro Sekunde. Das ist die Zahl, die beim Lesen der Antwort spürbar wird.
Prompt-Tempo
prompt_eval_count ÷ prompt_eval_duration zeigt, wie schnell das Modell den eingegebenen Text verarbeitet. Lange Dokumente machen diesen Wert wichtig.
Ladezeit
load_duration misst den Kaltstart. Ein aufgewärmtes Modell kann schnell sein und sich nach längerer Pause trotzdem träge anfühlen.
Gesamtdauer
total_duration enthält Laden, Prompt und Ausgabe. Sie ist für den Arbeitsalltag wichtig, aber allein kein fairer Hardwarevergleich.
Kostenloser Auswerter
Ollama-JSON einfügen, Messwerte erhalten
Verwenden Sie die letzte JSON-Antwort eines Aufrufs mit "stream": false. Antworttext darf vorher entfernt werden; für die Berechnung zählen nur die Laufzeitfelder.
Noch keine Daten ausgewertet.
Messung erzeugen
Ein API-Aufruf mit festen Bedingungen
Modell, Kontext, Temperatur und gewünschte Antwortlänge müssen feststehen. Sonst vergleicht man verschiedene Aufgaben statt verschiedene Hardware.
curl http://localhost:11434/api/generate -d '{
"model": "qwen3.8:27b",
"prompt": "Erkläre in 300 Wörtern, wie ein Schweizer KMU Rechnungen prüft.",
"stream": false,
"options": {
"temperature": 0,
"num_ctx": 8192,
"num_predict": 400
}
}'
Die Antwort enthält am Ende unter anderem prompt_eval_count, prompt_eval_duration, eval_count, eval_duration, load_duration und total_duration. Ollama gibt Dauerwerte in Nanosekunden aus.
Tokens/s = Anzahl ÷ (Dauer in Nanosekunden ÷ 1'000'000'000)
Vor dem Vergleich: Mit ollama ps kontrollieren, ob das Modell vollständig auf GPU beziehungsweise gemeinsamem Speicher liegt. Schon kleiner CPU-Offload kann das Ergebnis stark verändern.
Reproduzierbare Methode
So wird aus einem Screenshot ein brauchbarer Benchmark
- 01
System notieren
CPU, GPU, RAM/VRAM, Betriebssystem, Treiber und Ollama-Version.
- 02
Modell festhalten
Exakter Tag, Quantisierung, Dateigrösse und Kontextfenster.
- 03
Aufwärmen
Ein Lauf lädt das Modell. Seine Ladezeit separat protokollieren.
- 04
Dreimal messen
Denselben Prompt dreimal mit identischen Optionen ausführen.
- 05
Median verwenden
Der mittlere Wert ist robuster als der beste Einzelwert.
- 06
Qualität prüfen
Tempo, Richtigkeit, Format und Speicher gemeinsam bewerten.
Vergleiche nur Messungen mit gleicher Modellversion, Quantisierung, Kontextlänge und ungefähr gleicher Ausgabelänge. Hintergrundprogramme, Temperatur und Energiemodus gehören ebenfalls dokumentiert.
Vergleichsvorlage
Diese Angaben gehören zu jedem Ergebnis
| Bereich | Pflichtangabe | Warum sie zählt |
|---|---|---|
| Hardware | CPU, GPU/APU, VRAM oder gemeinsamer Speicher, RAM | Nur so lässt sich das Resultat einordnen. |
| Software | OS, Treiber, Ollama-Version | Runtime- und Treiberupdates verändern Tempo und Kompatibilität. |
| Modell | Name, Tag, Quantisierung, Dateigrösse | Ein Q4- und ein Q8-Modell sind kein fairer Vergleich. |
| Kontext | num_ctx, Prompt-Tokens, Ausgabe-Tokens | Langer Kontext benötigt mehr Speicher und Zeit. |
| Tempo | Prompt tok/s, Ausgabe tok/s, Lade- und Gesamtdauer | Die Werte beschreiben unterschiedliche Wartezeiten. |
| Auslastung | Ausgabe von ollama ps, Energiemodus | CPU-Offload und Stromlimit können den Vergleich entwerten. |
| Qualität | Bestanden/nicht bestanden plus begründete Bewertung | Ein schnelles falsches Ergebnis ist kein Produktivitätsgewinn. |
Praxis statt Spielprompt
Fünf Tests für Schweizer KMU
Beleg zu JSON
Felder aus Rechnung oder Lieferschein vollständig und schemafest ausgeben.
Dokument mit Quellen
Eine Antwort formulieren und jede Aussage auf eine Fundstelle zurückführen.
Schweizer Schreibweise
Geschäftstext ohne ß, mit korrekten CHF-, Datums- und Adressformaten.
Langer Kontext
Widersprüche und Fristen in einem umfangreichen Reglement finden.
Werkzeugwahl
Aus einer Anfrage das richtige erlaubte Werkzeug und seine Parameter auswählen.
Fehlergrenze
Belegen, ob das Modell bei fehlenden Angaben sauber stoppt statt zu raten.
Stand dieser Seite: Sie veröffentlicht bewusst noch keine eigenen Hardware-Ranglisten. Erst wenn dieselbe Testreihe auf mehreren dokumentierten Systemen gelaufen ist, gehören Resultate hierher. Bis dahin ist die Methode vollständig, die Ergebnistabelle aber ehrlich leer.
Häufige Fragen
FAQ zum Ollama-Benchmark
Wie messe ich Tokens pro Sekunde in Ollama?
Eine nicht gestreamte API-Antwort enthält eval_count und eval_duration. Teilen Sie die Tokenzahl durch die Dauer in Sekunden. Der Auswerter oben übernimmt die Umrechnung aus Nanosekunden.
Warum ist der erste Lauf langsamer?
Beim ersten Lauf muss das Modell geladen werden. load_duration deshalb separat ausweisen. Für das reine Antworttempo vergleicht man aufgewärmte Läufe; im Alltag kann der Kaltstart trotzdem relevant sein.
Reichen Tokens pro Sekunde als Benchmark?
Nein. Tempo sagt nichts über Richtigkeit, Vollständigkeit oder brauchbare strukturierte Ausgaben. Ein sinnvoller Test bewertet Tempo und Qualität mit denselben echten Aufgaben.
Primärquellen
- Ollama API: Usage — Bedeutung der Messfelder und offizielle Formeln
- Ollama API: Generate — Anfrage- und Antwortformat
- Ollama CLI — Befehle einschliesslich
ollama ps
Erst messen, dann investieren
Wir testen Ihren echten Anwendungsfall, nicht einen Werbeprompt
Im Erstgespräch klären wir, welches Ergebnis bestanden sein muss. Erst danach folgen Modelltest, Hardwareklasse und die Entscheidung zwischen Kauf, Miete oder Cloud.
Beschreiben Sie kurz, wo es hakt. Den Rest klären wir im Gespräch.
Sie schreiben uns, was Sie beschäftigt. Ihre Nachricht landet nicht in einem Ticketsystem, sondern direkt bei Daniel Bidoli, dem Inhaber.
-
Nachricht senden
Zwei Sätze reichen, das Eingrenzen ist unsere Arbeit.
-
Persönliche Antwort
Erste Einschätzung innerhalb von 24 Stunden.
-
Kostenloses Erstgespräch
Rund 30 Minuten: online, vor Ort oder flexibel am Abend. Danach entscheiden Sie.
Sehen wir keinen Nutzen, sagen wir es Ihnen offen.
Lieber direkt sprechen?
Ihre Anfrage
Was beschäftigt Sie? Eine kurze Beschreibung reicht, wir melden uns innerhalb von 24 Stunden.