Mentor · Trainer · Dozent für KI-Ethik

StartQwen3.8-27B Qwen3.8-27B Benchmark

Anleitung

Qwen3.8-27B Benchmark — MacBook Air M4 24 GB

Meine Messwerte vom 19.08.2026: Cold Start, tokens/s, E-Mail-Klassifikation — ehrlich inklusive Grenzen.

Thomas RümmeleZuletzt getestet: 19.08.2026MacBook Air M4 · 24 GB · Ollama 0.32.14

Setup: MacBook Air M4, 24 GB Unified Memory, Mac16,13. Ollama 0.32.14, Modell qwen3.8:27b (17 GB, Q4_K_M). Kein Overclocking, normale Raumtemperatur.

Ergebnisse

TestThinkingDauerTokens/s
Erster Prompt (Cold Start)an (default)5:38 min1,14
E-Mail-Klassifikation (warm)aus48 s1,53

Was das bedeutet

Qualität: Inhaltlich überzeugend — historische Fragen, Klassifikation Google Ads Tagesreport → Handlungsbedarf korrekt.

Geschwindigkeit: Nicht für Echtzeit-Chat. Gut für Batch-Jobs (morgens E-Mails sortieren, nachts Digest).

RAM: ollama ps zeigt ~18 GB geladen, 72 % GPU / 28 % CPU. Knapp, aber stabil bei 4096 Context.

Praxis-Regel: Thinking immer aus für Routine — /no_think im Chat oder "think": false in der API. Spart Minuten pro Prompt.

Modell wirklich lokal?

Ja. ollama run spricht nur localhost. Dass das Modell manchmal behauptet, Cloud/Claude zu sein, ist Training-Bias — der Forward Pass läuft trotzdem auf deinem Mac.