Mentor · Trainer · Dozent für KI-Ethik

StartQwen3.8-27B Tutorial

Hands-on · Aug 2026Mac & RTXApache 2.0

Qwen3.8-27Blokal starten

Opus-Nähe beim Coding — oder Benchmark-Hype? In ~10 Minuten weißt du, ob sich 27B lokal lohnt. In ~20 Minuten läuft es ohne API-Key.

Terminal · ollama

$ ollama pull qwen3.8:27b
pulling manifest … done
17 GB / 17 GB ▓▓▓▓▓▓▓▓▓▓ 100%

$ ollama run qwen3.8:27b --think=false
>>> Hallo — lokales 27B läuft.
Modell bereit · ~3,8 s Antwort (think: false)
~17 GBQ4_K_M
61,7 %SWE-bench*
262KSpec-Kontext
24 GBMinimum RAM
Getestet20.08.2026HardwareMacBook Air M4 · 24 GBStackOllama 0.32.14 · qwen3.8:27bAutorThomas Rümmele
Inhalt (17 Abschnitte)

Lokales 27B mit Opus-4.6-Nähe beim Coding — oder nur Benchmark-Hype? In diesem Tutorial zeige ich dir, ob sich Qwen3.8-27B lokal lohnt — und wie du es auf Mac oder NVIDIA-PC wirklich startest.

Der Guide ist für DACH-Selbstständige und EPUs, die ohne Cloud testen oder entscheiden wollen. Du brauchst keinen ML-Hintergrund, aber einen Rechner mit genug Speicher.

Danach weißt du in etwa zehn Minuten, ob das Modell zu deinem Fall passt — und in etwa zwanzig Minuten läuft es lokal, ohne API-Key.

Getestet am 20.08.2026 auf einem MacBook Air M4 mit 24 GB Unified Memory, Ollama 0.32.14, Modell-Tag qwen3.8:27b (Q4_K_M, ~17 GB).

Kurz gesagt: Qwen3.8-27B lohnt sich, wenn du Coding-, Agent- oder Vision-Routinen lokal willst und mindestens ~24 GB Unified Memory oder VRAM hast. Mit Ollama (≥ 0.32.12) und think: false startest du in Minuten. Apache 2.0. Kein Chat-Speed-Ersatz für Opus — aber für bestimmte Workflows plötzlich realistisch lokal.
~17 GB (Q4_K_M)Modell-Datei
61,7 %*SWE-bench Pro (Vendor)
262K TokensSpec-Kontext
Apache 2.0Lizenz

*Vendor-Tabelle — siehe Abschnitt Benchmarks; nicht deine Latenz.

Phase 1 · EntscheidenLohnt sich Qwen3.8-27B für dich?

Ja — wenn du bestimmte Coding-, Agent- oder Vision-Jobs lokal erledigen willst und genug Speicher hast. Nein — wenn du ChatGPT-Tempo im Dialog erwartest oder unter ~24 GB bleibst und trotzdem „alles“ willst.

Das ist die Frage, mit der die meisten kommen. Die News sagen „neu“ und „stark“. Du brauchst eine praktische Antwort.

Voraussetzungen

  • Mac oder PC mit ≥ 24 GB Unified Memory bzw. VRAM (Minimum für sinnvollen Alltag)
  • Ollama ≥ 0.32.12, rund 20 GB freier Speicher für den Pull
  • Etwa 10 Minuten für die Entscheidung, 20 Minuten bis zum ersten Lauf
  • Kein ML-Hintergrund nötig — Terminal copy-paste reicht

Was ist das — in einem Absatz

Qwen3.8-27B ist ein dichtes 27-Milliarden-Parameter-Modell mit Vision (Text + Bild), veröffentlicht am 14.08.2026 unter Apache 2.0. Über Ollama lädst du es als qwen3.8:27b — rund 17 GB im Default-Quant Q4_K_M. Quelle: ollama.com/library/qwen3.8.

Schreibweisen, die du auch siehst: Qwen 3.8 27B, qwen3 8 27b und qwen3.8 27b — gemeint ist dasselbe Modell. Ollama listet den Download oft mit 18 GB; die Quant-Datei liegt bei mir bei ~17 GB (Q4_K_M) — dieselbe Sache, andere Rundung.

Abgrenzung Qwen3.8-Max

Qwen3.8-Max (bzw. die große Open-Weights-Linie um 2.4T) ist ein anderes Produkt: andere Größe, nicht Apache 2.0, und der 27B-Tag ist das Modell, das du realistisch lokal fährst. Der 27B bringt Vision mit; Max ist nicht „dasselbe in größer“.

Für diesen Artikel gilt: wir reden vom lokal nutzbaren 27B — nicht vom Cloud-Flaggschiff.

Warum gerade so viel Aufmerksamkeit

Die Aufmerksamkeit kommt vom Release am 14.08.2026 plus Vendor-Benchmarks nahe Opus 4.6 — nicht vom Alltagstempo auf einem Air.

Kurz danach überschlagen sich Tests und Videos. AICodeKing nennt Qwen3.8-27B auf einem Mac mit 48 GB ein starkes lokales Agent-Modell und zitiert Vendor-Zahlen wie SWE-bench Pro über Opus 4.6 Max. IchBinFabian fragt auf Deutsch, ob das lokale Modell wirklich gegen Claude/Opus hält — getestet auf starker NVIDIA-Hardware.

AICodeKing: Qwen3.8-27B on Mac 48GB
IchBinFabian: Qwen 3.8 vs Claude (DE)
DEEPTECH: Opus-Level at Home — the Catch

Meine Einordnung: In SE-Benchmarks liegt Qwen nahe an Opus 4.6 Max — das heißt nicht Chat-Gefühl wie Opus. Vergleich ist 4.6, nicht 5. Und 48 GB im Video sind nicht dein Air mit 24 GB.

Wenn Creator sagen, sie könnten Claude kündigen: das ist ihre Meinung, nicht meine Empfehlung.

Für wen ja — und für wen nein

Ja, wenn du Batch-Jobs, Coding-Agenten, Repo-Fragen oder lokale Beleg-/Screenshot-Prüfung willst — und Latenz in Sekunden bis Minuten okay ist.

Nein, wenn du flüssigen Chat-Ersatz für Opus/Claude brauchst, unter 24 GB bleibst und trotzdem volles Kontextfenster erwartest, oder wenn du nur „das neueste Modell“ willst, ohne einen konkreten Job.

Empfehlung: Entscheide über den Job, nicht über den Hype. Wenn dein Job Coding/Agent/Vision lokal ist und 24 GB da sind — weiterlesen. Wenn du nur schnell chatten willst — Cloud bleibt oft die bessere Wahl.
Als Nächstes klären wir, welche Hardware du dafür wirklich brauchst.

Welche Hardware brauchst du wirklich?

Du brauchst mindestens rund 24 GB Unified Memory (Apple) oder VRAM (NVIDIA), wenn du Qwen3.8-27B im Alltag sinnvoll nutzen willst. Darunter geht es oft nur mit Abstrichen — ehrlich gesagt.

Nach „lohnt sich“ kommt als Nächstes die Hardware-Frage. Ohne klare Wahl scheiterst du später am Download oder am Swap.

Minimum: 24 GB Unified Memory oder VRAM

Der Default-Download liegt bei ~17 GB Gewichten. Dazu kommen Runtime, KV-Cache und Betriebssystem. Auf meinem Air mit 24 GB läuft qwen3.8:27b — aber nur, wenn du Kontext und Thinking im Griff hast (siehe Messwerte und Troubleshooting).

Empfehlung: Plane mit 24 GB als Minimum für „sinnvoll testen“. Für tägliche Agent-Arbeit lieber mehr.

Entscheidungsbaum

ZielEmpfehlung
Testen / EPU nebenbeiMacBook Air/Pro 24 GB oder Mac mini M4
Täglich Agent/CodingMac Studio 32–64 GB oder RTX 4090/5090
Max Speed, Budget GPURTX 4090/5090
Leise, privat, unkompliziertMac + Tag qwen3.8:27b-mlx
Nur ausprobierenMiet-GPU (Prompt Engineer: 4090-Klasse stundenweise)
Unter 24 GBKleineres Quant oder anderes Modell — ehrlich

Willst du erst prüfen, ob lokal Sinn macht? Nimm Air/Pro 24 GB oder Mac mini M4.

Willst du täglich Agents und Coding? Mac Studio mit 32–64 GB oder eine RTX 4090/5090.

Willst du maximale Token/s? NVIDIA high-end — siehe Named Sources wie KGP Talkie und Prompt Engineer, nicht meine Air-Zahlen.

Willst du leise und im Apple-Ökosystem bleiben? Mac plus MLX-Tag.

Nur Wochenend-Experiment? GPU mieten statt Hardware kaufen.

16 GB / 8 GB: geht, mit Abstrichen

Auf 16 GB und darunter berichten Tester Abstriche bei Quant, Kontext und Tempo. Prompt Engineer zeigt ehrlich, was auf einem 8-GB-Laptop übrig bleibt — und wie weit das von einer 4090 entfernt ist.

Prompt Engineer: Qwen auf schwacher Hardware
Empfehlung: Unter 24 GB nicht „Qwen3.8-27B wie im Video“ erwarten. Entweder kleineres Quant, kleinerer Kontext — oder ein anderes Modell.

Quant: Q4_K_M Default; wann Q8

Ollamas Default-Tag qwen3.8:27b kommt als Q4_K_M (~17 GB). Das ist der Sweet Spot für 24 GB.

Q8 braucht mehr Speicher und lohnt sich, wenn du Qualität über Kapazität stellst und die Hardware mitzieht. Ausführliche Quant-Leitern (2–8 bit) sparst du dir für später — für den Start reicht Q4_K_M.

Empfehlung: Starte mit dem Default-Tag. Wechsle zu Q8 erst, wenn Qualität messbar hakt und RAM/VRAM noch Luft hat.

Kosten: lokal vs. Miet-GPU vs. OpenRouter

Lokal: Strom + einmal Hardware. Kein Token-Preis, aber deine Zeit und dein RAM.

Miet-GPU: laut Prompt Engineer gut zum Wochenend-Test (4090-Klasse stundenweise) — Preis im Video prüfen, hier keine ct/h-Zahl.

OpenRouter/API: du zahlst pro Token, bekommst Tempo und Skalierung — aber Daten verlassen dein Gerät.

Empfehlung: Erst lokal auf vorhandener Hardware testen (oder eine Stunde mieten). Kaufentscheidung RTX/Mac Studio erst, wenn ein Job klar ist.
Mit Hardware-Klarheit schauen wir als Nächstes, wofür das Modell jenseits der Tabelle taugt.

Was kann das Modell — jenseits der Benchmark-Tabelle?

Qwen3.8-27B eignet sich vor allem für lokale Coding-, Agent-, Vision- und Batch-Jobs — nicht als Drop-in für schnellen Chat. Die Vendor-Tabelle ist ein Hinweis, kein Alltag.

Hier die Jobs, die für Selbstständige zählen.

Lokaler Coding-Agent ohne API-Key

Mit Ollama kannst du Agent-Setups ohne Cloud-Key fahren — etwa über ollama launch claude mit dem lokalen Modell (siehe Prompt Engineer und AICodeKing). Du bleibst auf localhost.

In Qwens Vendor-Tabelle liegt Qwen3.8-27B bei SWE-bench Pro bei 61,7 % — über Opus 4.6 Max (53,4 %). Das bedeutet nicht, dass sich jede Unterhaltung wie Opus anfühlt.

Auf meinem MacBook Air M4 messe ich eher Batch-Tempo als Chat-Speed.

Für Coding- und Agent-Workflows, bei denen du think: false setzt und genug RAM hast, wird lokal aber plötzlich realistisch.

Repository-Fragen, Refactoring, Tool-Calling

Das Modell bringt Tool-Calling mit (Ollama listet tools bei den Capabilities). Repo-Fragen, Refactoring und Review-Schleifen sind genau der Bereich, in dem die SWE-Zahlen interessant werden — als Batch, nicht als Instant-Chat.

Empfehlung: Nutze es für abgegrenzte SE-Aufgaben mit klarem Prompt und think: false. Für Brainstorming im Dialogtempo bleib bei der Cloud, wenn Tempo zählt.

Screenshots, Belege, Dokumente lokal prüfen (Vision)

Der Default-Tag ist ein VLM: Text und Bild. Auf dem Air hat ein synthetischer Testbeleg mit „Betrag: EUR 127,50“ lokal korrekt EUR 127,50 gelesen — in 42 s mit think: false, ohne Cloud.

Das beweist den Vision-Tag, nicht die Belegprüfung im EPU-Alltag. Für sensible Dokumente ist der Punkt trotzdem: der Byte-Strom muss die Cloud nicht berühren. Die konkrete Anleitung steht im Abschnitt Vision.

Batch-Routinen wo Latenz egal ist (Mail — mein Fall)

Wenn du nachts 200 Mails sortieren oder klassifizieren willst, zählt Durchsatz über Stunden, nicht Antwortzeit im Dialog. Genau dafür ist lokales Qwen interessant: kein API-Budget, keine Cloud-Weitergabe der Mailtexte.

Harte Sekunden-pro-Mail-Zahlen folgen in einem späteren Update. Qualitativ: der Use-Case passt — wenn Thinking aus und Kontext klein sind.

Wann Cloud trotzdem schneller ist

Immer dann, wenn du flüssig hin und her reden willst, große Kontexte brauchst, oder dein Gerät am Limit swappt. Vendor-Nähe zu Opus 4.6 in einer Tabelle ersetzt keine Cloud-Latenz.

Empfehlung: Lokal für Routinen und Datenschutz-sensible Jobs. Cloud für Dialog-Speed und große Kontexte.
Ok — an diesem Punkt weißt du, wofür Qwen lokal taugt und wann Cloud schneller ist. Jetzt holen wir es auf deinen Rechner.

Phase 2 · Umsetzen1Ollama installieren

Ohne aktuelle Ollama-Version lädst du Qwen3.8-27B nicht zuverlässig. Mindestversion laut Modell-Anforderung: 0.32.12 oder neuer.

Auf dem Mac:

Dieser Befehl muss im Terminal ausgeführt werden.
brew install ollama
# oder Installer von https://ollama.com
ollama --version

Auf Windows/Linux denselben Weg über die offizielle Distribution — der Befehl ollama bleibt gleich.

Bei mir lief der Test mit 0.32.14 unter /opt/homebrew/bin/ollama.

Terminal mit ollama --version und ollama list
Ollama-Version und installierte Modelle
Empfehlung: Homebrew-Pfad auf dem Mac bevorzugen und danach which -a ollama prüfen — zwei Installationen sind ein Klassiker (siehe Troubleshooting).
Du hast jetzt Ollama ≥ 0.32.12 bestätigt. Als Nächstes lädst du das Modell selbst.

2Modell laden (~17 GB)

Mit einem Befehl holst du den Default-Tag — rund 17 GB, Q4_K_M:

Dieser Befehl muss im Terminal ausgeführt werden.
ollama pull qwen3.8:27b

Der Download braucht Zeit und Speicher. Lass ihn durchlaufen; abgebrochene Pulls führen oft zu Manifest-Fehlern.

Empfehlung: Starte mit qwen3.8:27b. Den MLX-Tag (qwen3.8:27b-mlx) holst du später, wenn du auf Apple Silicon Speed vergleichen willst.
Das Modell liegt lokal. Als Nächstes der erste Satz im Terminal.

3Erster Test im Terminal

So prüfst du in Sekunden, ob Modell und Runtime sprechen:

Dieser Befehl muss im Terminal ausgeführt werden.
ollama run qwen3.8:27b

Stell eine kurze Frage. Wenn die Antwort minutenlang auf sich warten lässt, ist Thinking sehr wahrscheinlich noch an — das ist der nächste Schritt, nicht „dein Mac ist kaputt“.

Dieser Befehl muss im Terminal ausgeführt werden.
ollama ps

zeigt, ob das Modell geladen ist und wie SIZE / Processor aussehen.

ollama ps mit SIZE und CPU/GPU-Anteil
Modell geladen — SIZE und Processor-Anteile
Empfehlung: Nach dem ersten erfolgreichen Satz sofort Thinking abschalten lernen — sonst verbrennst du die Woche-1-Geduld.
Genau das ist Schritt 4.

4Thinking abschalten — sonst wartest du Minuten

Thinking ist bei Qwen3.8-27B unter Ollama standardmäßig aktiv — und macht triviale Antworten auf dem Air unnötig langsam. Der richtige Schalter heißt think: false, nicht /no_think.

Das ist der häufigste Live-Fehler nach dem Pull.

Warum Default so langsam ist

Auf dem MacBook Air M4 (24 GB, Ollama 0.32.14, qwen3.8:27b Q4_K_M) braucht die Frage „Hauptstadt Österreichs — ein Wort“ im Default Median 44 Sekunden und 40 Thinking-Wörter. Mit think: false sind es Median 3,8 Sekunden und null Thinking-Wörter — rund elfmal schneller.

/no_think im Chat-Text funktioniert bei Qwen3.8-27B nicht. Median 36 s, 43 Thinking-Wörter — dasselbe Verhalten wie Default. Der Schalter ist Ollamas Parameter think: false, nicht der alte Qwen3-Hybrid-Token. (Qwen-Cloud-Doku: /no_think gilt für Qwen3-Hybridmodelle.)

Caveat: triviale Aufgabe, n=3, Kontext 4K. Kein Throughput-Claim in Tokens/s.

Thinking-Block aus Default-Lauf
Thinking-Block bei Default — deshalb dauert es

Im Chat und API: think: false

Im API-Body (Chat):

Dieser Befehl muss im Terminal ausgeführt werden.
{
  "model": "qwen3.8:27b",
  "messages": [{"role": "user", "content": "Nenne die Hauptstadt von Oesterreich. Antworte in genau einem Wort."}],
  "think": false,
  "stream": false
}

Im interaktiven Chat: Thinking über die Ollama-/Client-Option abschalten, die think: false setzt — nicht den String /no_think in die Nachricht tippen.

Empfehlung: Für Routine und Batch immer think: false. Thinking nur bewusst einschalten, wenn du Reasoning wirklich brauchst und Zeit hast.

Unter Ollama zählt an/aus — nicht Cloud-Parameter

Unter Ollama steuerst du Thinking praktisch über think (an/aus). Cloud-Parameter aus der Qwen-Doku brauchst du für den Start nicht.

Antwort wirkt leer?

Manchmal frisst Thinking das Token-Budget. Die Antwort wirkt leer, obwohl das Modell „gedacht“ hat.

Dann hilft oft: Max-Output-Limit im Client erhöhen und parallel think: false, wenn du keine Reasoning-Spur brauchst.

Damit hast du Thinking unter Kontrolle — der häufigste Woche-1-Killer ist erledigt. Als Nächstes die API für Skripte und Agenten.

5Die lokale API nutzen

Ollama spricht lokal unter http://localhost:11434 — ohne HTTPS und ohne API-Key für den lokalen Default. So baust du Skripte und Agenten an.

http://localhost:11434/v1 — nicht https

OpenAI-kompatibel:

Dieser Befehl muss im Terminal ausgeführt werden.
http://localhost:11434/v1

Basis-Chat auch unter /api/chat. Kein Cloud-Endpoint, kein TLS auf localhost nötig.

curl/Python mit think: false

Dieser Befehl muss im Terminal ausgeführt werden.
curl http://127.0.0.1:11434/api/chat -d '{
  "model": "qwen3.8:27b",
  "messages": [{"role": "user", "content": "ping — antworte mit einem Wort"}],
  "think": false,
  "stream": false,
  "keep_alive": "30m"
}'

In Python dasselbe JSON an denselben Port. Setze think: false explizit — Defaults können Thinking anlassen.

think: false wirkt nicht über /v1?

Die OpenAI-kompatible Route http://localhost:11434/v1/chat/completions nimmt think nicht immer genauso entgegen wie /api/chat. Symptom: Thinking bleibt an, obwohl du im Body abschalten wolltest.

Workaround: Für Thinking-Steuerung /api/chat nutzen (wie im curl oben) — oder prüfen, ob dein Client chat_template_kwargs / Ollama-eigene Felder unterstützt. Wenn Tempo zählt und Thinking aus soll: native Chat-API bevorzugen.

ollama launch claude --model qwen3.8

Für Agent-Workflows ohne eigenen API-Key zeigen Community-Guides Varianten wie ollama launch claude --model … mit dem lokalen Qwen-Tag (Prompt Engineer, AICodeKing). Prüfe die aktuelle CLI-Hilfe deiner Ollama-Version — Flags ändern sich.

Empfehlung: Skripte immer gegen 127.0.0.1:11434 und mit think: false starten. Tunnel/Cursor-Cloud sind eine andere Geschichte (siehe Was bleibt wirklich lokal).
Ok: Ollama läuft, Modell geladen, API erreichbar. Wenn etwas hakt, bist du in der typischen Woche-1 — genau dafür kommt Troubleshooting.

Troubleshooting — die ersten Fehler der Woche

Die fünf häufigsten Woche-1-Fehler: Ollama zu alt, doppelte Installation, abgebrochener Pull, OOM, Thinking an. Hier die Fehler im Wortlaut.

Fehler 412: Ollama zu alt

Meldung sinngemäß: pull model manifest: 412 — requires a newer version. Ursache: Ollama unter der Mindestversion für Qwen3.8. Lösung: Update auf ≥ 0.32.12, Server neu starten. Tracking u. a. ollama/ollama#14876.

Zwei Ollama-Installationen (which -a ollama)

Symptom: du hast „aktualisiert“, der laufende Server ist aber noch die alte Binary.

Dieser Befehl muss im Terminal ausgeführt werden.
which -a ollama
ollama --version

Auf meinem Air zeigte which -a nur den Homebrew-Pfad — kein zweites Ollama. Wenn du /usr/local/bin und Homebrew parallel siehst: alte Instanz beenden, klare PATH-Priorität setzen, Server neu starten.

which -a ollama Ausgabe
Nur eine Ollama-Installation — oder zwei?

Download bricht ab / Manifest fehlt

Nach abgebrochenem Pull: erneut ollama pull qwen3.8:27b.

Out of memory — Mac unbenutzbar

Zu großer Kontext oder parallel zu viele Apps: macOS swappt, der Rechner wird träge. Modell entladen, num_ctx senken, andere Speicherfresser schließen.

Dieser Befehl muss im Terminal ausgeführt werden.
# Modell entladen: keep_alive auf 0 setzen oder ollama stop / ps prüfen
ollama ps

Antworten dauern minutenlang → Schritt 4

Das ist fast immer Thinking. Setze think: false. Vergiss /no_think im Prompt.

„does not support images“ trotz Vision-Tag

Falsches Tag, Client schickt kein Bild-Format, oder alter Client-Pfad. Mit Default qwen3.8:27b und korrektem Multimodal-Request sollte Vision gehen — bei mir kam der Fehler im E5-Test nicht. Siehe Vision-Abschnitt.

Empfehlung: Bei jedem „es ist langsam/kaputt“ zuerst Version, which -a, think: false und ollama ps prüfen — in dieser Reihenfolge.
Ok — die typischen Woche-1-Fallen kennst du. Als Nächstes die Speichergrenze, die auf 24 GB fast jeden trifft: Kontext.

Kontext und Speicher auf 24 GB

Der Spec-Wert 262K ist kein Alltagswert auf 24 GB. Was du einstellst (num_ctx), bestimmt Tempo und Speicher — nicht die Marketingzahl.

Warum 262K nicht das ist, was du nutzt

262.144 Tokens sind die Architektur-Angabe (oft als 256K gerundet). Der KV-Cache dafür passt nicht komfortabel neben Gewichte und OS auf 24 GB.

num_ctx: 8K / 32K / 64K

Eigene Messung Air M4, Prompt „ping“, think: false:

num_ctxSIZE (ollama ps)ProcessorDauer
819218 GB30%/70% CPU/GPU3,22 s
3276818 GB35%/65% CPU/GPU123,64 s
6553620 GB44%/56% CPU/GPU201,06 s
13107222 GB55%/45% CPU/GPU250,62 s

Kein OOM bis 131K. Der Kipppunkt ist nicht der Absturz, sondern: Speicher steigt, GPU-Anteil sinkt, ein One-Word-Ping braucht Minuten.

Mit Default-Kontext (4K–8K) bleibt das Modell bei 18 GB und antwortet in wenigen Sekunden. Für Routine auf 24 GB: Kontext klein halten.

ollama ps — GPU ja/nein

ollama ps zeigt SIZE und Processor-Anteile. Steigt der CPU-Anteil stark, arbeitest du nicht mehr „sauber“ auf der GPU — Tempo bricht ein.

keep_alive, Modell entladen

Dieser Befehl muss im Terminal ausgeführt werden.
ollama stop qwen3.8:27b
ollama ps

Zum Freigeben nach schweren Jobs: ollama stop (aktuelle CLI), dann erneut ollama ps prüfen. keep_alive hält Gewichte sonst im Speicher (bei mir in Messungen 30m).

Empfehlung: Auf 24 GB defaultmäßig 4K–8K Kontext. Große Fenster nur bewusst und mit Zeitbudget.
Damit hast du den Vollzug — jetzt die Einordnung, was an den Benchmarks Substanz hat.

Phase 3 · EinordnenWas an den Benchmarks Substanz hat — und was nur Tabelle ist

Benchmarks erklären den Hype — nicht dein Gefühl im Chat. Lies sie als Hinweis für Coding/Agent-Jobs, nicht als Qualitätsgarantie für jede Unterhaltung.

SWE-bench Pro (Vendor + Caveat)

Vendor und darauf aufbauende Videos heben Software-Engineering- und Agent-Benchmarks hervor — dieselbe Gegenüberstellung wie oben in der Kennzahlen-Leiste und im Coding-Use-Case, unter Laborbedingungen.

Das ist eine Tabelle. Deine Hardware, dein Quant und dein Prompt ändern das Ergebnis.

Wo es Opus 4.6 schlägt — und wo nicht (GPQA, HLE)

In einzelnen SE-/Agent-Spalten liegt das lokale 27B laut Vendor-Tabelle nahe oder über Opus 4.6 Max. In Reasoning-/Wissens-Benchmarks wie GPQA und HLE liegt Opus laut derselben Vendor-Gegenüberstellung oft höher.

DEEPTECH betont den Catch (Thinking, RAM, Speed) — unabhängig von einzelnen Benchmark-Namen. Für Zahlen: Vendor lesen, nicht YouTube.

Opus-These nochmal klar: Nie „Opus-Qualität lokal“. Immer: genug Nähe in bestimmten Coding- und Agent-Workflows, damit lokal realistisch wird — mit Caveat zu Chat-Gefühl und Hardware.

„Frontier-adjacent Agent“ — AICodeKing-Formulierung

AICodeKing und andere sprechen von einem frontier-adjacent Agent, nicht von einem Frontier-Reasoner. Das trifft den Alltagsnutzen besser als „besser als Opus“.

Empfehlung: Nutze Benchmarks zur Priorisierung von Use-Cases (Coding/Agent ja prüfen) — nicht als Kaufargument ohne Hardware- und Thinking-Plan.
Als Nächstes kurz: welche Runtime auf Mac und PC.

Welche Runtime?

Für die meisten reicht Ollama mit dem Default-Tag; auf Apple Silicon ist der MLX-Tag die naheliegende Alternative. LM Studio und llama.cpp sind Optionen, kein Muss für den Start.

qwen3.8:27b vs. qwen3.8:27b-mlx

qwen3.8:27b — Default, breit getestet, meine Messwerte.

qwen3.8:27b-mlx — Apple-Silicon-optimiert, von Ollama gelistet und in Videos (AICodeKing) empfohlen, wenn du auf dem Mac Speed vergleichen willst.

Empfehlung: Erst Default zum Lernen. Dann MLX-Tag parallel pullen und selbst vergleichen — Videos mit 48 GB sind kein Ersatz für deinen Air.

Ollama vs. LM Studio vs. llama.cpp — kurz

RuntimeWann
OllamaAPI, Agent-Hooks, schneller Einstieg
LM StudioGUI und Experimente
llama.cppMaximale Kontrolle, steilere Lernkurve

Windows/Linux: gleicher Befehl

ollama pull / ollama run / API-Port sind plattformübergreifend gleich. Unterschied ist GPU-Treiber und VRAM, nicht die Befehlssyntax.

Empfehlung: Bleib bei Ollama, bis ein konkreter Limit-Fall dich zu LM Studio oder llama.cpp zwingt.
Als Nächstes Vision — der Differenzierer zum reinen Textmodell.

Vision: Bilder lokal testen

Qwen3.8-27B kann lokal Bilder lesen — ohne Cloud. Ein erster Test dauert eine Minute Setup und zeigt, ob dein Client Multimodal korrekt schickt.

Erster Test mit Foto/Screenshot

Schick ein klares Bild (Screenshot oder Foto) mit einer konkreten Frage („Welcher Betrag steht in der Zeile?“).

Bei mir: synthetisches PNG mit „Betrag: EUR 127,50“ → Antwort EUR 127,50 in 42 s mit think: false. Kein „does not support images“.

Vision-Beleg und Modell-Antwort
Synthetischer Beleg — EUR 127,50 korrekt gelesen

Caveat: synthetisches PNG, kein Papierscan. Für EPU-Alltag später echte Belege nachziehen.

Wenn „does not support images“ kommt

Prüfe Client/API-Pfad (Bild wirklich als Image-Part), Ollama-Version und korrektes Modell-Tag qwen3.8:27b. Bei meinem E5-Lauf trat der Fehler nicht auf — ähnliche Meldungen bei anderen Qwen-VL-Tags sind ein separates Thema.

Empfehlung: Vision mit think: false und kleinem Kontext testen. Sensible Belege lokal lassen, wenn Datenschutz der Grund für Qwen ist.
Zum Schluss die Zahlen von meinem Air — und was davon du übernehmen kannst.

Meine Messwerte (MacBook Air M4)

Auf dem MacBook Air M4 mit 24 GB: Thinking aus = ~3,8 s statt ~44 s; ab 32K Kontext kippt das Tempo. Alle eigenen Zahlen stammen vom 20.08.2026, Ollama 0.32.14, qwen3.8:27b Q4_K_M — ein Air, kein Studio und keine 5090.

Thinking (E1)

VarianteMedian DauerMedian Thinking-Wörter
Default43,63 s40
think: false3,78 s0
/no_think im Prompt36,47 s43

Publish-Satz: Default ~44 s / 40 Thinking-Wörter; think: false ~3,8 s / null; /no_think wirkt nicht.

Warmlauf vorab: erster Load ~54,7 s (davon ~49 s Load). Danach ollama ps: 18 GB, 28%/72% CPU/GPU, CONTEXT 4096.

Mail-Batch (E2)

Qualitativ vorgesehen: lokale Mail-Klassifikation über Nacht, ohne Cloud. Harte s/Mail- und Mails/h-Zahlen folgen in v1.1 — hier bewusst keine erfundenen Benchmarks.

Kontext-Kipppunkt (E3)

Siehe Tabelle oben: ab 32K Kontext dauert selbst ein Ping Minuten; bei 131K SIZE 22 GB und mehr CPU als GPU. 262K Spec ≠ Alltag auf 24 GB.

RTX-Vergleich nur als Named Source

Speed auf RTX 4090/5090 übernehme ich nicht aus dem Air. Einordnung über KGP Talkie, Prompt Engineer und Hardware-Guides wie kingy.ai — mit dem Caveat: andere Quantisierung, anderer Stack.

Activity Monitor während Inferenz
Speicherauslastung während Inferenz
Empfehlung: Meine Air-Zahlen für Thinking und Kontext übernehmen; GPU-Kaufentscheidungen an NVIDIA-Quellen und deinem Job spiegeln.
Zuletzt der Vertrauensblock: was wirklich lokal bleibt.

Was bleibt wirklich lokal — und was nicht?

Ollama auf dem Rechner hält Prompt und Antwort standardmäßig auf localhost — ohne API-Key. Sobald ein Tunnel, eine Cloud-IDE oder ein Remote-Endpoint dazwischenhängt, gilt das nicht mehr.

Ollama = localhost, kein API-Key

Default: 127.0.0.1:11434. Kein Account bei Alibaba nötig für den lokalen Lauf. Gewichte liegen bei dir.

Cursor/Tunnel-Ausnahme ehrlich

Wenn du Cursor, Cloudflare-Tunnel oder einen gehosteten Agenten anbindest, können Inhalte die Maschine verlassen — auch wenn das Modell „lokal“ heißt. Das ist Konfiguration, nicht Magie.

Screenshots/Dokumente: wann wirklich lokal

Nur wenn der Client das Bild an die lokale API schickt und kein Sync in die Cloud parallel läuft. Vision lokal ist möglich (E5) — aber nur im richtigen Pfad.

Apache 2.0 kommerziell

Die Modell-Lizenz laut Ollama-Bibliothek: Apache 2.0. Für kommerzielle Nutzung im Rahmen der Lizenzbedingungen — kein Ersatz für deine eigene Rechtsprüfung bei Spezialfällen.

Datenschutz lokal / DSGVO: was gewonnen ist, was nicht

Gewonnen: keine Weitergabe an einen US-/Cloud-LLM-Anbieter für genau diesen Request, wenn wirklich lokal. Nicht gewonnen: Geräteverlust, Backups in iCloud, Telemetrie anderer Apps, menschliche Fehlkonfiguration.

Empfehlung: Für Belege und Kundenmails den lokalen Pfad bewusst halten — und Tunnel/Cloud-Features auslassen, wenn Datenschutz der Kaufgrund war.
Damit hast du Entscheidung, Setup, Fehler und Grenzen. Die Restfragen bündelt das FAQ.

AbschlussHäufige Fragen

Brauche ich wirklich 24 GB?

Für einen sinnvollen Alltag mit dem Default-Tag: ja, plane damit.

Darunter berichten Tester Abstriche; 8–16 GB sind Experiment, kein Komfort. Dann eher kleineres Quant, kleinerer Kontext — oder ein anderes Modell.

Reicht Qwen3.8-27B als Opus-Ersatz?

Nein als pauschaler Chat-Ersatz — auf dem Air messe ich Sekunden bis Minuten, nicht Dialogtempo.

Ja für abgegrenzte Coding-/Agent-Jobs mit think: false und genug RAM. Dann zählt Vendor-Nähe zu Opus 4.6 in SE-Benchmarks — nicht jede Unterhaltung.

Merksatz: Entscheide über den Job. Brainstorming live → Cloud. Repo-Review über Nacht → lokal prüfbar.

Soll ich /no_think verwenden?

Nein. Bei Qwen3.8-27B unter Ollama wirkt /no_think in meiner Messung wie Default (Median ~36 s, Thinking an).

Nutze think: false in der API bzw. die Client-Option, die denselben Parameter setzt. Der alte Hybrid-Token aus der Qwen-Cloud-Doku gilt hier nicht.

Mac oder RTX?

Mac, wenn du leise, mobil und im Apple-Ökosystem bleiben willst (ggf. MLX-Tag).

RTX 4090/5090, wenn Token/s und Budget für eine GPU da sind. Beides ist erstklassig — abhängig vom Job, nicht vom Hype.

Ist der 262K-Kontext nutzbar?

Auf 24 GB praktisch nein für Alltag. Spec ≠ Sitzplatz.

Halte num_ctx klein (4K–8K für Routine). Ab 32K dauert bei mir schon ein Ping Minuten.

Darf ich es kommerziell nutzen?

Apache 2.0 laut Modellseite — plus deine Compliance-Prüfung.

Lokal betreiben ≠ automatisch jede Datenverarbeitung erlaubt. Sensible Kundenmails brauchen den lokalen Pfad und saubere Konfiguration (kein Tunnel „nebenbei“).

Nächster Schritt

Wenn Qwen3.8-27B für dich ein Baustein ist — nicht nur ein Wochenend-Download — schau dir an, wie lokale Modelle in wiederholbare Agent-Routinen passen: KI-Agenten.

Dort geht es um Workflows; hier um das Modell. Beides gehört zusammen, wenn du lokal produktiv werden willst.