KEN’S CAT LOG
▣

Lokale LLM-News im September 2026: Was sollte man zum Coden auf einer RTX 4090 wählen?

Rückblick auf 23 LLM-News aus dem September 2026 und Untersuchung, welches offene lokale LLM sich zum Coden auf einer RTX 4090 realistisch eignet. Das Fazit: die 4-Bit-quantisierte Version von Qwen3.8-27B.

Die LLM-Szene war im September 2026, ehrlich gesagt, ziemlich turbulent. Schon zu Monatsbeginn folgten die Ankündigungen neuer Modelle der großen Anbieter Schlag auf Schlag. Im weiteren Verlauf rückten neben Leistung auch Preis, Sicherheit, das Risiko außer Kontrolle geratender Agenten und die Frage „Wie viel ist lokal letztlich möglich?“ in den Mittelpunkt.

Diesmal fasse ich die 23 Beiträge der „Heutigen LLM-bezogenen Nachrichten“ für September (3. bis 25. September) zusammen und habe zugleich untersucht, welches offene lokale LLM, das auf einer RTX 4090 läuft, derzeit für Coding-Zwecke die beste Wahl ist.

Vorweg das Fazit: Wenn du eine einzelne RTX 4090 nutzt, ist die 4-Bit-quantisierte Version von Qwen3.8-27B derzeit der Favorit. Statt ein möglichst großes Modell mit Gewalt zum Laufen zu bringen, ist es fürs Coden deutlich angenehmer, ein 27B-Modell sauber im GPU-Speicher unterzubringen und damit langen Kontext sowie praktische Geschwindigkeit zu vereinen.

Im September verlagerte sich der Wettbewerb von „neuen Modellen“ zu Preis, Sicherheit und Praxistauglichkeit

Zu Monatsbeginn standen neue Modelle der geschlossenen Anbieter im Mittelpunkt: GPT-6 Astra, Claude Fable 5.1 und Gemini 3.8 Flash. Etwa vom 3. bis 9. September ging es vor allem um Aussagen wie „Die Leistung ist schon wieder gestiegen“ und „Computer Use ist beeindruckend“; auf sozialen Netzwerken verbreiteten sich Demos und Benchmarks rasant.

Gleichzeitig stachen Sicherheitsprobleme hervor. Fast täglich wurde darüber berichtet, dass Agenten nicht autorisierte Aktionen ausführten, versuchten, Sandboxes zu verlassen, oder bei Cyber-Evaluierungen unerwartetes Verhalten zeigten. Je intelligenter die Modelle werden, desto weniger reicht es aus, nur die Trefferquote zu betrachten. Die eigentlichen Fragen lauten zunehmend: „Was erledigt das Modell eigenmächtig?“ und „Wie viele Berechtigungen kann man ihm geben?“

Mitte des Monats gewannen der Threat-Intelligence-Bericht von Anthropic, Rücktritte und Sicherheitsäußerungen von KI-Forschenden sowie Debatten darüber, ob die Entwicklung von Frontier-Modellen bewusst verlangsamt werden sollte, deutlich an Gewicht. Das waren weniger technische als Governance-Nachrichten. Es ging nicht mehr nur um Forschungslabore, sondern gleichzeitig um militärische Nutzung, Cyberangriffe, Trainingsdaten und Kartellrecht.

Gegen Monatsende fielen dann die Ankündigungen von Claude Opus 5.5 und GPT-6 Sol/Luna zusammen, wodurch sich die neue Wettbewerbsachse klar zeigte. Natürlich blieb Leistung ein Thema, doch noch stärker interessierten sich viele dafür, „Was kostet die Nutzung?“ und „Kann das Modell als Agent Aufgaben tatsächlich abschließen?“. Analysen zufolge sind die Kosten für Inferenz in kurzer Zeit stark gefallen, weshalb allein ein Spitzenmodell nicht mehr leicht zur Differenzierung reicht.

Open-Weight-Modelle gewannen nicht durch Spektakel, sondern durch Praxistauglichkeit

Bei lokalen LLMs tauchten im September wiederholt Namen wie DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 und Qwen3.8-27B auf. Ihre Ankündigungen waren vielleicht weniger groß inszeniert als bei den geschlossenen Anbietern, doch bei Kosteneffizienz, lokalem Betrieb und Tool-Nutzung sind sie sehr präsent.

Besonders auffällig war, dass weniger wichtig wurde, „das leistungsstärkste Modell zu besitzen“, sondern vielmehr, wie schnell, lange und stabil ein Modell auf der eigenen GPU läuft. In der lokalen LLM-Community auf Reddit waren auch steigende Preise für GPUs und Spezialhardware ein großes Thema; Hardwarepreise beeinflussen die Modellwahl inzwischen direkt.

Andererseits enthalten die Nachrichten aus dem Open-Bereich auch viele Gerüchte. In Berichten von Ende September tauchte etwa Qwen4-27B auf, doch im Rahmen dieser Recherche ließ sich weder auf der offiziellen Modell-Distributionsseite von Qwen noch in Model Cards ein entsprechendes Modell bestätigen. Daher ist es eher ein Modell, das als Nächstes kommen könnte, und gehört nicht zu den Empfehlungen, die man jetzt sofort auf einer 4090 einsetzen kann.

Auch DeepSeek V4.1 Flash ist äußerst leistungsfähig. Die offizielle Model Card nennt eine MIT-Lizenz, maximal eine Million Tokens und umfangreiche Bewertungen für Coding-Agenten. Die Gesamtparameterzahl ist jedoch enorm; das Modell vollständig auf einer einzelnen RTX 4090 unterzubringen, ist keine realistische Option. Ein Modell per CPU-Offloading „starten zu können“ ist etwas anderes, als es täglich komfortabel zum Coden einzusetzen.

Das angenehmste Coding-LLM auf einer 4090 ist Qwen3.8-27B

Eine RTX 4090 bietet 24 GB VRAM. Betrachtet man unter diesen Bedingungen Modellqualität, Geschwindigkeit, Kontextlänge und einfache Einrichtung zusammen, ist Qwen3.8-27B in 4-Bit-Quantisierung die ausgewogenste Konfiguration.

Qwen3.8-27B ist ein öffentlich verfügbares Modell unter der Apache-2.0-Lizenz. Die offizielle Card berichtet folgende Coding-Ergebnisse:

  • Terminal Bench 2.1: 73.0
  • SWE-bench Pro: 61.7
  • NL2Repo-Bench: 42.3
  • DeepSWE 1.1: 42.2
  • QwenSWEBench: 79.0
  • LiveCodeBench v6: 90.3

Die Werte hängen von Laufzeitumgebung und Agenten-Harness ab, daher sollte man sie nicht direkt mit anderen Modellen vergleichen. Dennoch ist es ein großer Vorteil, dass das Modell nicht nur bei einzelner Code-Vervollständigung, sondern auch bei Bewertungen für Terminal-Operationen und Änderungen auf Repository-Ebene stark abschneidet. Die offiziellen Informationen finden sich in der Model Card von Qwen3.8-27B.

Auf einer 4090 ist es realistischer, statt der BF16-Version direkt eine GGUF-Variante wie Q4_K_M oder UD-Q4_K_XL zu wählen. Für UD-Q4_K_XL gibt es Distributionen mit etwa 17,9 GB; außerdem wurde ein Implementierungs- und Messbeispiel veröffentlicht, das 128K Kontext, Bildeingaben und spekulatives Decoding innerhalb der 24 GB einer 4090 erfolgreich umsetzt.

Allerdings muss man nicht von Anfang an 128K anpeilen. Für gewöhnliches Coden empfehle ich, zunächst mit etwa 32K zu beginnen. Auch der KV-Cache benötigt VRAM; ein zu großer Kontext beeinträchtigt daher Geschwindigkeit und Stabilität. Statt ein großes Repository vollständig hineinzukippen, ist es meist besser, nur die benötigten Dateien über Suche oder RAG bereitzustellen. Das verbessert häufig auch die Qualität der Antworten.

Konkrete empfohlene Konfiguration

Wenn es unkompliziert sein soll, eignen sich LM Studio oder Ollama; wer alles fein abstimmen möchte, ist mit einer aktuellen llama.cpp-basierten Runtime gut beraten. Als Ausgangspunkt reicht Qwen3.8-27B in 4-Bit-Quantisierung, zunächst 32K Kontext und GPU-Offloading für möglichst alle Schichten.

Bei der Nutzung kommt die Stärke dieses Modells eher zur Geltung, wenn man es statt für einen bloßen Chat mit einem Coding-Agenten verbindet, der Aider, Continue oder eine OpenAI-kompatible API unterstützt. Prompts werden stabiler, wenn der Arbeitsablauf klar vorgegeben ist, etwa: „Prüfe vor der Änderung die relevanten Dateien und Tests“, „Halte den Diff klein“ und „Berichte zum Schluss die Testergebnisse“.

Wenn du Qualitätsverluste durch Quantisierung möglichst gering halten möchtest, kommen auch Q5-Varianten infrage. Mit 24 GB bleibt dann jedoch weniger Spielraum für Kontext. In der Praxis ist Q4 häufig einfacher zu handhaben, weil mehr Reserve für Kontext und Cache bleibt.

Und wie lässt sich die lokale LLM-Szene im September in einem Satz zusammenfassen?

Das Interesse verlagerte sich von „Welches Modell ist am intelligentesten?“ hin zu „Wie viel Arbeit kann ich in meiner Umgebung, zu welchen Kosten, tatsächlich erledigen?“

Geschlossene Modelle bleiben an der Spitze, stehen aber unter dem Druck von Preiswettbewerb und Sicherheitsfragen. Die Open-Weight-Seite hat sich nicht darauf beschränkt, mit den Zahlen riesiger Modelle zu konkurrieren, sondern entwickelte sich in Richtung schneller 27B-Modelle auf persönlichen GPUs, die sich in Agenten und reale Entwicklungsabläufe integrieren lassen.

Wenn du eine RTX 4090 besitzt, ist es derzeit eine solide Entscheidung, mit der 4-Bit-Version von Qwen3.8-27B zu beginnen. Die Lage könnte sich ändern, wenn Qwen4-27B offiziell erscheint oder eine kleinere DeepSeek-V4.1-Variante herauskommt. Doch wenn du ein Modell „heute Abend installierst und ab morgen Code schreiben lassen“ willst, ist Qwen3.8-27B derzeit die realistischste Wahl.

※ Dieser Artikel basiert auf öffentlich verfügbaren Informationen vom 25. September 2026 sowie den täglichen Berichten dieser Website vom 3. bis 25. September. Benchmark-Werte der Modelle enthalten offizielle Angaben; Geschwindigkeit und Genauigkeit in der Praxis variieren je nach Quantisierungsmethode, Runtime, Kontextlänge und Agenten-Konfiguration.