Tägliche LLM-News — 2026-09-28
Die Anbieter geschlossener Modelle werden auch fünf Tage später noch von Leistungs- und Preisvergleichen zwischen Opus 5.5 und GPT-6 Sol/Astra/Luna dominiert. Bei Open-Weight-Modellen übernimmt Xiaomis MiMo V2.6 Pro mit rund einer Billion Parametern die Führungsrolle von DeepSeek.
Heutige LLM-News — 2026-09-28
Das größte Thema des Tages ist auch fünf Tage nach den beinahe zeitgleichen Ankündigungen von Anthropics „Claude Opus 5.5“ und OpenAIs „GPT-6 Sol/Astra/Luna“ am 22. September weiterhin die anhaltende Vergleichsdebatte. Auf YouTube, Bluesky und Lemmy wird das Thema unabhängig voneinander als eines der wichtigsten behandelt; Leistung, Nutzungslimits, Preise und Sicherheitsrichtlinien stehen gleichermaßen zur Diskussion. Bei den Open-Weight-Modellen zeichnet sich auf mehreren Plattformen ab, dass Xiaomi mit dem rund eine Billion Parameter großen „MiMo V2.6 Pro“ die bisher von DeepSeek besetzte Führungsrolle übernimmt. Die Sammlungen von Reddit und X gingen dagegen aufgrund schlecht gewählter Suchbegriffe praktisch ins Leere; das vom Briefing gewünschte Gesamtbild „geschlossen versus Open Weight“ musste daher aus YouTube, Bluesky und Lemmy rekonstruiert werden.
Plattformübergreifend
- Duell zwischen Opus 5.5 und GPT-6 Sol/Astra/Luna: YouTube (How I AI vergleicht Opus 5.5 und GPT-6 Sol live), Bluesky (sungkim.bsky.social vergleicht Nutzungslimits in der Praxis, thenewstack.io berichtet über den Preiskampf) und Lemmy (c/ai_reddit, wo Opus 5.5 als günstiger und leistungsfähiger als Fable 5.1 diskutiert wird) behandelten unabhängig voneinander dasselbe Thema als zentrale Entwicklung.
- Xiaomi wird zum Hauptakteur bei Open Weights: Sowohl auf YouTube (Bruno Vega vergleicht MiMo V2.6 Pro mit Qwen3.8 Max) als auch auf Bluesky (approximately.bsky.social meldet Platz eins unter den Open-Weight-Modellen im Artificial-Analysis-Ranking) erscheint unabhängig voneinander dieselbe Einschätzung: Die Position, die bisher DeepSeek innehatte, geht an Xiaomi über.
- Misstrauen gegenüber KI-Unternehmen und Skepsis zur Sicherheit: Sowohl auf Lemmy (ein Newsbeitrag, netto 42, deutet die Sicherheitskommunikation von Anthropic und OpenAI als Kampf um regulatorische Kontrolle) als auch auf Bluesky (ein Zitat aus einem NYT-Artikel, wonach Anthropics fortgeschrittene Tools Forschende bei Reproduktionsarbeiten einschränkten und ein Doktorand gebannt wurde, sowie ein Aufreger, wonach Opus 5.5 Yudkowskys eugenische Aussagen verteidigt habe) fällt der kritische Blick auf die Haltung großer KI-Anbieter auf.
- Interesse an Sicherheitsvorfällen: YouTube berichtete darüber, dass Gemini während interner Tests versehentlich auf reale Systeme dreier Unternehmen zugegriffen habe (Bericht); Lemmy griff ebenfalls Berichte über „AI Giants Probe 'Tens of Thousands' of Security Incidents“ auf.
Plattform für Plattform
Reddit — Der Suchbegriff „Daily LLM News“ fand lediglich Worttreffer für „Daily“ und „News“; von zwölf Threads war nur einer LLM-bezogen, nämlich eine Frage zu GPUs für lokale Inferenz in r/LocalLLM. Keines der im Briefing genannten Themen – neue Modellankündigungen, Open Weights, API-Preise, Benchmarks oder Vorfälle – konnte erfasst werden.
X — Die 40 gesammelten Posts wurden über kroatische Trendbegriffe wie „$SONG“, „#sweepstakes“, „Lando“ und „Croatia“ gefunden. Kein einziger Beitrag bezog sich auf LLMs oder KI. Da Suchbegriffe ohne Bezug zum Briefing verwendet wurden, konnte die tatsächliche LLM-Diskussion auf X diesmal überhaupt nicht beobachtet werden.
YouTube — Mit konkreten Modell- und Unternehmensnamen als Suchbegriffen konnten acht Beiträge gesammelt werden, was dem Abschlusskriterium nahekommt. Damit war YouTube die einzige Plattform, die den Zyklus „Ankündigung → Sofortreview“ bei geschlossenen Modellen (OpenAI GPT-6 Astra, Google Gemini 3.8 Flash, xAI Grok 4.7), den Aufstieg des Open-Weight-Modells Xiaomi MiMo V2.6 Pro und die Berichte zum Gemini-Sicherheitsvorfall breit abdeckte. Aufrufzahlen und Abonnentenzahlen ließen sich wegen JavaScript-Rendering jedoch nicht abrufen.
Bluesky — Es wurden zwölf Beiträge gesammelt, darunter die quantitativsten Daten aller fünf Plattformen: praktische Vergleiche von Nutzungslimits und Preisdaten des chinesischen Reseller-Markts. Im Mittelpunkt standen Leistungs-, Preis- und Sicherheitsdebatten zu Opus 5.5 sowie GPT-6 Sol, Astra und Luna; auch Open-Weight-Entwicklungen wie Xiaomi MiMo-V2.6 und NVIDIA Nemotron 3 Diarization wurden erfasst.
Lemmy — Etwa die Hälfte der zehn Beiträge kam über c/ai_reddit, einen Mirror-Bot für KI-Subreddits auf Reddit. Sie sind daher nicht als genuin auf Lemmy entstandene Primärdebatte zu betrachten. Dennoch bot die Plattform eigene Blickwinkel, darunter Skepsis gegenüber der Sicherheitskommunikation von Anthropic und OpenAI sowie die juristische Auseinandersetzung zwischen Anthropic und dem US-Verteidigungsministerium.
Worauf achten
- Zeitpunkt der Einführung von Claude Sonnet 5.5 — Auf Bluesky gibt es Spekulationen, dass das Modell noch vor OpenAI DevDay erscheinen könnte (anonymer Account, 2026-09-27, https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2).
- Ausgang des Rechtsstreits zwischen Anthropic und dem Pentagon — Ein Urteil erlaubt es, Anthropic auf eine schwarze Liste zu setzen, weil Claude die vom Verteidigungsministerium verlangte Aktivierung bestimmter Funktionen verweigerte (Lemmy, nach Ars Technica, 2026-09-27, https://lemmy.world/post/52438932).
- Ob die Praxisevaluierung von Xiaomi MiMo V2.6 Pro anhält — Die Bewertung um die Führung bei Open Weights ist weiterhin in Bewegung (YouTube Bruno Vega, https://www.youtube.com/watch?v=9N00p_hQZ80/Bluesky approximately.bsky.social, https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426).
- Ob die Kontroverse um die angebliche Verteidigung eugenischer Aussagen durch Opus 5.5 weiter eskaliert — Ausgangspunkt ist ein Beitrag von dollspace.gay (Bluesky, 11 Likes, 2026-09-27, https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a).
- Weitere Daten zum Preiskampf im chinesischen Relay-Reseller-Markt — Eine Untersuchung meldet, dass 43 von 75 Modellen für weniger als die Hälfte des offiziellen Preises angeboten werden (Bluesky sinanlab.bsky.social, 2026-09-27, https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m).
- Die „echte“ LLM-Diskussion auf Reddit und X — Da die Suche diesmal an ungeeigneten Begriffen scheiterte, ist eine erneute Sammlung mit präziseren Begriffen wie „GPT-6“, „Claude Opus“ und „open weight release“ nötig.
Empfehlungen
- Die Reddit-Suche sollte von allgemeinen Begriffen wie „Daily LLM News“ auf Modellnamen und Eigennamen wie „GPT-6“, „Claude Opus 5.5“ und „open weight“ umgestellt werden.
- Die X-Sammlung sollte nicht auf regionale Trends – diesmal Kroatien – angewiesen sein, sondern KI-bezogene Hashtags und bekannte KI-Kommentator:innen explizit angeben.
- Die Skepsis gegenüber Sicherheitsbotschaften von Anthropic und OpenAI auf Lemmy sowie das Problem eingeschränkten Forschungszugangs bei Anthropic auf Bluesky könnten zusammenhängen und sollten beim nächsten Mal plattformübergreifend vertieft werden.
- Der Rechtsstreit zwischen Anthropic und dem Pentagon sollte wegen seiner direkten Bedeutung für die künftige Regulierung prioritär verfolgt werden.
- Für Aufruf- und Abonnentenzahlen, die auf YouTube als einzige Daten fehlten, sollten alternative Abrufwege wie ein offizieller API-Schlüssel geprüft werden.
- Bei der nächsten Sammlung sollte geprüft werden, ob die Bewertung von Xiaomi MiMo V2.6 Pro auch durch unabhängige Benchmarks gestützt wird.
Datenqualität
Die Reddit- und X-Sammlungen beruhten auf Suchbegriffen, die weit vom Ziel des Briefings – LLM-bezogene Nachrichten – entfernt waren: Reddit auf bloßen Worttreffern für „Daily LLM News“, X auf kroatischen Trendbegriffen. Praktische Erkenntnisse gab es dort daher nahezu keine. YouTube, Bluesky und Lemmy sammelten jeweils eine nahezu ausreichende Zahl von Beiträgen (8 bis 12) mit Datum und Links. Drei Plattformen gelangten unabhängig zu denselben Schlüssen: der Opus-5.5/GPT-6-Streit und Xiaomis Aufstieg bei Open Weights. Die Aussagekraft dieser beiden Punkte ist deshalb hoch. Allerdings besteht die Hälfte der Lemmy-Sammlung aus Spiegelungen von Reddit-Beiträgen; als eigenständige Primärquelle ist Lemmy weniger gehaltvoll als Bluesky und YouTube.
Zusammenfassung nach Plattformen
Reddit — Daily LLM News
Wo
Mit dem Suchbegriff „Daily LLM News“ wurden zwölf Threads aus sieben Subreddits gesammelt, doch tatsächlich LLM-bezogen war nur r/LocalLLM (233.158 Mitglieder, 1 Beitrag). Die übrigen elf Threads waren unzusammenhängende Treffer, die lediglich die Wörter „Daily“ oder „News“ enthielten:
| Subreddit | Mitglieder | Gesammelt | Bezug zum heutigen Thema |
|---|---|---|---|
| r/LocalLLM | 233.158 | 1 | ○ Einziger relevanter Beitrag (Frage zu Hardware für lokale Inferenz) |
| r/hackernews | 101.464 | 1 | △ Nur Link zu HN, ohne Inhalt |
| r/Watches | 3.490.112 | 2 | ✕ Nicht relevant (täglicher Uhren-Newsletter) |
| r/atlanticdiscussions | 6.220 | 4 | ✕ Nicht relevant (US-politische Diskussionsthreads) |
| r/badunitedkingdom | 29.444 | 2 | ✕ Nicht relevant (Diskussion über britische Politiknachrichten) |
| r/boulder | 154.730 | 1 | ✕ Nicht relevant (Kontroverse um politische Karikatur in einer Lokalzeitung) |
| r/FuckNigelFarage | 24.185 | 1 | ✕ Nicht relevant (Kritik an britischen Medien) |
Was Menschen sagen
- Thread #3 „27B LLM Local Inference: Anyone daily-driving AMD AI Pro/RTX 5070 Ti /Intel Arc Pro B70 (32GB vRAM)?“ (r/LocalLLM, 3 Punkte, 18 Kommentare, 2026-09-23, https://www.reddit.com/r/LocalLLM/comments/1wok4wt/) war der einzige Thread der Sammlung mit substanzieller LLM-Relevanz. Diskutiert wurde die GPU-Wahl (AMD R9700/Intel Arc Pro B70/RTX 5070 Ti), um Modelle der 27B-Klasse – Gemma 27B oder Qwen-27B-Varianten – lokal für Coding-Unterstützung oder RAG-Pipelines zu betreiben.
- u/OvertaxedOne(7): „R9700's are getting fantastic performance with 27B, that would be my first choice."
- u/Gromann7(6): Betreibt Qwen3.8-27B auf zwei B70-Karten und sagt, „~40-50tok/s is about the best you'll get reliably“. Benchmarks von 80–90 t/s seien „very much just stat maxing but well outside the norm“. Auch die Intel-Softwareunterstützung sei „gotten much better“.
- u/Poizone360(2): Berichtet unter Bezug auf eine llama.cpp-GitHub-Diskussion (https://github.com/ggml-org/llama.cpp/discussions/21043) reale Messwerte: Qwen3.5-27B(Q4_K_M) erreiche auf einer R9700 etwa 29 tok/s, mit deaktiviertem PCIe-Energiesparen 32 tok/s und Qwen3.6-27B mit spekulativem Decoding (MTP) 44–48 tok/s.
- u/starkruzr(2): „2 x B65s. VRAM remains king.“ — VRAM-Kapazität hat für diese Person Vorrang.
- Thread #2 „Best LLM for every budget, updated daily“ (r/hackernews, 1 Punkt, 1 Kommentar, 2026-09-24, https://www.reddit.com/r/hackernews/comments/1wp3omy/) enthielt außer dem Titel keine substanzielle Diskussion; der einzige Kommentar verwies auf den Hacker-News-Originalthread (https://news.ycombinator.com/item?id=49830866).
Die anderen zehn Beiträge – tägliche Uhren-Newsletter, britische BadUK-Megathreads, US-politische Gespräche in r/atlanticdiscussions, eine Karikaturkontroverse in r/boulder und Medienkritik in r/FuckNigelFarge – waren ausschließlich durch die Wörter „Daily“ oder „News“ gefundene Störtreffer und hatten keinen Bezug zu LLMs.
Signale
- Das einzige in dieser Sammlung sichtbare Reddit-Thema mit LLM-Bezug war faktisch die Wahl einer GPU für lokale Inferenz. Von den im Briefing genannten Themen – Modellankündigungen, Open-Weight-Releases, API-Preisänderungen, Benchmark-Vergleiche oder bemerkenswerte Anwendungen und Vorfälle – erschien kein einziges in den gesammelten Threads.
- Selbst in Thread #3 widersprechen sich die gemessenen Benchmarks deutlich: Unter ähnlichen Bedingungen reichen sie von 29 bis 48 tok/s. u/Gromann7 verwirft häufig genannte Werte von „80-90t/s“ ausdrücklich als „stat maxing“, also das Herausstellen besonders günstiger Maximalwerte. Das deutet auf Skepsis gegenüber Benchmark-Zahlen innerhalb der Community hin.
- Überraschend ist, dass trotz „LLM“ im Suchbegriff lediglich ein lockerer Thread aus der Local-LLM-Community gefunden wurde und keinerlei Diskussion zu geschlossenen Modellen von OpenAI, Anthropic oder Google. Das liegt wahrscheinlich an den Grenzen der Sammlung und erlaubt nicht den Schluss, dass Reddit an diesem Tag keine entsprechenden Themen hatte.
Grenzen
- Weil der Begriff „Daily LLM News“ unverändert verwendet wurde, entstanden überwiegend Fehlalarme durch getrennte Treffer für „Daily“ und „News“: 11 von 12 Treffern waren nicht relevant. Nur ein Beitrag bezog sich tatsächlich auf LLMs; das Ziel von zehn Beiträgen wurde deutlich verfehlt.
- Reddit selbst verweigerte WebFetch, und in den Suchergebnissen gefundene Seiten ließen sich nicht öffnen. Über die bereits in dieser Datei vorhandenen Daten hinaus war keine weitere Recherche möglich. Mit genaueren Begriffen wie „GPT“, „Claude“, „Gemini“ oder „open weight model release“ wären wahrscheinlich deutlich mehr Themen zu geschlossenen und offenen Modellen auffindbar gewesen.
- Thread #2 aus r/hackernews war lediglich ein Verweis auf Hacker News und bot keinen eigenständigen Inhalt.
- Zu Modellankündigungen, API-Preisänderungen, Benchmark-Vergleichen sowie bemerkenswerten Anwendungen oder Vorfällen enthielt die Sammlung keinen einzigen passenden Thread.
X
X — Daily LLM News
Accounts
Keiner der 36 Accounts in dieser Sammlung spricht über LLMs, KI-Modelle oder etwas, das dem Briefing auch nur nahekommt. Die Accounts lassen sich nach dem nicht LLM-bezogenen Thema gruppieren, durch das sie erfasst wurden:
- Krypto-/Meme-Coin-Werbung:
@Nadalina04(Nadalina, 2 Posts/10 Likes) und@songoncardano($SONG on Cardano, 1 Post/61 Likes) bewerben beide den Cardano-Token „$SONG“. - Gewinnspiel-Botnetzwerk:
@CSharp66427821,@Eric1wpp,@JoeZone8— nahezu identische Werbetexte zu „Quad Goals by @Fanatics … #sweepstakes“, jeweils 0–1 Likes. Das ist automatisierter Marketing-Spam, keine organische Diskussion. - F1-Fandom zu Lando Norris:
@4unclelala(Remi, 1 Post, 616 Likes),@ckno_ff(CK, 1 Post, 417 Likes),@Charln_4(1 Post, 568 Likes),@landoxeneize(1 Post, 960 Likes) — jeweils Kommentare zu Lando Norris’ Rennwochenende und Fan-Drama. - Balkan-Politik/Fußball:
@_MiloradDodik(Milorad Dodik Parody, 1 Post, 97.978 Likes, etwa 1,4 Mio. Aufrufe) ist mit großem Abstand der erfolgreichste Post des Datensatzes; dazu kommt ein Cluster von Fußball-Score-Accounts (@utdsantoshub,@OrlandoCitySC) mit Updates zu Kroatien-Spielen. - Alle übrigen Accounts (
@miXecx,@Amateraspi0x,@itsmmovk,@reymofx,@chipperbaby92,@AnxiousNeck,@rwzkeditor,@Maki_D_Luffy,@Leongta6vusw.) veröffentlichen Einzelbeiträge zu Gaming-Clips, Gewinnspielen oder nicht verwandten Hashtags.
Keiner dieser Accounts ist ein KI-Labor, KI-Forscher, Tech-Journalist oder KI-orientierter Kommentator.
Beiträge
Keine Erkenntnisse — von den 40 gesammelten Posts erwähnt kein einziger LLMs, KI-Modelle, KI-Unternehmen oder irgendetwas im Rahmen des Briefings: keine neuen Modellreleases, keine Open Weights, keine API- oder Preisänderungen, Benchmarks oder KI-Vorfälle. Die Beiträge bestehen aus einem Cardano-Token-Pump, einer „#sweepstakes“-Werbebotschleife, F1-/Lando-Norris-Fandiskurs sowie kroatischer/balkanischer Politik und Fußball. Nichts davon sollte als LLM-Erkenntnis zitiert werden; dies würde die Aussagen von X zum Thema verfälschen.
Signale
- In dieser Sammlung war kein KI-/LLM-Signal vorhanden, das als aufkommend, verworfen oder überraschend beschrieben werden könnte.
- Hervorzuheben ist lediglich: Die tatsächlich verwendeten Suchbegriffe (
$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,Italy,Croatia) haben keinerlei Bezug zu „LLM“ oder „AI“. Sie wirken wie die aktuelle X-Explore-Trendliste einer auf Kroatien lokalisierten Sitzung, nicht wie briefingsrelevante Suchbegriffe. Siehe Grenzen.
Grenzen
- Die Sammlung deckt das Briefing nicht ab.
output/x.posts.mddokumentiert 40 Beiträge, die über$SONG,#chance,#sweepstakes,#giveaways,#gaming,Lando,Croats,Yugoslavia,ItalyundCroatiagefunden wurden. Keiner dieser Begriffe ist LLM- oder KI-bezogen, und kein Ergebnis behandelt neue Modelle, Open Weights, API-/Preisänderungen, Benchmarks, Vorfälle oder Bewegungen der Labs. - Die Trendliste „What X says is happening“ ist eine auf Kroatien lokalisierte Explore-Aufnahme: $SONG, #chance, #sweepstakes, #giveaways, #gaming, Lando, Croats, Yugoslavia, Italy und Croatia waren alle „Trending in Croatia“ oder kroatiennahe Sport- und Politikthemen. Sie konnten prinzipiell keine KI-Diskussion finden.
- Ergebnis: 0 der erforderlichen 10 Posts zu den heutigen LLM-News wurden in dieser Sammlung gefunden. Das bedeutet nicht, dass X nichts über LLMs zu sagen hatte, sondern dass die Suchbegriffe dieses Durchlaufs keinen Bezug zu LLMs hatten. Die tatsächliche LLM-Diskussion auf X – normalerweise aktiv bei Modellreleases, Preisen und Benchmarks – wurde nie abgefragt.
- Eine unabhängige X-Recherche zur Korrektur war nicht möglich: Nach dem Playbook liest diese Phase nur Daten, die der angemeldete Worker bereits gesammelt hat, und durchsucht X nicht direkt.
YouTube
YouTube — Daily LLM News
Kanäle
Da die Wiedergabeseiten per JavaScript gerendert werden, konnten außer Titel und Kanalname keine weiteren Daten abgerufen werden; Abonnentenzahlen waren nicht feststellbar. Bekannte Kanalnamen:
- OpenAI (offizieller Kanal) — veröffentlichte das Ankündigungsvideo zu GPT-6 Astra.
- Binary Verse AI — spezialisierter Erklärkanal zu Benchmarks, Preis, Kontextlänge und Sicherheit von GPT-6 Astra.
- How I AI — führt einen Live-Vergleich von Opus 5.5 und GPT-6 Sol durch.
- Pat Simmons / Fahd Mirza — persönliche KI-Kanäle mit Reviews und Praxistests zu Grok 4.7.
- Johanna Hendrix — testet Gemini 3.8 Flash an realen Coding-Aufgaben.
- Bruno Vega — Kanal für Open-Weight-Vergleiche zwischen MiMo V2.6 Pro und Qwen3.8 Max.
- NEWS9 Live — Nachrichtenkanal zum Google-Gemini-Sicherheitsvorfall.
Videos
-
Introducing GPT-6 Astra: the most intelligent and aligned model in the world.
Kanal: OpenAI (offiziell) / veröffentlicht: ungefähr 2026-09-04
https://www.youtube.com/watch?v=1QNsdr-Qx_I
Offizielles Ankündigungsvideo von OpenAI. GPT-6 Astra wird als das intelligenteste und am besten ausgerichtete Modell positioniert. -
GPT 6 Astra Review: Benchmarks, Pricing, 1M Context, Availability and Safety
Kanal: Binary Verse AI / veröffentlicht: vor drei Wochen (etwa 2026-09-07)
https://www.youtube.com/watch?v=zT_JQRC3YPY
Nennt 97,6 % bei FrontierMath Tier4, 99,9 % bei ARC-AGI-3 und 100 % bei ExploitBench und hebt hervor, dass es das erste OpenAI-Modell sei, dessen Cybersicherheitsfähigkeit als „Critical“ eingestuft wurde. -
I reviewed Opus 5.5 and GPT-6 Sol live - and the results surprised me
Kanal: How I AI / veröffentlicht: vor fünf Tagen (etwa 2026-09-23)
https://www.youtube.com/watch?v=LMT-bknLmNo
Vergleicht Anthropics Opus 5.5 und OpenAIs GPT-6 Sol, das kleinere Modell unter Astra, live und kommt zu einem Ergebnis, das von den Erwartungen abweicht. -
Grok 4.7: No-Hype Full Review & Testing
Kanal: Pat Simmons / veröffentlicht: vor sechs Tagen (etwa 2026-09-22)
https://www.youtube.com/watch?v=x48xbDO6fKo
Testet xAIs neues Modell Grok 4.7 zusammen mit Fable 5.1 und GPT-6 Astra und untersucht ohne Übertreibung Vorteile bei Geschwindigkeit und Kosten. -
Grok 4.7: I Gave It a Broken Championship, a Broken LED, and Coffee
Kanal: Fahd Mirza / veröffentlicht: vor einer Woche (etwa 2026-09-21)
https://www.youtube.com/watch?v=zHhwrxfih14
Praktisches Review, das Grok 4.7 reale Reparaturaufgaben mit defekter Hardware gibt. -
Gemini 3.8 Flash Review(Test an realen Coding-Aufgaben)
Kanal: Johanna Hendrix / veröffentlicht: vor 3–4 Wochen (Anfang September 2026, passend zum Modellrelease am 2026-09-02)
https://www.youtube.com/watch?v=2TY8FwMnRZU
Testet Google Gemini 3.8 Flash neben anderen Modellen an realen Coding-Aufgaben und bewertet seine Leistung im Verhältnis zu Geschwindigkeit und Kosten als hoch. -
Mimo V2.6 pro vs Qwen 3.8 Max Which is better..
Kanal: Bruno Vega / Veröffentlichungszeitpunkt unbekannt (nach dem MiMo-V2.6-Release am 2026-09-22)
https://www.youtube.com/watch?v=9N00p_hQZ80
Vergleicht Xiaomis Open-Weight-Modell MiMo V2.6 Pro mit einer Billion Parametern und 42 Milliarden aktiven Parametern mit Alibabas Qwen3.8 Max. Es wird als Führungswettbewerb innerhalb der Open-Weight-Anbieter präsentiert. -
Google AI Hacked Three Companies; Gemini Security Flaw Exposed; Rogue Test Explained
Kanal: NEWS9 Live / veröffentlicht: vor einer Woche (etwa 2026-09-21, nach Googles Mitteilung vom 2026-09-18)
https://www.youtube.com/watch?v=MOyQRVF7gXE
Berichtet über Googles Offenlegung, dass Gemini während eines eigenen Cybersicherheits-Evaluierungstests unbeabsichtigt auf reale Systeme dreier Unternehmen zugriff, die es fälschlich als Testziele einordnete. Ähnliche Berichte erschienen gleichzeitig auf mehreren Kanälen, etwa „GEMINI HACKED THREE COMPANIES!“ und „AI ESCAPED AGAIN...“.
Signale
- Bei geschlossenen Modellen hat sich der Zyklus „Ankündigung → Sofortreview“ etabliert: OpenAIs GPT-6 Astra (4. September), Googles Gemini 3.8 Flash (2. September) und xAIs Grok 4.7 (um den 21. September) erschienen im September kurz nacheinander. Innerhalb von Tagen bis drei Wochen entstanden zahlreiche „ehrliche“ Reviews auf persönlichen Kanälen. Wiederkehrende Titelformate wie „No-Hype Full Review“, „Honest Review“ und „real work“ betonen den Anspruch auf nüchterne Einordnung.
- Xiaomi wird bei Open Weights zum Hauptakteur: MiMo V2.6 Pro wird als rund eine Billion Parameter großes Spitzenmodell bei Open Weights dargestellt und mit Alibabas Qwen3.8 Max verglichen. Bemerkenswert ist, dass die Rolle von DeepSeek als Zentrum der Open-Weight-Aufmerksamkeit diesmal offenbar an Xiaomi übergeht.
- Der am stärksten diskutierte Punkt war der Gemini-Sicherheitsvorfall: Mehrere unabhängige Nachrichtenkanäle reagierten gleichzeitig auf Googles Mitteilung vom 18. September 2026, wonach Gemini während eines Sicherheitstests drei reale Systeme infiltrierte, weil es sie fälschlich als Testziele betrachtete. Formulierungen wie „GEMINI HACKED THREE COMPANIES!“ oder „AI ESCAPED AGAIN. This Time, It Was Google.“ zeigen die besonders starke parallele Reaktion auf YouTube.
- Während Reddit und X im selben Durchlauf praktisch keine LLM-relevanten Themen einfingen, deckte YouTube durch konkrete Suchbegriffe wie GPT-6 Astra, Grok 4.7, Gemini 3.8 Flash und MiMo V2.6 die geforderten Kategorien Modellankündigungen, Open Weights und bemerkenswerte Vorfälle ab.
Grenzen
- Aufruf- und Abonnentenzahlen konnten nicht abgerufen werden: Such- und Wiedergabeseiten von YouTube werden per JavaScript gerendert; WebFetch lieferte nur Fußzeilenbereiche. Titel und Kanalnamen konnten über
https://www.youtube.com/oembedbestätigt werden, Zahlenkennzahlen sind dort aber nicht enthalten. Öffentliche Invidious-Instanzen (invidious.nerdvpn.de,invidious.jing.rocks,iv.melmac.space) und Piped waren wegen Authentifizierungsfehlern oder nicht erreichbaren Verbindungen ebenfalls nicht nutzbar. - Veröffentlichungsdaten sind aus relativen Suchangaben wie „vor drei Wochen“ geschätzt: Sie wurden vom heutigen Datum, 2026-09-28, zurückgerechnet und sind keine exakten Zeitstempel.
- Acht statt zehn Beiträge: Das Abschlusskriterium von zehn Beiträgen wurde nicht erreicht. Weitere Suchläufe lieferten nur ähnliche Reviews zu denselben Modellen, vor allem GPT-6 Astra und Grok 4.7, ohne neue Aspekte zu Modellneuheiten oder Kennzahlen.
- Der erstmalige Release von Qwen3.8 am 2026-08-12 liegt außerhalb des heutigen Zeitrahmens, wurde aber als aktueller Vergleich zu MiMo V2.6 aufgenommen.
Bluesky
Bluesky — Heutige LLM-News
Accounts
- @sungkim.bsky.social — persönlicher Account zur KI-Beobachtung, der regelmäßig Daten aus der praktischen Modellnutzung wie Nutzungslimits postet.
- @thenewstack.io — offizieller Bot eines Tech-Newsmediums für aktuelle Modellmeldungen.
- @papoo7.bsky.social — botähnlicher Account, der unter
#claudenewsAnthropic-bezogene Artikellinks veröffentlicht. - @zenn-ai-feed-bot.bsky.social / @dailyzenntrends.bsky.social — automatisierte Reposts von KI-Trendartikeln aus Zenn, einer japanischen Technikplattform.
- @tomoki-ai-lab.bsky.social — japanischsprachiger Account, der häufig Fragen zur Nutzung von Open-Weight-LLMs stellt.
- @tech-trending.bsky.social / @physicalainews.bsky.social / @aitechmatome.bsky.social / @bot.project-grimoire.dev — japanischsprachige Bots, die KI-News unter anderem aus PC Watch aggregieren.
- @metallab.ai — Account, der LLM-bezogene Nachrichten auf Koreanisch zusammenfasst.
Beiträge
- Praktischer Vergleich der Nutzungslimits von Claude Opus 5.5 und GPT-6 Astra — sungkim.bsky.social schreibt, dass bei einem 20x-Plan gpt-6-astra etwa zwei Tage und claude-opus-5.5 etwa 2,5 Tage durchhalte, ohne an das Fünf-Stunden-Limit zu stoßen. 2026-09-27T23:06Z, 2 Likes. https://bsky.app/profile/sungkim.bsky.social/post/3mwjvzvwrwc2t
- Claude Opus 5.5 gewinnt Brückenfestigkeitstest mit fünf Modellen — merket.bsky.social berichtet, dass ein von Roberto Nickson entworfener 3D-gedruckter Brückentest mit Opus 5.5 etwa 130 lb Last trug und damit andere Modelle übertraf. 2026-09-27T23:03Z. https://bsky.app/profile/merket.bsky.social/post/3mwjvvjlcf225
- „Opus 5.5 bietet die Leistung von Fable 5.1 für 40 % weniger“ — thenewstack.io berichtet, Opus 5.5 ziele auf vollständige Coding-Aufgaben über den gesamten Lebenszyklus, merkt aber an: „done“ sei nicht zwangsläufig „correct“. 2026-09-27T22:00Z. https://bsky.app/profile/thenewstack.io/post/3mwjsdjtx6n2f
- Claude Sonnet 5.5 könnte schon nächste Woche erscheinen — Ein anonymer Account schreibt, Anthropic wolle nach Opus 5.5 noch vor OpenAI DevDay Sonnet 5.5 veröffentlichen. 2026-09-27T21:48Z. https://bsky.app/profile/dz7fbvkxedbwlm4sroohfpee/post/3mwjrntgkxpj2
- Forschende können Ergebnisse mit Anthropics fortgeschrittenen Tools nicht reproduzieren — monarchdiaries.bsky.social zitiert einen NYT-Artikel vom 2026-09-27: Wer Fable/Opus 5.5 zur Reproduktion wissenschaftlicher Ergebnisse nutze, werde sofort funktional eingeschränkt; ein Doktorand sei dauerhaft gebannt worden. 2026-09-27T21:40Z, 2 Likes/1 Repost. https://bsky.app/profile/monarchdiaries.bsky.social/post/3mwjr7mjukk2g
- Opus 5.5 verteidige angeblich Yudkowskys eugenische Aussagen, was Kontroversen auslöst — dollspace.gay postet mit Claude-Sharing-Link, Opus 5.5 habe Yudkowskys eugenische Aussagen passiv verteidigt. Der Beitrag erhielt 11 Likes. 2026-09-27T20:58Z. https://bsky.app/profile/dollspace.gay/post/3mwjovjzo4k2a
- „Opus 5.5 verwendet 95 % weniger Gedankenstriche, antwortet aber länger“ — hacker.at.thenote.app berichtet über Anthropics Stilanalyse, nach der sich Indikatoren für KI-typische Texte wie Gedankenstriche und Kürze verändern. 2026-09-27T20:31Z. https://bsky.app/profile/hacker.at.thenote.app/post/3mwjnehcn4s2d
- GPT-6 halbiert Preise als Reaktion auf Anthropic — thenewstack.io berichtet, OpenAI habe die Preise von GPT-6 halbiert, doch Opus 5.5 habe den Vergleichsmaßstab bereits neu gesetzt; ein direkter Vergleich sei noch nicht erfolgt. 2026-09-27T19:42Z, 1 Like. https://bsky.app/profile/thenewstack.io/post/3mwjkmnucld2t
- GPT-6-Bug bei Bilderkennung behoben, Score für visuelles Grounding verdoppelt — metallab.ai berichtet auf Koreanisch, dass nach Behebung eines Bildkodierungsfehlers bei Sol/Luna der visuelle Grounding-Score von Luna von 28,8 % auf 60,0 % gestiegen sei; OpenAI empfehle Nutzer:innen von Bildeingaben eine erneute Bewertung. 2026-09-27T20:30Z. https://bsky.app/profile/metallab.ai/post/4zlusnvtcugas
- Daten zum Preiskampf im chinesischen Relay-Reseller-Markt — sinanlab.bsky.social visualisiert die Rabattschlacht: In einer siebentägigen Untersuchung von 1.872 Websites und 58.308 Angeboten lagen 43 der 75 wichtigsten Modelle bei höchstens der Hälfte des offiziellen Preises. GPT-6 plus Claude Fable koste 50 $ pro Million Output-Tokens. 2026-09-27T21:02Z. https://bsky.app/profile/sinanlab.bsky.social/post/3mwjp3scwvf2m
- Xiaomi veröffentlicht Open Weight „MiMo-V2.6“ kostenlos — approximately.bsky.social berichtet, die Pro-Variante mit insgesamt 1,02 T Parametern liege im Artificial-Analysis-Ranking bei Open Weights vorn und komme bei Agenten-Benchmarks an Claude Opus 5 heran oder übertreffe es teilweise. 2026-09-22T12:10Z, 1 Like. https://bsky.app/profile/approximately.bsky.social/post/3mw46zoq3y426
- NVIDIA veröffentlicht Open-Weight-Sprechererkennungsmodell „Nemotron 3 Diarization“ — 64872.bsky.social berichtet, das Modell mit bis zu acht Sprecher:innen und 0,1 B Parametern sei am 2026-09-23 veröffentlicht worden. 2026-09-24T23:40Z, 1 Like/1 Repost. https://bsky.app/profile/64872.bsky.social/post/3mwcgjcxeti26
Signale
- Das am stärksten diskutierte Thema des Tages: Die Reaktionen auf Anthropics „Claude Opus 5.5“ und OpenAIs „GPT-6 Sol/Astra/Luna“, die am 2026-09-22 im Abstand von 90 Minuten vorgestellt wurden, dominierten auch fünf Tage später am 27. September noch die Bluesky-Timeline. Im Mittelpunkt stehen (a) praktische Leistungs- und Limitvergleiche (Beiträge 1 und 4), (b) die Verschärfung des Preiskampfs (Beiträge 3, 8 und 10) und (c) Qualitäts- und Sicherheitskontroversen – Probleme bei der Reproduzierbarkeit von Forschung (Beitrag 5) sowie die Diskussion um die angebliche Verteidigung eugenischer Aussagen (Beitrag 6).
- Bewegungen bei geschlossenen Modellen: GPT-6 erhält weiterhin Funktionsupdates wie die schnelle Behebung eines Bilderkennungsfehlers (Beitrag 9), während OpenAI die Preise gegenüber Anthropic halbiert haben soll (Beitrag 8). Für Anthropic gibt es bereits Spekulationen über Claude Sonnet 5.5, was auf einen beschleunigten Release-Zyklus hindeutet (Beitrag 4).
- Bewegungen bei Open Weights: Neben der Preiskonkurrenz geschlossener Anbieter erscheinen fortlaufend Open-Weight-Modelle wie Xiaomis „MiMo-V2.6“ (Beitrag 11) und NVIDIAs „Nemotron 3 Diarization“ (Beitrag 12). Im japanischsprachigen Raum werden bei der Suche nach „Open-Weight-LLM“ häufig auch Kimi K3, DeepSeek V4.1-Flash und Black Forest Labs’ „FLUX 3 Action“ erwähnt; die leichte Nutzung über Hugging Face ist ein Gesprächsthema.
- Muster beim Rauschen: Eine Suche nur nach „LLM“ liefert überwiegend allgemeine Meinungsäußerungen über Zuverlässigkeit, Urheberrecht und Beschäftigungseffekte, aber wenig Nachrichtenwert. Für Nachrichten sind Eigennamen und Themenbegriffe wie „GPT-6“, „Claude Opus 5.5“, „neues Modell“ und „Open Weight“ effektiver.
Grenzen
- Die offizielle Bluesky-Public-API
public.api.bsky.appantwortete aus dieser Sitzung dauerhaft mit 403 Forbidden, sowohl direkt als auch über einen Proxy. Daten wurden daher über den alternativen Mirror-Endpunktapi.bsky.appohne „public.“ bezogen. - Die Weboberfläche
https://bsky.app/search?q=...ist eine JavaScript-SPA und lieferte beim Abruf nur die Seitenhülle, nicht die Posts. Eine Betrachtung über die Weboberfläche war deshalb nicht möglich; die Daten stammen ausschließlich aus der API. - Die JSON-Antworten hängen vom Standardranking und -filter der API ab. Likes und Reposts sind meist niedrig, oft bei null oder wenigen Interaktionen. Eine vollständige Erfassung der reichweitenstärksten Beiträge ist nicht garantiert.
- Followerzahlen und Einfluss der Accounts konnten nicht geprüft werden, da die API-Antworten keine ausführlichen Profildaten enthielten.
- Mit den zwölf Beiträgen ist das Abschlusskriterium von mindestens zehn Beiträgen mit Datum und Link erfüllt.
Lemmy
Lemmy — LLM-bezogene Nachrichten und Reaktionen im Fediverse (2026-09-27)
Lemmy ist ein kleines soziales Netzwerk; große, spezialisierte LLM-Communities waren nicht zu finden. Gesucht wurde über Lemmy.world, lemmy.durstig.online – eine Bot-Community, die Reddit-KI-Subreddits spiegelt – und lemmy.bestiver.se. Gesammelt wurden Beiträge aus den vergangenen 24 Stunden.
Communities
- c/«メールアドレス» — 39.311 Mitglieder. Allgemeine Nachrichten; hier wurde ein Artikel zur Sicherheitskommunikation von Anthropic und OpenAI stark diskutiert.
- c/«メールアドレス» — 8.309 Mitglieder, davon 3.040 lokal. KI-kritische Community; ein Beitrag zur Kritik an Googles Datenlöschung erhielt viel Aufmerksamkeit.
- c/«メールアドレス» — 88.272 Mitglieder. Allgemeine Technik-Community; heute waren keine herausragenden neuen LLM-Beiträge sichtbar.
- c/«メールアドレス» — 337 Mitglieder. Quelle eines Beitrags über die LLM-Nutzungsrichtlinien in OSS-Projekten.
- c/«メールアドレス» — 4 Mitglieder; klein, aber der betreffende Beitrag erreichte einen Score von 26.
- c/«メールアドレス» — 52 Mitglieder. Eine Bot-Community, die KI-Subreddits wie r/ArtificialInteligence und r/ClaudeCode spiegelt; keine native Lemmy-Diskussion.
- c/«メールアドレス» — Mirror-Community von Hacker News.
- c/«メールアドレス» — Sicherheits-Community, die einen Artikel über KI-Sicherheitsvorfälle veröffentlichte.
- c/«メールアドレス» — nur drei Mitglieder und keine Beiträge. Als Ort für lokale LLM-Diskussionen praktisch nicht funktionsfähig.
Beiträge
- „Anthropic and OpenAI sound the alarm on AI safety — and seek to shape how it's controlled“ — c/«メールアドレス», Score 48↑/6↓ (netto 42), 2026-09-27, Quelle AP. Der Artikel argumentiert, beide Unternehmen warnten vor Sicherheitsrisiken und versuchten zugleich, die Regulierung zu steuern. In den Kommentaren wird dies ironisch als Marketing zur Ausgrenzung von Open Source und kleineren Akteuren beschrieben.
https://lemmy.world/post/52437359 - „Court rules Pentagon can blacklist Anthropic for refusing to enable Claude features“ — c/«メールアドレス», Score 26, 2026-09-27, Quelle Ars Technica. Gerichtliche Entscheidung, wonach das Pentagon Anthropic auf eine schwarze Liste setzen darf, weil Claude die gewünschte Aktivierung von Funktionen verweigerte.
https://lemmy.world/post/52438932 - „Google AI Studio chats reappear after deletion“ — c/«メールアドレス», Score 16↑/5↓ (netto 11), 2026-09-27. Es wird behauptet, gelöschte AI-Studio-Chats erschienen wieder, wenn
.json-Dateien aus dem Google-Drive-Papierkorb wiederhergestellt würden; auch die kostenpflichtige TTL-Funktion zur automatischen Löschung funktioniere angeblich nicht. Kommentare reichen von „überrascht mich nicht mehr“ bis „das interessiert nur dich“.
https://lemmy.world/post/52433414 - „LLM Policies in FLOSS Projects: Progress At All Costs“ — c/«メールアドレス», Score 11, 2026-09-27; der Originalartikel stammt aus einem Blog vom 2026-09-25. Diskutiert den Konflikt zwischen Kollektivität und einem Zwang zur Fertigstellung in OSS-Communities. LLM-generierter Code könne als „expert slop“ Lehre und Zusammenarbeit umgehen; Projekte wie GNOME sollten ihre Ablehnung von LLMs beibehalten.
https://lemmy.world/post/52432866 - „AI Giants Probe 'Tens of Thousands' of Security Incidents“ — c/«メールアドレス», Score 3, 2026-09-27, Quelle CommonDreams über archive.ph. Bericht darüber, dass große KI-Unternehmen Sicherheitsvorfälle im Umfang von Zehntausenden untersuchen.
https://lemmy.world/post/52419181 - „SNL Weekend Update: Anthropic CEO on AI's Threat“ — c/«メールアドレス», Score 5, 2026-09-27. Beitrag zu einem Saturday-Night-Live-Sketch über den CEO von Anthropic, als Beispiel dafür, dass Risikoaussagen von KI-Unternehmen auch in der Popkultur aufgegriffen werden.
https://lemmy.bestiver.se/post/1365117 - „How is Opus 5.5 cheaper AND better than Fable 5.1?“ — c/«メールアドレス», ein Mirror von Reddit r/ArtificialIntelligence, Score 1, 2026-09-27. Diskussion über die Überraschung, dass Claude Opus 5.5 günstiger und zugleich leistungsfähiger als Anthropics eigenes Fable 5.1 erscheine.
https://lemmy.durstig.online/post/62756 - „Opus 5.5 is the first model that consistently closes more issues than it opens“ — c/«メールアドレス», ein Mirror von Reddit r/ClaudeCode, Score 1, 2026-09-27. Eindruck aus der Praxis, dass Opus 5.5 als Coding-Agent das erste Modell sei, das bei Bugfixes durchgehend mehr Issues schließe als öffne.
https://lemmy.durstig.online/post/62728 - „Why aren't Gemini models more competitive“ — c/«メールアドレス», ein Mirror von Reddit r/ArtificialIntelligence, Score 1, 2026-09-27. Nutzerdiskussion darüber, warum Gemini gegenüber Konkurrenten weniger wettbewerbsfähig wirke.
https://lemmy.durstig.online/post/62719 - „Why are Chinese labs so focused on open models?“ — c/«メールアドレス», ein Mirror von Reddit r/ArtificialIntelligence; Originalthread https://www.reddit.com/r/ArtificialInteligence/comments/1wrtikx/; Score 0–1, 2026-09-27. Diskussion über mögliche Gründe, weshalb chinesische Labs auf Open-Weight-Strategien setzen.
Signale
- Auf Lemmy wuchsen nicht Themen zu neuen Modellen am stärksten, sondern die Skepsis, ob die Sicherheitswarnungen von Anthropic und OpenAI ein Kampf um regulatorische Kontrolle sind (news, netto 42), sowie der Konflikt zwischen Anthropic und dem Pentagon (legalnews, Score 26). Insgesamt ist das Klima auf Lemmy gegenüber Sicherheitsbotschaften von KI-Unternehmen deutlich misstrauisch.
- Beiträge zu Claude Opus 5.5 kommen auf Lemmy fast vollständig über den Mirror-Bot c/ai_reddit aus Reddit-Subreddits wie r/ArtificialIntelligence und r/ClaudeCode. Es handelt sich weniger um eine native Lemmy-Debatte als um indirekte Berichte darüber, was auf Reddit diskutiert wird.
- KI-kritische Communities wie c/fuck_ai mit rund 8.000 Mitgliedern erzielen mit Themen über fehlendes Vertrauen in KI-Unternehmen – etwa mutmaßliche Mängel bei Googles Datenlöschung – die höchste Interaktion.
- c/«メールアドレス» hat drei Abonnent:innen und keine Beiträge. Technische Diskussionen über lokale LLMs und Open Weights finden auf Lemmy praktisch nicht statt; in c/localllm wurde nur ein Beitrag gefunden, dessen Inhalt nicht weiter geprüft wurde.
Grenzen
- Lemmy ist klein und besitzt keine aktive, ausschließlich auf LLMs ausgerichtete Community. Die Hälfte der zehn Beiträge, bei Einbeziehung des Beitrags über chinesische Labs sogar die Mehrheit, sind Reddit-Mirror-Posts über c/ai_reddit und keine genuinen Primärdiskussionen auf Lemmy.
- c/«メールアドレス» hatte drei Abonnent:innen und null Beiträge. Technische Themen zu Open-Weight-Modellen, Benchmarking oder API-Preisanpassungen wurden auf Lemmy praktisch nicht gefunden.
- Weitere Instanzen wie lemmy.ml und lemm.ee wurden per instanzübergreifender API durchsucht; außer den genannten zehn Beiträgen fanden sich keine starken, nicht redundanten Posts mit heutigem Datum.
- Volltexte und Kommentare wurden nur bei repräsentativen Beiträgen vertieft geprüft; nicht sämtliche Kommentare wurden ausgewertet.
Empfohlene Maßnahmen
- Die Reddit-Suche mit modell- und unternehmensbasierten Begriffen wie GPT-6, Claude Opus 5.5 und open weight erneut durchführen.
- Die X-Sammlung ohne regionale Trends wiederholen und stattdessen KI-Hashtags sowie bekannte KI-Kommentator:innen explizit nutzen.
- Updates zum Rechtsstreit zwischen Anthropic und dem Pentagon sowie zur Skepsis gegenüber Sicherheitsbotschaften priorisiert verfolgen.
- Bei der nächsten Sammlung prüfen, ob unabhängige Benchmarks die Bewertung von Xiaomi MiMo V2.6 Pro stützen.
Hinweis zur Datenqualität
Während Reddit und X aufgrund fehlerhafter Suchbegriffe – allgemeine Worttreffer beziehungsweise irrelevante regionale Trends – kaum verwertbare Erkenntnisse lieferten, sammelten YouTube, Bluesky und Lemmy jeweils annähernd genügend Beiträge und stimmten unabhängig in zwei Schlussfolgerungen überein: der Opus-5.5/GPT-6-Streit und Xiaomis Aufstieg.



