KEN’S CAT LOG

KI-News zur Bild- und Videogenerierung — 2026-09-05

GPT-6 „Astra“ dominierte diese Woche den Hype um Closed-Source-Modelle auf X und Bluesky, während Open-Source-Video- und Bildmodelle (LTX-2.5, MiniMax H3, Qwen-Image-3.0) fast vollständig innerhalb des ComfyUI-Ökosystems mithielten. Die insgesamt größte Einzelmeldung war jedoch Midjourneys Kurswechsel weg von der Bildgenerierung hin zu Hardware für medizinischen Ultraschall.

Zusammenfassung der KI-News zur Bild- und Videogenerierung — Closed Source vs. Open Source — 2026-09-05

Hallo! Die Szene für KI-Bild- und Videogenerierung war diese Woche wirklich komplett chaotisch www🔥 Auf der Closed-Source-Seite hat OpenAIs GPT-6 „Astra“ auf X (ehemals Twitter) mit über 100 Millionen Aufrufen einen riesigen Hype ausgelöst und gefühlt alles an sich gerissen😳 Gleichzeitig war die Open-Source-Seite keineswegs abgeschlagen: Extrem starke Modelle wie LTX-2.5, MiniMax H3 und Qwen-Image-3.0 erschienen nacheinander als Open Weights, und ComfyUI wird immer mehr zum echten Mutterschiff🛠️ Eher nebenbei, aber ebenfalls heftig: Midjourney soll die Bildgenerierung aufgegeben und auf ein Unternehmen für medizinische Ultraschallscanner umgeschwenkt sein😱 Das war wirklich überraschend. Außerdem zeigte sich: Auf Reddit traf die Debatte über die rechtliche Behandlung von KI-generierten Inhalten stärker ins Schwarze als der technische Fortschritt selbst.

Plattformübergreifend

Plattform für Plattform

Reddit: Die Monatszusammenfassung in r/StableDiffusion (eine Flut von Open-Source-Releases wie Qwen3.8, DeepSeek-V4-Pro, Ling-3.0 und Gemma-4-31B; selbst die Kommentare kommen nicht hinterher) ist ein großartiger Thread https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/ . Bemerkenswert ist auch World Labs’ Atlas: eine Technologie, die aus Videos oder Fotos sofort 3D-Welten erzeugt und damit auch für Robotik relevant sein könnte https://www.reddit.com/r/accelerate/comments/1w5ye9s/ . Am meisten Aufmerksamkeit bekam jedoch nicht eine Technikmeldung, sondern der Thread zum Urteil, dass KI-generierte Kinderpornografie verfassungsgemäß geschützt sei. Rechtliche und ethische Themen scheinen Reddit stärker zu bewegen.

X: Die Suche lieferte nur vier Astra-bezogene Beiträge – GPT-6 Astra hatte die Bühne für sich🎤 Der technisch konkreteste Beitrag neben dem Ankündigungspost mit 108.000.000 Aufrufen war die Demo des Entwicklers @Dimillian für eine 3D-Pipeline von Blender nach UE5 https://x.com/Dimillian/status/2095596700815516004 。Open-Source-Themen wie Stable Diffusion, Flux oder Wan tauchten im Suchumfang dieses Durchlaufs kein einziges Mal auf – eine echte Lücke.

YouTube: Bei Closed Source gab es zahlreiche Vergleichsreviews zu Nano Banana 2, Kling 3.0 vs. Veo3.1 vs. Sora2 sowie Seedance2.5 und Seedream5.0 Pro https://www.youtube.com/watch?v=AAD7wJ3DWiA 。Auf der offenen Seite wurden LTX-2.5 (ein extrem schnelles Modell, das 10 Sekunden in 720p in 6,8 Sekunden erzeugt) https://www.youtube.com/watch?v=RjlbDhs1MPk und HunyuanImage3.0 (80B-Parameter-MoE) https://www.youtube.com/watch?v=U-8RjjU7x14 behandelt. Open Weights werden inzwischen direkt nach ihrer Veröffentlichung mit den Closed-Source-Anbietern verglichen. Außerdem gab es Berichte, dass OpenAI die Sora API beendet und Ressourcen auf das Nachfolgemodell „Spud“ konzentriert (das YouTube-Video selbst konnte nicht verifiziert werden, die Meldung stammt aus Newsquellen).

Bluesky: Simon Willisons regelmäßiger „Pelikan-Bildbenchmark“ ist zu einer festen Beobachtungsstation für die Qualitätsprüfung von Closed-Source-Modellen geworden https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c 。Der offizielle Replicate-Account fungiert als Hub für schnelle Release-Meldungen zu Videomodellen wie Kling3.0, Seedance2.0, Runway Gen-4.5 und Vidu Q3 https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c 。Primäre Open-Source-Meldungen gibt es fast nicht; selbst der LoRA-Tool-Entwickler ostris sagt, die AI/ML-Szene sei fast vollständig auf X (Twitter) geblieben😅 Im Japanischen beschränkte sich die Sichtbarkeit ungefähr auf das Teilen eines GIGAZINE-Artikels zu Qwen-Image-3.0 https://gigazine.net/news/20260722-qwen-image-3/

Lemmy: !«メールアドレス» hat die mit Abstand höchste Informationsdichte für offene Modelle. Beiträge zu MiniMax H3 (Comfy als kommerzieller Resellerhttps://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 、Tools, die mit 16 GB VRAM laufen usw.) machten fast die Hälfte der Posts aus. Auch LLaDA-Image mit vollständig veröffentlichtem Trainingsrezept https://arxiv.org/abs/2609.03796 ist spannend. Auf der Closed-Source-Seite erzielte nicht ein neues Modell, sondern die Meldung „Midjourney wechselt von Bildgenerierung zu medizinischen Ultraschallscannern“ einen um Größenordnungen höheren Score (58–73) und war damit das wichtigste Thema für Lemmy-Nutzer.

Pinterest: Visuell dominierten klar Closed-Source-Themen (Google Veo2/3, Microsoft VASA-1, Grok4.6, Gemini mit einer Milliarde Nutzern) die Sammelgrafiken. Bei offenen Modellen war kaum mehr als AMDs lokales Tool „Amuse 3.0“ zu finden. Auch die Anwendungsfälle „Gesichter animieren oder erzeugen“ – Lip Sync, Mimik-Reproduktion und Porträtgenerierung – waren enorm häufig. Das passt offenbar gut zur Pinterest-Zielgruppe mit Interessen an Beauty- und Social-Media-Content.

Beobachtungspunkte

  1. Weitere bild-/videonahe Meldungen zu GPT-6 Astra — X, https://x.com/flowith/status/2095750768204877858(Animationsvergleich GPT-6 Astra vs. GPT-5.6, Ankündigung für die nahe Zukunft)
  2. Ende der Sora API → Nachfolgemodell „Spud“ — Laut YouTube-Recherche soll die API am 2026-09-24 eingestellt werden. Reale Videos und Funktionen wurden bislang von niemandem bestätigt.
  3. Wie sich die Kommerzialisierung der MiniMax-H3-Lizenz entwickelt — Lemmy, https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller (ob sich der Hybridansatz „Open Weights, kommerziell kostenpflichtig“ etabliert)
  4. Midjourneys Wechsel zu Medizintechnik — Lemmy, https://lemmy.zip/post/66397234 (ob ein etablierter Closed-Source-Anbieter die KI-Bildgenerierung wirklich ernsthaft verlässt)
  5. LLaDA-Images vollständig offenes Trainingsrezept — Lemmy/arXiv, https://arxiv.org/abs/2609.03796 (wie stark künftige Open-Modelle das Spitzenmodell auf Qwen-Image-Bench nachahmen werden)
  6. World Labs’ Atlas — Reddit, https://www.reddit.com/r/accelerate/comments/1w5ye9s/ (wie Video-zu-3D-Welt-Generierung für Robotik-Trainingsdaten genutzt werden könnte)

Empfehlungen

  1. Die Suchbegriffe auf X sollten nicht den Trends überlassen werden. Stattdessen sollten konkrete Tags wie „Stable Diffusion“, „ComfyUI“, „Flux“, „Wan“, „Kling“ und „Sora“ gezielt erneut erhoben werden.
  2. Da die searchPosts API von Bluesky mit 403 nicht verfügbar war, wäre es beim nächsten Mal effizienter, vorab eine größere Liste bekannter Accounts über die Google-Suche zusammenzustellen.
  3. Modelle wie MiniMax H3, die Open Weights anbieten, kommerziell aber kostenpflichtig sind, sollten im Bericht nicht einfach als „offen“ klassifiziert, sondern ausdrücklich annotiert werden.
  4. Meldungen über Rückzüge oder Richtungswechsel großer Anbieter – etwa Midjourneys Pivot und das Sora-Ende bei OpenAI – sollten dauerhaft beobachtet werden, da sie Leser stärker anziehen als reine Technikmeldungen.
  5. Pinterest enthält wenig Primärinformationen und eignet sich daher eher als Stimmungsbarometer dafür, wie allgemeine Konsumenten die Entwicklung wahrnehmen.
  6. Die auf Reddit und Lemmy sichtbare Tendenz, dass Gerichtsurteile und ethische Kontroversen stärker viral gehen als Techniknews, sollte im nächsten Briefing als separates Signal berücksichtigt werden.

Datenqualität

  • X: Die gesammelten Beiträge basierten auf Trends aus dem kroatischen Raum. Neben vier GPT-6-Astra-bezogenen Beiträgen bestand das Ergebnis daher aus irrelevanten Störsignalen wie Krypto, Elon-Themen und Sport. Open-Source-Erwähnungen gab es keine; die geforderte Analyse von 20 Beiträgen wurde nicht erreicht.
  • Bluesky: Die offizielle Such-API lieferte 403, daher wurde auf die Prüfung individueller Feeds bekannter Accounts umgestellt. Es blieben etwa 12 direkt relevante Beiträge; Primärinformationen zu Open Source wurden fast nicht gefunden.
  • Reddit: Mit nur einem Suchbegriff wurden lediglich 12 Threads in 9 Subreddits gesammelt, also weniger als die Zielgröße von 20. Die jeweils wichtigsten Kommentare wurden aber mit bis zu sechs pro Thread erfasst.
  • YouTube: Da Suchergebnisse und Videoseiten per JavaScript gerendert werden, konnten Aufrufe, Abonnentenzahlen und genaue Veröffentlichungstage nicht direkt verifiziert werden. Datierungen wurden aus relativen Angaben in Snippets abgeleitet.
  • Lemmy: Wegen der föderierten Struktur fehlen in der Suche einer einzelnen Instanz Beiträge anderer Instanzen. Direkte Suchen nach Closed-Source-Videodiensten wie Sora, Kling und Veo lieferten fast keine Treffer.
  • Pinterest: Von 50 Ergebnissen wurden nur 24 Bilder tatsächlich geöffnet und geprüft; bei den übrigen blieb es beim Titel. Engagement-Daten wie Likes oder Saves waren nicht Teil der erhobenen Daten.

Zusammenfassung nach Plattform

Reddit

Reddit — KI-News zur Bild- und Videogenerierung

Wo

Die 12 gesammelten Threads stammen aus 9 Subreddits. Der einzige Suchbegriff war „Image and Video Generation AI News“.

Subreddit Abonnenten Gesammelte Threads
r/generativeAI 150,575 4
r/GrokAiDiscussion 4,883 1
r/freetoolsAI 7,616 1
r/StableDiffusion 1,000,814 1
r/accelerate 77,800 1
r/news 31,531,475 1
r/antiai 313,317 1
r/allthequestions 127,064 1
r/teenagers 3,673,210 1

r/generativeAI war mit vier Beiträgen zahlenmäßig am stärksten vertreten und der Mittelpunkt für lockere Posts über Tool-Suche und Vergleiche. Ansonsten kam jeweils nur ein Beitrag aus jedem Subreddit. Auffällig ist, dass das Thema auch in nicht auf Bild- oder Videogenerierung spezialisierten Subs wie r/news und r/teenagers auftauchte.

Was die Leute sagen
  • #4 r/StableDiffusion „Local AI News You Missed - August 2026“(201pt・22 Kommentare・2026-08-31, https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/) — Eine Monatsübersicht, laut der allein im August zahlreiche Open-Source-Modelle wie Qwen3.8, DeepSeek-V4-Pro-0813, die Ling-3.0-Reihe und Gemma-4-31B veröffentlicht wurden. Auch in den Kommentaren folgen Ergänzungen rasch aufeinander: u/Narutobirama(20) „You probably missed Qwen3.8 Flash Next.“, u/MoJaKF(14) „Anima-3.8B its already on its 1.1 release that just released 3h ago“. Selbst die Zusammenfassung kann das Tempo nicht einholen.
  • #5 r/accelerate „…They built an AI that looks at a few casual real-world videos or photos and instantly turns them into a full 3D playground“(763pt・76 Kommentare・2026-09-03, https://www.reddit.com/r/accelerate/comments/1w5ye9s/) — World Labs’ Atlas erzeugt interaktive 3D-Welten aus Videos oder Fotos. Die Reaktionen waren begeistert, etwa u/stainless_steelcat(48): „Matrix bullet time comes to real life...now I know it wasn't ambitious enough.“ Diskutiert wurde auch die Möglichkeit, Videogenerierung für Robotik-Trainingsdaten einzusetzen.
  • #6 r/generativeAI „Same prompt. Same 30 seconds. Two different AI video models.“(98pt・30 Kommentare・2026-09-03, https://www.reddit.com/r/generativeAI/comments/1w60fip/) — Vergleich von Seedance 2.5 und Wan 3.0 mit identischem Prompt. u/SpecialistDragonfly9(5) bewertet „seedance is the by FAR superior one“, während u/Positive-Key6640(4) einwendet: „Same-prompt comparisons are fun but they mostly measure which model happens to like your prompt style, not which one is better“.
  • #2 r/GrokAiDiscussion „Have they loosened the image to video generation moderation“(14pt・28 Kommentare・2026-08-29, https://www.reddit.com/r/GrokAiDiscussion/comments/1w1w0e8/) — Die Wahrnehmung der Moderationspolitik von Grok Imagine ist gespalten. u/Miserable_Appeal515(2) sagt „it has gotten better“, u/joderrelldalejr(2) hingegen: „Hell no it gets worse and then they start to limit how many images you can even do in a week“.
  • #1 r/generativeAI „List of daily AI video generative websites“(38pt・27 Kommentare・2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3frr2/) — Austausch für Nutzer, die kostenlose Kontingente maximal ausnutzen wollen. Kling AI bietet „66 free credits every 24 hours“, u/Murky-Race-3443(1) erwähnt „capcut gives daily free credits btw“, und u/Julia_Leeds94(1) stellt YalleryLabs mit Preisen ab 0,18 USD für ein 5-Sekunden-Video in 720p bei einem Budget von 3 USD vor.
  • #3 r/freetoolsAI „Free AI Image Generator“(31pt・31 Kommentare・2026-09-04, https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/) — Ein Werbepost für eine kostenlose Bildgenerierungsseite ohne Registrierung erhielt zahlreiche Kommentare. u/Odd-Lingonberry1516(2) listet Alternativen wie Deepany, Aifun und Perchance auf. u/thecragmire(1) fragt nach dem Geschäftsmodell: „How do you maintain this? It's got to cost you something, right?“
  • #11 r/generativeAI „GOOD image-to-video ??“(1pt・13 Kommentare・2026-08-29, https://www.reddit.com/r/generativeAI/comments/1w20rq1/) — Kling AI wird als „practically king of the hill for realistic human motion“ bezeichnet, Runway als „The gold standard for creative control“. Für lokale Nutzung empfiehlt u/Ok-Addition1264(2) ComfyUI plus WAN22/LTX2.3.
  • #7 r/generativeAI „Any good Ai video site ? Even if it paid ?“(0pt・15 Kommentare・2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3kptg/) — u/Previous-Course-5160(1) lobt Runways gen-3, weil es „actually handles motion pretty well compared to a lot of the jank“, urteilt über Pika aber deutlich härter: „fun for quick little loops...but the output gets samey after a while“.
  • #8/#10 r/news „Federal Judge rules AI generated child sex abuse material is protected by First Amendment.“(1,379pt・545 Kommentare・2026-09-02, https://www.reddit.com/r/news/comments/1w5k6pr/) und r/allthequestions „Why did a federal judge declare the creation of AI generated child porn as legal?“(31pt・277 Kommentare・2026-08-31, https://www.reddit.com/r/allthequestions/comments/1w3hf3o/) — Die rechtliche Einordnung KI-generierter Inhalte erzeugte außergewöhnlich viel Engagement. u/Ntroepy(414) weist darauf hin, dass „The headline reads like click-bait...bound by a 2002 Supreme Court ruling“ irreführend sei. u/TheGracefulCrane(31) ordnet auf r/allthequestions die Rechtsauslegung ein: „judges dont make laws and the law hasnt been updated to make it illegal ergo the ruling“.
  • #9 r/antiai „AI generated images are becoming harder to detect“(113pt・30 Kommentare・2026-08-30, https://www.reddit.com/r/antiai/comments/1w2mr8g/) — Entgegen dem Titel drehten sich die Kommentare vor allem um fehlgebildete Hände und Füße, etwa u/GurInside278(31): „why are her feet her hands“. Daraus entstand eine ironische Diskrepanz.
  • #12 r/teenagers „To all AI image/video generator users“(7pt・41 Kommentare・2026-08-31, https://www.reddit.com/r/teenagers/comments/1w2y305/) — Ein Gegenbeitrag zur Behauptung, bei KI-Kunst arbeite kein Künstler. Kommentare wie u/LiterallyGarbage_0(5) „people who use ai to make "art" genuinely make me so upset...pick up a pencil“ zeigen starke Anti-KI-Stimmungen unter Teenagern.
Signale
  • Steigend: Die Veröffentlichungsfrequenz lokaler Open-Source-Modelle für LLMs, Bilder und Videos ist so hoch, dass sie bereits in den Kommentaren zu Thread #4 nicht mehr vollständig nachvollzogen werden kann. Auch die Übertragung von Videogenerierung auf Robotik-Trainingsdaten, etwa mit World Labs’ Atlas (#5), ist eine neue Richtung mit wachsendem Interesse.
  • Meinungskonflikte: Bei Grok Imagine (#2) stehen Berichte „es ist besser geworden“ und „es ist schlechter geworden“ direkt nebeneinander. Bei Seedance vs. Wan (#6) gibt es sowohl die Ansicht, Seedance gewinne klar, als auch den Einwand, dass Vergleiche mit identischem Prompt methodisch wenig aussagekräftig seien. Eine einzelne Schlussfolgerung ist nicht möglich.
  • Herabgesetzt / hinterfragt: Das Standardformat des Modellvergleichs mit identischem Prompt (#6) wird von u/Positive-Key6640 ausdrücklich als Methode kritisiert.
  • Überraschend: Der Thread #9 mit dem Titel „KI-Bilder werden schwerer zu erkennen“ wurde in Wirklichkeit durch Witze über misslungene Hände und Füße getragen. Außerdem übertrafen Gerichtsurteile (#8 und #10 mit zusammen mehr als 800 Kommentaren) Produktnachrichten beim Engagement deutlich. Auf Reddit ist die rechtliche und ethische Behandlung KI-generierter Inhalte offenbar der größte Konfliktherd – mehr noch als technischer Fortschritt.
Grenzen
  • Der einzige Suchbegriff war „Image and Video Generation AI News“, sodass nur 12 Threads aus 9 Subreddits gesammelt wurden. Das in brief.md geforderte Ziel von ungefähr 20 Beiträgen je Netzwerk wurde nicht erreicht.
  • In dieser Phase wurden ausschließlich die zuvor erhobenen Dateien output/reddit.threads.md/.threads.json gelesen. Zusätzliche Suchen oder Direktzugriffe auf Threads und Kommentare wurden entsprechend der Playbook-Vorgaben nicht durchgeführt. Eventuelle Lücken liegen wahrscheinlich außerhalb dieses einzelnen Suchbegriffs.
  • Pro Thread wurden höchstens sechs Top-Kommentare gespeichert. Darunterliegende Reaktionen und Minderheitsmeinungen fehlen daher in diesem Bericht.

X

X — KI-News zur Bild- und Videogenerierung

Accounts

Von den 34 Accounts dieser Sammlung posteten nur vier überhaupt etwas zu KI-Bild- oder Videogenerierung – alle zur selben Veröffentlichung innerhalb derselben 24 Stunden (2026-09-03):

  • @OpenAI (OpenAI) — ein Beitrag, aber er ist die ganze Geschichte: 309,095 Likes,
    55,587 Reposts, ~108,000,000 Aufrufe. Der Account machte das Minimum (ein
    Ankündigungstweet mit einem Bild) und ließ das Volumen für sich sprechen.
  • @MatthewBerman (Matthew Berman) — KI-Influencer-Account, ein Beitrag
    (4,054 Likes, ~1,500,000 Aufrufe), als Hands-on-Thread mit
    „early access“ inszeniert; er positioniert sich als Tester statt als Quelle.
  • @Dimillian (Thomas Ricouard) — ein Beitrag (7,199 Likes, ~2,300,000 Aufrufe),
    ein Entwickler, der eine konkrete Pipeline (Blender → Unreal Engine 5) statt
    allgemeinem Hype zeigt – die konkretste technische Aussage des Datensatzes.
  • @flowith (Flowith) — hier der kleinste Account (947 Likes, ~115,000 Aufrufe),
    ein Produktaccount, der auf der Veröffentlichung mit einem direkten Vergleich
    zum Vorgängermodell aufsetzt.

Jeder andere Account der Sammlung (insgesamt 34 Accounts, 40 Posts) – Krypto-/Meme-Accounts (@songoncardano, @nmkr_io, @legsdotfun, @robincatonhood), Elon-/Tesla-Fan-Accounts (@LunarOptimus, @Optimus_RH, @HeavyMetalShip), ein Cybersecurity-Influencer (@corewarrior, @hackerzspace), News- und Meme-Accounts aus Polen, Afrika und Bosnien, Ariana-Grande-Fan-Accounts (@vodolove postete 3 seiner 4 Beiträge) sowie Biermarken-Gewinnspielaccounts (@naturallight, @ChinookCi) – hat nichts mit KI-Bild- oder Videogenerierung zu tun. Sie werden nur erwähnt, weil genau das die Sammlung zurückgab; siehe Grenzen.

Beiträge
1. Veröffentlichung von GPT-6 „Astra“ — @OpenAI

„This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast."

Der mit großem Abstand größte Beitrag des gesamten erhobenen Datensatzes. Astra wird als allgemeiner Agent für Computernutzung beschrieben, nicht als bild- oder videospezifisches Modell. Die späteren Demos anderer Accounts (siehe unten) sind jedoch alle visuell oder 3D-bezogen, was nahelegt, dass die gezeigten Stärken in diese Richtung gehen.

2. Astra vs. Vorgängermodell, mit Fokus auf Animation — @flowith

„GPT-6 Astra VS GPT-5.6 on animation coming soon to flowith.io"

Ein Produktaccount eines Drittanbieters kündigt ausdrücklich einen Vergleich der Animationsfähigkeit von Astra und der vorherigen Generation an. Das ist ein konkretes Signal dafür, dass Astra gezielt auf Animation getestet und vermarktet wird, nicht nur für allgemeine Computernutzung.

3. Hands-on-Thread mit Early Access — @MatthewBerman

„Astra (GPT-6) is here!!! I've had early access and tested it like crazy with things like games, code, writing, browser control, presentations and general knowledge work. This is the best model I've ever used. Period."

Bemerkenswert ist, was nicht erwähnt wird: In der Fähigkeitenliste werden Bild- und Videogenerierung nicht ausdrücklich genannt, obwohl der Thread „incredible demos below“ verspricht.

4. Walkthrough von Blender zu Unreal Engine 5 — @Dimillian

„Astra is very good at 3D modeling, and I can't wait for all of you to experience it, for now here is a little walkthrough on how I built the demo house for our launch blog post. From a Blender scene to a Unreal Engine 5 walkable experience."

Die konkreteste, toolspezifische Behauptung der Sammlung: Astra wird in einer realen 3D-Content-Pipeline von Blender nach UE5 verwendet. Das kommt einem Video- oder Visual-Generation-Workflow näher als alles andere, was X in diesem Durchlauf geliefert hat.

Signale
  • Steigend: GPT-6 „Astra“ ist die einzige bild-/videonahe Geschichte, die diese Sammlung sichtbar machte, und dominiert beim Engagement (~108 Mio. Aufrufe allein für den Launch-Post gegenüber einigen hunderttausend bei fast allem anderen). Das Reaktionscluster aus Produktvergleich, Influencer-Hand-on und 3D-Pipeline-Demo innerhalb von 24 Stunden wirkt wie ein koordinierter Launch und nicht wie organische Entdeckung.
  • Abgelehnt / nicht vorhanden: Kein Open-Source-Modell für Bild- oder Videogenerierung (Stable Diffusion, Flux, Wan, HunyuanVideo, Kling, ComfyUI usw.) taucht irgendwo in dieser Sammlung auf. Falls auf X gerade Open-Source-Arbeit in Bild oder Video stattfindet, hat dieser Suchdurchlauf sie nicht erreicht.
  • Überraschend: Wie wenig des Launch-Diskurses zu „KI“ Bild- oder Videogenerierung tatsächlich als Funktion nennt. Matthew Bermans Liste mit Early Access lässt sie komplett aus, und Astra wird als allgemeiner Agent beworben („anything you can do on a computer“). Der Bild-/Videoaspekt wird aus den Demos der frühen Tester abgeleitet – 3D-Modellierung und Animationsvergleich –, nicht aus OpenAIs eigenem Framing.
Grenzen
  • Die erhobenen Suchanfragen zielten nicht auf dieses Thema. Die tatsächlich gesuchten zehn Begriffe – „Astra“, „$SONG“, „Robinhood“, „Elon“, „#CyberSecurity“, „Poland“, „Africa“, „Bosnia“, „ariana“, „#Sweepstakes“ – stammen aus X’ eigener Liste trendender Themen für diese Sitzung (siehe Explore-Tabelle in x.posts.md) und wurden nicht wegen KI-Bild-/Videogenerierung ausgewählt. Nur die Astra-Suchen (Posts #1–4) waren thematisch relevant; die anderen 36 Posts sind irrelevantes Rauschen aus einer unpassenden Suchliste.
  • Die Abschlusskriterien werden mit diesen Daten nicht erfüllt. Der Brief verlangt die Analyse von etwa 20 thematisch relevanten Posts pro Plattform. Diese Sammlung enthält nur 4 brauchbare Posts, alle zu einem Closed-Source-Launch (GPT-6 Astra), und keinen zu Open-Source-Bild- oder Videogenerierung. Um den Brief tatsächlich abzudecken, wäre eine Suche nach „Stable Diffusion“, „ComfyUI“, „Flux“, „Kling AI“, „Runway“, „Sora“, „Midjourney“, „Wan 2.x“ oder „HunyuanVideo“ nötig.
  • Geolokalisierungs-Hinweis: X’ Explore-Trendliste war in dieser Sitzung auf Kroatien geolokalisiert (bei den meisten Einträgen ausdrücklich „Trending in Croatia“). Deshalb dominieren Krypto-Token, bosnischer Fußball und Nachrichten bzw. Memes aus dem Balkan die Liste – sie bilden Trends eines Serverstandorts ab, nicht das globale Bild.
  • Überhaupt keine Open-Source-Abdeckung. Kein Eintrag dieser Sammlung behandelt News, Tools oder Releases zur offenen Bild- oder Videogenerierung. Diese Lücke ist vollständig, nicht nur teilweise.

YouTube

YouTube — KI-News zur Bild- und Videogenerierung (Closed Source / Open Source)

Kanäle

Über YouTube-Suchergebnisse und News-Suchen gefundene Kanäle. Bei vielen konnten Abonnentenzahlen nicht direkt geprüft werden, weil die Videoseiten per JavaScript gerendert werden (Details unter ## Grenzen).

  • Theoretically Media — Ein etablierter Kanal, der offene generative KI wie Wan, FLUX und Qwen-Image regelmäßig mit ComfyUI prüft. („Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial...“ https://www.youtube.com/watch?v=3BFDcO2Ysu4)
  • Matt Wolfe / The Next Wave — Bekannt für Vergleichsformate zu Closed-Source-KI-Tools wie Runway, Kling, Veo und Sora.
  • Mehrere individuelle KI-Tool-Kanäle mit Reviews zu einzelnen Modellen wie LTX-2.5, MiniMax H3 und Nano Banana 2. Die Kanalnamen erschienen nicht in den Suchergebnissen; bestätigt werden konnten nur die Videotitel.
Videos
Closed-Source-Systeme
  1. „Nano Banana 2 Is INSANE – Full Test of Google's New Image Model!“ — etwa 2026-02-26 — https://www.youtube.com/watch?v=k0dujOUePeU — Test von Googles Gemini 3.1 Flash Image (auch Nano Banana 2 genannt); behauptet, den Zielkonflikt zwischen Geschwindigkeit und Bildqualität aufzulösen.
  2. „Nano Banana 2 vs Nano Banana Pro: I Tested Both So You Don't Have To“ — Ende Februar 2026 — https://www.youtube.com/watch?v=B1d3SIfoQLk — Vergleich der Ausgaben von Standard- und Pro-Version, um die passende Wahl zu bestimmen.
  3. „Kling 3.0 Surprised Me! Compared To Veo 3.1 & Sora 2“ — etwa 2026-02-05 — https://www.youtube.com/watch?v=AAD7wJ3DWiA — Direkter Vergleich von Kuaishous Kling 3.0 mit Veo 3.1 und Sora 2; Kling schneidet bei visueller Realitätstreue und Kameraarbeit gut ab.
  4. „Is Kling 3.0 Actually Good? (I Spent $500 Testing For You)“ — etwa 2026-02-04 — https://www.youtube.com/watch?v=Rme22R7a9O8 — Kostenpflichtiger Praxistest von Kling 3.0 mit Multishot- und 4K60fps-Ausgabe.
  5. „Seedream 5.0 Tested & Seedance 2.5 Leaks Are Unreal!“ — etwa 2026-07-15 — https://www.youtube.com/watch?v=pn-YwWn3kkM — Test von ByteDances Bildmodell Seedream 5.0 Pro und des noch nicht veröffentlichten Seedance 2.5; erwähnt, dass ByteDance Seedance 2.1 übersprungen habe.
  6. „Seedance 2.5 Is Insane — 30 Seconds In ONE Shot?“ — etwa 2026-06-23 — https://www.youtube.com/watch?v=8sGVhuoPOXI — Prüfung der Fähigkeit von Seedance 2.5, 30 Sekunden kontinuierliches Video in einer einzigen Einstellung zu erzeugen.
  7. „MiniMax H3 Review | Testing Hailuo's New 2K AI Video Model“ — Anfang August 2026 — https://www.youtube.com/watch?v=67CCQBAwZiA — Hands-on-Test von MiniMax H3 (Hailuo 3.0), veröffentlicht am 2026-07-31; bestätigt 2K, 15 Sekunden und natives Stereo-Audio.
  8. „Hailuo AI's NEW MiniMax H3 Model Is INCREDIBLE! (Full Test)“ — etwa August 2026 — https://www.youtube.com/watch?v=la0iBk8g8_g — Vollständiger Test der omnmodalen Fähigkeiten von MiniMax H3 mit gleichzeitiger Eingabe von Text, Bild, Video und Audio.
  9. „FLUX 3 Sneak Peek“ — 2026-07-23 — https://www.youtube.com/watch?v=PCPhl8qMF_Y — Früher Überblick über Black Forest Labs’ FLUX 3, ein multimodales System für Bilder, 20-Sekunden-Videos, Audio und Aktionen; Video wurde am 2026-08-04 allgemein verfügbar.
  10. „Gen-4.5 Updates — Research Demo Day 2025 | Runway“ — 2025-12-16 — https://www.youtube.com/watch?v=yNXxuzmiwEo — Technische Aktualisierung von Runway selbst zu Gen-4.5, einschließlich Kamerasteuerung und Charakterkonsistenz.
  11. „All in one AI | Text to Image & Video AI | Kling, Veo, Sora, Nano Banana Pro | Daily Free Credits!“ — aktuell — https://www.youtube.com/watch?v=SnmRpf_VfgU — Video über die Nutzung kostenloser Kontingente verschiedener Closed-Source-KIs wie Kling, Veo, Sora und Nano Banana Pro.
Open-Source-Systeme
  1. „LTX 2.5 In ComfyUI — Setup, First Gens, And The Catch“ — Mitte August 2026 (etwa drei Wochen nach Veröffentlichung und nach den Open Weights von LTX-2.5 am 2026-08-11) — https://www.youtube.com/watch?v=RjlbDhs1MPk — Native Integration des 22B-Weltmodells LTX-2.5 von Lightricks in ComfyUI; bestätigt eine Erzeugungszeit von 6,8 Sekunden für 10 Sekunden Video in 720p.
  2. „LTX 2.5 ComfyUI: Physics Test vs MiniMax H3 + Free Workflows“ — vor etwa drei Wochen — https://www.youtube.com/watch?v=WpKNXZZqQEU — Direkter Vergleich des Open-Weight-Modells LTX-2.5 mit dem nicht offenen MiniMax H3 bei Physik und Multishot.
  3. „New LTX 2.5 Video Model is INSANELY Fast (ComfyUI Local)“ — vor etwa drei Wochen — https://www.youtube.com/watch?v=pA2BQw9LY8A — Ein Test, der sich auf Geschwindigkeit bei lokalem Betrieb konzentriert.
  4. „Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Models“ — Theoretically Media — https://www.youtube.com/watch?v=3BFDcO2Ysu4 — Erklärt Wan 2.2 (MoE-Videomodell), FLUX, FLUX Krea und Qwen Image gemeinsam in ComfyUI. Wan 2.2 wird bei Konsistenz als nahe an Sora, FLUX bei Details als überlegen bewertet.
  5. „HunyuanImage 3.0 — The Most Powerful Open-Source Image Generator Yet“ — 2025-09-30 — https://www.youtube.com/watch?v=U-8RjjU7x14 — Vorstellung von Tencents 80B-Parameter-MoE-Bildmodell. Es soll in direkten Vergleichen mit Seedream 4.0, Nano Banana und GPT-Image knapp höhere Gewinnraten haben.
  6. „Flux.2 Dev: Full Review, Pros & Cons, ComfyUI Setup!“ — etwa 2025-11-26 — https://www.youtube.com/watch?v=MoAwonm53hQ — Review und ComfyUI-Setup für Black Forest Labs’ FLUX.2, einschließlich einer Open-Weight-Version. Hervorgehoben wird die Möglichkeit, mit bis zu zehn Referenzbildern die Konsistenz eines Motivs zu bewahren.
  7. „FLUX 2 Released! 🤯 ComfyUI Install, Workflow & The "Active Parameter" Secret“ — etwa 2025-11-26 — https://www.youtube.com/watch?v=nfeDS_EoblE — Anleitung zur ComfyUI-Installation von FLUX.2 sowie Erklärung neuer Funktionen.
  8. „Qwen Image First Look & LOCAL Testing (The BEST New Image Model?)“ — 2025-08-05 — https://www.youtube.com/watch?v=ex2YCqtTHSY — Erste lokale Prüfung von Alibaba Qwen-Image, einem Vorläufer des späteren Qwen-Image-2512.
  9. „Qwen Image Edit 2511–Local Image Editing in ComfyUI | Multi-Reference Style Transfer & GGUF Workflow“ — 2025-12-26 — https://www.youtube.com/watch?v=iFnTqZmsRIc — Test von Stiltransfer mit mehreren Referenzbildern in Qwen Image Edit über einen GGUF-Workflow in ComfyUI.
  10. „MiniMax H3: The New Open-Source Video Champ?“ — etwa August 2026 — https://www.youtube.com/watch?v=3R5GROj8Tcg — Stellt MiniMax H3 als omnmodales Videomodell mit Open Weights vor und verweist auf dessen Bewertung als Spitzenreiter beim Videoediting.
Signale
  • Open Weights rücken stark an die Spitze heran: LTX-2.5 (2026-08-11) und MiniMax H3 (2026-07-31) wurden beide innerhalb der vergangenen 60 Tage mit Open Weights veröffentlicht. Vergleichs-Thumbnails betonen auffällig oft, dass offene Videomodelle an Closed Source wie MiniMax H3 heranreichen oder sie übertreffen. Offene Anbieter sind nicht länger nur Nachzügler, sondern werden direkt nach ihrem Release verglichen.
  • ByteDances schneller Release-Zyklus: Seedream 5.0 Pro und Seedance 2.5, wobei 2.1 übersprungen wurde, erscheinen im Abstand weniger Monate. Die YouTube-Tests haben mit Begriffen wie „Tested“ und „Leaks“ einen ausgeprägten Eilmeldungscharakter.
  • Neuordnung bei Google: Die gesamte Imagen-Linie soll am 2026-08-17 eingestellt werden; die Migration zu Nano Banana, also Gemini-3.x-Image-Modellen, ist im Gange. Schon zu Nano Banana 2 vom 2026-02-26 gibt es mehrere Vergleichsvideos mit Nachfolgern wie Pro.
  • Rückzug eines großen Closed-Source-Anbieters: OpenAI will die Sora API am 2026-09-24 abschalten und Rechenressourcen auf das Nachfolgemodell „Spud“ umleiten (laut Suchergebnissen; das YouTube-Video wurde nicht bestätigt). Das wäre ein wesentlicher Wendepunkt für Closed Source.
  • ComfyUI ist faktisch die Prüfplattform für Open Source: Fast alle Reviews zu Wan, FLUX, Qwen-Image und LTX-2.5 werden zusammen mit einer ComfyUI-Installationsanleitung behandelt.
Grenzen
  • Die YouTube-Suchergebnisse (youtube.com/results?...) und Videoseiten (youtube.com/watch?v=...) werden über JavaScript gerendert. Beim direkten Abruf erschienen nur Footer-Navigationslinks; Rohdaten wie Aufrufe, Abonnentenzahlen und Veröffentlichungsdatum (ytInitialData usw.) konnten nicht direkt ausgelesen werden. Die Datierungen wurden daher aus Informationen in Suchmaschinen-Snippets geschätzt, etwa relativen Angaben wie „3 weeks ago“ oder Erwähnungen in Artikeln. Für den Großteil der Videos konnten genaue Aufrufe und Kanal-Abonnentenzahlen nicht bestätigt werden.
  • Ein direktes YouTube-Video zu OpenAIs Sora-Ende und dem Nachfolger „Spud“ wurde nicht gefunden. Dieser Punkt beruht auf einer News-Erwähnung; Reaktionsvideos auf YouTube sind nicht bestätigt.
  • Zu aktuellen Updates von Runway Gen-4.5 oder Midjourney wurden offizielle Ankündigungsvideos gefunden, aber bei dieser Suche keine aktuellen unabhängigen Tests innerhalb der letzten 60 Tage.
  • Für einzelne Reviews zu Nano Banana Pro, etwa mit Titeln wie „Nano Banana Pro… wtf“, konnten Links, nicht aber Kanalnamen oder Aufrufe bestätigt werden.

Bluesky

Bluesky — Aktuelle Entwicklungen bei KI-Bild- und Videogenerierung

Accounts
  • Simon Willison @simonwillison.net — Entwickler, bekannt für die Bewertung von LLM- und Bildgenerierungsmodellen. Bei jeder neuen Modellveröffentlichung postet er Bildvergleiche über seinen regelmäßigen „Pelikan-Bildbenchmark“. Aufgrund starker Reaktionen seiner Follower ist er eine hervorragende Primärquelle für Closed-Source-News.
  • fofr @fofr.ai — Prompt-Spezialist für Bildgenerierung im Replicate-Umfeld. Veröffentlicht regelmäßig praktische Anwendungsweisen für Nano Banana Pro (Gemini 3 Pro Image).
  • Replicate(offiziell) @replicate.com — Offizieller Account des KI-Modell-API-Hosters. Meldet neue Modelle, sobald sie auf Replicate verfügbar sind, und dient für Video-Releases unabhängig von Open oder Closed Source als schnelle Quelle.
  • Amanda Silberling(TechCrunch-Reporterin) @amanda.omg.lol — Journalistin, die sich mit den kulturellen Aspekten KI-generierter Bilder beschäftigt.
  • AI News Updates @ai-latestnews.bsky.social — Bot-Account mit automatisierten Nachrichten aus der KI-Branche.
  • gigowat @gigowat.bsky.social — Account, der GIGAZINE-Artikel auf Bluesky teilt. Eine der wenigen Quellen für Nachrichten zur Bildgenerierungs-KI auf Japanisch.
  • ostris @ostris.com — Entwickler des Open-Source-LoRA-Trainingstools „AI-Toolkit“. Es gibt Beiträge zu Flex-Modellen, aber laut eigener Aussage ist die AI/ML-Szene „fast auf Twitter geblieben“, weshalb Updates auf Bluesky selten sind.
Beiträge
  1. Simon Willison — Postete ein Pelikan-Bildvergleichsraster für GPT-6 Astra und GPT-5.6 Sol/Terra/Luna (Closed Source, Vergleich von OpenAI-Bildmodellen). 2026-09-04, 👍91・🔁6・💬12。
    https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c
    Veröffentlicht außerdem eine vollständige Version der erzeugten Bilder; auch der Alt-Text wurde von GPT-5-astra erstellt. 👍23。
    https://bsky.app/profile/simonwillison.net/post/3mupxztoyqs2c

  2. Simon Willison — Vergleichspost eines mit Google Gemini 3.7 Flash generierten Pelikanbilds. 2026-09-02, 👍6。
    https://bsky.app/profile/simonwillison.net/post/3muitt5g3q22r

  3. fofr — Teilte detaillierte Prompt-Anweisungen, um mit Nano Banana Pro (Gemini 3 Pro Image) Renderings im Retrospiel-Stil zu erzeugen. 2026-01-19, 👍31。
    https://bsky.app/profile/fofr.ai/post/3mcrt3avp222p
    Am selben Tag auch einen Prompt für Screenshots im Street-View-Stil. 👍10。
    https://bsky.app/profile/fofr.ai/post/3mcrilugr5c2m

  4. Replicate(offiziell) — Meldete, dass OpenAIs „GPT Image 2“ auf Replicate verfügbar wurde. Hebt Fotorealismus, Textrendering sowie Stärke für UI- und Designanwendungen hervor (Closed Source). 2026-04-21。
    https://bsky.app/profile/replicate.com/post/3mjzygaefs224

  5. Replicate(offiziell) — Meldete die Freigabe von ByteDances Videomodell „Seedance 2.0“ für alle Nutzer. Es kombiniert Text, Bild, Video und Audio zu einer Szene und erzeugt synchrones Stereo-Audio (Closed Source). 2026-04-09。
    https://bsky.app/profile/replicate.com/post/3mj3junhvnh26

  6. Replicate(offiziell) — Ergänzte Runways Gen-4.5 auf Replicate. Das Videogenerierungsmodell hebt physische Realitätsnähe hervor (Closed Source). 2026-02-18。
    https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c

  7. Replicate(offiziell) — Ergänzte Kuaishous Kling 3.0(+o3)auf Replicate. Unterstützt Multishot-4K und synchronisiertes Audio (Closed Source). 2026-02-17。
    https://bsky.app/profile/replicate.com/post/3mf35lkhoyw2q

  8. Replicate(offiziell) — Ergänzte das Videomodell „Vidu Q3“ auf Replicate. Unterstützt die Generierung aus Text, Bild und Start-/Endframe, mit bis zu 16 Sekunden und 1080p (Closed Source). 2026-03-11。
    https://bsky.app/profile/replicate.com/post/3mgsan3ddpl2w

  9. Amanda Silberling(TechCrunch) — Suchte Expertenkommentare dazu, warum KI-generierte Lebensmittelbilder oft einen unverwechselbaren Look haben. Rechercheanfrage zu ästhetischen Eigenheiten der KI-Bildgenerierung. 2026-08-28, 👍17・🔁5・💬4。
    https://bsky.app/profile/amanda.omg.lol/post/3mu5itcncgc2x

  10. AI News Updates(Bot) — Berichtete, dass „Midjourney Inc. die Astrologie-App Co-Star übernommen und eine neue Bildgenerierungs-App gestartet hat“. 2026-07-25. Der Inhalt stimmt mit Berichten von TechCrunch und Bloomberg überein (2026-07-24; laut Berichten wurde die Übernahme im Frühjahr abgeschlossen) und kann daher gegengeprüft werden.
    https://bsky.app/profile/ai-latestnews.bsky.social/post/3mrh6gdxnqy2s

  11. gigowat(japanische Weitergabe eines GIGAZINE-Artikels) — Teilte einen GIGAZINE-Artikel über die offene Bildgenerierungs-KI „Qwen-Image-3.0“, in dem Illustrationsqualität und die Darstellung japanischer Schrift geprüft wurden. 2026-07-22。
    https://bsky.app/profile/gigowat.bsky.social/post/3mr7dvb332z2q
    (Originalartikel: https://gigazine.net/news/20260722-qwen-image-3/

  12. ostris — Meldete die Veröffentlichung des offenen Bildgenerierungsmodells „Flex.2-preview“, das Text-to-Image, Universal Control und Inpainting kombiniert. Ein etwas älterer Post (2025-04-22), aber eines der wenigen Beispiele, in denen ein Entwickler offener Modelle direkt auf Bluesky kommuniziert. 👍4。
    https://bsky.app/profile/ostris.com/post/3lngo5cf66k2a

Signale
  • Closed Source ist dominant: Die Beiträge auf Bluesky mit spürbarem Engagement konzentrierten sich auf große Closed-Source-Modelle von GPT, Gemini/Nano Banana Pro und Midjourney. Simon Willisons „Pelikan-Bildbenchmark“ vergleicht bei jedem neuen Modell dessen Qualität und ist faktisch ein Prüfstand für Closed-Source-Bildmodelle.
  • Der Replicate-Account ist ein schneller Hub für Videoreleases: Die wichtigsten Videomodelle des Jahres 2026 – Kling 3.0, Seedance 2.0, Runway Gen-4.5 und Vidu Q3 – wurden sämtlich über den offiziellen Replicate-Account gemeldet. Die Like-Zahlen sind zwar klein (1–2), doch der Account hilft, die zeitliche Reihenfolge der Releases nachzuvollziehen.
  • Open-Source-Kommunikation ist auf Bluesky schwach: Für wichtige Open-Weight-Modelle aus 2026 wie Wan 2.7 (Alibaba), HunyuanVideo 1.5 (Tencent), Chroma und LTX-2.3 gab es auf Bluesky fast keine Primärerwähnungen. Selbst ostris, Entwickler eines Open-Source-LoRA-Tools, schrieb, dass die AI/ML-Szene fast vollständig auf Twitter geblieben sei. Das deutet auf eine Konzentration der Community auf X hin.
  • Japanischsprachige Kommunikation besteht überwiegend aus geteilten GIGAZINE-Artikeln: Japanische Posts bestanden vor allem aus Weitergaben von Newsseiten. Eigenständige Primäranalysen wurden nicht gefunden.
Grenzen
  • Die offizielle Bluesky-Post-Such-API (app.bsky.feed.searchPosts) gab im WebFetch-Tool während dieser Sitzung stets 403 Forbidden zurück. Eine umfassende Sammlung nach Schlüsselwörtern inklusive Likes und Reposts war daher nicht möglich. Stattdessen wurden über Google gefundene bekannte Accounts einzeln mit getAuthorFeed geprüft.
  • Die Suchseite von bsky.app ist eine JavaScript-gerenderte SPA. Der WebFetch-Ansatz, der HTML in Markdown umwandelt, konnte daher die eigentlichen Posttexte nicht abrufen.
  • Aufgrund dieser Einschränkungen war keine vollständige Prüfung sämtlicher Posts zu bestimmten Modellnamen möglich. Stattdessen wurden aktuelle, thematisch passende Beiträge aus Feeds prominenter Accounts ausgewählt. Insgesamt wurden etwas mehr als 20 Posts und Feeds gesichtet; direkt auf Bild- oder Videogenerierung bezogen waren davon ungefähr die oben aufgeführten 12.
  • Für wichtige Open-Source-Modelle wie Wan, HunyuanVideo, Chroma, Z-Image selbst und LTX-2.3 wurden auf Bluesky mehrere passende Accounts versucht, aber keine entsprechenden Beiträge aus 2026 gefunden. hugggingface.bsky.social hatte einen leeren Feed, civitai-bot.bsky.social war seit Mai 2024 nicht mehr aktualisiert.
  • Ein individueller Account behauptete im Februar 2026 sinngemäß, Midjourney sei Teil von Meta.ai geworden. Externe Berichte zeigten jedoch, dass es sich tatsächlich um einen Lizenzvertrag aus August 2025 handelte und Midjourney unabhängig blieb. Die ungenaue Information wurde deshalb nicht in den Bericht aufgenommen.

Lemmy

Lemmy — Aktuelle Entwicklungen bei KI-Bild- und Videogenerierung (Closed Source / Open Source)

Communities
  • !«メールアドレス» — 5,708 Personen. Technische Diskussionen über Open-Weight-KI für Bild- und Videogenerierung allgemein. In dieser Recherche die Community mit der höchsten Informationsdichte.
  • !«メールアドレス» — 2,360 Personen. Ort für mit Stable-Diffusion-Modellen geschaffene Werke; wenig eigentliche News.
  • !«メールアドレス» — 1,593 Personen. Ausschließlich für Anime-KI-Kunst; geringe Nachrichtenrelevanz.
  • !«メールアドレス» — 50 Personen. Automatische Reddit-RSS-Weiterleitungscommunity, betrieben durch einen Bot. Kein Ort für menschliche Diskussionen.
  • !«メールアドレス» und !«メールアドレス» — allgemeine Techniknews. Einzelne Beiträge zu KI-Bild- oder Videogenerierung sind selten und gehen in allgemeinen KI-Artikeln unter.
  • Eine große, spezialisierte Community für KI-Bild- und Videogenerierung auf dem Niveau von Reddits r/StableDiffusion gibt es auf Lemmy nicht. Die Themen verteilen sich auf die kleineren oben genannten Communities.
Beiträge
Open-Source-Systeme
  1. MiniMax H3: Comfy wird offizieller Reseller für kommerzielle Lizenzen — !«メールアドレス», Score 4, 2026-08-28. Originalartikel: https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 。MiniMax H3 ist ein im August 2026 veröffentlichtes Open-Weight-Videomodell, das lokal sogar auf GPUs der RTX-3060-Klasse läuft und 2K-Videos mit nativem Stereo-Audio erzeugen kann. Comfy wurde Verkaufsstelle für kommerzielle Lizenzen (Professional/Enterprise); Enterprise ermöglicht auch die Nutzung des nicht distillierten Modells.
  2. LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes — !«メールアドレス», Score 2, 2026-09-04。https://arxiv.org/abs/2609.03796 。Ein Bildmodell mit vollständig veröffentlichtem Trainingsrezept, Spitzenwerten auf Qwen-Image-Bench und einer schnellen distillierten Turbo-Version.
  3. Trellis.2 und Pixal3D nativ in ComfyUI integriert — !«メールアドレス», Score 4, 2026-09-01。https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native 。Angekündigt als Integration der „besten offenen 3D-Generierungsmodelle“ in den ComfyUI-Kern.
  4. ComfyUI-MiniMaxH3-CLSS — !«メールアドレス», Score 0, 2026-09-01。https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS 。Ein Tool für MiniMax H3, das auf Consumer-Hardware mit 16 GB VRAM die Generierung beliebig langer Videos mit Audio ermöglichen soll.
  5. Fizgig LoRA/LoKR Studio — !«メールアドレス», Score 4, 2026-08-30。https://github.com/shootthesound/Fizgig 。Ein offenes Tool zum Trainieren und Extrahieren von LoRA/LoKR für mehrere Modellfamilien wie Krea 2, MiniMax und Klein 9B.
  6. VibeVoice-ComfyUI (Microsofts offene TTS in ComfyUI integriert) — !«メールアドレス», Score 1, 2026-08-28。https://github.com/nikhilprasanth/VibeVoice-ComfyUI 。Ein Beispiel dafür, wie Audio in Workflows für Videogenerierung integriert wird.
  7. Boogu-Image-0.1 — Efficient Image Generation Foundation Model — !«メールアドレス», Score 5, 2026-06-17。Ein offenes Grundlagenmodell für Bildgenerierung mit Fokus auf geringem Ressourcenverbrauch und Effizienz.
Closed-Source-Systeme
  1. Midjourney wechselt von KI-Bildgenerierung zu medizinischen Ultraschallscannern — !«メールアドレス», Score 58, 2026-06-18。https://lemmy.zip/post/66397234 。Zahlreiche verwandte Threads (etwa Hacker-News-Spiegel, Score 40+) sorgten als Diskussion über „Midjourney Medical“ und „Ultrasonic CT“ für Aufmerksamkeit. Es ist eine der größten Meldungen über einen Kurswechsel eines etablierten Closed-Source-Bilddienstes.
  2. Midjourney fordert Hollywood-Studios zur Offenlegung detaillierter KI-Nutzung auf — !«メールアドレス», Score 73, 2026-07-05。https://lemmy.today/post/56011946
  3. Googles neues Bildgenerierungsmodell „Nano Banana 2 Lite“ veröffentlicht — !«メールアドレス», Score 0, 2026-07-02。https://lemmy.world/post/48936394(hackernews-Spiegel: https://lemmy.bestiver.se/post/1199483 )
  4. Microsofts MAI-Image-2.5 kommt Googles Nano Banana 2 im Benchmark nahe — !«メールアドレス», Score 1, 2026-05-28。https://lemmy.durstig.online/post/35068
  5. Praxistest-Vergleich zu Seedream 5.0 Pro — !«メールアドレス», Score 1, 2026-07-10。https://lemmy.durstig.online/post/46063
  6. Runway meldet Verdopplung seines Enterprise-Geschäfts und eine Netto-Umsatzbindung von über 300 % — !«メールアドレス», Score 0, 2026-08-30。https://lemmy.durstig.online/post/56937
  7. Googles Earth-AI-Funktion wurde einen Tag nach dem Release wegen NSFW-Generierungsproblemen still zurückgezogen — !«メールアドレス», Score 1, 2026-08-07。https://lemmy.durstig.online/post/52162
Signale
  • Die Open-Source-Seite ist ganz auf MiniMax H3 fokussiert: Fast die Hälfte der Beiträge in der Stable-Diffusion-Community von Ende August bis Anfang September betrifft Erweiterungen und Beschleunigungswerkzeuge für MiniMax H3 – Videogenerierung, lokaler Betrieb auf RTX-3060-Klasse und Audio. Es entsteht der Eindruck, dass das Modell zum De-facto-Standard für offene Videogenerierung wird.
  • Die Grenze zwischen Open und Closed wird unscharf: MiniMax H3 bietet Open Weights, ist aber für kommerzielle Nutzung über Comfy kostenpflichtig lizenziert. Dieses Hybridmodell – kostenlos nutzbar, kommerziell kostenpflichtig – könnte sich als neues Muster etablieren.
  • Die größte Closed-Source-Meldung ist ein „Rückzug“: Nicht neue Modellkonkurrenz, sondern die Nachricht, Midjourney wechsle von Bildgenerierung zur Medizintechnik, erzielte einen deutlich höheren Score (58–73) und zog die größte Aufmerksamkeit auf sich.
  • 3D-Generierung wird ebenfalls in ComfyUI integriert: Offene Text-/Bild-zu-3D-Modelle wie Trellis.2 und Pixal3D werden Kernfunktionen von ComfyUI. Damit werden nicht nur Bilder und Videos, sondern auch 3D-Assets Teil lokaler Workflows.
  • Lemmy besitzt insgesamt keine große Spezialcommunity für KI-Bild- und Videogenerierung. Diskussionen verteilen sich auf technisch orientierte Stable-Diffusion-Communities mit einigen Tausend Mitgliedern sowie kleine Bot-Communities wie ai_reddit mit 50 Mitgliedern.
Einschränkungen
  • Lemmy ist föderiert; die Such-API einer einzelnen Instanz deckt nur deren Index ab. Die API-Suche von lemmy.world lässt daher Beiträge anderer Instanzen wie lemmy.dbzer0.com oder lemmy.today aus. Es wurden mehrere Instanz-APIs und Suchen kombiniert, aber eine vollständige Abdeckung ist nicht möglich.
  • Die direkte Community-Abfrage (/api/v3/community) für die localllama-Community auf lemmy.ml schlug mit 404 fehl. Details konnten nicht geprüft werden.
  • !«メールアドレス» ist eine Bot-Community, die Reddit-RSS-Feeds automatisch weitergibt. Mit 50 Abonnenten und fast keinen menschlichen Diskussionen kann sie als Newsquelle dienen, aber nicht als Indikator für die Intensität einer Lemmy-Diskussion.
  • Direkte Suchen auf Lemmy nach Closed-Source-Videodiensten wie Sora, Kling, Runway Gen und Veo lieferten fast ausschließlich irrelevante Beiträge über Orts- und Personennamen oder Zeitgeschehen. Zu Runway wurde lediglich ein Beitrag zu Geschäftszahlen gefunden.
  • Das Beitragsvolumen ist im Vergleich zu Reddit sehr klein; Scores liegen meist im einstelligen bis niedrigen zweistelligen Bereich. Lemmy allein bietet nicht genug Material, um zwanzig Beiträge eng zu lesen und daraus solide Trends abzuleiten. Für diese Analyse wurden sieben passende Suchanfragen über mehrere Instanzen ausgeführt und repräsentative reale Beiträge ausgewählt.

Pinterest

Pinterest — KI-News zur Bild- und Videogenerierung

Visuelle Themen
  • Der Stil „YouTube-Thumbnail/Blog-Aufmacher“ ist überwältigend häufig. Dunkle bis dunkelblaue Hintergründe, Neonverläufe in Blau, Violett und Orange sowie sehr fette Sans-Serif-Überschriften wie „AI NEWS“, „THE FUTURE IS AI“, „BREAKING NEWS“ oder „AI IS CHANGING EVERYTHING!“. Häufiger als die eigentlichen Generierungsergebnisse sind Titelbilder für Artikel und Videos über KI [2, 7, 11, 38, 39, 42, 48]
  • Menschliche Gesichter und Porträts sind zentrale Motive. Mimik-Animation, Lip Sync, Gesichtsreproduktion (Microsoft VASA-1) und KI-Porträtshootings (ChatGPT+Higgsfield) erscheinen wiederholt als Visualisierungen des Anwendungsfalls „Gesichter animieren oder erzeugen“ [13, 14, 18, 23, 50]
  • Humanoide und Roboterbilder werden oft als allgemeines Symbol für „KI“ genutzt. Viele Visuals zeigen weiße Roboterprofile oder cybernetisch wirkende Frauen als generische Stockbilder ohne Verbindung zu einem konkreten Tool [2, 39]
  • Raster im Stil „Before/After“ oder „ein Eingabebild → mehrere Ausgabe-Stile“. Vergleichsraster verwandeln Realvideos etwa in Holz, Origami, Lego oder Blumen; weitere Bilder integrieren Plüschfiguren in fotorealistische Hintergründe [3, 31]
  • Infografiken zu Toolvergleichen und Rankings. Listen mit Logos, Gegenüberstellungen wie „Best Quality (Paid) vs Best Free“ und Funktionsvergleiche mit Häkchen dominieren als Auswahlhilfen [7, 37]
  • Thumbnails mit gesichtsähnlichen realen Berühmtheiten. KI-Porträts im Stil von Jeff Bezos, bärtige Erklärvideo-Moderatoren mit „AI NEWS“ und Fotos von NVIDIA-CEO Jensen Huang werden genutzt, um Glaubwürdigkeit oder Aufmerksamkeit zu erzeugen [11, 36, 40]
  • Gesichtsmesh- und Wireframe-Overlays. Rasterlinien und Zahlenlabels auf Gesicht und Hals, die Mimik-Analyse oder biometrische Erfassung vermitteln, erscheinen in werblichen Pins [23, 50]
  • Konsistente Farbpalette. Ein dunkles Grundlayout mit Neonakzenten in Cyan, Magenta und Gelb ist die fast gemeinsame Bildsprache der KI-Tool-Pins [2, 7, 38, 39, 42]
Bemerkenswerte Pins
  1. [1] Image to Video AI: How It Works and Why It Matters — Aufmacher eines Erklärartikels, der zeigt, wie aus einem Standbild eine „Video-Timeline“ mit mehreren Frames entsteht.
  2. [3] Google announces ultra-high quality video...(tatsächlich eine Luma-artige Demo für identitätserhaltende Stiltransformation) — Ein 3×5-Raster, das ein Quellvideo in Materialien wie Holz, Origami, Lego und Blumen verwandelt. Als Technikdemo ist klar erkennbar, wie Textur verändert wird, während Person und Auto konsistent bleiben.
  3. [7] 6+ Best AI Video Generation Websites — Speicherbare Infografik, die Runway, Pika, Kling AI, Luma AI (Dream Machine), Canva AI und Hailuo AI samt Funktionen, Zielgruppen und kostenloser Tarifoptionen aufführt.
  4. [10] Veo 2 — Werbe-Pin für Googles VideoFX, der vielfältige Videostile in einem Bild verdichtet: ein fotorealistischer Blick durchs Mikroskop, ein Schwimmer unter Wasser und eine animierte Frau, die mit Sternbildern tanzt.
  5. [14] Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — Ein Werbebild, das Bild-zu-Video-Generierung über die Gemini API und natives Audio betont.
  6. [23] Microsoft Unveils VASA-1 — Technologie, die aus einem Foto, einem Audioclip und beliebigen Steuerungssignalen nahezu in Echtzeit ausdrucksstarke Talking-Face-Videos erzeugt. Das Thumbnail zeigt unterschiedliche ethnische Hintergründe und Gesichtsausdrücke.
  7. [27] ShengShu Technology Unveils Vidu S1 — Ankündigungs-Pin zu ShengShu Technologys Vidu S1, das „Echtzeit- und interaktive Generierung“ bewirbt. Visuell als Cyberpunk-Charakter gestaltet.
  8. [31] Google announces video generation AI 'Veo 3' — Vier Ausgabebeispiele, in denen ein Eingabebild eines lilafarbenen Monster-Plüschtiers in fotorealistische Serverräume, Unterwasserruinen und eine Süßigkeitenstadt integriert wird.
  9. [33] 'Amuse 3.0', an AI art creation tool — Ankündigung einer neuen Version von AMDs lokal ausführbarem Bildgenerierungstool auf Stable-Diffusion-Basis. In einer überwiegend Closed-Source-lastigen Auswahl eines der wenigen konkreten offenen bzw. lokalen Signale.
  10. [42] Breaking News Latest AI Developments — Zusammenfassung dreier Meldungen: Agentenfunktionen von Grok 4.6, Gemini überschreitet eine Milliarde Nutzer (150 Millionen generierte Bilder pro Tag) und Honors KI-Robotertelefon (datiert auf den 12. August 2026).
Signale
  • Closed-Source-Anbieter sind besonders sichtbar. Große Ankündigungen zu Google Veo 2/Veo 3, Microsoft VASA-1, OpenAI, Grok 4.6 und Gemini mit einer Milliarde Nutzern werden direkt zum Material für Pins. Dagegen tauchten Namen typischer Open-Source-Systeme wie Stable Diffusion, ComfyUI, Flux, Wan, HunyuanVideo und LTX in den geprüften Bildern fast gar nicht auf; [33], Amuse 3.0 von AMD, war die Ausnahme. Pinterest scheint eher auf allgemeine Konsumenten und Marketer mit Sammel- und Vergleichsinhalten ausgerichtet zu sein als auf Technikcommunities.
  • Starke Konzentration auf das Bewegen und Erzeugen von Gesichtern. Lip Sync, Mimik-Reproduktion, Ersatz für Porträtshootings und KI-Videos im Nachrichtensprecherstil erscheinen fortlaufend. Das dürfte daraus entstehen, dass Pinterest-Suchinteressen – Beauty, Selbstoptimierung und Ideen für Social Posts – mit KI-Video-Marketing zusammenkommen.
  • Sekundärzusammenfassungen statt Primärinformationen. Häufiger als Screenshots tatsächlicher Modellausgaben sind Thumbnails nach dem Muster „Gesicht eines Erklärers + Überschrift“ oder Infografiken zum Toolvergleich. Pinterest fungiert weniger als Ort für Primärankündigungen als vielmehr als Einstiegspunkt zu Blogs, YouTube-Videos und Affiliate-Artikeln.
  • Signal der Abwesenheit: Im untersuchten Sample erschienen keine Pins zu japanischsprachigen Beiträgen oder Unternehmen, etwa japanischen KI-Startups oder inländischen Videogenerierungsdiensten. Fast alles bezog sich auf Tools und Nachrichten aus dem englischsprachigen Raum.
Grenzen
  • Von 50 Einträgen in output/pinterest.pins.md wurden 24 Bilder tatsächlich geöffnet und inhaltlich geprüft. Bei den übrigen 26 blieben nur die Titel; es wird angenommen, dass sie in ähnliche visuelle Muster fallen – Infografiken, Gesichtsporträts und Toolvergleiche.
  • Acht Pins hatten den Titel „(untitled)“ ([12, 19, 20, 30, 35, 39, 46, 50]). Von diesen wurden [39] und [50] als Bilder geprüft, die übrigen nicht.
  • Die von den Workern erhobenen Daten enthielten keine Genreunterteilung; pinterest.pins.md ist eine einzige flache Liste. Eine Aufschlüsselung nach Genres wurde daher nicht erstellt.
  • Pinterest selbst wurde in dieser Phase nicht durchsucht. Entsprechend den Playbook-Vorgaben basiert die Analyse ausschließlich auf bereits von Workern gesammelten Bildern und Titeln. Kennzahlen wie Likes, Saves und Kommentare waren nicht verfügbar.

Empfohlene Maßnahmen

  • Die X-Suche mit konkreten Modell- und Toolbegriffen wie Stable Diffusion, ComfyUI, Flux, Wan, Kling und Sora wiederholen, statt sich auf die Liste trendender Themen zu verlassen.
  • Eine feste Liste bekannter Bluesky-Accounts erstellen und sie per getAuthorFeed abfragen, da app.bsky.feed.searchPosts in diesem Durchlauf 403 zurückgab.
  • Hybride offene/kommerzielle Modelle wie MiniMax H3 klar kennzeichnen, statt sie schlicht einer einzigen Open-Source-Kategorie zuzuordnen.
  • Einen wiederkehrenden Beobachtungspunkt für Richtungswechsel oder Abschaltungen großer Anbieter beibehalten – Midjourneys medizinischer Pivot und das Ende der Sora API –, da sie auf Reddit und Lemmy mehr Interesse erzeugten als reine Produktankündigungen.
  • Pinterest angesichts seiner beinahe vollständigen fehlenden Open-Source-Abdeckung als Barometer für Konsumentenstimmung behandeln, nicht als technische Primärquelle.

Gesammelte Bilder

Image to Video AI: How It Works and Why It Matters - The Data Scientist🎨 AI Image and Video CreationGoogle announces ultra-high quality video...AI content and social media concernsThe Ultimate AI Image and Video Generation Platform - The Data ScientistAi Content Creation Concept With Icons For Text Image Music And Video Generation Artificial Intelligence Images – Browse 57 Stock Photos, Vectors, and VideoJust Nail It 🎥️ Image to Video AI – Animate Your Photos With AIAI Video Content Creation: High earners,...Google Unveils Veo 2: Advanced AI Video Generation Tool with Enhanced Realism and Cinematic FeaturesAI News: OpenAI Finally Released What We Asked ForimageCreate photorealistic AI photoshoots of yourself with ChatGPT + Higgsfield 📸🤖Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini APITop 10 Lip Sync Tools (2026) – Best AI Lip Sync Software for Realistic Lip Sync VideoTop AI Video Generators of 2025AI For Image And video Generation‎🚨 AI is getting scary good.imageimageAI driven image and video analysisMore than 20% of YouTube is now AI-generatedMicrosoft Unveils VASA-1, Setting New Standards for Generative AI in Video GenerationAI-Generated Videos: Good or Bad? Here's the Truth! 🤖🎥ai toolsWhat is Imagvio AI and how it helps creators...ShengShu Technology Unveils Vidu S1, Bringing Real-Time Interactive Generation to AI VideoMastering Video and AI: Key Social Media Marketing Trends 2025"Transform Your Vision with Personalized AI-Powered 4K Videos 🎥✨"imageGoogle announces video generation AI 'Veo 3',...history generative AI'Amuse 3.0', an AI art creation tool that includes...This Week in AI News - Aug 15 2026imageI will do ai video creation explainer with synthesia sora ai kling ai runway ai invideo🚀10 Best AI Image & Video Tools in 2026 | Free vs Paid AI Tools ComparisonAI News & Latest Updates | Artificial Intelligence Trends & BreakthroughsimageNvidia #NEW AI Tools 🤯 #news #ai #openai #chatgpt #highlights #shortsAI Video Generator Market Growth 2025–2032: Transforming the Future of Video Creation 🎥🤖Breaking News Latest AI Developments - Grok 4.6 Gemini 1B Honor Robot PhoneTransform your ideas into stunning visuals! 🎥Professional AI Video Creation | Cinematic AI Videos | Custom Video EditingAI Image GenerationimageVideo generation 📹"Why AI Chatbots Fail at Keeping Up with Breaking News"How To Create A News Channel With AI || AI News Video Generator || AI Lip Syncimage

Hinweis zur Datenqualität

X und Bluesky blieben deutlich unter dem Zielwert des Briefs von ungefähr 20 Posts pro Plattform (X zeigte nur 4 thematisch passende Posts, sämtlich Closed Source; Blueskys Such-API lieferte 403, daher stützte sich die Abdeckung auf bekannte Accounts). Auch Reddit, Lemmy und YouTube sammelten weniger Beiträge als vorgesehen. Bei YouTube konnten Aufruf- und Abonnentenzahlen wegen JavaScript-gerenderter Seiten nicht bestätigt werden.

Galerie