Text-to-Video
Text-to-Video erweitert Diffusion über die Zeit, was die harte Bedingung hinzufügt, dass die Frames zueinander konsistent bleiben müssen. Cliplänge, physikalische Plausibilität und Charakterkonsistenz sind die aktuellen Grenzen. Das Feld bewegt sich so schnell, dass jede konkrete Aussage über Fähigkeiten binnen Monaten altert. In der Praxis: Eine Zehn-Sekunden-Produktaufnahme, erzeugt statt gefilmt.