video-generation
Erfasste Open-Source-Repos mit dem Tag video-generation, sortiert nach Sternen.
- #91
Clip-Verknüpfung für MiniMax H3 in ComfyUI – Bewegung und Audio werden nahtlos über Übergänge hinweg fortgesetzt
★ 919+143Sterne-Änderung der letzten 7 Tage - #92
[AAAI 2025] Follow-Your-Click: Dieses Repository ist die offizielle Implementierung von „Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts“
★ 908-1Sterne-Änderung der letzten 7 Tage - #93★ 896+1Sterne-Änderung der letzten 7 Tage
- #94
[ACM MM 2025] Ditto: Motion-Space Diffusion für steuerbare Echtzeit-Sprechkopf-Synthese.
★ 881+7Sterne-Änderung der letzten 7 Tage - #95
[ICLR2026] SeedVR2: Ein-Schritt-Videowiederherstellung durch Diffusion Adversarial Post-Training
★ 867+11Sterne-Änderung der letzten 7 Tage - #96
[CVPR 2025 Highlight🔥] Identitätserhaltende Text-zu-Video-Generierung durch Frequenzzerlegung
★ 857+2Sterne-Änderung der letzten 7 Tage - #97
UniAnimate-DiT: Menschliche Bildanimation mit Large-Scale Video Diffusion Transformer
★ 850-2Sterne-Änderung der letzten 7 Tage - #98
Flatkey Media-Generierungs-CLI für Bilder, Videos, Audio, Text, Credits und Modellsuche.
★ 845+191Sterne-Änderung der letzten 7 Tage - #99
[SIGGRAPH 2025] Diffusion als Shader: 3D-bewusste Videodiffusion für vielseitige Steuerung der Videogenerierung.
★ 834+2Sterne-Änderung der letzten 7 Tage - #100
Offizielle Implementierung für „RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers“ (ICML 2025), UltraViCo (ICLR 2026) und UltraImage
★ 827+2Sterne-Änderung der letzten 7 Tage - #101
Eine einfache, einheitliche Trainings-Engine für multimodale Modelle. Schlank, flexibel und für skalierbares Hacking konzipiert.
★ 825+0Sterne-Änderung der letzten 7 Tage - #102
Kandinsky 5.0: Eine Familie von Diffusionsmodellen für die Video- und Bildgenerierung
★ 822+4Sterne-Änderung der letzten 7 Tage - #103
Generieren Sie Videos aus Text mithilfe von KI
★ 821+7Sterne-Änderung der letzten 7 Tage - #104
Generieren Sie groß angelegte, erkundbare 3D-Szenen mit hochwertigen Panoramavideos aus einem einzigen Bild oder Texteingabeaufforderung.
★ 816+12Sterne-Änderung der letzten 7 Tage - #105
[TMLR 2025🔥] Eine Übersicht über autoregressive Modelle in der Vision.
★ 808+1Sterne-Änderung der letzten 7 Tage - #106
Open-WebUI Tools ist ein modulares Toolkit zur Erweiterung und Bereicherung Ihrer Open-WebUI-Instanz, das sie in eine leistungsstarke KI-Workstation verwandelt. Mit über 15 spezialisierten Tools, Funktions-Pipelines und Filtern unterstützt dieses Projekt akademische Forschung, agentenbasierte Autonomie, multimodale Kreativität, Workflows und mehr.
★ 807+5Sterne-Änderung der letzten 7 Tage - #107
[CVPR 2024 Highlight] GenAD: Generalisiertes Prädiktives Modell für das autonome Fahren
★ 805+0Sterne-Änderung der letzten 7 Tage - #108
rCM & Causal-rCM: Führende und einheitliche Algorithmen/Infrastrukturen für die bidirektionale/autoregressive Video-Diffusion-Destillation im großen Maßstab.
★ 800+6Sterne-Änderung der letzten 7 Tage - #109
[NeurIPS 2025 Oral] Infinity⭐️: Einheitliche raumzeitliche autoregressive Modellierung für visuelle Generierung
★ 784+5Sterne-Änderung der letzten 7 Tage - #110
Eine Sammlung herausragender Videogenerierungsstudien.
★ 783+0Sterne-Änderung der letzten 7 Tage - #111
[ICML 2024] MagicPose (auch bekannt als MagicDance): Realistische Übertragung von menschlichen Posen und Gesichtsausdrücken mit identitätsbewusster Diffusion
★ 777+0Sterne-Änderung der letzten 7 Tage - #112
Local-first visuelle Generierungs-Laufzeitumgebung und -Studio für Menschen und Coding Agents, mit reproduzierbaren Bild- und Video-Workflows über mehrere Anbieter hinweg.
★ 751+30Sterne-Änderung der letzten 7 Tage - #113
Eine Übersicht zur Text-zu-Video-Generierung/-Synthese.
★ 744+3Sterne-Änderung der letzten 7 Tage - #114
Cosmos-Transfer2.5, basierend auf Cosmos-Predict2.5, erzeugt hochwertige Weltsimulationen unter Berücksichtigung mehrerer räumlicher Steuerungseingaben.
★ 736+6Sterne-Änderung der letzten 7 Tage - #115
Lokales, agenten-natives Control Plane für ComfyUI – MCP-Server + Seitenleisten-Agent, der Bilder, Videos und Audio generiert, Workflows erstellt und ausführt sowie Ihren Live-Graphen in natürlicher Sprache mit beliebigem LLM (Claude, ChatGPT, Gemini, offline Ollama oder jedem gehosteten Modell) bearbeitet. 178 Tools, 36 KI-Fähigkeiten, 55 Installer-Pakete. Lokal, LAN, VPS oder Comfy Cloud.
★ 729+35Sterne-Änderung der letzten 7 Tage - #116
Ein minimalistisches, funktionsreiches Repository zur Förderung der World-Model-Forschung.
★ 729+10Sterne-Änderung der letzten 7 Tage - #117
[ICCV 2025] Offizielle Implementierung des Papiers „MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control“
★ 729+1Sterne-Änderung der letzten 7 Tage - #118
[ICML 2025] Offizielle PyTorch-Implementierung von „History-Guided Video Diffusion“
★ 709+1Sterne-Änderung der letzten 7 Tage - #119
[ICLR 2026] ChronoEdit: Hin zu temporalem Schließen für Bildbearbeitung und Weltsimulation
★ 706+1Sterne-Änderung der letzten 7 Tage - #120
Eine kuratierte Liste fantastischer Video-Weltmodelle mit AR-Diffusion: Umfasst Algorithmen, Anwendungen und Infrastruktur als umfassende Ressource für Forscher, Praktiker und Enthusiasten.
★ 702+5Sterne-Änderung der letzten 7 Tage