video-generation
video-generation がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #91
ComfyUIにおけるMiniMax H3向けのクリップ連鎖 - 結合部分をまたいでモーションとオーディオが自然に継続
★ 914+143直近 7 日のスター増減 - #92
[AAAI 2025] Follow-Your-Click: 本リポジトリは論文「Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts」の公式実装です
★ 908-1直近 7 日のスター増減 - #93★ 896+1直近 7 日のスター増減
- #94
[ACM MM 2025] Ditto: 制御可能なリアルタイムトーキングヘッド合成のためのモーション空間拡散モデル
★ 878+7直近 7 日のスター増減 - #95★ 865+11直近 7 日のスター増減
- #96★ 857+2直近 7 日のスター増減
- #97
UniAnimate-DiT: 大規模動画Diffusion Transformerを用いた人物画像アニメーション
★ 850-2直近 7 日のスター増減 - #98
[SIGGRAPH 2025] Diffusion as Shader: 多様な動画生成制御のための 3D 認識型ビデオディフュージョン
★ 833+2直近 7 日のスター増減 - #99
「RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers」(ICML 2025)、UltraViCo(ICLR 2026)、および UltraImage の公式実装
★ 827+2直近 7 日のスター増減 - #100
画像、動画、音声、テキスト、クレジット、モデル探索のための Flatkey メディア生成 CLI
★ 825+191直近 7 日のスター増減 - #101
シンプルで統一されたマルチモーダルモデル学習エンジン。軽量で柔軟性があり、大規模なハッキングに対応するように構築されています。
★ 824+0直近 7 日のスター増減 - #102
AI を使用してテキストから動画を生成
★ 821+7直近 7 日のスター増減 - #103
Kandinsky 5.0: 動画および画像生成のための拡散モデルファミリー
★ 820+4直近 7 日のスター増減 - #104★ 816+12直近 7 日のスター増減
- #105
視覚分野における自己回帰モデルのサーベイ論文。
★ 808+1直近 7 日のスター増減 - #106
Open-WebUI Tools は、Open WebUI インスタンスを拡張・強化し、強力な AI ワークステーションへと変えるために設計されたモジュール式ツールキットです。15 種類以上の特化型ツール、関数パイプライン、フィルターを備え、学術研究、エージェントの自律性、マルチモーダルの創造性、ワークフローなどをサポートします。
★ 806+5直近 7 日のスター増減 - #107★ 805+0直近 7 日のスター増減
- #108★ 800+6直近 7 日のスター増減
- #109
[NeurIPS 2025 Oral]Infinity⭐️: 視覚生成のための統合時空間自己回帰モデリング
★ 784+5直近 7 日のスター増減 - #110
動画生成に関する素晴らしい研究のコレクション。
★ 782+0直近 7 日のスター増減 - #111
[ICML 2024] MagicPose (MagicDance としても知られる): アイデンティティを考慮した Diffusion によるリアルな人物のポーズと表情の再ターゲット
★ 776+0直近 7 日のスター増減 - #112
複数のプロバイダー間で再現可能な画像および動画ワークフローを備えた、人間とコーディングエージェントのためのローカルファーストなビジュアル生成ランタイムおよびスタジオ
★ 749+30直近 7 日のスター増減 - #113
テキストから動画への生成/合成に関するサーベイ。
★ 744+3直近 7 日のスター増減 - #114
Cosmos-Predict2.5をベースに構築されたCosmos-Transfer2.5は、複数の空間制御入力を条件とした高品質な世界シミュレーションを生成します。
★ 735+6直近 7 日のスター増減 - #115
ComfyUI向けのローカルファーストかつエージェントネイティブなコントロールプレーン。MCPサーバーとサイドバーエージェントを備え、あらゆるLLM(Claude、ChatGPT、Gemini、オフラインのOllama、または任意のホステッドモデル)を使用して、自然言語で画像・動画・音声の生成、ワークフローの作成・実行、ライブグラフの編集を行います。178個のツール、36個のAIスキル、55個のインストーラーパックを搭載。ローカル、LAN、VPS、Comfy Cloudに対応。
★ 729+35直近 7 日のスター増減 - #116
[ICCV 2025] 論文「MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control」の公式実装。
★ 729+1直近 7 日のスター増減 - #117
ワールドモデル科学の発展を目的とした、ミニマリストで機能が充実したリポジトリ。
★ 729+10直近 7 日のスター増減 - #118
[ICML 2025] 「History-Guided Video Diffusion」の公式 PyTorch 実装
★ 709+1直近 7 日のスター増減 - #119
[ICLR 2026] ChronoEdit: 画像編集とワールドシミュレーションにおける時間的推論に向けて
★ 706+1直近 7 日のスター増減 - #120★ 702+3直近 7 日のスター増減