video-generation
Các kho mã nguồn mở đang theo dõi được gắn thẻ video-generation, sắp xếp theo số sao.
- #91
[AAAI 2025] Follow-Your-Click: Kho lưu trữ này là bản cài đặt chính thức của "Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts"
★ 908+0Thay đổi số sao trong 7 ngày qua - #92★ 896+0Thay đổi số sao trong 7 ngày qua
- #93
[ACM MM 2025] Ditto: Khuếch tán không gian chuyển động để tổng hợp Talking Head thời gian thực có thể kiểm soát
★ 877+5Thay đổi số sao trong 7 ngày qua - #94
[ICLR2026] SeedVR2: Khôi phục video một bước thông qua huấn luyện hậu kỳ đối nghịch khuếch tán (Diffusion Adversarial Post-Training).
★ 863+9Thay đổi số sao trong 7 ngày qua - #95
[CVPR 2025 Highlight🔥] Tạo video từ văn bản bảo toàn danh tính bằng phân tách tần số
★ 856+1Thay đổi số sao trong 7 ngày qua - #96
UniAnimate-DiT: Hoạt họa ảnh con người sử dụng Video Diffusion Transformer quy mô lớn
★ 850-1Thay đổi số sao trong 7 ngày qua - #97
[SIGGRAPH 2025] Diffusion as Shader: Khuếch tán video nhận thức 3D để kiểm soát tạo video linh hoạt
★ 832+1Thay đổi số sao trong 7 ngày qua - #98
Triển khai chính thức cho "RIFLEx: A Free Lunch for Length Extrapolation in Video Diffusion Transformers" (ICML 2025), UltraViCo (ICLR 2026) và UltraImage
★ 827+0Thay đổi số sao trong 7 ngày qua - #99
Một công cụ huấn luyện mô hình đa phương thức đơn giản và thống nhất. Tinh gọn, linh hoạt và được xây dựng để tùy chỉnh ở quy mô lớn.
★ 824+0Thay đổi số sao trong 7 ngày qua - #100
Tạo video từ văn bản bằng AI
★ 820+3Thay đổi số sao trong 7 ngày qua - #101
Kandinsky 5.0: Một dòng mô hình khuếch tán để tạo Video và Hình ảnh
★ 819+7Thay đổi số sao trong 7 ngày qua - #102
Tạo các cảnh 3D quy mô lớn có thể khám phá với video toàn cảnh chất lượng cao từ một hình ảnh hoặc văn bản gợi ý duy nhất.
★ 815+17Thay đổi số sao trong 7 ngày qua - #103
CLI tạo phương tiện Flatkey cho hình ảnh, video, âm thanh, văn bản, thông tin ghi công và khám phá mô hình.
★ 810+132Thay đổi số sao trong 7 ngày qua - #104
[TMLR 2025🔥] Khảo sát về các mô hình tự hồi quy trong thị giác máy tính.
★ 808+1Thay đổi số sao trong 7 ngày qua - #105★ 805+0Thay đổi số sao trong 7 ngày qua
- #106
Open-WebUI Tools là bộ công cụ mô-đun được thiết kế để mở rộng và làm phong phú thêm phiên bản Open WebUI của bạn, biến nó thành một trạm làm việc AI mạnh mẽ. Với hơn 15 công cụ chuyên dụng, đường ống chức năng và bộ lọc, dự án này hỗ trợ nghiên cứu học thuật, tính tự chủ của tác nhân, sáng tạo đa phương thức, quy trình làm việc và nhiều hơn nữa.
★ 805+2Thay đổi số sao trong 7 ngày qua - #107
rCM & Causal-rCM: Các thuật toán/cơ sở hạ tầng hàng đầu và thống nhất cho việc chưng cất khuếch tán video hai chiều/tự hồi quy ở quy mô lớn.
★ 800+6Thay đổi số sao trong 7 ngày qua - #108
[NeurIPS 2025 Oral] Infinity⭐️: Mô hình tự hồi quy không gian-thời gian thống nhất cho tạo hình ảnh.
★ 783+3Thay đổi số sao trong 7 ngày qua - #109
Bộ sưu tập các nghiên cứu tuyệt vời về tạo video.
★ 782+0Thay đổi số sao trong 7 ngày qua - #110
[ICML 2024] MagicPose (còn gọi là MagicDance): Tái tạo tư thế người và biểu cảm khuôn mặt chân thực với Diffusion nhận diện danh tính
★ 776+0Thay đổi số sao trong 7 ngày qua - #111
Môi trường thực thi và studio tạo hình ảnh trực quan local-first dành cho người dùng và các coding agent, hỗ trợ quy trình làm việc hình ảnh và video có thể tái lập trên nhiều nhà cung cấp.
★ 746+20Thay đổi số sao trong 7 ngày qua - #112
Khảo sát về tạo/tổng hợp văn bản thành video.
★ 743+0Thay đổi số sao trong 7 ngày qua - #113
Cosmos-Transfer2.5, được xây dựng trên nền tảng Cosmos-Predict2.5, tạo ra các mô phỏng thế giới chất lượng cao dựa trên nhiều đầu vào điều khiển không gian.
★ 733+4Thay đổi số sao trong 7 ngày qua - #114
[ICCV 2025] Triển khai chính thức của bài báo “MagicDrive-V2: Tạo video dài độ phân giải cao cho lái xe tự động với điều khiển thích ứng”
★ 729+1Thay đổi số sao trong 7 ngày qua - #115
Control plane ưu tiên cục bộ, hỗ trợ agent cho ComfyUI — bao gồm MCP server và sidebar agent giúp tạo hình ảnh, video & âm thanh, viết và chạy quy trình, chỉnh sửa đồ thị trực tiếp bằng ngôn ngữ tự nhiên trên bất kỳ LLM nào (Claude, ChatGPT, Gemini, Ollama ngoại tuyến hoặc bất kỳ mô hình được lưu trữ nào). Gồm 178 công cụ, 36 kỹ năng AI, 55 gói cài đặt. Hỗ trợ cục bộ, LAN, VPS hoặc Comfy Cloud.
★ 727+24Thay đổi số sao trong 7 ngày qua - #116
Một kho lưu trữ tối giản, đầy đủ tiện ích để thúc đẩy khoa học về mô hình thế giới (World Model).
★ 725+4Thay đổi số sao trong 7 ngày qua - #117
[ICML 2025] Triển khai PyTorch chính thức cho "History-Guided Video Diffusion"
★ 709+1Thay đổi số sao trong 7 ngày qua - #118
[ICLR 2026] ChronoEdit: Hướng tới suy luận thời gian cho chỉnh sửa hình ảnh và mô phỏng thế giới
★ 706-2Thay đổi số sao trong 7 ngày qua - #119
[ECCV 2026] SparkVSR: Siêu phân giải video tương tác thông qua lan truyền keyframe thưa
★ 702+3Thay đổi số sao trong 7 ngày qua - #120
Danh sách tổng hợp các Video World Models với AR Diffusion: Bao gồm thuật toán, ứng dụng và cơ sở hạ tầng, nhằm phục vụ như một tài nguyên toàn diện cho các nhà nghiên cứu, chuyên gia và người đam mê.
★ 701+4Thay đổi số sao trong 7 ngày qua