video-understanding
Repositori open source terpantau bertanda video-understanding, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan video-understanding di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda video-understanding.
- #1★ 5.150+3Perubahan bintang dalam 7 hari terakhir
- #2
Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.
★ 4.390+7Perubahan bintang dalam 7 hari terakhir - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT dengan pemahaman video! Dan banyak lagi LM yang didukung seperti miniGPT4, StableLM, dan MOSS.
★ 3.347+0Perubahan bintang dalam 7 hari terakhir - #4
GLM-4.6V/4.5V/4.1V-Thinking: Menuju Penalaran Multimodal Serbaguna dengan Reinforcement Learning yang Dapat Diskalakan.
★ 2.379+2Perubahan bintang dalam 7 hari terakhir - #5
[ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal
★ 2.374+5Perubahan bintang dalam 7 hari terakhir - #6
[ICCV 2019] TSM: Temporal Shift Module untuk Pemahaman Video yang Efisien
★ 2.222+1Perubahan bintang dalam 7 hari terakhir - #7
NVIDIA AI Blueprint untuk pencarian dan peringkasan video (VSS) adalah arsitektur referensi yang dipercepat GPU untuk membangun agen analitik video dengan peringatan terverifikasi waktu nyata, tanya jawab visual, dan pelaporan otomatis. Blueprint VSS menggunakan model bahasa visi (VLM) seperti NVIDIA Cosmos, LLM seperti NVIDIA Nemotron, RAG, dan NVIDIA NIM.
★ 1.840+10Perubahan bintang dalam 7 hari terakhir - #8
"VideoAgent: Kerangka Kerja Agen Serbaguna untuk Pemahaman, Pengeditan, dan Pembuatan Ulang Video"
★ 1.834+65Perubahan bintang dalam 7 hari terakhir - #9
Toolkit pemahaman video luar biasa berbasis PaddlePaddle. Mendukung alat anotasi data video, model pengenalan tindakan berbasis RGB ringan dan kerangka, aplikasi praktis untuk penandaan video dan deteksi tindakan olahraga.
★ 1.702+0Perubahan bintang dalam 7 hari terakhir - #10★ 1.521+3Perubahan bintang dalam 7 hari terakhir
- #11
Model multimodal unified native dengan 3B parameter aktif untuk pemahaman, pembuatan, dan pengeditan gambar dan video.
★ 1.334+3Perubahan bintang dalam 7 hari terakhir - #12
awesome grounding: Daftar kurasi makalah penelitian tentang visual grounding
★ 1.127+0Perubahan bintang dalam 7 hari terakhir - #13
:fire: :fire: :fire: Daftar makalah dari beberapa karya Computer Vision (CV) terkini
★ 973+1Perubahan bintang dalam 7 hari terakhir - #14
[CVPR 2024 Highlight🔥] Chat-UniVi: Representasi Visual Terpadu Memberdayakan Large Language Models dengan Pemahaman Gambar dan Video
★ 941+0Perubahan bintang dalam 7 hari terakhir - #15
[CVPR 2023] VideoMAE V2: Penskalaan Video Masked Autoencoders dengan Dual Masking
★ 819+3Perubahan bintang dalam 7 hari terakhir - #16
Kode resmi untuk model Goldfish untuk pemahaman video panjang dan MiniGPT4-video untuk pemahaman video pendek
★ 639+1Perubahan bintang dalam 7 hari terakhir - #17
Node ComfyUI untuk model vision-language: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Ditambah deteksi open-vocabulary, segmentasi SAM2/SAM3, penalaran temporal video, GGUF melalui llama.cpp, dan API LLM/VLM yang dihost.
★ 588-1Perubahan bintang dalam 7 hari terakhir - #18★ 588—Perubahan bintang dalam 7 hari terakhir
- #19
[ICCV 2023 & TPAMI 2025] MeViS: Tolok Ukur Skala Besar untuk Segmentasi Video dengan Ekspresi Gerakan
★ 525+0Perubahan bintang dalam 7 hari terakhir