video-understanding
Dépôts open source suivis étiquetés video-understanding, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de video-understanding sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés video-understanding.
- #1
Boîte à outils et benchmark de nouvelle génération pour la compréhension vidéo d'OpenMMLab
★ 5 150+3Évolution des étoiles sur les 7 derniers jours - #2
Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.
★ 4 390+7Évolution des étoiles sur les 7 derniers jours - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT avec compréhension vidéo ! Supporte également de nombreux autres modèles de langage tels que miniGPT4, StableLM et MOSS.
★ 3 347+0Évolution des étoiles sur les 7 derniers jours - #4
GLM-4.6V/4.5V/4.1V-Thinking : Vers un raisonnement multimodal polyvalent grâce à l'apprentissage par renforcement évolutif
★ 2 379+2Évolution des étoiles sur les 7 derniers jours - #5
[ECCV2024] Modèles de fondation vidéo et données pour la compréhension multimodale.
★ 2 374+5Évolution des étoiles sur les 7 derniers jours - #6
[ICCV 2019] TSM : Module de décalage temporel pour une compréhension vidéo efficace
★ 2 222+1Évolution des étoiles sur les 7 derniers jours - #7
Le blueprint NVIDIA AI pour la recherche et le résumé vidéo (VSS) est une architecture de référence accélérée par GPU pour créer des agents d'analyse vidéo avec des alertes vérifiées en temps réel, des questions-réponses visuelles et des rapports automatisés. Le blueprint VSS utilise des modèles de langage visuel (VLM) tels que NVIDIA Cosmos, des LLM tels que NVIDIA Nemotron, le RAG et NVIDIA NIMs.
★ 1 840+10Évolution des étoiles sur les 7 derniers jours - #8
VideoAgent : framework agentique tout-en-un pour la compréhension, l'édition et la recréation de vidéos
★ 1 834+65Évolution des étoiles sur les 7 derniers jours - #9
Boîtes à outils de compréhension vidéo basées sur PaddlePaddle. Inclut des outils d'annotation de données vidéo, des modèles légers de reconnaissance d'actions basés sur le RGB et le squelette, ainsi que des applications pratiques pour le taggage vidéo et la détection d'actions sportives.
★ 1 702+0Évolution des étoiles sur les 7 derniers jours - #10★ 1 521+3Évolution des étoiles sur les 7 derniers jours
- #11
Un modèle multimodal unifié natif de 3 milliards de paramètres actifs pour la compréhension, la génération et l'édition d'images et de vidéos.
★ 1 334+3Évolution des étoiles sur les 7 derniers jours - #12
awesome grounding : une liste organisée d'articles de recherche sur le visual grounding.
★ 1 127+0Évolution des étoiles sur les 7 derniers jours - #13
Une liste d'articles sur des travaux récents en vision par ordinateur (CV)
★ 973+1Évolution des étoiles sur les 7 derniers jours - #14
[CVPR 2024 Highlight] Chat-UniVi : Une représentation visuelle unifiée permettant aux grands modèles de langage de comprendre les images et les vidéos.
★ 941+0Évolution des étoiles sur les 7 derniers jours - #15
[CVPR 2023] VideoMAE V2 : Mise à l'échelle des Video Masked Autoencoders avec double masquage
★ 819+3Évolution des étoiles sur les 7 derniers jours - #16
Code officiel du modèle Goldfish pour la compréhension de vidéos longues et de MiniGPT4-video pour la compréhension de vidéos courtes
★ 639+1Évolution des étoiles sur les 7 derniers jours - #17★ 606—Évolution des étoiles sur les 7 derniers jours
- #18
Nœuds ComfyUI pour les modèles vision-langage : Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclut également la détection à vocabulaire ouvert, la segmentation SAM2/SAM3, le raisonnement temporel vidéo, GGUF via llama.cpp et des API LLM/VLM hébergées.
★ 588-1Évolution des étoiles sur les 7 derniers jours - #19
[ICCV 2023 & TPAMI 2025] MeViS : Un benchmark à grande échelle pour la segmentation vidéo avec expressions de mouvement.
★ 525+0Évolution des étoiles sur les 7 derniers jours