video-understanding
Erfasste Open-Source-Repos mit dem Tag video-understanding, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit video-understanding am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit video-understanding getaggt wurden.
- #1★ 5.150+3Sterne-Änderung der letzten 7 Tage
- #2
All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben
★ 4.390+7Sterne-Änderung der letzten 7 Tage - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT mit Videoverständnis! Sowie viele weitere unterstützte LMs wie miniGPT4, StableLM und MOSS.
★ 3.347+0Sterne-Änderung der letzten 7 Tage - #4
GLM-4.6V/4.5V/4.1V-Thinking: Auf dem Weg zu vielseitigem multimodalem Schließen mit skalierbarem Reinforcement Learning
★ 2.379+2Sterne-Änderung der letzten 7 Tage - #5
[ECCV2024] Video Foundation Models & Data für multimodales Verständnis
★ 2.374+5Sterne-Änderung der letzten 7 Tage - #6
[ICCV 2019] TSM: Temporal Shift Module für effizientes Video-Understanding
★ 2.222+1Sterne-Änderung der letzten 7 Tage - #7
NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.
★ 1.840+10Sterne-Änderung der letzten 7 Tage - #8
"VideoAgent: All-in-One Agentic Framework für Videoverständnis, -bearbeitung und -neuerstellung"
★ 1.834+65Sterne-Änderung der letzten 7 Tage - #9
Hervorragende Toolkits für das Videoverständnis basierend auf PaddlePaddle. Es unterstützt Tools zur Videodaten-Annotation, leichtgewichtige RGB- und skelettbasierte Aktionserkennungsmodelle sowie praktische Anwendungen für Video-Tagging und Sportaktionserkennung.
★ 1.702+0Sterne-Änderung der letzten 7 Tage - #10★ 1.521+3Sterne-Änderung der letzten 7 Tage
- #11
Ein natives, einheitliches multimodales Modell mit 3B aktiven Parametern für Bild- und Videoverständnis, -generierung und -bearbeitung.
★ 1.334+3Sterne-Änderung der letzten 7 Tage - #12
Awesome Grounding: Eine kuratierte Liste von Forschungspapieren zum Visual Grounding
★ 1.127+0Sterne-Änderung der letzten 7 Tage - #13
:fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)
★ 973+1Sterne-Änderung der letzten 7 Tage - #14
[CVPR 2024 Highlight🔥] Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
★ 941+0Sterne-Änderung der letzten 7 Tage - #15
[CVPR 2023] VideoMAE V2: Skalierung von Video Masked Autoencoders mit Dual Masking
★ 819+3Sterne-Änderung der letzten 7 Tage - #16
Offizieller Code für das Goldfish-Modell zum Verständnis langer Videos und MiniGPT4-video zum Verständnis kurzer Videos
★ 639+1Sterne-Änderung der letzten 7 Tage - #17★ 596—Sterne-Änderung der letzten 7 Tage
- #18
ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.
★ 588-1Sterne-Änderung der letzten 7 Tage - #19
[ICCV 2023 & TPAMI 2025] MeViS: Ein groß angelegter Benchmark für Videosegmentierung mit Bewegungsausdrücken
★ 525+0Sterne-Änderung der letzten 7 Tage