Zum Hauptinhalt springen
buildradar
Sign in
Thema · video-understanding

video-understanding

Erfasste Open-Source-Repos mit dem Tag video-understanding, sortiert nach Sternen.

Repos
19
Sterne gesamt
34.235
Sterne im Schnitt
1.802
Anteil
0,00%

Themen, die häufig gemeinsam mit video-understanding am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit video-understanding getaggt wurden.

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLabs Videoverständnis-Toolbox und Benchmark der nächsten Generation

    5.150+3Sterne-Änderung der letzten 7 Tage
  • lmms-eval@EvolvingLMMs-Lab

    All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben

    4.390+7Sterne-Änderung der letzten 7 Tage
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ChatGPT mit Videoverständnis! Sowie viele weitere unterstützte LMs wie miniGPT4, StableLM und MOSS.

    3.347+0Sterne-Änderung der letzten 7 Tage
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: Auf dem Weg zu vielseitigem multimodalem Schließen mit skalierbarem Reinforcement Learning

    2.379+2Sterne-Änderung der letzten 7 Tage
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data für multimodales Verständnis

    2.374+5Sterne-Änderung der letzten 7 Tage
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM: Temporal Shift Module für effizientes Video-Understanding

    2.222+1Sterne-Änderung der letzten 7 Tage
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.

    1.840+10Sterne-Änderung der letzten 7 Tage
  • VideoAgent@HKUDS

    "VideoAgent: All-in-One Agentic Framework für Videoverständnis, -bearbeitung und -neuerstellung"

    1.834+65Sterne-Änderung der letzten 7 Tage
  • PaddleVideo@PaddlePaddle

    Hervorragende Toolkits für das Videoverständnis basierend auf PaddlePaddle. Es unterstützt Tools zur Videodaten-Annotation, leichtgewichtige RGB- und skelettbasierte Aktionserkennungsmodelle sowie praktische Anwendungen für Video-Tagging und Sportaktionserkennung.

    1.702+0Sterne-Änderung der letzten 7 Tage
  • SALMONN@bytedance

    SALMONN-Familie: Eine Suite fortschrittlicher multimodaler LLMs

    1.521+3Sterne-Änderung der letzten 7 Tage
  • Lance@bytedance

    Ein natives, einheitliches multimodales Modell mit 3B aktiven Parametern für Bild- und Videoverständnis, -generierung und -bearbeitung.

    1.334+3Sterne-Änderung der letzten 7 Tage
  • Awesome Grounding: Eine kuratierte Liste von Forschungspapieren zum Visual Grounding

    1.127+0Sterne-Änderung der letzten 7 Tage
  • :fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)

    973+1Sterne-Änderung der letzten 7 Tage
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding

    941+0Sterne-Änderung der letzten 7 Tage
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: Skalierung von Video Masked Autoencoders mit Dual Masking

    819+3Sterne-Änderung der letzten 7 Tage
  • MiniGPT4-video@Vision-CAIR

    Offizieller Code für das Goldfish-Modell zum Verständnis langer Videos und MiniGPT4-video zum Verständnis kurzer Videos

    639+1Sterne-Änderung der letzten 7 Tage
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Sterne-Änderung der letzten 7 Tage
  • ComfyUI_VLM_nodes@gokayfem

    ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.

    588-1Sterne-Änderung der letzten 7 Tage
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: Ein groß angelegter Benchmark für Videosegmentierung mit Bewegungsausdrücken

    525+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen