Saltar al contenido principal
buildradar
Sign in
Tema · video-understanding

video-understanding

Repositorios de código abierto monitorizados etiquetados con video-understanding, ordenados por estrellas.

Repositorios
19
Estrellas totales
34.235
Estrellas de media
1802
Proporción
0,00%

Temas que aparecen con frecuencia junto a video-understanding en un mismo repositorio.

Emergentes recientes

Repositorios creados en los últimos 90 días, etiquetados con video-understanding.

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    Caja de herramientas y banco de pruebas de próxima generación para la comprensión de video de OpenMMLab

    5150+3Variación de estrellas de los últimos 7 días
  • lmms-eval@EvolvingLMMs-Lab

    Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio

    4390+7Variación de estrellas de los últimos 7 días
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ¡ChatGPT con comprensión de video! Y muchos más LM compatibles como miniGPT4, StableLM y MOSS.

    3347+0Variación de estrellas de los últimos 7 días
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: Hacia un razonamiento multimodal versátil con aprendizaje por refuerzo escalable

    2379+2Variación de estrellas de los últimos 7 días
  • InternVideo@OpenGVLab

    [ECCV2024] Modelos base de video y datos para comprensión multimodal

    2374+5Variación de estrellas de los últimos 7 días
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM: Módulo de cambio temporal para la comprensión eficiente de videos

    2222+1Variación de estrellas de los últimos 7 días
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint para búsqueda y resumen de video (VSS) es una arquitectura de referencia acelerada por GPU para construir agentes de análisis de video con alertas verificadas en tiempo real, preguntas y respuestas visuales, y generación automatizada de informes. El Blueprint VSS utiliza modelos de lenguaje visual (VLMs) como NVIDIA Cosmos, LLMs como NVIDIA Nemotron, RAG y NVIDIA NIMs.

    1840+10Variación de estrellas de los últimos 7 días
  • VideoAgent@HKUDS

    VideoAgent: Framework de agentes todo en uno para la comprensión, edición y recreación de video

    1834+65Variación de estrellas de los últimos 7 días
  • PaddleVideo@PaddlePaddle

    Kit de herramientas para comprensión de video basado en PaddlePaddle. Incluye herramientas de anotación, modelos de reconocimiento de acciones basados en RGB y esqueletos, y aplicaciones prácticas para etiquetado de video y detección de acciones deportivas.

    1702+0Variación de estrellas de los últimos 7 días
  • SALMONN@bytedance

    Familia SALMONN: un conjunto de LLMs multimodales avanzados.

    1521+3Variación de estrellas de los últimos 7 días
  • Lance@bytedance

    Un modelo multimodal unificado nativo con 3B de parámetros activos para la comprensión, generación y edición de imágenes y videos.

    1334+3Variación de estrellas de los últimos 7 días
  • awesome grounding: una lista curada de artículos de investigación sobre visual grounding.

    1127+0Variación de estrellas de los últimos 7 días
  • Una lista de artículos sobre trabajos recientes de Visión Artificial (CV)

    973+1Variación de estrellas de los últimos 7 días
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: La representación visual unificada potencia a los modelos de lenguaje grandes con comprensión de imágenes y videos

    941+0Variación de estrellas de los últimos 7 días
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: escalado de Video Masked Autoencoders con enmascaramiento dual.

    819+3Variación de estrellas de los últimos 7 días
  • MiniGPT4-video@Vision-CAIR

    Código oficial para el modelo Goldfish para comprensión de video largo y MiniGPT4-video para comprensión de video corto

    639+1Variación de estrellas de los últimos 7 días
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variación de estrellas de los últimos 7 días
  • ComfyUI_VLM_nodes@gokayfem

    Nodos de ComfyUI para modelos de lenguaje visual: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Incluye detección de vocabulario abierto, segmentación SAM2/SAM3, razonamiento temporal de video, GGUF mediante llama.cpp y APIs de LLM/VLM alojadas.

    588-1Variación de estrellas de los últimos 7 días
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: Un benchmark a gran escala para segmentación de video con expresiones de movimiento

    525+0Variación de estrellas de los últimos 7 días
← Volver a temas