video-understanding
Repositorios de código abierto monitorizados etiquetados con video-understanding, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a video-understanding en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con video-understanding.
- #1
Caja de herramientas y banco de pruebas de próxima generación para la comprensión de video de OpenMMLab
★ 5150+3Variación de estrellas de los últimos 7 días - #2
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4390+7Variación de estrellas de los últimos 7 días - #3
[CVPR2024 Highlight][VideoChatGPT] ¡ChatGPT con comprensión de video! Y muchos más LM compatibles como miniGPT4, StableLM y MOSS.
★ 3347+0Variación de estrellas de los últimos 7 días - #4
GLM-4.6V/4.5V/4.1V-Thinking: Hacia un razonamiento multimodal versátil con aprendizaje por refuerzo escalable
★ 2379+2Variación de estrellas de los últimos 7 días - #5
[ECCV2024] Modelos base de video y datos para comprensión multimodal
★ 2374+5Variación de estrellas de los últimos 7 días - #6
[ICCV 2019] TSM: Módulo de cambio temporal para la comprensión eficiente de videos
★ 2222+1Variación de estrellas de los últimos 7 días - #7
NVIDIA AI Blueprint para búsqueda y resumen de video (VSS) es una arquitectura de referencia acelerada por GPU para construir agentes de análisis de video con alertas verificadas en tiempo real, preguntas y respuestas visuales, y generación automatizada de informes. El Blueprint VSS utiliza modelos de lenguaje visual (VLMs) como NVIDIA Cosmos, LLMs como NVIDIA Nemotron, RAG y NVIDIA NIMs.
★ 1840+10Variación de estrellas de los últimos 7 días - #8
VideoAgent: Framework de agentes todo en uno para la comprensión, edición y recreación de video
★ 1834+65Variación de estrellas de los últimos 7 días - #9
Kit de herramientas para comprensión de video basado en PaddlePaddle. Incluye herramientas de anotación, modelos de reconocimiento de acciones basados en RGB y esqueletos, y aplicaciones prácticas para etiquetado de video y detección de acciones deportivas.
★ 1702+0Variación de estrellas de los últimos 7 días - #10★ 1521+3Variación de estrellas de los últimos 7 días
- #11
Un modelo multimodal unificado nativo con 3B de parámetros activos para la comprensión, generación y edición de imágenes y videos.
★ 1334+3Variación de estrellas de los últimos 7 días - #12
awesome grounding: una lista curada de artículos de investigación sobre visual grounding.
★ 1127+0Variación de estrellas de los últimos 7 días - #13
Una lista de artículos sobre trabajos recientes de Visión Artificial (CV)
★ 973+1Variación de estrellas de los últimos 7 días - #14
[CVPR 2024 Highlight🔥] Chat-UniVi: La representación visual unificada potencia a los modelos de lenguaje grandes con comprensión de imágenes y videos
★ 941+0Variación de estrellas de los últimos 7 días - #15
[CVPR 2023] VideoMAE V2: escalado de Video Masked Autoencoders con enmascaramiento dual.
★ 819+3Variación de estrellas de los últimos 7 días - #16
Código oficial para el modelo Goldfish para comprensión de video largo y MiniGPT4-video para comprensión de video corto
★ 639+1Variación de estrellas de los últimos 7 días - #17★ 596—Variación de estrellas de los últimos 7 días
- #18
Nodos de ComfyUI para modelos de lenguaje visual: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Incluye detección de vocabulario abierto, segmentación SAM2/SAM3, razonamiento temporal de video, GGUF mediante llama.cpp y APIs de LLM/VLM alojadas.
★ 588-1Variación de estrellas de los últimos 7 días - #19
[ICCV 2023 & TPAMI 2025] MeViS: Un benchmark a gran escala para segmentación de video con expresiones de movimiento
★ 525+0Variación de estrellas de los últimos 7 días