video-understanding
Repositórios de código aberto acompanhados marcados com video-understanding, ordenados por estrelas.
Tópicos relacionados
Tópicos que aparecem com frequência ao lado de video-understanding no mesmo repositório.
Em ascensão recentemente
Repositórios criados nos últimos 90 dias e marcados com video-understanding.
- #1
Caixa de ferramentas e benchmark de compreensão de vídeo de próxima geração da OpenMMLab
★ 5.150+3Variação de estrelas nos últimos 7 dias - #2
Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.
★ 4.390+7Variação de estrelas nos últimos 7 dias - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT com compreensão de vídeo! E muitos outros modelos de linguagem suportados, como miniGPT4, StableLM e MOSS.
★ 3.347+0Variação de estrelas nos últimos 7 dias - #4
GLM-4.6V/4.5V/4.1V-Thinking: Rumo ao raciocínio multimodal versátil com aprendizado por reforço escalável
★ 2.379+2Variação de estrelas nos últimos 7 dias - #5
[ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal
★ 2.374+5Variação de estrelas nos últimos 7 dias - #6
[ICCV 2019] TSM: Módulo de Deslocamento Temporal para compreensão eficiente de vídeo.
★ 2.222+1Variação de estrelas nos últimos 7 dias - #7
O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.
★ 1.840+10Variação de estrelas nos últimos 7 dias - #8
VideoAgent: Framework de agentes tudo-em-um para compreensão, edição e recriação de vídeos
★ 1.834+65Variação de estrelas nos últimos 7 dias - #9
Conjuntos de ferramentas de compreensão de vídeo baseados em PaddlePaddle. Suporta ferramentas de anotação de dados de vídeo, modelos leves de reconhecimento de ação baseados em RGB e esqueleto, e aplicações práticas para marcação de vídeo e detecção de ações esportivas.
★ 1.702+0Variação de estrelas nos últimos 7 dias - #10★ 1.521+3Variação de estrelas nos últimos 7 dias
- #11
Um modelo multimodal nativo unificado com 3B de parâmetros ativos para compreensão, geração e edição de imagens e vídeos.
★ 1.334+3Variação de estrelas nos últimos 7 dias - #12
awesome grounding: Uma lista curada de artigos de pesquisa sobre visual grounding
★ 1.127+0Variação de estrelas nos últimos 7 dias - #13
Lista de artigos de trabalhos recentes em Visão Computacional (CV)
★ 973+1Variação de estrelas nos últimos 7 dias - #14
[CVPR 2024 Highlight] Chat-UniVi: Representação visual unificada que capacita grandes modelos de linguagem com compreensão de imagem e vídeo.
★ 941+0Variação de estrelas nos últimos 7 dias - #15
[CVPR 2023] VideoMAE V2: Escalando Video Masked Autoencoders com mascaramento duplo
★ 819+3Variação de estrelas nos últimos 7 dias - #16
Código oficial para o modelo Goldfish para compreensão de vídeos longos e MiniGPT4-video para compreensão de vídeos curtos
★ 639+1Variação de estrelas nos últimos 7 dias - #17★ 596—Variação de estrelas nos últimos 7 dias
- #18
Nós do ComfyUI para modelos de visão-linguagem: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclui detecção de vocabulário aberto, segmentação SAM2/SAM3, raciocínio temporal de vídeo, GGUF via llama.cpp e APIs de LLM/VLM hospedadas.
★ 588-1Variação de estrelas nos últimos 7 dias - #19
[ICCV 2023 & TPAMI 2025] MeViS: Um benchmark em larga escala para segmentação de vídeo com expressões de movimento
★ 525+0Variação de estrelas nos últimos 7 dias