Pular para o conteúdo principal
buildradar
Sign in
Tópico · video-understanding

video-understanding

Repositórios de código aberto acompanhados marcados com video-understanding, ordenados por estrelas.

Repositórios
19
Total de estrelas
34.235
Média de estrelas
1.802
Participação
0,00%

Tópicos que aparecem com frequência ao lado de video-understanding no mesmo repositório.

Em ascensão recentemente

Repositórios criados nos últimos 90 dias e marcados com video-understanding.

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    Caixa de ferramentas e benchmark de compreensão de vídeo de próxima geração da OpenMMLab

    5.150+3Variação de estrelas nos últimos 7 dias
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit de avaliação multimodal tudo-em-um para tarefas de texto, imagem, vídeo e áudio.

    4.390+7Variação de estrelas nos últimos 7 dias
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ChatGPT com compreensão de vídeo! E muitos outros modelos de linguagem suportados, como miniGPT4, StableLM e MOSS.

    3.347+0Variação de estrelas nos últimos 7 dias
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: Rumo ao raciocínio multimodal versátil com aprendizado por reforço escalável

    2.379+2Variação de estrelas nos últimos 7 dias
  • InternVideo@OpenGVLab

    [ECCV2024] Modelos de fundação de vídeo e dados para compreensão multimodal

    2.374+5Variação de estrelas nos últimos 7 dias
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM: Módulo de Deslocamento Temporal para compreensão eficiente de vídeo.

    2.222+1Variação de estrelas nos últimos 7 dias
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    O NVIDIA AI Blueprint para pesquisa e resumo de vídeo (VSS) é uma arquitetura de referência acelerada por GPU para criar agentes de análise de vídeo com alertas verificados em tempo real, perguntas e respostas visuais e relatórios automatizados. O Blueprint VSS utiliza modelos de linguagem visual (VLMs) como o NVIDIA Cosmos, LLMs como o NVIDIA Nemotron, RAG e NVIDIA NIMs.

    1.840+10Variação de estrelas nos últimos 7 dias
  • VideoAgent@HKUDS

    VideoAgent: Framework de agentes tudo-em-um para compreensão, edição e recriação de vídeos

    1.834+65Variação de estrelas nos últimos 7 dias
  • PaddleVideo@PaddlePaddle

    Conjuntos de ferramentas de compreensão de vídeo baseados em PaddlePaddle. Suporta ferramentas de anotação de dados de vídeo, modelos leves de reconhecimento de ação baseados em RGB e esqueleto, e aplicações práticas para marcação de vídeo e detecção de ações esportivas.

    1.702+0Variação de estrelas nos últimos 7 dias
  • SALMONN@bytedance

    Família SALMONN: Um conjunto de LLMs multimodais avançados

    1.521+3Variação de estrelas nos últimos 7 dias
  • Lance@bytedance

    Um modelo multimodal nativo unificado com 3B de parâmetros ativos para compreensão, geração e edição de imagens e vídeos.

    1.334+3Variação de estrelas nos últimos 7 dias
  • awesome grounding: Uma lista curada de artigos de pesquisa sobre visual grounding

    1.127+0Variação de estrelas nos últimos 7 dias
  • Lista de artigos de trabalhos recentes em Visão Computacional (CV)

    973+1Variação de estrelas nos últimos 7 dias
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight] Chat-UniVi: Representação visual unificada que capacita grandes modelos de linguagem com compreensão de imagem e vídeo.

    941+0Variação de estrelas nos últimos 7 dias
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: Escalando Video Masked Autoencoders com mascaramento duplo

    819+3Variação de estrelas nos últimos 7 dias
  • MiniGPT4-video@Vision-CAIR

    Código oficial para o modelo Goldfish para compreensão de vídeos longos e MiniGPT4-video para compreensão de vídeos curtos

    639+1Variação de estrelas nos últimos 7 dias
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variação de estrelas nos últimos 7 dias
  • ComfyUI_VLM_nodes@gokayfem

    Nós do ComfyUI para modelos de visão-linguagem: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclui detecção de vocabulário aberto, segmentação SAM2/SAM3, raciocínio temporal de vídeo, GGUF via llama.cpp e APIs de LLM/VLM hospedadas.

    588-1Variação de estrelas nos últimos 7 dias
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: Um benchmark em larga escala para segmentação de vídeo com expressões de movimento

    525+0Variação de estrelas nos últimos 7 dias
← Voltar para os tópicos