본문으로 건너뛰기
buildradar
Sign in
토픽 · video-understanding

video-understanding

video-understanding 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
19
총 스타
34,235
평균 스타
1,802
비중
0.00%

같은 리포지토리에 video-understanding 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 video-understanding 태그가 달린 리포지토리예요.

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    OpenMMLab의 차세대 비디오 이해 툴박스 및 벤치마크

    5,150+3최근 7일 스타 변화
  • lmms-eval@EvolvingLMMs-Lab

    텍스트, 이미지, 비디오, 오디오 작업을 아우르는 올인원 멀티모달 평가 툴킷

    4,390+7최근 7일 스타 변화
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] 비디오 이해 기능이 포함된 ChatGPT! miniGPT4, StableLM, MOSS 등 다양한 지원 언어 모델(LM) 포함.

    3,347+0최근 7일 스타 변화
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: 확장 가능한 강화 학습을 통한 다목적 멀티모달 추론 지향

    2,379+2최근 7일 스타 변화
  • InternVideo@OpenGVLab

    [ECCV2024] 멀티모달 이해를 위한 비디오 파운데이션 모델 및 데이터

    2,374+5최근 7일 스타 변화
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] 효율적인 비디오 이해를 위한 TSM: Temporal Shift Module

    2,222+1최근 7일 스타 변화
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    비디오 검색 및 요약(VSS)을 위한 NVIDIA AI Blueprint는 실시간 검증된 알림, 시각적 Q&A, 자동화된 보고 기능을 갖춘 비디오 분석 에이전트를 구축하기 위한 GPU 가속 레퍼런스 아키텍처입니다. VSS Blueprint는 NVIDIA Cosmos 같은 비전 언어 모델(VLM), NVIDIA Nemotron 같은 LLM, RAG 및 NVIDIA NIM을 사용합니다.

    1,840+10최근 7일 스타 변화
  • VideoAgent@HKUDS

    "VideoAgent: 비디오 이해, 편집 및 리메이크를 위한 올인원 에이전트 프레임워크"

    1,834+65최근 7일 스타 변화
  • PaddleVideo@PaddlePaddle

    PaddlePaddle 기반의 멋진 비디오 이해 툴킷. 비디오 데이터 주석 도구, 경량 RGB 및 스켈레톤 기반 행동 인식 모델, 비디오 태깅 및 스포츠 행동 감지를 위한 실용적인 애플리케이션을 지원합니다.

    1,702+0최근 7일 스타 변화
  • SALMONN@bytedance

    SALMONN 제품군: 고급 멀티모달 LLM 모음

    1,521+3최근 7일 스타 변화
  • Lance@bytedance

    이미지 및 비디오 이해, 생성, 편집을 위한 3B 활성 파라미터 네이티브 통합 멀티모달 모델

    1,334+3최근 7일 스타 변화
  • 멋진 grounding: 비주얼 grounding 관련 연구 논문 큐레이션 목록

    1,127+0최근 7일 스타 변화
  • :fire: :fire: :fire: 최근 컴퓨터 비전(CV) 관련 논문 목록

    973+1최근 7일 스타 변화
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: 통합 시각 표현을 통해 대규모 언어 모델에 이미지 및 비디오 이해 능력 부여

    941+0최근 7일 스타 변화
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: 듀얼 마스킹을 통한 비디오 마스크드 오토인코더 확장

    818+2최근 7일 스타 변화
  • MiniGPT4-video@Vision-CAIR

    장영상 이해를 위한 Goldfish 모델 및 단영상 이해를 위한 MiniGPT4-video 공식 코드

    639+1최근 7일 스타 변화
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606최근 7일 스타 변화
  • ComfyUI_VLM_nodes@gokayfem

    Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V 등 비전-언어 모델을 위한 ComfyUI 노드입니다. 오픈 어휘 탐지, SAM2/SAM3 세그멘테이션, 비디오 시간 추론, llama.cpp 기반 GGUF 및 호스팅된 LLM/VLM API를 지원합니다.

    588-1최근 7일 스타 변화
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: 모션 표현을 포함한 비디오 세그멘테이션을 위한 대규모 벤치마크

    525+0최근 7일 스타 변화
← 토픽 목록으로