Lompat ke konten utama
buildradar
Sign in
Topik · video-understanding

video-understanding

Repositori open source terpantau bertanda video-understanding, diurutkan berdasarkan bintang.

Repositori
19
Total bintang
34.235
Rata-rata bintang
1.802
Porsi
0,00%

Topik yang sering muncul berdampingan dengan video-understanding di repositori yang sama.

Yang sedang naik

Repositori yang dibuat dalam 90 hari terakhir dan bertanda video-understanding.

  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • mmaction2@open-mmlab

    Toolbox dan benchmark pemahaman video generasi berikutnya dari OpenMMLab

    5.150+3Perubahan bintang dalam 7 hari terakhir
  • lmms-eval@EvolvingLMMs-Lab

    Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.

    4.390+7Perubahan bintang dalam 7 hari terakhir
  • Ask-Anything@OpenGVLab

    [CVPR2024 Highlight][VideoChatGPT] ChatGPT dengan pemahaman video! Dan banyak lagi LM yang didukung seperti miniGPT4, StableLM, dan MOSS.

    3.347+0Perubahan bintang dalam 7 hari terakhir
  • GLM-V@zai-org

    GLM-4.6V/4.5V/4.1V-Thinking: Menuju Penalaran Multimodal Serbaguna dengan Reinforcement Learning yang Dapat Diskalakan.

    2.379+2Perubahan bintang dalam 7 hari terakhir
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data untuk Pemahaman Multimodal

    2.374+5Perubahan bintang dalam 7 hari terakhir
  • temporal-shift-module@mit-han-lab

    [ICCV 2019] TSM: Temporal Shift Module untuk Pemahaman Video yang Efisien

    2.222+1Perubahan bintang dalam 7 hari terakhir
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint untuk pencarian dan peringkasan video (VSS) adalah arsitektur referensi yang dipercepat GPU untuk membangun agen analitik video dengan peringatan terverifikasi waktu nyata, tanya jawab visual, dan pelaporan otomatis. Blueprint VSS menggunakan model bahasa visi (VLM) seperti NVIDIA Cosmos, LLM seperti NVIDIA Nemotron, RAG, dan NVIDIA NIM.

    1.840+10Perubahan bintang dalam 7 hari terakhir
  • VideoAgent@HKUDS

    "VideoAgent: Kerangka Kerja Agen Serbaguna untuk Pemahaman, Pengeditan, dan Pembuatan Ulang Video"

    1.834+65Perubahan bintang dalam 7 hari terakhir
  • PaddleVideo@PaddlePaddle

    Toolkit pemahaman video luar biasa berbasis PaddlePaddle. Mendukung alat anotasi data video, model pengenalan tindakan berbasis RGB ringan dan kerangka, aplikasi praktis untuk penandaan video dan deteksi tindakan olahraga.

    1.702+0Perubahan bintang dalam 7 hari terakhir
  • SALMONN@bytedance

    Keluarga SALMONN: Sekumpulan multi-modal LLM tingkat lanjut

    1.521+3Perubahan bintang dalam 7 hari terakhir
  • Lance@bytedance

    Model multimodal unified native dengan 3B parameter aktif untuk pemahaman, pembuatan, dan pengeditan gambar dan video.

    1.334+3Perubahan bintang dalam 7 hari terakhir
  • awesome grounding: Daftar kurasi makalah penelitian tentang visual grounding

    1.127+0Perubahan bintang dalam 7 hari terakhir
  • :fire: :fire: :fire: Daftar makalah dari beberapa karya Computer Vision (CV) terkini

    973+1Perubahan bintang dalam 7 hari terakhir
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: Representasi Visual Terpadu Memberdayakan Large Language Models dengan Pemahaman Gambar dan Video

    941+0Perubahan bintang dalam 7 hari terakhir
  • VideoMAEv2@OpenGVLab

    [CVPR 2023] VideoMAE V2: Penskalaan Video Masked Autoencoders dengan Dual Masking

    819+3Perubahan bintang dalam 7 hari terakhir
  • MiniGPT4-video@Vision-CAIR

    Kode resmi untuk model Goldfish untuk pemahaman video panjang dan MiniGPT4-video untuk pemahaman video pendek

    639+1Perubahan bintang dalam 7 hari terakhir
  • ComfyUI_VLM_nodes@gokayfem

    Node ComfyUI untuk model vision-language: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Ditambah deteksi open-vocabulary, segmentasi SAM2/SAM3, penalaran temporal video, GGUF melalui llama.cpp, dan API LLM/VLM yang dihost.

    588-1Perubahan bintang dalam 7 hari terakhir
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    588Perubahan bintang dalam 7 hari terakhir
  • MeViS@henghuiding

    [ICCV 2023 & TPAMI 2025] MeViS: Tolok Ukur Skala Besar untuk Segmentasi Video dengan Ekspresi Gerakan

    525+0Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik