video-understanding
Các kho mã nguồn mở đang theo dõi được gắn thẻ video-understanding, sắp xếp theo số sao.
Chủ đề liên quan
Những chủ đề thường xuất hiện cùng video-understanding trên cùng một kho mã.
Mới nổi gần đây
Các kho mã tạo trong 90 ngày qua và được gắn thẻ video-understanding.
- #1★ 5.150+3Thay đổi số sao trong 7 ngày qua
- #2
Bộ công cụ đánh giá đa phương thức toàn diện cho các tác vụ Văn bản, Hình ảnh, Video và Âm thanh
★ 4.390+7Thay đổi số sao trong 7 ngày qua - #3
[CVPR2024 Highlight][VideoChatGPT] ChatGPT với tính năng hiểu video! Và nhiều LM được hỗ trợ khác như miniGPT4, StableLM và MOSS.
★ 3.347+0Thay đổi số sao trong 7 ngày qua - #4
GLM-4.6V/4.5V/4.1V-Thinking: Hướng tới suy luận đa phương thức linh hoạt với học tăng cường có thể mở rộng
★ 2.379+2Thay đổi số sao trong 7 ngày qua - #5
[ECCV2024] Video Foundation Models & Data dành cho thấu hiểu đa phương thức
★ 2.374+5Thay đổi số sao trong 7 ngày qua - #6
[ICCV 2019] TSM: Mô-đun dịch chuyển thời gian để hiểu video hiệu quả
★ 2.222+1Thay đổi số sao trong 7 ngày qua - #7
NVIDIA AI Blueprint cho tìm kiếm và tóm tắt video (VSS) là một kiến trúc tham chiếu tăng tốc bằng GPU để xây dựng các tác nhân phân tích video với cảnh báo được xác thực theo thời gian thực, hỏi đáp trực quan và báo cáo tự động. VSS Blueprint sử dụng các mô hình ngôn ngữ tầm nhìn (VLMs) như NVIDIA Cosmos, LLMs như NVIDIA Nemotron, RAG và NVIDIA NIMs.
★ 1.840+10Thay đổi số sao trong 7 ngày qua - #8
"VideoAgent: Khung tác nhân tất cả trong một để hiểu, chỉnh sửa và làm lại video"
★ 1.834+65Thay đổi số sao trong 7 ngày qua - #9
Bộ công cụ hiểu video tuyệt vời dựa trên PaddlePaddle. Nó hỗ trợ các công cụ chú thích dữ liệu video, mô hình nhận dạng hành động nhẹ dựa trên RGB và khung xương, các ứng dụng thực tế cho việc gắn thẻ video và phát hiện hành động thể thao.
★ 1.702+0Thay đổi số sao trong 7 ngày qua - #10★ 1.521+3Thay đổi số sao trong 7 ngày qua
- #11
Một mô hình đa phương thức hợp nhất gốc 3B tham số hoạt động (3B-active-parameter) dành cho việc hiểu, tạo và chỉnh sửa hình ảnh cũng như video.
★ 1.334+3Thay đổi số sao trong 7 ngày qua - #12
awesome grounding: Danh sách tuyển chọn các bài báo nghiên cứu về visual grounding.
★ 1.127+0Thay đổi số sao trong 7 ngày qua - #13
:fire: :fire: :fire: Danh sách bài báo về một số công trình Thị giác Máy tính (CV) gần đây
★ 973+1Thay đổi số sao trong 7 ngày qua - #14
[CVPR 2024 Highlight🔥] Chat-UniVi: Biểu diễn hình ảnh hợp nhất giúp các mô hình ngôn ngữ lớn có khả năng hiểu hình ảnh và video
★ 941+0Thay đổi số sao trong 7 ngày qua - #15
[CVPR 2023] VideoMAE V2: Mở rộng quy mô Video Masked Autoencoders với Dual Masking.
★ 819+3Thay đổi số sao trong 7 ngày qua - #16
Mã nguồn chính thức cho mô hình Goldfish để hiểu video dài và MiniGPT4-video để hiểu video ngắn
★ 639+1Thay đổi số sao trong 7 ngày qua - #17★ 596—Thay đổi số sao trong 7 ngày qua
- #18
Các node ComfyUI dành cho mô hình ngôn ngữ - thị giác: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Cùng với khả năng phát hiện từ vựng mở, phân đoạn SAM2/SAM3, suy luận thời gian trong video, GGUF qua llama.cpp và các API LLM/VLM được lưu trữ.
★ 588-1Thay đổi số sao trong 7 ngày qua - #19
[ICCV 2023 & TPAMI 2025] MeViS: Điểm chuẩn quy mô lớn cho phân đoạn video với các biểu đạt chuyển động
★ 525+0Thay đổi số sao trong 7 ngày qua