vision-language-model
Repositori open source terpantau bertanda vision-language-model, diurutkan berdasarkan bintang.
- #31★ 1.309+0Perubahan bintang dalam 7 hari terakhir
- #32
Framework Terbuka Penuh untuk Pelatihan Multimodal yang Didemokratisasi
★ 1.195+1Perubahan bintang dalam 7 hari terakhir - #33
Seri ini akan membawa Anda dalam perjalanan dari dasar-dasar NLP dan Computer Vision hingga Vision-Language Models terkini.
★ 1.179+0Perubahan bintang dalam 7 hari terakhir - #34★ 1.153-25Perubahan bintang dalam 7 hari terakhir
- #35
Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.
★ 1.136+18Perubahan bintang dalam 7 hari terakhir - #36★ 979-1Perubahan bintang dalam 7 hari terakhir
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), model pertama yang mampu menghasilkan respons bahasa alami yang terintegrasi secara mulus dengan mask segmentasi objek.
★ 967+0Perubahan bintang dalam 7 hari terakhir - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: Representasi Visual Terpadu Memberdayakan Large Language Models dengan Pemahaman Gambar dan Video
★ 941+0Perubahan bintang dalam 7 hari terakhir - #39
Tentang Repositori ini adalah koleksi pilihan dari makalah CVPR 2025 yang paling menarik dan berpengaruh. 🔥 [Paper + Code + Demo]
★ 895+1Perubahan bintang dalam 7 hari terakhir - #40★ 874+0Perubahan bintang dalam 7 hari terakhir
- #41
Toolkit visual yang lebih canggih untuk model teks: instalasi satu baris, pengenalan gambar langsung, tanya jawab multi-gambar, dan pemulihan UI dari tangkapan layar. Integrasi DeepSeek untuk toolkit visi agen: tanya jawab gambar, OCR tangkapan layar panjang, pemulihan UI, grounding, perbandingan piksel, Artifacts, dan Web UI.
★ 856+15Perubahan bintang dalam 7 hari terakhir - #42
VoxPoser: Peta Nilai 3D yang Dapat Disusun untuk Manipulasi Robotik dengan Model Bahasa
★ 834+1Perubahan bintang dalam 7 hari terakhir - #43★ 833+4Perubahan bintang dalam 7 hari terakhir
- #44★ 832+0Perubahan bintang dalam 7 hari terakhir
- #45
Daftar kurasi makalah Visi 3D yang berkaitan dengan domain Robotika di era model besar seperti LLM/VLM, terinspirasi dari awesome-computer-vision, mencakup makalah, kode, dan situs web terkait
★ 821+1Perubahan bintang dalam 7 hari terakhir - #46
Daftar pilihan metode pembelajaran prompt/adapter yang luar biasa untuk model vision-language seperti CLIP.
★ 797+1Perubahan bintang dalam 7 hari terakhir - #47
[ICLR 2026] Implementasi resmi dari "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
★ 725+4Perubahan bintang dalam 7 hari terakhir - #48★ 677+0Perubahan bintang dalam 7 hari terakhir
- #49★ 642+0Perubahan bintang dalam 7 hari terakhir
- #50
🎉 PILOT: Toolbox pembelajaran berkelanjutan berbasis model pra-latih.
★ 600+3Perubahan bintang dalam 7 hari terakhir - #51
Mengevaluasi model text-to-image/video/3D dengan VQAScore
★ 600+0Perubahan bintang dalam 7 hari terakhir - #52
[CVPR 2026] SpatialVID: Dataset Video Skala Besar dengan Anotasi Spasial
★ 600+1Perubahan bintang dalam 7 hari terakhir - #53★ 596—Perubahan bintang dalam 7 hari terakhir
- #54
[ECCV2024] Grounded Multimodal Large Language Model dengan Tokenisasi Visual Terlokalisasi
★ 586+0Perubahan bintang dalam 7 hari terakhir - #55
LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.
★ 577+0Perubahan bintang dalam 7 hari terakhir - #56
Cambrian-S: Menuju Spatial Supersensing dalam Video
★ 567+0Perubahan bintang dalam 7 hari terakhir - #57
Chatbot Arena bertemu dengan multimodalitas! Multi-Modality Arena memungkinkan Anda membandingkan model visi-bahasa secara berdampingan sambil menyediakan gambar sebagai masukan. Mendukung MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2, dan banyak lagi!
★ 566+0Perubahan bintang dalam 7 hari terakhir - #58
Flame adalah sistem AI multimodal sumber terbuka yang dirancang untuk menerjemahkan maket desain UI ke dalam kode React berkualitas tinggi. Sistem ini memanfaatkan pemodelan bahasa-visi, sintesis data otomatis, dan alur kerja pelatihan terstruktur untuk menjembatani kesenjangan antara desain dan pengembangan front-end.
★ 562+0Perubahan bintang dalam 7 hari terakhir - #59
Kode dan panduan implementasi untuk makalah ✨Counting Anything. Halaman Proyek: https://mengqi-lei.github.io/count-anything-projectpage/
★ 538+1Perubahan bintang dalam 7 hari terakhir