Lompat ke konten utama
buildradar
Sign in
Topik · vision-language-model

vision-language-model

Repositori open source terpantau bertanda vision-language-model, diurutkan berdasarkan bintang.

59 repositori
  • prismer@NVlabs

    Implementasi dari "Prismer: A Vision-Language Model with Multi-Task Experts".

    1.309+0Perubahan bintang dalam 7 hari terakhir
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework Terbuka Penuh untuk Pelatihan Multimodal yang Didemokratisasi

    1.195+1Perubahan bintang dalam 7 hari terakhir
  • vlms-zero-to-hero@SkalskiP

    Seri ini akan membawa Anda dalam perjalanan dari dasar-dasar NLP dan Computer Vision hingga Vision-Language Models terkini.

    1.179+0Perubahan bintang dalam 7 hari terakhir
  • doc7@magicrew

    Ubah dokumen menjadi Markdown siap-AI dengan pemahaman visual

    1.153-25Perubahan bintang dalam 7 hari terakhir
  • Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.

    1.136+18Perubahan bintang dalam 7 hari terakhir
  • VisRAG@OpenBMB

    RAG tanpa parsing yang didukung oleh VLM.

    979-1Perubahan bintang dalam 7 hari terakhir
  • groundingLMM@mbzuai-oryx

    [CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), model pertama yang mampu menghasilkan respons bahasa alami yang terintegrasi secara mulus dengan mask segmentasi objek.

    967+0Perubahan bintang dalam 7 hari terakhir
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight🔥] Chat-UniVi: Representasi Visual Terpadu Memberdayakan Large Language Models dengan Pemahaman Gambar dan Video

    941+0Perubahan bintang dalam 7 hari terakhir
  • Tentang Repositori ini adalah koleksi pilihan dari makalah CVPR 2025 yang paling menarik dan berpengaruh. 🔥 [Paper + Code + Demo]

    895+1Perubahan bintang dalam 7 hari terakhir
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Model CLIP yang berfokus pada area yang Anda inginkan.

    874+0Perubahan bintang dalam 7 hari terakhir
  • dsh-vision-toolkit@Anionex

    Toolkit visual yang lebih canggih untuk model teks: instalasi satu baris, pengenalan gambar langsung, tanya jawab multi-gambar, dan pemulihan UI dari tangkapan layar. Integrasi DeepSeek untuk toolkit visi agen: tanya jawab gambar, OCR tangkapan layar panjang, pemulihan UI, grounding, perbandingan piksel, Artifacts, dan Web UI.

    856+15Perubahan bintang dalam 7 hari terakhir
  • VoxPoser@huangwl18

    VoxPoser: Peta Nilai 3D yang Dapat Disusun untuk Manipulasi Robotik dengan Model Bahasa

    834+1Perubahan bintang dalam 7 hari terakhir
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA: Pondasi Terbuka untuk Agen Penggunaan Komputer

    833+4Perubahan bintang dalam 7 hari terakhir
  • MINT-1T@mlfoundations

    🍃 MINT-1T: Kumpulan data multimodal terselip satu triliun token.

    832+0Perubahan bintang dalam 7 hari terakhir
  • Daftar kurasi makalah Visi 3D yang berkaitan dengan domain Robotika di era model besar seperti LLM/VLM, terinspirasi dari awesome-computer-vision, mencakup makalah, kode, dan situs web terkait

    821+1Perubahan bintang dalam 7 hari terakhir
  • Daftar pilihan metode pembelajaran prompt/adapter yang luar biasa untuk model vision-language seperti CLIP.

    797+1Perubahan bintang dalam 7 hari terakhir
  • X-VLA@2toinf

    [ICLR 2026] Implementasi resmi dari "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

    725+4Perubahan bintang dalam 7 hari terakhir
  • OmniVinci@NVlabs

    OmniVinci adalah LLM omni-modal untuk pemahaman bersama visi, audio, dan bahasa.

    677+0Perubahan bintang dalam 7 hari terakhir
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Perubahan bintang dalam 7 hari terakhir
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT: Toolbox pembelajaran berkelanjutan berbasis model pra-latih.

    600+3Perubahan bintang dalam 7 hari terakhir
  • t2v_metrics@linzhiqiu

    Mengevaluasi model text-to-image/video/3D dengan VQAScore

    600+0Perubahan bintang dalam 7 hari terakhir
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID: Dataset Video Skala Besar dengan Anotasi Spasial

    600+1Perubahan bintang dalam 7 hari terakhir
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Perubahan bintang dalam 7 hari terakhir
  • Groma@FoundationVision

    [ECCV2024] Grounded Multimodal Large Language Model dengan Tokenisasi Visual Terlokalisasi

    586+0Perubahan bintang dalam 7 hari terakhir
  • LLaVA-Mini@ictnlp

    LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.

    577+0Perubahan bintang dalam 7 hari terakhir
  • cambrian-s@cambrian-mllm

    Cambrian-S: Menuju Spatial Supersensing dalam Video

    567+0Perubahan bintang dalam 7 hari terakhir
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena bertemu dengan multimodalitas! Multi-Modality Arena memungkinkan Anda membandingkan model visi-bahasa secara berdampingan sambil menyediakan gambar sebagai masukan. Mendukung MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2, dan banyak lagi!

    566+0Perubahan bintang dalam 7 hari terakhir
  • Flame-Code-VLM@Flame-Code-VLM

    Flame adalah sistem AI multimodal sumber terbuka yang dirancang untuk menerjemahkan maket desain UI ke dalam kode React berkualitas tinggi. Sistem ini memanfaatkan pemodelan bahasa-visi, sintesis data otomatis, dan alur kerja pelatihan terstruktur untuk menjembatani kesenjangan antara desain dan pengembangan front-end.

    562+0Perubahan bintang dalam 7 hari terakhir
  • count-anything@Mengqi-Lei

    Kode dan panduan implementasi untuk makalah ✨Counting Anything. Halaman Proyek: https://mengqi-lei.github.io/count-anything-projectpage/

    538+1Perubahan bintang dalam 7 hari terakhir
← Kembali ke topik