large-multimodal-models
Repositori open source terpantau bertanda large-multimodal-models, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan large-multimodal-models di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda large-multimodal-models.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
✨✨[NeurIPS 2025] VITA-1.5: Menuju Interaksi Visi dan Suara Real-Time setingkat GPT-4o.
★ 2.532-2Perubahan bintang dalam 7 hari terakhir - #2
[ICCV 2025] Implementasi untuk Describe Anything: Keterangan Gambar dan Video Lokal yang Detail
★ 1.517+3Perubahan bintang dalam 7 hari terakhir - #3
Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.
★ 1.310+4Perubahan bintang dalam 7 hari terakhir - #4
[NeurIPS 2024] Implementasi resmi "ShareGPT4Video: Meningkatkan Pemahaman dan Pembuatan Video dengan Keterangan yang Lebih Baik"
★ 1.094+0Perubahan bintang dalam 7 hari terakhir - #5
Kerangka kerja untuk Model Multimodal Besar berskala kecil
★ 1.004+1Perubahan bintang dalam 7 hari terakhir - #6
Kumpulan sumber daya tentang penerapan pembelajaran multi-modal dalam pencitraan medis.
★ 975+1Perubahan bintang dalam 7 hari terakhir - #7
LLaVA-Plus: Asisten Bahasa dan Visi Besar yang Dapat Dipasang dan Belajar Menggunakan Keterampilan
★ 770+0Perubahan bintang dalam 7 hari terakhir - #8
Repositori ini berisi kode evaluasi untuk makalah "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 593+1Perubahan bintang dalam 7 hari terakhir - #9
LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.
★ 577+0Perubahan bintang dalam 7 hari terakhir