multimodal-large-language-models
Repositori open source terpantau bertanda multimodal-large-language-models, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan multimodal-large-language-models di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda multimodal-large-language-models.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
Kemajuan terbaru dalam Multimodal Large Language Models
★ 17.996+8Perubahan bintang dalam 7 hari terakhir - #2
Mobile-Agent: Keluarga Agen GUI yang Kuat
★ 9.157+19Perubahan bintang dalam 7 hari terakhir - #3
StarVector adalah model dasar untuk pembuatan SVG yang mengubah vektorisasi menjadi tugas pembuatan kode. Menggunakan arsitektur pemodelan visi-bahasa, StarVector memproses input visual dan tekstual untuk menghasilkan kode SVG berkualitas tinggi dengan presisi luar biasa.
★ 4.567+6Perubahan bintang dalam 7 hari terakhir - #4
LLaMA-Omni adalah model interaksi ucapan ujung-ke-ujung berlatensi rendah dan berkualitas tinggi yang dibangun di atas Llama-3.1-8B-Instruct, yang bertujuan untuk mencapai kemampuan ucapan setara GPT-4o.
★ 3.147+1Perubahan bintang dalam 7 hari terakhir - #5
Kerangka kerja penstrukturan video (analisis video) lintas platform berbasis model CV & mLLM.
★ 2.933+2Perubahan bintang dalam 7 hari terakhir - #6
✨✨[NeurIPS 2025] VITA-1.5: Menuju Interaksi Visi dan Suara Real-Time setingkat GPT-4o.
★ 2.532-2Perubahan bintang dalam 7 hari terakhir - #7
mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen
★ 2.411+0Perubahan bintang dalam 7 hari terakhir - #8
Cambrian-1 adalah keluarga LLM multimodal dengan desain yang berpusat pada visi.
★ 2.014+1Perubahan bintang dalam 7 hari terakhir - #9
[ICML 2024] Menguasai Difusi Teks-ke-Gambar: Pembuatan Keterangan Ulang, Perencanaan, dan Pembuatan dengan LLM Multimodal (RPG)
★ 1.844+2Perubahan bintang dalam 7 hari terakhir - #10
Seed1.5-VL, model dasar visi-bahasa yang dirancang untuk memajukan pemahaman dan penalaran multimodal serbaguna, mencapai performa terbaik pada 38 dari 60 tolok ukur publik.
★ 1.586+0Perubahan bintang dalam 7 hari terakhir - #11
Arsitektur Multimodal Large Language Model (MLLM) baru, yang dirancang untuk menyelaraskan embedding visual dan tekstual secara struktural.
★ 1.514+2Perubahan bintang dalam 7 hari terakhir - #12
Kumpulan Model Multimodal Terpadu yang Hebat
★ 1.314+2Perubahan bintang dalam 7 hari terakhir - #13
Digital human interaktif suara secara real-time, dengan tampilan dan suara yang dapat disesuaikan, mendukung kloning suara, serta latensi dialog serendah 3 detik.
★ 1.303+0Perubahan bintang dalam 7 hari terakhir - #14
Implementasi PyTorch dari Audio Flamingo: Seri Model Bahasa Pemahaman Audio Tingkat Lanjut
★ 1.184+2Perubahan bintang dalam 7 hari terakhir - #15
Kerangka kerja untuk Pemrosesan Ucapan, Bahasa, Audio, dan Musik dengan Large Language Model.
★ 1.058+1Perubahan bintang dalam 7 hari terakhir - #16★ 1.053+0Perubahan bintang dalam 7 hari terakhir
- #17
Penalaran Multimodal Chain-of-Thought: Survei Komprehensif
★ 1.025+1Perubahan bintang dalam 7 hari terakhir - #18
Kumpulan sumber daya tentang penerapan pembelajaran multi-modal dalam pencitraan medis.
★ 975+1Perubahan bintang dalam 7 hari terakhir - #19★ 888+0Perubahan bintang dalam 7 hari terakhir
- #20
✨✨[CVPR 2025] Video-MME: Benchmark Evaluasi Komprehensif Pertama untuk LLM Multimodal dalam Analisis Video
★ 791+3Perubahan bintang dalam 7 hari terakhir - #21
LLaVA-Plus: Asisten Bahasa dan Visi Besar yang Dapat Dipasang dan Belajar Menggunakan Keterampilan
★ 770+0Perubahan bintang dalam 7 hari terakhir - #22
[CVPR 2024] MovieChat: Dari Token Padat ke Memori Jarang untuk Pemahaman Video Panjang
★ 706+0Perubahan bintang dalam 7 hari terakhir - #23★ 702+0Perubahan bintang dalam 7 hari terakhir
- #24
Proyek Pribadi: MPP-Qwen14B & MPP-Qwen-Next (Multimodal Pipeline Parallel berdasarkan Qwen-LM). Mendukung [video/gambar/multi-gambar] {sft/percakapan}. Jangan biarkan kemiskinan membatasi imajinasi Anda! Latih MLLM mirip pelatihan LLaVA 8B/14B Anda sendiri di RTX3090/4090 24GB.
★ 686+0Perubahan bintang dalam 7 hari terakhir - #25★ 677+1Perubahan bintang dalam 7 hari terakhir
- #26
Woodpecker: Koreksi halusinasi untuk Multimodal Large Language Models
★ 650+1Perubahan bintang dalam 7 hari terakhir - #27
(Diterima oleh IJCV) Liquid: Model Bahasa adalah Generator Multimodal yang Skalabel dan Terpadu
★ 640+0Perubahan bintang dalam 7 hari terakhir - #28
Makalah NeurIPS 2024: Vision LLM tingkat piksel terpadu untuk pemahaman, pembuatan, segmentasi, dan pengeditan
★ 577+1Perubahan bintang dalam 7 hari terakhir - #29
LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.
★ 577+0Perubahan bintang dalam 7 hari terakhir - #30
Cambrian-S: Menuju Spatial Supersensing dalam Video
★ 568+1Perubahan bintang dalam 7 hari terakhir