mllm
Repositori open source terpantau bertanda mllm, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan mllm di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda mllm.
- #1
Visi sebagai Generasi Multimodal Terpadu
★ 658
- #1★ 22.196+3Perubahan bintang dalam 7 hari terakhir
- #2★ 12.202+20Perubahan bintang dalam 7 hari terakhir
- #3
Mobile-Agent: Keluarga Agen GUI yang Kuat
★ 9.148+32Perubahan bintang dalam 7 hari terakhir - #4
[NeurIPS 2025] SpatialLM: Melatih Large Language Models untuk Pemodelan Dalam Ruangan Terstruktur
★ 4.723+11Perubahan bintang dalam 7 hari terakhir - #5
[CVPR'25] Implementasi Resmi untuk Makalah - MagicQuill: Sistem Pengeditan Gambar Interaktif yang Cerdas
★ 3.689+0Perubahan bintang dalam 7 hari terakhir - #6
Dari Chain-of-Thought prompting hingga OpenAI o1 dan DeepSeek-R1 🍓
★ 3.678+5Perubahan bintang dalam 7 hari terakhir - #7
Kode dan model untuk makalah ICML 2024, NExT-GPT: Large Language Model Multimodal Any-to-Any
★ 3.636-1Perubahan bintang dalam 7 hari terakhir - #8★ 3.479+50Perubahan bintang dalam 7 hari terakhir
- #9
InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang
★ 2.926+1Perubahan bintang dalam 7 hari terakhir - #10
mPLUG-DocOwl: Model Bahasa Besar Multimodal Modular untuk Pemahaman Dokumen
★ 2.411+2Perubahan bintang dalam 7 hari terakhir - #11
Cambrian-1 adalah keluarga LLM multimodal dengan desain yang berpusat pada visi.
★ 2.014+0Perubahan bintang dalam 7 hari terakhir - #12
🚀🚀🚀 Kumpulan proyek seri deteksi objek YOLO publik yang luar biasa dan dataset deteksi objek terkait.
★ 1.785+2Perubahan bintang dalam 7 hari terakhir - #13
Repo Resmi untuk Basis Kode Pixel-LLM: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (solusi ke-1 untuk LSVOS)
★ 1.666+4Perubahan bintang dalam 7 hari terakhir - #14★ 1.563+4Perubahan bintang dalam 7 hari terakhir
- #15
Katalog visual pilihan dari 155+ arsitektur vision-language model (VLM/MLLM): makalah, diagram, resep pelatihan, dataset, dan lini masa rilis untuk agen AI multimodal.
★ 1.308+2Perubahan bintang dalam 7 hari terakhir - #16
Framework Terbuka Penuh untuk Pelatihan Multimodal yang Didemokratisasi
★ 1.194+6Perubahan bintang dalam 7 hari terakhir - #17★ 1.053+1Perubahan bintang dalam 7 hari terakhir
- #18★ 951+1Perubahan bintang dalam 7 hari terakhir
- #19★ 888+4Perubahan bintang dalam 7 hari terakhir
- #20
[NeurIPS' 2025] JarvisArt: Membebaskan kreativitas artistik manusia melalui agen retouching foto cerdas
★ 861+3Perubahan bintang dalam 7 hari terakhir - #21
[CVPR2024] Kode untuk "Osprey: Pixel Understanding with Visual Instruction Tuning"
★ 843+0Perubahan bintang dalam 7 hari terakhir - #22
[Sorotan NeurIPS 2025] Implementasi resmi untuk "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving"
★ 822+1Perubahan bintang dalam 7 hari terakhir - #23
[NeurIPS 2025] 4KAgent: Agen Super-Resolusi 4K untuk gambar apa pun. Agen visi komputer cerdas yang dapat memulihkan gambar apa pun menjadi 4K yang sempurna.
★ 819+1Perubahan bintang dalam 7 hari terakhir - #24
🚀🚀🚀Kumpulan beberapa proyek publik hebat tentang Large Language Model (LLM), Vision Language Model (VLM), Vision Language Action (VLA), AI Generated Content (AIGC), serta Dataset dan Aplikasi terkait.
★ 814+0Perubahan bintang dalam 7 hari terakhir - #25
Ini adalah repositori untuk mendaftarkan makalah tentang pembuatan dan aplikasi grafik adegan.
★ 720+5Perubahan bintang dalam 7 hari terakhir - #26
Proyek Pribadi: MPP-Qwen14B & MPP-Qwen-Next (Multimodal Pipeline Parallel berdasarkan Qwen-LM). Mendukung [video/gambar/multi-gambar] {sft/percakapan}. Jangan biarkan kemiskinan membatasi imajinasi Anda! Latih MLLM mirip pelatihan LLaVA 8B/14B Anda sendiri di RTX3090/4090 24GB.
★ 686+2Perubahan bintang dalam 7 hari terakhir - #27
Visi sebagai Generasi Multimodal Terpadu
★ 658+12Perubahan bintang dalam 7 hari terakhir - #28
Woodpecker: Koreksi halusinasi untuk Multimodal Large Language Models
★ 649+1Perubahan bintang dalam 7 hari terakhir - #29
[ICLR 2025] FakeShield: Deteksi dan lokalisasi pemalsuan gambar yang dapat dijelaskan melalui Multi-modal Large Language Models.
★ 621+1Perubahan bintang dalam 7 hari terakhir - #30
Emotion-LLaMA: Pengenalan dan Penalaran Emosi Multimodal dengan Penyetelan Instruksi
★ 616+1Perubahan bintang dalam 7 hari terakhir