vision-language-model
Repositori open source terpantau bertanda vision-language-model, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan vision-language-model di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda vision-language-model.
- #1★ 1.153
- #2
Toolkit visual dan skill yang dirancang untuk model teks murni agar bisa "melihat", mendukung pemahaman multi-gambar, tanya jawab gambar, restorasi UI frontend, otomatisasi GUI, dan integrasi opsional yang mulus dengan berbagai agen utama serta pengenalan gambar tempel secara langsung.
★ 1.136 - #3
Toolkit visual yang lebih canggih untuk model teks: instalasi satu baris, pengenalan gambar langsung, tanya jawab multi-gambar, dan pemulihan UI dari tangkapan layar. Integrasi DeepSeek untuk toolkit visi agen: tanya jawab gambar, OCR tangkapan layar panjang, pemulihan UI, grounding, perbandingan piksel, Artifacts, dan Web UI.
★ 859 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) yang dibangun untuk mencapai kemampuan setingkat GPT-4V dan seterusnya.
★ 25.014+9Perubahan bintang dalam 7 hari terakhir - #2
X-AnyLabeling: Aplikasi desktop lintas platform yang ringan, efisien, dan terpadu untuk menganotasi data teks, gambar, video, dan multimodal, menggabungkan alat bawaan yang serbaguna dengan model AI mutakhir serta ekspor multi-format yang fleksibel.
★ 10.313+59Perubahan bintang dalam 7 hari terakhir - #3
[CVPR 2024 Oral] Keluarga InternVL: Alternatif Open-Source Perintis untuk GPT-4o. Model dialog multimodal open-source dengan performa mendekati GPT-4o
★ 10.150+3Perubahan bintang dalam 7 hari terakhir - #4
👀 Latih VLM dengan 65 juta parameter dari nol hanya dalam 2 jam!
★ 8.535+40Perubahan bintang dalam 7 hari terakhir - #5
Repositori resmi Qwen-VL (通义千问-VL), model bahasa visi besar chat & pra-terlatih yang diusulkan oleh Alibaba Cloud.
★ 6.727+1Perubahan bintang dalam 7 hari terakhir - #6
MineContext adalah mitra AI proaktif yang sadar konteks (Context-Engineering+ChatGPT Pulse)
★ 5.497+1Perubahan bintang dalam 7 hari terakhir - #7
MLX-VLM adalah paket untuk inferensi dan fine-tuning Vision Language Models (VLM) di Mac menggunakan MLX.
★ 5.462+25Perubahan bintang dalam 7 hari terakhir - #8
Align Anything: Melatih Model Semua Modalitas dengan Umpan Balik
★ 4.671+3Perubahan bintang dalam 7 hari terakhir - #9
Toolkit evaluasi multimodal serbaguna untuk tugas teks, gambar, video, dan audio.
★ 4.390+7Perubahan bintang dalam 7 hari terakhir - #10
DeepSeek-VL: Menuju Pemahaman Visi-Bahasa Dunia Nyata
★ 4.177+2Perubahan bintang dalam 7 hari terakhir - #11
Repositori resmi MiniMax-Text-01 dan MiniMax-VL-01, large-language-model & vision-language-model berbasis Linear Attention
★ 3.467+0Perubahan bintang dalam 7 hari terakhir - #12
Repositori resmi untuk "Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models"
★ 3.327+0Perubahan bintang dalam 7 hari terakhir - #13
Koleksi model vision-language yang luar biasa untuk tugas-tugas visi komputer
★ 3.126+0Perubahan bintang dalam 7 hari terakhir - #14
Pisau lipat Swiss untuk AI offline. Mengobrol, melihat, berbicara, dan menghasilkan gambar di ponsel atau Mac Anda — mendukung LLM GGUF, visi, pengenalan suara Whisper, Stable Diffusion, pemanggilan alat, dan server jaringan lokal. Berjalan di CPU, GPU, atau NPU Anda. Tanpa akun, tanpa kunci API, data tidak keluar dari perangkat Anda.
★ 3.038+17Perubahan bintang dalam 7 hari terakhir - #15
InternLM-XComposer2.5-OmniLive: Sistem multimodal komprehensif untuk interaksi video dan audio streaming jangka panjang
★ 2.925-1Perubahan bintang dalam 7 hari terakhir - #16
Kode yang digunakan untuk melatih dan menjalankan inferensi dengan model ColVision, contohnya ColPali, ColQwen2, dan ColSmol.
★ 2.809+7Perubahan bintang dalam 7 hari terakhir - #17
Kerangka kerja Cradle adalah upaya pertama dalam General Computer Control (GCC). Cradle mendukung agen untuk menguasai tugas komputer apa pun dengan mengaktifkan kemampuan penalaran yang kuat, peningkatan mandiri, dan kurasi keterampilan, di lingkungan umum standar dengan persyaratan minimal.
★ 2.578+2Perubahan bintang dalam 7 hari terakhir - #18
Implementasi open-source untuk fine-tuning seri Qwen-VL dari Alibaba Cloud.
★ 1.961+1Perubahan bintang dalam 7 hari terakhir - #19
[CVPR 2025] Model Vision-Language-Action end-to-end open-source untuk GUI Agent & Computer Use.
★ 1.896+2Perubahan bintang dalam 7 hari terakhir - #20
Daftar kurasi sumber daya LLM/VLM/VLA/World Model yang luar biasa untuk Autonomous Driving (LLM4AD) (diperbarui secara berkala).
★ 1.890-2Perubahan bintang dalam 7 hari terakhir - #21
NVIDIA AI Blueprint untuk pencarian dan peringkasan video (VSS) adalah arsitektur referensi yang dipercepat GPU untuk membangun agen analitik video dengan peringatan terverifikasi waktu nyata, tanya jawab visual, dan pelaporan otomatis. Blueprint VSS menggunakan model bahasa visi (VLM) seperti NVIDIA Cosmos, LLM seperti NVIDIA Nemotron, RAG, dan NVIDIA NIM.
★ 1.840+10Perubahan bintang dalam 7 hari terakhir - #22
Kumpulan ide dan algoritma orisinal serta inovatif menuju Advanced Literate Machinery. Proyek ini dikelola oleh Tim OCR di Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835+1Perubahan bintang dalam 7 hari terakhir - #23
Seed1.5-VL, model dasar visi-bahasa yang dirancang untuk memajukan pemahaman dan penalaran multimodal serbaguna, mencapai performa terbaik pada 38 dari 60 tolok ukur publik.
★ 1.586+0Perubahan bintang dalam 7 hari terakhir - #24
Server inferensi LLM yang kompatibel dengan OpenAI dan Anthropic berkinerja tinggi untuk Apple Silicon. Dilengkapi MLX asli, continuous batching, model multimodal, pemanggilan alat MCP, dan dukungan Claude Code.
★ 1.557+6Perubahan bintang dalam 7 hari terakhir - #25★ 1.524+0Perubahan bintang dalam 7 hari terakhir
- #26
[ICCV 2025] Implementasi untuk Describe Anything: Keterangan Gambar dan Video Lokal yang Detail
★ 1.517+3Perubahan bintang dalam 7 hari terakhir - #27
Arsitektur Multimodal Large Language Model (MLLM) baru, yang dirancang untuk menyelaraskan embedding visual dan tekstual secara struktural.
★ 1.514+2Perubahan bintang dalam 7 hari terakhir - #28
Ringkasan LLM Bahasa Jepang - Ikhtisar LLM Bahasa Jepang
★ 1.428+1Perubahan bintang dalam 7 hari terakhir - #29
Fine-tune LLM di Mac Anda dengan Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding, dan fine-tuning OCR — secara native di MLX. API yang kompatibel dengan Unsloth.
★ 1.398+8Perubahan bintang dalam 7 hari terakhir - #30
Kumpulan Model Multimodal Terpadu yang Hebat
★ 1.314+1Perubahan bintang dalam 7 hari terakhir