llava
Repositori open source terpantau bertanda llava, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan llava di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda llava.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) yang dibangun untuk mencapai kemampuan setingkat GPT-4V dan seterusnya.
★ 25.005+9Perubahan bintang dalam 7 hari terakhir - #2
SUPIR bertujuan untuk mengembangkan algoritma praktis untuk restorasi gambar fotorealistik di alam liar. Demo daring kami yang baru juga telah dirilis di suppixel.ai.
★ 5.649+9Perubahan bintang dalam 7 hari terakhir - #3
MLX-VLM adalah paket untuk inferensi dan fine-tuning Vision Language Models (VLM) di Mac menggunakan MLX.
★ 5.455+49Perubahan bintang dalam 7 hari terakhir - #4
Toolkit evaluasi open-source untuk large multi-modality models (LMMs), mendukung 220+ LMM, 80+ benchmark
★ 4.371+10Perubahan bintang dalam 7 hari terakhir - #5★ 3.836+0Perubahan bintang dalam 7 hari terakhir
- #6
Pustaka C#/.NET untuk menjalankan LLM (🦙LLaMA/LLaVA) di perangkat lokal Anda secara efisien.
★ 3.790+2Perubahan bintang dalam 7 hari terakhir - #7★ 3.511+50Perubahan bintang dalam 7 hari terakhir
- #8★ 2.666+0Perubahan bintang dalam 7 hari terakhir
- #9
[ACL 2024 🔥] Video-ChatGPT adalah model percakapan video yang mampu menghasilkan percakapan bermakna tentang video. Model ini menggabungkan kemampuan LLM dengan visual encoder praterkait yang diadaptasi untuk representasi video spatiotemporal. Kami juga memperkenalkan 'Quantitative Evaluation Benchmarking' yang ketat untuk model percakapan berbasis video.
★ 1.507+0Perubahan bintang dalam 7 hari terakhir - #10★ 1.348+1Perubahan bintang dalam 7 hari terakhir
- #11
AI Multimodal Berukuran Saku untuk pemahaman dan pembuatan konten lintas teks multibahasa, gambar, dan 🔜 video, hingga 5x lebih cepat dari OpenAI CLIP dan LLaVA 🖼️ & 🖋️
★ 1.247+3Perubahan bintang dalam 7 hari terakhir - #12
Framework Terbuka Penuh untuk Pelatihan Multimodal yang Didemokratisasi
★ 1.195+6Perubahan bintang dalam 7 hari terakhir - #13
Kerangka kerja untuk Model Multimodal Besar berskala kecil
★ 1.004-1Perubahan bintang dalam 7 hari terakhir - #14
🔥🔥 LLaVA++: Memperluas LLaVA dengan Phi-3 dan LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842-1Perubahan bintang dalam 7 hari terakhir - #15★ 794+0Perubahan bintang dalam 7 hari terakhir
- #16
Integrasi dan Eksplorasi Multimodal Paddle, mendukung tugas multimodal arus utama, termasuk model pra-pelatihan multimodal skala besar end-to-end dan kotak alat model difusi. Dilengkapi dengan kinerja tinggi dan fleksibilitas.
★ 724+0Perubahan bintang dalam 7 hari terakhir - #17
Koleksi Frontend dan survei makalah vision-language model serta repositori GitHub model. Pembaruan berkelanjutan.
★ 705+5Perubahan bintang dalam 7 hari terakhir - #18
👁️ + 💬 + 🎧 = 🤖 Daftar pilihan model fondasi dan multimodal teratas! [Makalah + Kode + Contoh + Tutorial]
★ 637+0Perubahan bintang dalam 7 hari terakhir - #19
Node ComfyUI untuk model vision-language: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Ditambah deteksi open-vocabulary, segmentasi SAM2/SAM3, penalaran temporal video, GGUF melalui llama.cpp, dan API LLM/VLM yang dihost.
★ 589+4Perubahan bintang dalam 7 hari terakhir - #20
LLaVA-Mini adalah model multimodal besar (LMM) terpadu yang dapat mendukung pemahaman gambar, gambar beresolusi tinggi, dan video secara efisien.
★ 577+0Perubahan bintang dalam 7 hari terakhir - #21
Asisten bertenaga AI untuk membantu tugas sehari-hari Anda, didukung oleh Llama 3, DeepSeek R1, dan banyak model lainnya di HuggingFace.
★ 530+0Perubahan bintang dalam 7 hari terakhir