vision-language
Repositori open source terpantau bertanda vision-language, diurutkan berdasarkan bintang.
Topik terkait
Topik yang sering muncul berdampingan dengan vision-language di repositori yang sama.
Yang sedang naik
Repositori yang dibuat dalam 90 hari terakhir dan bertanda vision-language.
Tidak ada repositori baru bertanda topik ini dalam 90 hari terakhir.
- #1
[ECCV 2024] Implementasi resmi dari makalah "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection"
★ 10.522+13Perubahan bintang dalam 7 hari terakhir - #2
Versi bahasa Mandarin dari CLIP yang mencapai pengambilan lintas modal dan pembuatan representasi dalam bahasa Mandarin.
★ 6.001+7Perubahan bintang dalam 7 hari terakhir - #3
Repositori resmi OFA (ICML 2022). Makalah: OFA: Menyatukan Arsitektur, Tugas, dan Modalitas Melalui Kerangka Kerja Pembelajaran Sequence-to-Sequence yang Sederhana
★ 2.557+0Perubahan bintang dalam 7 hari terakhir - #4
Implementasi open-source untuk fine-tuning seri Qwen-VL dari Alibaba Cloud.
★ 1.961+1Perubahan bintang dalam 7 hari terakhir - #5
Kumpulan ide dan algoritma orisinal serta inovatif menuju Advanced Literate Machinery. Proyek ini dikelola oleh Tim OCR di Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1.835-1Perubahan bintang dalam 7 hari terakhir - #6
[ACL 2024 🔥] Video-ChatGPT adalah model percakapan video yang mampu menghasilkan percakapan bermakna tentang video. Model ini menggabungkan kemampuan LLM dengan visual encoder praterkait yang diadaptasi untuk representasi video spatiotemporal. Kami juga memperkenalkan 'Quantitative Evaluation Benchmarking' yang ketat untuk model percakapan berbasis video.
★ 1.506+0Perubahan bintang dalam 7 hari terakhir - #7
Ringkasan LLM Bahasa Jepang - Ikhtisar LLM Bahasa Jepang
★ 1.428+1Perubahan bintang dalam 7 hari terakhir - #8★ 1.340+0Perubahan bintang dalam 7 hari terakhir
- #9
Model representasi umum lintas modalitas visi, audio, dan bahasa. Makalah: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Perubahan bintang dalam 7 hari terakhir - #10
Kerangka kerja untuk Model Multimodal Besar berskala kecil
★ 1.004-1Perubahan bintang dalam 7 hari terakhir - #11
CALVIN - Tolok ukur untuk Pembelajaran Kebijakan Berbasis Bahasa untuk Tugas Manipulasi Robot Berdurasi Panjang
★ 981+5Perubahan bintang dalam 7 hari terakhir - #12★ 874-1Perubahan bintang dalam 7 hari terakhir
- #13
Ini adalah implementasi pihak ketiga dari makalah Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 845+0Perubahan bintang dalam 7 hari terakhir - #14
🔥🔥 LLaVA++: Memperluas LLaVA dengan Phi-3 dan LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842-1Perubahan bintang dalam 7 hari terakhir - #15
[ICLR 2024] Mengontrol Vision-Language Models untuk Restorasi Gambar Universal. Peringkat ke-5 dalam NTIRE 2024 Restore Any Image Model in the Wild Challenge.
★ 817+0Perubahan bintang dalam 7 hari terakhir - #16★ 642+0Perubahan bintang dalam 7 hari terakhir
- #17
Repositori resmi untuk makalah "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)
★ 588+0Perubahan bintang dalam 7 hari terakhir