vision-language
Dépôts open source suivis étiquetés vision-language, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de vision-language sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés vision-language.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
[ECCV 2024] Implémentation officielle de l'article "Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection".
★ 10 536+14Évolution des étoiles sur les 7 derniers jours - #2
Version chinoise de CLIP permettant la recherche intermodale et la génération de représentations en chinois
★ 6 001+1Évolution des étoiles sur les 7 derniers jours - #3
Dépôt officiel d'OFA (ICML 2022). Article : OFA : Unifier les architectures, les tâches et les modalités via un framework d'apprentissage séquence-à-séquence simple.
★ 2 557+0Évolution des étoiles sur les 7 derniers jours - #4
Une implémentation open-source pour le fine-tuning de la série Qwen-VL d'Alibaba Cloud.
★ 1 961+1Évolution des étoiles sur les 7 derniers jours - #5
Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1 835+1Évolution des étoiles sur les 7 derniers jours - #6
[ACL 2024 🔥] Video-ChatGPT est un modèle de conversation vidéo capable de générer des échanges pertinents sur des vidéos. Il combine les capacités des LLM avec un encodeur visuel pré-entraîné adapté à la représentation spatio-temporelle des vidéos. Nous introduisons également un banc d'essai d'évaluation quantitative rigoureux pour les modèles conversationnels basés sur la vidéo.
★ 1 507+1Évolution des étoiles sur les 7 derniers jours - #7
Vue d'ensemble des LLM japonais.
★ 1 428+1Évolution des étoiles sur les 7 derniers jours - #8
[ECCV 2024 Oral] DriveLM : Conduite avec réponse aux questions visuelles par graphe
★ 1 340+1Évolution des étoiles sur les 7 derniers jours - #9
Un modèle de représentation général pour les modalités vision, audio et langage. Article : ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1 060+0Évolution des étoiles sur les 7 derniers jours - #10
Un framework de modèles multimodaux à petite échelle.
★ 1 004+1Évolution des étoiles sur les 7 derniers jours - #11
CALVIN - Un benchmark pour l'apprentissage de politiques conditionnées par le langage pour des tâches de manipulation robotique à long terme
★ 983+8Évolution des étoiles sur les 7 derniers jours - #12
[CVPR 2024] Alpha-CLIP : un modèle CLIP qui se concentre sur la zone de votre choix.
★ 874+0Évolution des étoiles sur les 7 derniers jours - #13
Implémentation tierce de l'article Grounding DINO : Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 846+2Évolution des étoiles sur les 7 derniers jours - #14
🔥🔥 LLaVA++ : Extension de LLaVA avec Phi-3 et LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842+0Évolution des étoiles sur les 7 derniers jours - #15
[ICLR 2024] Contrôle de modèles vision-langage pour la restauration d'images universelle. 5e place au challenge NTIRE 2024 Restore Any Image Model in the Wild.
★ 817+1Évolution des étoiles sur les 7 derniers jours - #16★ 641-1Évolution des étoiles sur les 7 derniers jours
- #17★ 596—Évolution des étoiles sur les 7 derniers jours
- #18
🛰️ Dépôt officiel de l'article "RemoteCLIP: A Vision Language Foundation Model for Remote Sensing" (IEEE TGRS)
★ 591+4Évolution des étoiles sur les 7 derniers jours