vision-language-model
Dépôts open source suivis étiquetés vision-language-model, triés par étoiles.
- #31★ 1 309+0Évolution des étoiles sur les 7 derniers jours
- #32
Framework entièrement ouvert pour la démocratisation de l'entraînement multimodal.
★ 1 195+1Évolution des étoiles sur les 7 derniers jours - #33
Cette série vous emmène des fondamentaux du NLP et de la vision par ordinateur jusqu'à la pointe des modèles vision-langage.
★ 1 179+0Évolution des étoiles sur les 7 derniers jours - #34
Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle
★ 1 153-25Évolution des étoiles sur les 7 derniers jours - #35
Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.
★ 1 136+18Évolution des étoiles sur les 7 derniers jours - #36★ 979-1Évolution des étoiles sur les 7 derniers jours
- #37
[CVPR 2024] Grounding Large Multimodal Model (GLaMM), le premier modèle capable de générer des réponses en langage naturel intégrées de manière transparente aux masques de segmentation d'objets
★ 967+0Évolution des étoiles sur les 7 derniers jours - #38
[CVPR 2024 Highlight] Chat-UniVi : Une représentation visuelle unifiée permettant aux grands modèles de langage de comprendre les images et les vidéos.
★ 941+0Évolution des étoiles sur les 7 derniers jours - #39
À propos : cette collection rassemble les articles les plus passionnants et influents de la CVPR 2025. 🔥 [Article + Code + Démo]
★ 895+1Évolution des étoiles sur les 7 derniers jours - #40
[CVPR 2024] Alpha-CLIP : un modèle CLIP qui se concentre sur la zone de votre choix.
★ 874+0Évolution des étoiles sur les 7 derniers jours - #41
Boîte à outils visuelle puissante conçue pour les modèles textuels : installation gratuite, reconnaissance directe d'images collées, questions-réponses sur plusieurs images, OCR de captures d'écran vers UI front-end, et intégration native DeepSeek pour agent-vision-toolkit : Q&A, OCR, restauration d'UI, grounding, diff de pixels, Artifacts et Web UI.
★ 856+17Évolution des étoiles sur les 7 derniers jours - #42
VoxPoser : cartes de valeurs 3D composables pour la manipulation robotique avec des modèles de langage.
★ 834+1Évolution des étoiles sur les 7 derniers jours - #43
[NeurIPS 2025 Spotlight] OpenCUA : Fondations ouvertes pour les agents d'utilisation informatique
★ 833+4Évolution des étoiles sur les 7 derniers jours - #44★ 832+0Évolution des étoiles sur les 7 derniers jours
- #45
Une liste organisée d'articles sur la vision 3D liés au domaine de la robotique à l'ère des grands modèles (LLM/VLM), inspirée par awesome-computer-vision, incluant des articles, des codes et des sites web associés.
★ 821+2Évolution des étoiles sur les 7 derniers jours - #46
Une liste organisée de méthodes d'apprentissage par prompt/adaptateur pour les modèles vision-langage comme CLIP.
★ 797+1Évolution des étoiles sur les 7 derniers jours - #47
[ICLR 2026] Implémentation officielle de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
★ 725+5Évolution des étoiles sur les 7 derniers jours - #48
OmniVinci est un LLM multimodal pour la compréhension conjointe de la vision, de l'audio et du langage.
★ 677+0Évolution des étoiles sur les 7 derniers jours - #49★ 642+0Évolution des étoiles sur les 7 derniers jours
- #50
🎉 PILOT : Une boîte à outils d'apprentissage continu basée sur des modèles pré-entraînés.
★ 600+3Évolution des étoiles sur les 7 derniers jours - #51
Évaluation des modèles texte-vers-image/vidéo/3D avec VQAScore.
★ 600+0Évolution des étoiles sur les 7 derniers jours - #52
[CVPR 2026] SpatialVID : Un jeu de données vidéo à grande échelle avec annotations spatiales
★ 600+1Évolution des étoiles sur les 7 derniers jours - #53★ 596—Évolution des étoiles sur les 7 derniers jours
- #54
[ECCV2024] Grand modèle de langage multimodal ancré avec tokenisation visuelle localisée
★ 586+0Évolution des étoiles sur les 7 derniers jours - #55
LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.
★ 577+0Évolution des étoiles sur les 7 derniers jours - #56
Cambrian-S : Vers une supersense spatiale dans la vidéo
★ 567-1Évolution des étoiles sur les 7 derniers jours - #57
Chatbot Arena rencontre la multimodalité ! Multi-Modality Arena vous permet d'évaluer des modèles vision-langage côte à côte en fournissant des images en entrée. Prend en charge MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 et bien d'autres !
★ 566+0Évolution des étoiles sur les 7 derniers jours - #58
Flame est un système d'IA multimodal open-source conçu pour traduire des maquettes de design d'UI en code React de haute qualité. Il exploite la modélisation vision-langage, la synthèse automatisée de données et des flux de travail d'entraînement structurés pour combler le fossé entre le design et le développement front-end.
★ 562+0Évolution des étoiles sur les 7 derniers jours - #59
Code et directives d'implémentation pour l'article ✨Counting Anything. Page du projet : https://mengqi-lei.github.io/count-anything-projectpage/
★ 539+2Évolution des étoiles sur les 7 derniers jours