Aller au contenu principal
buildradar
Sign in
Sujet · vision-language-model

vision-language-model

Dépôts open source suivis étiquetés vision-language-model, triés par étoiles.

59 dépôts
  • prismer@NVlabs

    Implémentation de Prismer : un modèle vision-langage avec des experts multi-tâches.

    1 309+0Évolution des étoiles sur les 7 derniers jours
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Framework entièrement ouvert pour la démocratisation de l'entraînement multimodal.

    1 195+1Évolution des étoiles sur les 7 derniers jours
  • vlms-zero-to-hero@SkalskiP

    Cette série vous emmène des fondamentaux du NLP et de la vision par ordinateur jusqu'à la pointe des modèles vision-langage.

    1 179+0Évolution des étoiles sur les 7 derniers jours
  • doc7@magicrew

    Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle

    1 153-25Évolution des étoiles sur les 7 derniers jours
  • Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.

    1 136+18Évolution des étoiles sur les 7 derniers jours
  • VisRAG@OpenBMB

    RAG sans analyse syntaxique (parsing-free) pris en charge par les VLM.

    979-1Évolution des étoiles sur les 7 derniers jours
  • groundingLMM@mbzuai-oryx

    [CVPR 2024] Grounding Large Multimodal Model (GLaMM), le premier modèle capable de générer des réponses en langage naturel intégrées de manière transparente aux masques de segmentation d'objets

    967+0Évolution des étoiles sur les 7 derniers jours
  • Chat-UniVi@PKU-YuanGroup

    [CVPR 2024 Highlight] Chat-UniVi : Une représentation visuelle unifiée permettant aux grands modèles de langage de comprendre les images et les vidéos.

    941+0Évolution des étoiles sur les 7 derniers jours
  • À propos : cette collection rassemble les articles les plus passionnants et influents de la CVPR 2025. 🔥 [Article + Code + Démo]

    895+1Évolution des étoiles sur les 7 derniers jours
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP : un modèle CLIP qui se concentre sur la zone de votre choix.

    874+0Évolution des étoiles sur les 7 derniers jours
  • dsh-vision-toolkit@Anionex

    Boîte à outils visuelle puissante conçue pour les modèles textuels : installation gratuite, reconnaissance directe d'images collées, questions-réponses sur plusieurs images, OCR de captures d'écran vers UI front-end, et intégration native DeepSeek pour agent-vision-toolkit : Q&A, OCR, restauration d'UI, grounding, diff de pixels, Artifacts et Web UI.

    856+17Évolution des étoiles sur les 7 derniers jours
  • VoxPoser@huangwl18

    VoxPoser : cartes de valeurs 3D composables pour la manipulation robotique avec des modèles de langage.

    834+1Évolution des étoiles sur les 7 derniers jours
  • OpenCUA@xlang-ai

    [NeurIPS 2025 Spotlight] OpenCUA : Fondations ouvertes pour les agents d'utilisation informatique

    833+4Évolution des étoiles sur les 7 derniers jours
  • MINT-1T@mlfoundations

    🍃 MINT-1T : Un jeu de données multimodal entrelacé d'un billion de jetons.

    832+0Évolution des étoiles sur les 7 derniers jours
  • Une liste organisée d'articles sur la vision 3D liés au domaine de la robotique à l'ère des grands modèles (LLM/VLM), inspirée par awesome-computer-vision, incluant des articles, des codes et des sites web associés.

    821+2Évolution des étoiles sur les 7 derniers jours
  • Une liste organisée de méthodes d'apprentissage par prompt/adaptateur pour les modèles vision-langage comme CLIP.

    797+1Évolution des étoiles sur les 7 derniers jours
  • X-VLA@2toinf

    [ICLR 2026] Implémentation officielle de "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"

    725+5Évolution des étoiles sur les 7 derniers jours
  • OmniVinci@NVlabs

    OmniVinci est un LLM multimodal pour la compréhension conjointe de la vision, de l'audio et du langage.

    677+0Évolution des étoiles sur les 7 derniers jours
  • MiMo-VL@XiaomiMiMo

    MiMo-VL

    642+0Évolution des étoiles sur les 7 derniers jours
  • LAMDA-PILOT@LAMDA-CL

    🎉 PILOT : Une boîte à outils d'apprentissage continu basée sur des modèles pré-entraînés.

    600+3Évolution des étoiles sur les 7 derniers jours
  • t2v_metrics@linzhiqiu

    Évaluation des modèles texte-vers-image/vidéo/3D avec VQAScore.

    600+0Évolution des étoiles sur les 7 derniers jours
  • SpatialVID@NJU-3DV

    [CVPR 2026] SpatialVID : Un jeu de données vidéo à grande échelle avec annotations spatiales

    600+1Évolution des étoiles sur les 7 derniers jours
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Évolution des étoiles sur les 7 derniers jours
  • Groma@FoundationVision

    [ECCV2024] Grand modèle de langage multimodal ancré avec tokenisation visuelle localisée

    586+0Évolution des étoiles sur les 7 derniers jours
  • LLaVA-Mini@ictnlp

    LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.

    577+0Évolution des étoiles sur les 7 derniers jours
  • cambrian-s@cambrian-mllm

    Cambrian-S : Vers une supersense spatiale dans la vidéo

    567-1Évolution des étoiles sur les 7 derniers jours
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena rencontre la multimodalité ! Multi-Modality Arena vous permet d'évaluer des modèles vision-langage côte à côte en fournissant des images en entrée. Prend en charge MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 et bien d'autres !

    566+0Évolution des étoiles sur les 7 derniers jours
  • Flame-Code-VLM@Flame-Code-VLM

    Flame est un système d'IA multimodal open-source conçu pour traduire des maquettes de design d'UI en code React de haute qualité. Il exploite la modélisation vision-langage, la synthèse automatisée de données et des flux de travail d'entraînement structurés pour combler le fossé entre le design et le développement front-end.

    562+0Évolution des étoiles sur les 7 derniers jours
  • count-anything@Mengqi-Lei

    Code et directives d'implémentation pour l'article ✨Counting Anything. Page du projet : https://mengqi-lei.github.io/count-anything-projectpage/

    539+2Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets