vision-language-model
Dépôts open source suivis étiquetés vision-language-model, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de vision-language-model sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés vision-language-model.
- #1
Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle
★ 1 153 - #2
Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.
★ 1 136 - #3
Boîte à outils visuelle puissante conçue pour les modèles textuels : installation gratuite, reconnaissance directe d'images collées, questions-réponses sur plusieurs images, OCR de captures d'écran vers UI front-end, et intégration native DeepSeek pour agent-vision-toolkit : Q&A, OCR, restauration d'UI, grounding, diff de pixels, Artifacts et Web UI.
★ 856 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) conçu pour atteindre et dépasser les capacités de GPT-4V
★ 25 014+9Évolution des étoiles sur les 7 derniers jours - #2
X-AnyLabeling : une application de bureau multiplateforme légère, efficace et unifiée pour l'annotation de texte, d'images, de vidéos et de données multimodales, combinant des outils intégrés polyvalents avec des modèles d'IA de pointe et une exportation flexible multi-format.
★ 10 313+59Évolution des étoiles sur les 7 derniers jours - #3
[CVPR 2024 Oral] Famille InternVL : Une alternative open source pionnière à GPT-4o
★ 10 150+3Évolution des étoiles sur les 7 derniers jours - #4
Entraînez un VLM de 65 millions de paramètres à partir de zéro en seulement 2 heures !
★ 8 535+40Évolution des étoiles sur les 7 derniers jours - #5
Le dépôt officiel de Qwen-VL, un modèle de langage visuel large, conversationnel et pré-entraîné, proposé par Alibaba Cloud.
★ 6 727+1Évolution des étoiles sur les 7 derniers jours - #6
MineContext est votre partenaire IA proactif et conscient du contexte (Context-Engineering + ChatGPT Pulse).
★ 5 497+1Évolution des étoiles sur les 7 derniers jours - #7
MLX-VLM est un package pour l'inférence et le réglage fin de modèles de vision par langage (VLM) sur Mac via MLX.
★ 5 462+25Évolution des étoiles sur les 7 derniers jours - #8
Align Anything : Entraînement de modèles multimodaux avec rétroaction.
★ 4 671+3Évolution des étoiles sur les 7 derniers jours - #9
Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.
★ 4 390+7Évolution des étoiles sur les 7 derniers jours - #10
DeepSeek-VL : Vers une compréhension vision-langage en conditions réelles
★ 4 177+2Évolution des étoiles sur les 7 derniers jours - #11
Dépôt officiel de MiniMax-Text-01 et MiniMax-VL-01, modèles de langage et de vision basés sur l'attention linéaire
★ 3 467+0Évolution des étoiles sur les 7 derniers jours - #12
Dépôt officiel pour "Mini-Gemini : Exploiter le potentiel des modèles de langage de vision multimodaux"
★ 3 327+0Évolution des étoiles sur les 7 derniers jours - #13
Collection de modèles vision-langage impressionnants pour les tâches de vision par ordinateur.
★ 3 126+0Évolution des étoiles sur les 7 derniers jours - #14
Le couteau suisse de l'IA hors ligne. Discutez, voyez, parlez et générez des images sur votre téléphone ou Mac — LLM GGUF, vision, reconnaissance vocale Whisper, Stable Diffusion, appel d'outils et serveurs réseau locaux. Fonctionne sur votre CPU, GPU ou NPU. Aucun compte, aucune clé API, aucune donnée ne quitte votre appareil.
★ 3 038+17Évolution des étoiles sur les 7 derniers jours - #15
InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.
★ 2 925-1Évolution des étoiles sur les 7 derniers jours - #16
Code utilisé pour entraîner et exécuter l'inférence avec les modèles ColVision, tels que ColPali, ColQwen2 et ColSmol.
★ 2 809+7Évolution des étoiles sur les 7 derniers jours - #17
Le framework Cradle est une première tentative de contrôle informatique général (GCC). Il permet aux agents de réussir n'importe quelle tâche informatique grâce à un raisonnement robuste, une auto-amélioration et une curation de compétences, dans un environnement standardisé aux exigences minimales.
★ 2 578+2Évolution des étoiles sur les 7 derniers jours - #18
Une implémentation open-source pour le fine-tuning de la série Qwen-VL d'Alibaba Cloud.
★ 1 961+1Évolution des étoiles sur les 7 derniers jours - #19
[CVPR 2025] Modèle Vision-Language-Action open source de bout en bout pour les agents GUI et l'utilisation informatique
★ 1 896+2Évolution des étoiles sur les 7 derniers jours - #20
Liste organisée de ressources LLM/VLM/VLA/World Model pour la conduite autonome (LLM4AD) (mise à jour continue)
★ 1 890-2Évolution des étoiles sur les 7 derniers jours - #21
Le blueprint NVIDIA AI pour la recherche et le résumé vidéo (VSS) est une architecture de référence accélérée par GPU pour créer des agents d'analyse vidéo avec des alertes vérifiées en temps réel, des questions-réponses visuelles et des rapports automatisés. Le blueprint VSS utilise des modèles de langage visuel (VLM) tels que NVIDIA Cosmos, des LLM tels que NVIDIA Nemotron, le RAG et NVIDIA NIMs.
★ 1 840+10Évolution des étoiles sur les 7 derniers jours - #22
Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1 835+1Évolution des étoiles sur les 7 derniers jours - #23
Seed1.5-VL, un modèle de fondation vision-langage conçu pour faire progresser la compréhension et le raisonnement multimodal généraliste, atteignant des performances de pointe sur 38 des 60 benchmarks publics.
★ 1 586+0Évolution des étoiles sur les 7 derniers jours - #24
Serveur d'inférence LLM haute performance compatible OpenAI et Anthropic pour Apple Silicon. Support natif MLX, traitement par lots continu, modèles multimodaux, appel d'outils MCP et support de Claude Code.
★ 1 557+6Évolution des étoiles sur les 7 derniers jours - #25
Obtenez des données propres à partir de documents complexes, grâce aux modèles de vision-langage ⚡
★ 1 524+0Évolution des étoiles sur les 7 derniers jours - #26
[ICCV 2025] Implémentation de Describe Anything : sous-titrage détaillé et localisé d'images et de vidéos
★ 1 517+3Évolution des étoiles sur les 7 derniers jours - #27
Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.
★ 1 514+2Évolution des étoiles sur les 7 derniers jours - #28
Vue d'ensemble des LLM japonais.
★ 1 428+1Évolution des étoiles sur les 7 derniers jours - #29
Fine-tuning de LLM sur Mac avec Apple Silicon. Support natif MLX pour SFT, DPO, GRPO, Vision, TTS, STT, Embedding et OCR. API compatible avec Unsloth.
★ 1 398+8Évolution des étoiles sur les 7 derniers jours - #30
Liste impressionnante de modèles multimodaux unifiés.
★ 1 314+1Évolution des étoiles sur les 7 derniers jours