Aller au contenu principal
buildradar
Sign in
Sujet · vision-language-model

vision-language-model

Dépôts open source suivis étiquetés vision-language-model, triés par étoiles.

Dépôts
59
Total d'étoiles
150 825
Étoiles en moyenne
2 556
Part
0,01%

Sujets qui apparaissent souvent aux côtés de vision-language-model sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés vision-language-model.

  • doc7@magicrew

    Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle

    1 153
  • Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.

    1 136
  • dsh-vision-toolkit@Anionex

    Boîte à outils visuelle puissante conçue pour les modèles textuels : installation gratuite, reconnaissance directe d'images collées, questions-réponses sur plusieurs images, OCR de captures d'écran vers UI front-end, et intégration native DeepSeek pour agent-vision-toolkit : Q&A, OCR, restauration d'UI, grounding, diff de pixels, Artifacts et Web UI.

    856
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) conçu pour atteindre et dépasser les capacités de GPT-4V

    25 014+9Évolution des étoiles sur les 7 derniers jours
  • X-AnyLabeling@CVHub520

    X-AnyLabeling : une application de bureau multiplateforme légère, efficace et unifiée pour l'annotation de texte, d'images, de vidéos et de données multimodales, combinant des outils intégrés polyvalents avec des modèles d'IA de pointe et une exportation flexible multi-format.

    10 313+59Évolution des étoiles sur les 7 derniers jours
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] Famille InternVL : Une alternative open source pionnière à GPT-4o

    10 150+3Évolution des étoiles sur les 7 derniers jours
  • minimind-v@jingyaogong

    Entraînez un VLM de 65 millions de paramètres à partir de zéro en seulement 2 heures !

    8 535+40Évolution des étoiles sur les 7 derniers jours
  • Qwen-VL@QwenLM

    Le dépôt officiel de Qwen-VL, un modèle de langage visuel large, conversationnel et pré-entraîné, proposé par Alibaba Cloud.

    6 727+1Évolution des étoiles sur les 7 derniers jours
  • MineContext@volcengine

    MineContext est votre partenaire IA proactif et conscient du contexte (Context-Engineering + ChatGPT Pulse).

    5 497+1Évolution des étoiles sur les 7 derniers jours
  • mlx-vlm@Blaizzy

    MLX-VLM est un package pour l'inférence et le réglage fin de modèles de vision par langage (VLM) sur Mac via MLX.

    5 462+25Évolution des étoiles sur les 7 derniers jours
  • align-anything@PKU-Alignment

    Align Anything : Entraînement de modèles multimodaux avec rétroaction.

    4 671+3Évolution des étoiles sur les 7 derniers jours
  • lmms-eval@EvolvingLMMs-Lab

    Boîte à outils d'évaluation multimodale tout-en-un pour les tâches textuelles, d'image, vidéo et audio.

    4 390+7Évolution des étoiles sur les 7 derniers jours
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL : Vers une compréhension vision-langage en conditions réelles

    4 177+2Évolution des étoiles sur les 7 derniers jours
  • MiniMax-01@MiniMax-AI

    Dépôt officiel de MiniMax-Text-01 et MiniMax-VL-01, modèles de langage et de vision basés sur l'attention linéaire

    3 467+0Évolution des étoiles sur les 7 derniers jours
  • MGM@JIA-Lab-research

    Dépôt officiel pour "Mini-Gemini : Exploiter le potentiel des modèles de langage de vision multimodaux"

    3 327+0Évolution des étoiles sur les 7 derniers jours
  • VLM_survey@jingyi0000

    Collection de modèles vision-langage impressionnants pour les tâches de vision par ordinateur.

    3 126+0Évolution des étoiles sur les 7 derniers jours
  • OGAM@off-grid-ai

    Le couteau suisse de l'IA hors ligne. Discutez, voyez, parlez et générez des images sur votre téléphone ou Mac — LLM GGUF, vision, reconnaissance vocale Whisper, Stable Diffusion, appel d'outils et serveurs réseau locaux. Fonctionne sur votre CPU, GPU ou NPU. Aucun compte, aucune clé API, aucune donnée ne quitte votre appareil.

    3 038+17Évolution des étoiles sur les 7 derniers jours
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.

    2 925-1Évolution des étoiles sur les 7 derniers jours
  • colpali@illuin-tech

    Code utilisé pour entraîner et exécuter l'inférence avec les modèles ColVision, tels que ColPali, ColQwen2 et ColSmol.

    2 809+7Évolution des étoiles sur les 7 derniers jours
  • Cradle@BAAI-Agents

    Le framework Cradle est une première tentative de contrôle informatique général (GCC). Il permet aux agents de réussir n'importe quelle tâche informatique grâce à un raisonnement robuste, une auto-amélioration et une curation de compétences, dans un environnement standardisé aux exigences minimales.

    2 578+2Évolution des étoiles sur les 7 derniers jours
  • Une implémentation open-source pour le fine-tuning de la série Qwen-VL d'Alibaba Cloud.

    1 961+1Évolution des étoiles sur les 7 derniers jours
  • ShowUI@showlab

    [CVPR 2025] Modèle Vision-Language-Action open source de bout en bout pour les agents GUI et l'utilisation informatique

    1 896+2Évolution des étoiles sur les 7 derniers jours
  • Awesome-LLM4AD@Thinklab-SJTU

    Liste organisée de ressources LLM/VLM/VLA/World Model pour la conduite autonome (LLM4AD) (mise à jour continue)

    1 890-2Évolution des étoiles sur les 7 derniers jours
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    Le blueprint NVIDIA AI pour la recherche et le résumé vidéo (VSS) est une architecture de référence accélérée par GPU pour créer des agents d'analyse vidéo avec des alertes vérifiées en temps réel, des questions-réponses visuelles et des rapports automatisés. Le blueprint VSS utilise des modèles de langage visuel (VLM) tels que NVIDIA Cosmos, des LLM tels que NVIDIA Nemotron, le RAG et NVIDIA NIMs.

    1 840+10Évolution des étoiles sur les 7 derniers jours
  • AdvancedLiterateMachinery@AlibabaResearch

    Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.

    1 835+1Évolution des étoiles sur les 7 derniers jours
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, un modèle de fondation vision-langage conçu pour faire progresser la compréhension et le raisonnement multimodal généraliste, atteignant des performances de pointe sur 38 des 60 benchmarks publics.

    1 586+0Évolution des étoiles sur les 7 derniers jours
  • vllm-mlx@waybarrios

    Serveur d'inférence LLM haute performance compatible OpenAI et Anthropic pour Apple Silicon. Support natif MLX, traitement par lots continu, modèles multimodaux, appel d'outils MCP et support de Claude Code.

    1 557+6Évolution des étoiles sur les 7 derniers jours
  • thepipe@emcf

    Obtenez des données propres à partir de documents complexes, grâce aux modèles de vision-langage ⚡

    1 524+0Évolution des étoiles sur les 7 derniers jours
  • [ICCV 2025] Implémentation de Describe Anything : sous-titrage détaillé et localisé d'images et de vidéos

    1 517+3Évolution des étoiles sur les 7 derniers jours
  • Ovis@ATH-MaaS

    Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.

    1 514+2Évolution des étoiles sur les 7 derniers jours
  • awesome-japanese-llm@llm-jp

    Vue d'ensemble des LLM japonais.

    1 428+1Évolution des étoiles sur les 7 derniers jours
  • mlx-tune@ARahim3

    Fine-tuning de LLM sur Mac avec Apple Silicon. Support natif MLX pour SFT, DPO, GRPO, Vision, TTS, STT, Embedding et OCR. API compatible avec Unsloth.

    1 398+8Évolution des étoiles sur les 7 derniers jours
  • Liste impressionnante de modèles multimodaux unifiés.

    1 314+1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets