Aller au contenu principal
buildradar
Sign in
Sujet · multimodal

multimodal

Dépôts open source suivis étiquetés multimodal, triés par étoiles.

148 dépôts
  • Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.

    1 136+18Évolution des étoiles sur les 7 derniers jours
  • Le système d'auto-codage pour votre application — SDK Alan AI pour Cordova

    1 132+0Évolution des étoiles sur les 7 derniers jours
  • sglang-omni@sgl-project

    SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.

    1 118+143Évolution des étoiles sur les 7 derniers jours
  • MOVA@OpenMOSS

    MOVA : Vers une génération vidéo-audio évolutive et synchronisée

    1 110+5Évolution des étoiles sur les 7 derniers jours
  • Aria@rhymes-ai

    Base de code pour Aria, un modèle MoE multimodal natif open source

    1 088+1Évolution des étoiles sur les 7 derniers jours
  • dsh-vision-router@ysr666

    Vision pour les agents DeepSeek Harness : chaîne de vision gratuite intégrée (sans clé) et outils de vision au niveau du pixel (Q&A, ancrage, recadrage, différence de pixels, couleurs, OCR, tracé SVG, détourage, captures d'écran). Installation en une commande, sans Python, les images fonctionnent comme des appels d'outils classiques.

    1 086+64Évolution des étoiles sur les 7 derniers jours
  • XrayGLM@WangRongsheng

    Le premier modèle médical multimodal chinois capable d'interpréter des radiographies thoraciques.

    1 084+2Évolution des étoiles sur les 7 derniers jours
  • VisCPM@OpenBMB

    [ICLR'24 spotlight] Série de grands modèles multimodaux chinois et anglais (Chat et Paint) basés sur le modèle CPM.

    1 061-1Évolution des étoiles sur les 7 derniers jours
  • ONE-PEACE@OFA-Sys

    Un modèle de représentation général pour les modalités vision, audio et langage. Article : ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1 060+0Évolution des étoiles sur les 7 derniers jours
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM : Permettre aux grands modèles de langage de comprendre les nuages de points

    1 053+2Évolution des étoiles sur les 7 derniers jours
  • CLIP4Clip@ArrowLuo

    Implémentation officielle pour CLIP4Clip : une étude empirique de CLIP pour la recherche de clips vidéo de bout en bout.

    1 032+1Évolution des étoiles sur les 7 derniers jours
  • Awesome-MCoT@yaotingwangofficial

    Raisonnement multimodal par chaîne de pensée : une étude complète

    1 025+2Évolution des étoiles sur les 7 derniers jours
  • tongflow@tong-io

    TongFlow — Studio d'IA générative multimodale

    1 017+38Évolution des étoiles sur les 7 derniers jours
  • vectordb-recipes@lancedb

    Ressources, exemples et tutoriels pour l'IA multimodale, le RAG et les agents utilisant la recherche vectorielle et les LLM

    973-1Évolution des étoiles sur les 7 derniers jours
  • verl-omni@verl-project

    Framework d'entraînement RL multimodal pour modèles de diffusion et omni

    959+64Évolution des étoiles sur les 7 derniers jours
  • rag-time@microsoft

    RAG Time : Un parcours d'apprentissage de 5 semaines pour maîtriser le RAG

    903+4Évolution des étoiles sur les 7 derniers jours
  • À propos : cette collection rassemble les articles les plus passionnants et influents de la CVPR 2025. 🔥 [Article + Code + Démo]

    895+1Évolution des étoiles sur les 7 derniers jours
  • NEO@EvolvingLMMs-Lab

    Série NEO : Modèles vision-langage natifs conçus à partir des principes fondamentaux

    888+0Évolution des étoiles sur les 7 derniers jours
  • AnyGPT@OpenMOSS

    Code pour "AnyGPT : LLM multimodal unifié avec modélisation de séquence discrète"

    881-1Évolution des étoiles sur les 7 derniers jours
  • ohmycaptcha@shenhao-stu

    Solveur de captcha auto-hébergeable compatible avec YesCaptcha, construit avec FastAPI, Playwright et des modèles multimodaux compatibles OpenAI.

    869+4Évolution des étoiles sur les 7 derniers jours
  • lmms-engine@EvolvingLMMs-Lab

    Un moteur d'entraînement simple et unifié pour modèles multimodaux. Léger, flexible et conçu pour le hacking à grande échelle.

    824+0Évolution des étoiles sur les 7 derniers jours
  • [TMLR 2025🔥] Étude sur les modèles autorégressifs en vision.

    808+1Évolution des étoiles sur les 7 derniers jours
  • papermage@allenai

    Bibliothèque dédiée à la recherche en NLP et en vision par ordinateur sur les articles scientifiques.

    803+0Évolution des étoiles sur les 7 derniers jours
  • contrastors@nomic-ai

    Entraîner des modèles par apprentissage contrastif avec PyTorch.

    802+0Évolution des étoiles sur les 7 derniers jours
  • Surveillance locale + vision IA — Framework de surveillance IA basé sur LAN et alimenté par smartphone, avec sortie d'événements structurés pour l'acquisition et l'analyse de données.

    768+10Évolution des étoiles sur les 7 derniers jours
  • Liste d'articles sur les modèles multimodaux et les grands modèles de langage, utilisée uniquement pour enregistrer mes lectures quotidiennes sur arxiv.

    761+1Évolution des étoiles sur les 7 derniers jours
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR : Restauration d'images de haute qualité suivant des instructions humaines https://huggingface.co/spaces/marcosv/InstructIR

    741+0Évolution des étoiles sur les 7 derniers jours
  • PaddleMIX@PaddlePaddle

    Paddle Multimodal Integration and eXploration, prenant en charge les tâches multimodales courantes, incluant des modèles de pré-entraînement multimodaux à grande échelle et une boîte à outils de modèles de diffusion, alliant haute performance et flexibilité.

    723-1Évolution des étoiles sur les 7 derniers jours
  • MMRec@enoche

    Boîte à outils pour la recommandation MultiModal. Intégration de 10+ modèles...

    689+1Évolution des étoiles sur les 7 derniers jours
  • VLM2Vec@TIGER-AI-Lab

    Ce dépôt contient le code de "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], et "MMEB-V3" [COLM 2026]

    682+2Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets