Aller au contenu principal
buildradar
Sign in
Sujet · multimodal-large-language-models

multimodal-large-language-models

Dépôts open source suivis étiquetés multimodal-large-language-models, triés par étoiles.

Dépôts
32
Total d'étoiles
66 902
Étoiles en moyenne
2 091
Part
0,00%

Sujets qui apparaissent souvent aux côtés de multimodal-large-language-models sur un même dépôt.

Ascensions récentes

Dépôts créés au cours des 90 derniers jours et étiquetés multimodal-large-language-models.

Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.

  • Dernières avancées sur les modèles de langage multimodaux (MLLM)

    17 996+2Évolution des étoiles sur les 7 derniers jours
  • MobileAgent@X-PLUG

    Mobile-Agent : une famille d'agents GUI puissants.

    9 157+9Évolution des étoiles sur les 7 derniers jours
  • star-vector@joanrod

    StarVector est un modèle de fondation pour la génération de SVG qui transforme la vectorisation en une tâche de génération de code. Utilisant une architecture de modélisation vision-langage, StarVector traite les entrées visuelles et textuelles pour produire du code SVG de haute qualité avec une précision remarquable.

    4 567+6Évolution des étoiles sur les 7 derniers jours
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni est un modèle d'interaction vocale de bout en bout à faible latence et haute qualité, basé sur Llama-3.1-8B-Instruct, visant des capacités vocales au niveau de GPT-4o.

    3 147+1Évolution des étoiles sur les 7 derniers jours
  • VideoPipe@sherlockchou86

    Un framework multiplateforme de structuration vidéo (analyse vidéo) basé sur des modèles CV et mLLM.

    2 933+0Évolution des étoiles sur les 7 derniers jours
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5 : Vers une interaction vision et parole en temps réel au niveau de GPT-4o.

    2 532-1Évolution des étoiles sur les 7 derniers jours
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl : Modèle de langage multimodal modulaire pour la compréhension de documents

    2 411+0Évolution des étoiles sur les 7 derniers jours
  • cambrian@cambrian-mllm

    Cambrian-1 est une famille de LLM multimodaux avec une conception centrée sur la vision.

    2 014+1Évolution des étoiles sur les 7 derniers jours
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Maîtriser la diffusion texte-vers-image : re-légendage, planification et génération avec des LLM multimodaux (RPG).

    1 844+0Évolution des étoiles sur les 7 derniers jours
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, un modèle de fondation vision-langage conçu pour faire progresser la compréhension et le raisonnement multimodal généraliste, atteignant des performances de pointe sur 38 des 60 benchmarks publics.

    1 586+0Évolution des étoiles sur les 7 derniers jours
  • Ovis@ATH-MaaS

    Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.

    1 514+2Évolution des étoiles sur les 7 derniers jours
  • Liste impressionnante de modèles multimodaux unifiés.

    1 314+1Évolution des étoiles sur les 7 derniers jours
  • VideoChat@Henry-23

    Humain numérique interactif en temps réel, avec apparence et voix personnalisables, support du clonage vocal et latence de dialogue aussi basse que 3 secondes.

    1 303-1Évolution des étoiles sur les 7 derniers jours
  • Implémentation PyTorch d'Audio Flamingo : série de modèles de langage avancés pour la compréhension audio.

    1 184+2Évolution des étoiles sur les 7 derniers jours
  • SLAM-LLM@X-LANCE

    Un framework pour le traitement de la parole, du langage, de l'audio et de la musique basé sur des modèles de langage de grande taille.

    1 058+2Évolution des étoiles sur les 7 derniers jours
  • Bunny@BAAI-DCAI

    Une famille de modèles multimodaux légers.

    1 053+0Évolution des étoiles sur les 7 derniers jours
  • Awesome-MCoT@yaotingwangofficial

    Raisonnement multimodal par chaîne de pensée : une étude complète

    1 025+2Évolution des étoiles sur les 7 derniers jours
  • Une collection de ressources sur les applications de l'apprentissage multimodal en imagerie médicale

    975+1Évolution des étoiles sur les 7 derniers jours
  • NEO@EvolvingLMMs-Lab

    Série NEO : Modèles vision-langage natifs conçus à partir des principes fondamentaux

    888+0Évolution des étoiles sur les 7 derniers jours
  • Video-MME@MME-Benchmarks

    ✨✨ [CVPR 2025] Video-MME : Le tout premier benchmark d'évaluation complet des LLM multimodaux pour l'analyse vidéo.

    791+2Évolution des étoiles sur les 7 derniers jours
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus : assistants de langage et de vision capables d'apprendre et d'utiliser des compétences.

    770+0Évolution des étoiles sur les 7 derniers jours
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat : Du token dense à la mémoire éparse pour la compréhension de vidéos longues

    706+0Évolution des étoiles sur les 7 derniers jours
  • unicom@deepglint

    Modèle de représentation visuelle à grande échelle

    702+0Évolution des étoiles sur les 7 derniers jours
  • MPP-LLaVA@Coobiw

    Projet personnel : MPP-Qwen14B & MPP-Qwen-Next (Pipeline multimodal parallèle basé sur Qwen-LM). Support [video/image/multi-image] {sft/conversations}. Ne laissez pas la pauvreté limiter votre imagination ! Entraînez votre propre MLLM similaire à LLaVA-training sur 8B/14B en utilisant RTX3090/4090 24GB.

    686+0Évolution des étoiles sur les 7 derniers jours
  • OmniVinci@NVlabs

    OmniVinci est un LLM multimodal pour la compréhension conjointe de la vision, de l'audio et du langage.

    677+0Évolution des étoiles sur les 7 derniers jours
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Correction des hallucinations pour les modèles de langage multimodaux de grande taille

    650+1Évolution des étoiles sur les 7 derniers jours
  • Liquid@FoundationVision

    (Accepté par IJCV) Liquid : Les modèles de langage sont des générateurs multimodaux évolutifs et unifiés

    640+0Évolution des étoiles sur les 7 derniers jours
  • Vitron@SkyworkAI

    Article NeurIPS 2024 : Un LLM de vision unifié au niveau du pixel pour la compréhension, la génération, la segmentation et l'édition

    577+1Évolution des étoiles sur les 7 derniers jours
  • LLaVA-Mini@ictnlp

    LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.

    577+0Évolution des étoiles sur les 7 derniers jours
  • cambrian-s@cambrian-mllm

    Cambrian-S : Vers une supersense spatiale dans la vidéo

    567-1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets