multimodal-large-language-models
Dépôts open source suivis étiquetés multimodal-large-language-models, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de multimodal-large-language-models sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés multimodal-large-language-models.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
Dernières avancées sur les modèles de langage multimodaux (MLLM)
★ 17 996+2Évolution des étoiles sur les 7 derniers jours - #2
Mobile-Agent : une famille d'agents GUI puissants.
★ 9 157+9Évolution des étoiles sur les 7 derniers jours - #3
StarVector est un modèle de fondation pour la génération de SVG qui transforme la vectorisation en une tâche de génération de code. Utilisant une architecture de modélisation vision-langage, StarVector traite les entrées visuelles et textuelles pour produire du code SVG de haute qualité avec une précision remarquable.
★ 4 567+6Évolution des étoiles sur les 7 derniers jours - #4
LLaMA-Omni est un modèle d'interaction vocale de bout en bout à faible latence et haute qualité, basé sur Llama-3.1-8B-Instruct, visant des capacités vocales au niveau de GPT-4o.
★ 3 147+1Évolution des étoiles sur les 7 derniers jours - #5
Un framework multiplateforme de structuration vidéo (analyse vidéo) basé sur des modèles CV et mLLM.
★ 2 933+0Évolution des étoiles sur les 7 derniers jours - #6
✨✨[NeurIPS 2025] VITA-1.5 : Vers une interaction vision et parole en temps réel au niveau de GPT-4o.
★ 2 532-1Évolution des étoiles sur les 7 derniers jours - #7
mPLUG-DocOwl : Modèle de langage multimodal modulaire pour la compréhension de documents
★ 2 411+0Évolution des étoiles sur les 7 derniers jours - #8
Cambrian-1 est une famille de LLM multimodaux avec une conception centrée sur la vision.
★ 2 014+1Évolution des étoiles sur les 7 derniers jours - #9
[ICML 2024] Maîtriser la diffusion texte-vers-image : re-légendage, planification et génération avec des LLM multimodaux (RPG).
★ 1 844+0Évolution des étoiles sur les 7 derniers jours - #10
Seed1.5-VL, un modèle de fondation vision-langage conçu pour faire progresser la compréhension et le raisonnement multimodal généraliste, atteignant des performances de pointe sur 38 des 60 benchmarks publics.
★ 1 586+0Évolution des étoiles sur les 7 derniers jours - #11
Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.
★ 1 514+2Évolution des étoiles sur les 7 derniers jours - #12
Liste impressionnante de modèles multimodaux unifiés.
★ 1 314+1Évolution des étoiles sur les 7 derniers jours - #13
Humain numérique interactif en temps réel, avec apparence et voix personnalisables, support du clonage vocal et latence de dialogue aussi basse que 3 secondes.
★ 1 303-1Évolution des étoiles sur les 7 derniers jours - #14
Implémentation PyTorch d'Audio Flamingo : série de modèles de langage avancés pour la compréhension audio.
★ 1 184+2Évolution des étoiles sur les 7 derniers jours - #15
Un framework pour le traitement de la parole, du langage, de l'audio et de la musique basé sur des modèles de langage de grande taille.
★ 1 058+2Évolution des étoiles sur les 7 derniers jours - #16★ 1 053+0Évolution des étoiles sur les 7 derniers jours
- #17
Raisonnement multimodal par chaîne de pensée : une étude complète
★ 1 025+2Évolution des étoiles sur les 7 derniers jours - #18
Une collection de ressources sur les applications de l'apprentissage multimodal en imagerie médicale
★ 975+1Évolution des étoiles sur les 7 derniers jours - #19
Série NEO : Modèles vision-langage natifs conçus à partir des principes fondamentaux
★ 888+0Évolution des étoiles sur les 7 derniers jours - #20
✨✨ [CVPR 2025] Video-MME : Le tout premier benchmark d'évaluation complet des LLM multimodaux pour l'analyse vidéo.
★ 791+2Évolution des étoiles sur les 7 derniers jours - #21
LLaVA-Plus : assistants de langage et de vision capables d'apprendre et d'utiliser des compétences.
★ 770+0Évolution des étoiles sur les 7 derniers jours - #22
[CVPR 2024] MovieChat : Du token dense à la mémoire éparse pour la compréhension de vidéos longues
★ 706+0Évolution des étoiles sur les 7 derniers jours - #23★ 702+0Évolution des étoiles sur les 7 derniers jours
- #24
Projet personnel : MPP-Qwen14B & MPP-Qwen-Next (Pipeline multimodal parallèle basé sur Qwen-LM). Support [video/image/multi-image] {sft/conversations}. Ne laissez pas la pauvreté limiter votre imagination ! Entraînez votre propre MLLM similaire à LLaVA-training sur 8B/14B en utilisant RTX3090/4090 24GB.
★ 686+0Évolution des étoiles sur les 7 derniers jours - #25
OmniVinci est un LLM multimodal pour la compréhension conjointe de la vision, de l'audio et du langage.
★ 677+0Évolution des étoiles sur les 7 derniers jours - #26
✨✨Woodpecker: Correction des hallucinations pour les modèles de langage multimodaux de grande taille
★ 650+1Évolution des étoiles sur les 7 derniers jours - #27
(Accepté par IJCV) Liquid : Les modèles de langage sont des générateurs multimodaux évolutifs et unifiés
★ 640+0Évolution des étoiles sur les 7 derniers jours - #28
Article NeurIPS 2024 : Un LLM de vision unifié au niveau du pixel pour la compréhension, la génération, la segmentation et l'édition
★ 577+1Évolution des étoiles sur les 7 derniers jours - #29
LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.
★ 577+0Évolution des étoiles sur les 7 derniers jours - #30
Cambrian-S : Vers une supersense spatiale dans la vidéo
★ 567-1Évolution des étoiles sur les 7 derniers jours