mllm
Dépôts open source suivis étiquetés mllm, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de mllm sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés mllm.
- #1
La vision comme génération multimodale unifiée
★ 683
- #1
Pré-entraînement auto-supervisé à grande échelle à travers les tâches, les langues et les modalités.
★ 22 203+7Évolution des étoiles sur les 7 derniers jours - #2
Agent S : un framework agentique open source qui utilise les ordinateurs comme un humain
★ 12 219+17Évolution des étoiles sur les 7 derniers jours - #3
Mobile-Agent : une famille d'agents GUI puissants.
★ 9 157+9Évolution des étoiles sur les 7 derniers jours - #4
[NeurIPS 2025] SpatialLM : Entraînement de grands modèles de langage pour la modélisation intérieure structurée.
★ 4 726+3Évolution des étoiles sur les 7 derniers jours - #5
[CVPR'25] Implémentations officielles pour l'article - MagicQuill : Un système intelligent et interactif d'édition d'images.
★ 3 691+2Évolution des étoiles sur les 7 derniers jours - #6
Du Chain-of-Thought prompting à OpenAI o1 et DeepSeek-R1 🍓
★ 3 681+3Évolution des étoiles sur les 7 derniers jours - #7
Code et modèles pour l'article ICML 2024, NExT-GPT : un modèle de langage multimodal Any-to-Any.
★ 3 634-2Évolution des étoiles sur les 7 derniers jours - #8★ 3 511+32Évolution des étoiles sur les 7 derniers jours
- #9
InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.
★ 2 925-1Évolution des étoiles sur les 7 derniers jours - #10
mPLUG-DocOwl : Modèle de langage multimodal modulaire pour la compréhension de documents
★ 2 411+0Évolution des étoiles sur les 7 derniers jours - #11
Cambrian-1 est une famille de LLM multimodaux avec une conception centrée sur la vision.
★ 2 014+1Évolution des étoiles sur les 7 derniers jours - #12
🚀🚀🚀 Une collection de projets publics exceptionnels de la série de détection d'objets YOLO et des jeux de données de détection d'objets associés.
★ 1 783-2Évolution des étoiles sur les 7 derniers jours - #13
Dépôt officiel de la base de code Pixel-LLM : Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1ère solution pour LSVOS)
★ 1 666+0Évolution des étoiles sur les 7 derniers jours - #14★ 1 570+8Évolution des étoiles sur les 7 derniers jours
- #15
Catalogue visuel organisé de plus de 155 architectures de modèles vision-langage (VLM/MLLM) : articles, diagrammes, recettes d'entraînement, jeux de données et chronologie des versions pour les agents IA multimodaux.
★ 1 310+2Évolution des étoiles sur les 7 derniers jours - #16
Framework entièrement ouvert pour la démocratisation de l'entraînement multimodal.
★ 1 195+1Évolution des étoiles sur les 7 derniers jours - #17★ 1 053+0Évolution des étoiles sur les 7 derniers jours
- #18
OpenEMMA, une reproduction open source sous licence permissive du modèle EMMA de Waymo.
★ 951+0Évolution des étoiles sur les 7 derniers jours - #19
Série NEO : Modèles vision-langage natifs conçus à partir des principes fondamentaux
★ 889+0Évolution des étoiles sur les 7 derniers jours - #20
[NeurIPS 2025] JarvisArt : Libérer la créativité artistique humaine via un agent intelligent de retouche photo
★ 862+1Évolution des étoiles sur les 7 derniers jours - #21
[CVPR2024] Code pour « Osprey: Pixel Understanding with Visual Instruction Tuning ».
★ 843+0Évolution des étoiles sur les 7 derniers jours - #22
[NeurIPS 2025 spotlight] Implémentation officielle de "FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving".
★ 831+9Évolution des étoiles sur les 7 derniers jours - #23
[NeurIPS 2025] 4KAgent : super-résolution 4K agentique pour toute image. Un agent de vision par ordinateur intelligent capable de restaurer magiquement n'importe quelle image en 4K parfaite !
★ 822+3Évolution des étoiles sur les 7 derniers jours - #24
Collection de projets publics remarquables sur les LLM, VLM, VLA, AIGC, ainsi que les jeux de données et applications associés.
★ 815+1Évolution des étoiles sur les 7 derniers jours - #25
Ceci est un dépôt répertoriant les articles sur la génération et l'application de graphes de scène.
★ 725+5Évolution des étoiles sur les 7 derniers jours - #26
Projet personnel : MPP-Qwen14B & MPP-Qwen-Next (Pipeline multimodal parallèle basé sur Qwen-LM). Support [video/image/multi-image] {sft/conversations}. Ne laissez pas la pauvreté limiter votre imagination ! Entraînez votre propre MLLM similaire à LLaVA-training sur 8B/14B en utilisant RTX3090/4090 24GB.
★ 687+0Évolution des étoiles sur les 7 derniers jours - #27
La vision comme génération multimodale unifiée
★ 683+27Évolution des étoiles sur les 7 derniers jours - #28
✨✨Woodpecker: Correction des hallucinations pour les modèles de langage multimodaux de grande taille
★ 650+1Évolution des étoiles sur les 7 derniers jours - #29
[ICLR 2025] FakeShield : Détection et localisation explicables de falsification d'images via des modèles de langage multimodaux
★ 623+2Évolution des étoiles sur les 7 derniers jours - #30
Emotion-LLaMA : Reconnaissance et raisonnement émotionnels multimodaux avec réglage par instructions
★ 618+0Évolution des étoiles sur les 7 derniers jours