multimodal
Dépôts open source suivis étiquetés multimodal, triés par étoiles.
- #121
✨✨Derniers articles et références sur le raisonnement avec les modèles de base
★ 657+1Évolution des étoiles sur les 7 derniers jours - #122
MOSS-Audio est un modèle de fondation open source pour la compréhension audio unifiée, permettant la gestion de la parole, du son, de la musique, du sous-titrage, des questions-réponses et du raisonnement dans des scénarios réels.
★ 656+5Évolution des étoiles sur les 7 derniers jours - #123★ 641-1Évolution des étoiles sur les 7 derniers jours
- #124
Page de projet pour "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"
★ 639+0Évolution des étoiles sur les 7 derniers jours - #125
👁️ + 💬 + 🎧 = 🤖 Liste sélectionnée des principaux modèles de fondation et multimodaux ! [Article + Code + Exemples + Tutoriels]
★ 637+0Évolution des étoiles sur les 7 derniers jours - #126
Implémentation officielle de "Blended Latent Diffusion" [SIGGRAPH 2023]
★ 632+0Évolution des étoiles sur les 7 derniers jours - #127
Second Brain est un framework agentique agissant comme un système d'exploitation, utilisant l'intelligence des fichiers locaux, l'automatisation des flux de travail et les LLM pour accomplir des tâches et communiquer sur plusieurs modalités et plateformes de messagerie.
★ 631+12Évolution des étoiles sur les 7 derniers jours - #128
Ce dépôt fournit des programmes pour créer du code de génération augmentée par récupération (RAG) pour l'IA générative avec LlamaIndex, Deep Lake et Pinecone, exploitant la puissance des modèles OpenAI et Hugging Face pour la génération et l'évaluation.
★ 624+2Évolution des étoiles sur les 7 derniers jours - #129
Explorez le « moment Eurêka » multimodal sur le modèle 2B
★ 623+0Évolution des étoiles sur les 7 derniers jours - #130
Hunyuan3D-Omni : un framework unifié pour la génération contrôlable d'actifs 3D
★ 618+3Évolution des étoiles sur les 7 derniers jours - #131★ 606—Évolution des étoiles sur les 7 derniers jours
- #132
[ECCV 2024] Tokenize Anything via Prompting
★ 600+0Évolution des étoiles sur les 7 derniers jours - #133
Ce dépôt contient le code d'évaluation pour l'article "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+1Évolution des étoiles sur les 7 derniers jours - #134
Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle
★ 592+11Évolution des étoiles sur les 7 derniers jours - #135
Implémentation officielle de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]
★ 589+0Évolution des étoiles sur les 7 derniers jours - #136
[ECCV2024] Grand modèle de langage multimodal ancré avec tokenisation visuelle localisée
★ 586+0Évolution des étoiles sur les 7 derniers jours - #137
Créez des automatisations de navigateur comme si vous enseigniez à un humain en utilisant GPT-4 Vision.
★ 586+0Évolution des étoiles sur les 7 derniers jours - #138
RAI est un framework d'agents indépendant des fournisseurs pour la robotique en IA physique, utilisant les outils ROS 2 pour exécuter des actions complexes, des scénarios définis, une interface libre, des résumés de journaux, des interactions vocales et plus encore.
★ 582+6Évolution des étoiles sur les 7 derniers jours - #139★ 579+13Évolution des étoiles sur les 7 derniers jours
- #140
LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.
★ 577+0Évolution des étoiles sur les 7 derniers jours - #141
Le système d'autocodage pour votre application — Alan AI SDK pour React Native
★ 575+0Évolution des étoiles sur les 7 derniers jours - #142
Un agent IA multimodal MCP doté d'yeux et d'oreilles !
★ 575-1Évolution des étoiles sur les 7 derniers jours - #143★ 572+1Évolution des étoiles sur les 7 derniers jours
- #144★ 568+0Évolution des étoiles sur les 7 derniers jours
- #145
Flame est un système d'IA multimodal open-source conçu pour traduire des maquettes de design d'UI en code React de haute qualité. Il exploite la modélisation vision-langage, la synthèse automatisée de données et des flux de travail d'entraînement structurés pour combler le fossé entre le design et le développement front-end.
★ 562+0Évolution des étoiles sur les 7 derniers jours - #146
Un hub pour divers schémas spécifiques à l'industrie à utiliser avec les VLM.
★ 555+0Évolution des étoiles sur les 7 derniers jours - #147
Awesome Multimodal Modeling [Couvre MLLM, UMM et NMM]
★ 543+2Évolution des étoiles sur les 7 derniers jours - #148
Code officiel de "EVF-SAM : Early Vision-Language Fusion for Text-Prompted Segment Anything Model".
★ 508+1Évolution des étoiles sur les 7 derniers jours