Aller au contenu principal
buildradar
Sign in
Sujet · multimodal

multimodal

Dépôts open source suivis étiquetés multimodal, triés par étoiles.

148 dépôts
  • ✨✨Derniers articles et références sur le raisonnement avec les modèles de base

    657+1Évolution des étoiles sur les 7 derniers jours
  • MOSS-Audio@OpenMOSS

    MOSS-Audio est un modèle de fondation open source pour la compréhension audio unifiée, permettant la gestion de la parole, du son, de la musique, du sous-titrage, des questions-réponses et du raisonnement dans des scénarios réels.

    656+5Évolution des étoiles sur les 7 derniers jours
  • SEED@AILab-CVC

    Implémentation officielle de SEED-LLaMA (ICLR 2024).

    641-1Évolution des étoiles sur les 7 derniers jours
  • Seg-Zero@JIA-Lab-research

    Page de projet pour "Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement"

    639+0Évolution des étoiles sur les 7 derniers jours
  • 👁️ + 💬 + 🎧 = 🤖 Liste sélectionnée des principaux modèles de fondation et multimodaux ! [Article + Code + Exemples + Tutoriels]

    637+0Évolution des étoiles sur les 7 derniers jours
  • blended-latent-diffusion@omriav

    Implémentation officielle de "Blended Latent Diffusion" [SIGGRAPH 2023]

    632+0Évolution des étoiles sur les 7 derniers jours
  • second-brain@henrydaum

    Second Brain est un framework agentique agissant comme un système d'exploitation, utilisant l'intelligence des fichiers locaux, l'automatisation des flux de travail et les LLM pour accomplir des tâches et communiquer sur plusieurs modalités et plateformes de messagerie.

    631+12Évolution des étoiles sur les 7 derniers jours
  • RAG-Driven-Generative-AI@Denis2054

    Ce dépôt fournit des programmes pour créer du code de génération augmentée par récupération (RAG) pour l'IA générative avec LlamaIndex, Deep Lake et Pinecone, exploitant la puissance des modèles OpenAI et Hugging Face pour la génération et l'évaluation.

    624+2Évolution des étoiles sur les 7 derniers jours
  • VisualThinker-R1-Zero@turningpoint-ai

    Explorez le « moment Eurêka » multimodal sur le modèle 2B

    623+0Évolution des étoiles sur les 7 derniers jours
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni : un framework unifié pour la génération contrôlable d'actifs 3D

    618+3Évolution des étoiles sur les 7 derniers jours
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606Évolution des étoiles sur les 7 derniers jours
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenize Anything via Prompting

    600+0Évolution des étoiles sur les 7 derniers jours
  • MMMU@MMMU-Benchmark

    Ce dépôt contient le code d'évaluation pour l'article "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+1Évolution des étoiles sur les 7 derniers jours
  • Relax@redai-studio

    Un moteur d'apprentissage par renforcement asynchrone pour le post-entraînement omnimodal à grande échelle

    592+11Évolution des étoiles sur les 7 derniers jours
  • blended-diffusion@omriav

    Implémentation officielle de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]

    589+0Évolution des étoiles sur les 7 derniers jours
  • Groma@FoundationVision

    [ECCV2024] Grand modèle de langage multimodal ancré avec tokenisation visuelle localisée

    586+0Évolution des étoiles sur les 7 derniers jours
  • AI-Employe@vignshwarar

    Créez des automatisations de navigateur comme si vous enseigniez à un humain en utilisant GPT-4 Vision.

    586+0Évolution des étoiles sur les 7 derniers jours
  • rai@RobotecAI

    RAI est un framework d'agents indépendant des fournisseurs pour la robotique en IA physique, utilisant les outils ROS 2 pour exécuter des actions complexes, des scénarios définis, une interface libre, des résumés de journaux, des interactions vocales et plus encore.

    582+6Évolution des étoiles sur les 7 derniers jours
  • motis@motis-project

    Routage multimodal, géocodage et tuiles de carte

    579+13Évolution des étoiles sur les 7 derniers jours
  • LLaVA-Mini@ictnlp

    LLaVA-Mini est un grand modèle multimodal (LMM) unifié capable de prendre en charge la compréhension d'images, d'images haute résolution et de vidéos de manière efficace.

    577+0Évolution des étoiles sur les 7 derniers jours
  • Le système d'autocodage pour votre application — Alan AI SDK pour React Native

    575+0Évolution des étoiles sur les 7 derniers jours
  • multimodal-agents-course@the-ai-merge

    Un agent IA multimodal MCP doté d'yeux et d'oreilles !

    575-1Évolution des étoiles sur les 7 derniers jours
  • psi@microsoft

    Plateforme pour l'intelligence située

    572+1Évolution des étoiles sur les 7 derniers jours
  • clip.cpp@monatis

    Inférence CLIP en C/C++ pur sans dépendances supplémentaires

    568+0Évolution des étoiles sur les 7 derniers jours
  • Flame-Code-VLM@Flame-Code-VLM

    Flame est un système d'IA multimodal open-source conçu pour traduire des maquettes de design d'UI en code React de haute qualité. Il exploite la modélisation vision-langage, la synthèse automatisée de données et des flux de travail d'entraînement structurés pour combler le fossé entre le design et le développement front-end.

    562+0Évolution des étoiles sur les 7 derniers jours
  • vlmrun-hub@vlm-run

    Un hub pour divers schémas spécifiques à l'industrie à utiliser avec les VLM.

    555+0Évolution des étoiles sur les 7 derniers jours
  • Awesome Multimodal Modeling [Couvre MLLM, UMM et NMM]

    543+2Évolution des étoiles sur les 7 derniers jours
  • EVF-SAM@hustvl

    Code officiel de "EVF-SAM : Early Vision-Language Fusion for Text-Prompted Segment Anything Model".

    508+1Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets