Aller au contenu principal
buildradar
Sign in
Sujet · multimodal

multimodal

Dépôts open source suivis étiquetés multimodal, triés par étoiles.

148 dépôts
  • stability-sdk@Stability-AI

    SDK pour interagir avec les API de stability.ai (par exemple, l'inférence Stable Diffusion).

    2 435-1Évolution des étoiles sur les 7 derniers jours
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl : Modèle de langage multimodal modulaire pour la compréhension de documents

    2 411+0Évolution des étoiles sur les 7 derniers jours
  • InternVideo@OpenGVLab

    [ECCV2024] Modèles de fondation vidéo et données pour la compréhension multimodale.

    2 374+5Évolution des étoiles sur les 7 derniers jours
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer : Générez des données synthétiques de haute qualité à partir de zéro ou de données sources.

    2 197+7Évolution des étoiles sur les 7 derniers jours
  • genai-processors@google-gemini

    GenAI Processors est une bibliothèque Python légère permettant un traitement de contenu efficace et parallèle.

    2 120+0Évolution des étoiles sur les 7 derniers jours
  • claude-real-video@HUANGCHIHHUNGLeo

    Permet à Claude (ou tout autre LLM) de visionner une vidéo : analyse de scènes, déduplication d'images et transcription, à partir d'une URL ou d'un fichier local. Exécution locale, sous licence MIT.

    2 109+20Évolution des étoiles sur les 7 derniers jours
  • parlor@fikrikarim

    IA multimodale en temps réel sur appareil, avec des fonctionnalités similaires à GPT-Live

    2 048+7Évolution des étoiles sur les 7 derniers jours
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Dépôt pour la série Show-o, un transformeur unique pour unifier la compréhension et la génération multimodales.

    1 975+1Évolution des étoiles sur les 7 derniers jours
  • Une implémentation open-source pour le fine-tuning de la série Qwen-VL d'Alibaba Cloud.

    1 961+1Évolution des étoiles sur les 7 derniers jours
  • BitNet@kyegomez

    Implémentation en PyTorch de « BitNet: Scaling 1-bit Transformers for Large Language Models ».

    1 946+0Évolution des étoiles sur les 7 derniers jours
  • AdvancedLiterateMachinery@AlibabaResearch

    Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.

    1 835+1Évolution des étoiles sur les 7 derniers jours
  • DeTikZify@potamides

    Synthèse de programmes graphiques pour figures scientifiques et croquis avec TikZ.

    1 818+1Évolution des étoiles sur les 7 derniers jours
  • Le système d'auto-codage pour votre application — SDK Alan AI pour Android

    1 807-1Évolution des étoiles sur les 7 derniers jours
  • Le système d'auto-codage pour votre application — SDK Alan AI pour Flutter

    1 756-1Évolution des étoiles sur les 7 derniers jours
  • alan-sdk-ionic@alan-ai

    Le système d'auto-codage pour votre application — SDK Alan AI pour Ionic.

    1 649-1Évolution des étoiles sur les 7 derniers jours
  • pixeltable@pixeltable

    Backend multimodal unifié pour les applications de données IA

    1 619+5Évolution des étoiles sur les 7 derniers jours
  • mllm@UbiquitousLearning

    LLM multimodal rapide pour appareils mobiles

    1 602+3Évolution des étoiles sur les 7 derniers jours
  • thepipe@emcf

    Obtenez des données propres à partir de documents complexes, grâce aux modèles de vision-langage ⚡

    1 524+0Évolution des étoiles sur les 7 derniers jours
  • Ovis@ATH-MaaS

    Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.

    1 514+2Évolution des étoiles sur les 7 derniers jours
  • ha-llmvision@valentinfrlch

    Intelligence visuelle pour votre domicile.

    1 454+10Évolution des étoiles sur les 7 derniers jours
  • awesome-japanese-llm@llm-jp

    Vue d'ensemble des LLM japonais.

    1 428+1Évolution des étoiles sur les 7 derniers jours
  • SDT@dailenson

    Ce dépôt est l'implémentation officielle de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023).

    1 406-1Évolution des étoiles sur les 7 derniers jours
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1 368+462Évolution des étoiles sur les 7 derniers jours
  • airunner@Capsize-Games

    Moteur d'inférence hors ligne pour l'art, les conversations vocales en temps réel, les chatbots basés sur LLM et les flux de travail automatisés.

    1 314+0Évolution des étoiles sur les 7 derniers jours
  • Catalogue visuel organisé de plus de 155 architectures de modèles vision-langage (VLM/MLLM) : articles, diagrammes, recettes d'entraînement, jeux de données et chronologie des versions pour les agents IA multimodaux.

    1 310+2Évolution des étoiles sur les 7 derniers jours
  • claude-video-vision@jordanrendric

    Donnez à Claude la capacité de regarder et de comprendre des vidéos — plugin Claude Code avec extraction d'images et analyse audio multimodale

    1 281+6Évolution des étoiles sur les 7 derniers jours
  • UForm@unum-cloud

    IA multimodale de poche pour la compréhension et la génération de contenu textuel, image et bientôt vidéo, jusqu'à 5 fois plus rapide qu'OpenAI CLIP et LLaVA

    1 247+1Évolution des étoiles sur les 7 derniers jours
  • xtreme1@xtreme1-io

    Xtreme1 est une plateforme tout-en-un d'étiquetage et d'annotation de données pour l'entraînement multimodal, prenant en charge les nuages de points LiDAR 3D, les images et les LLM.

    1 239+2Évolution des étoiles sur les 7 derniers jours
  • LLaMA-Mesh@nv-tlabs

    Unification de la génération de maillages 3D avec des modèles de langage.

    1 167+0Évolution des étoiles sur les 7 derniers jours
  • doc7@magicrew

    Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle

    1 153-25Évolution des étoiles sur les 7 derniers jours
← Retour aux sujets