multimodal
Dépôts open source suivis étiquetés multimodal, triés par étoiles.
- #61
SDK pour interagir avec les API de stability.ai (par exemple, l'inférence Stable Diffusion).
★ 2 435-1Évolution des étoiles sur les 7 derniers jours - #62
mPLUG-DocOwl : Modèle de langage multimodal modulaire pour la compréhension de documents
★ 2 411+0Évolution des étoiles sur les 7 derniers jours - #63
[ECCV2024] Modèles de fondation vidéo et données pour la compréhension multimodale.
★ 2 374+5Évolution des étoiles sur les 7 derniers jours - #64
🎨 NeMo Data Designer : Générez des données synthétiques de haute qualité à partir de zéro ou de données sources.
★ 2 197+7Évolution des étoiles sur les 7 derniers jours - #65
GenAI Processors est une bibliothèque Python légère permettant un traitement de contenu efficace et parallèle.
★ 2 120+0Évolution des étoiles sur les 7 derniers jours - #66
Permet à Claude (ou tout autre LLM) de visionner une vidéo : analyse de scènes, déduplication d'images et transcription, à partir d'une URL ou d'un fichier local. Exécution locale, sous licence MIT.
★ 2 109+20Évolution des étoiles sur les 7 derniers jours - #67
IA multimodale en temps réel sur appareil, avec des fonctionnalités similaires à GPT-Live
★ 2 048+7Évolution des étoiles sur les 7 derniers jours - #68
[ICLR & NeurIPS 2025] Dépôt pour la série Show-o, un transformeur unique pour unifier la compréhension et la génération multimodales.
★ 1 975+1Évolution des étoiles sur les 7 derniers jours - #69
Une implémentation open-source pour le fine-tuning de la série Qwen-VL d'Alibaba Cloud.
★ 1 961+1Évolution des étoiles sur les 7 derniers jours - #70
Implémentation en PyTorch de « BitNet: Scaling 1-bit Transformers for Large Language Models ».
★ 1 946+0Évolution des étoiles sur les 7 derniers jours - #71
Une collection d'idées et d'algorithmes originaux et innovants pour des machines littéraires avancées. Ce projet est maintenu par l'équipe OCR du Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1 835+1Évolution des étoiles sur les 7 derniers jours - #72
Synthèse de programmes graphiques pour figures scientifiques et croquis avec TikZ.
★ 1 818+1Évolution des étoiles sur les 7 derniers jours - #73
Le système d'auto-codage pour votre application — SDK Alan AI pour Android
★ 1 807-1Évolution des étoiles sur les 7 derniers jours - #74
Le système d'auto-codage pour votre application — SDK Alan AI pour Flutter
★ 1 756-1Évolution des étoiles sur les 7 derniers jours - #75
Le système d'auto-codage pour votre application — SDK Alan AI pour Ionic.
★ 1 649-1Évolution des étoiles sur les 7 derniers jours - #76
Backend multimodal unifié pour les applications de données IA
★ 1 619+5Évolution des étoiles sur les 7 derniers jours - #77★ 1 602+3Évolution des étoiles sur les 7 derniers jours
- #78
Obtenez des données propres à partir de documents complexes, grâce aux modèles de vision-langage ⚡
★ 1 524+0Évolution des étoiles sur les 7 derniers jours - #79
Une nouvelle architecture de modèle de langage multimodal (MLLM), conçue pour aligner structurellement les plongements visuels et textuels.
★ 1 514+2Évolution des étoiles sur les 7 derniers jours - #80
Intelligence visuelle pour votre domicile.
★ 1 454+10Évolution des étoiles sur les 7 derniers jours - #81
Vue d'ensemble des LLM japonais.
★ 1 428+1Évolution des étoiles sur les 7 derniers jours - #82
Ce dépôt est l'implémentation officielle de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023).
★ 1 406-1Évolution des étoiles sur les 7 derniers jours - #83
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1 368+462Évolution des étoiles sur les 7 derniers jours - #84
Moteur d'inférence hors ligne pour l'art, les conversations vocales en temps réel, les chatbots basés sur LLM et les flux de travail automatisés.
★ 1 314+0Évolution des étoiles sur les 7 derniers jours - #85
Catalogue visuel organisé de plus de 155 architectures de modèles vision-langage (VLM/MLLM) : articles, diagrammes, recettes d'entraînement, jeux de données et chronologie des versions pour les agents IA multimodaux.
★ 1 310+2Évolution des étoiles sur les 7 derniers jours - #86
Donnez à Claude la capacité de regarder et de comprendre des vidéos — plugin Claude Code avec extraction d'images et analyse audio multimodale
★ 1 281+6Évolution des étoiles sur les 7 derniers jours - #87
IA multimodale de poche pour la compréhension et la génération de contenu textuel, image et bientôt vidéo, jusqu'à 5 fois plus rapide qu'OpenAI CLIP et LLaVA
★ 1 247+1Évolution des étoiles sur les 7 derniers jours - #88
Xtreme1 est une plateforme tout-en-un d'étiquetage et d'annotation de données pour l'entraînement multimodal, prenant en charge les nuages de points LiDAR 3D, les images et les LLM.
★ 1 239+2Évolution des étoiles sur les 7 derniers jours - #89
Unification de la génération de maillages 3D avec des modèles de langage.
★ 1 167+0Évolution des étoiles sur les 7 derniers jours - #90
Transformez vos documents en Markdown prêt pour l'IA grâce à la compréhension visuelle
★ 1 153-25Évolution des étoiles sur les 7 derniers jours