multimodal
Dépôts open source suivis étiquetés multimodal, triés par étoiles.
- #91
Boîte à outils et compétences visuelles conçues pour les LLM textuels : questions-réponses sur images, OCR de captures d'écran, restauration d'interface UI, automatisation GUI, avec intégration transparente optionnelle pour divers agents.
★ 1 136+18Évolution des étoiles sur les 7 derniers jours - #92
Le système d'auto-codage pour votre application — SDK Alan AI pour Cordova
★ 1 132+0Évolution des étoiles sur les 7 derniers jours - #93
SGLang-Omni permet un service haute performance pour les modèles TTS, ASR, vocaux et omnimodaux.
★ 1 118+143Évolution des étoiles sur les 7 derniers jours - #94★ 1 110+5Évolution des étoiles sur les 7 derniers jours
- #95★ 1 088+1Évolution des étoiles sur les 7 derniers jours
- #96
Vision pour les agents DeepSeek Harness : chaîne de vision gratuite intégrée (sans clé) et outils de vision au niveau du pixel (Q&A, ancrage, recadrage, différence de pixels, couleurs, OCR, tracé SVG, détourage, captures d'écran). Installation en une commande, sans Python, les images fonctionnent comme des appels d'outils classiques.
★ 1 086+64Évolution des étoiles sur les 7 derniers jours - #97
Le premier modèle médical multimodal chinois capable d'interpréter des radiographies thoraciques.
★ 1 084+2Évolution des étoiles sur les 7 derniers jours - #98
[ICLR'24 spotlight] Série de grands modèles multimodaux chinois et anglais (Chat et Paint) basés sur le modèle CPM.
★ 1 061-1Évolution des étoiles sur les 7 derniers jours - #99
Un modèle de représentation général pour les modalités vision, audio et langage. Article : ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1 060+0Évolution des étoiles sur les 7 derniers jours - #100
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM : Permettre aux grands modèles de langage de comprendre les nuages de points
★ 1 053+2Évolution des étoiles sur les 7 derniers jours - #101
Implémentation officielle pour CLIP4Clip : une étude empirique de CLIP pour la recherche de clips vidéo de bout en bout.
★ 1 032+1Évolution des étoiles sur les 7 derniers jours - #102
Raisonnement multimodal par chaîne de pensée : une étude complète
★ 1 025+2Évolution des étoiles sur les 7 derniers jours - #103★ 1 017+38Évolution des étoiles sur les 7 derniers jours
- #104
Ressources, exemples et tutoriels pour l'IA multimodale, le RAG et les agents utilisant la recherche vectorielle et les LLM
★ 973-1Évolution des étoiles sur les 7 derniers jours - #105★ 959+64Évolution des étoiles sur les 7 derniers jours
- #106★ 903+4Évolution des étoiles sur les 7 derniers jours
- #107
À propos : cette collection rassemble les articles les plus passionnants et influents de la CVPR 2025. 🔥 [Article + Code + Démo]
★ 895+1Évolution des étoiles sur les 7 derniers jours - #108
Série NEO : Modèles vision-langage natifs conçus à partir des principes fondamentaux
★ 888+0Évolution des étoiles sur les 7 derniers jours - #109★ 881-1Évolution des étoiles sur les 7 derniers jours
- #110
Solveur de captcha auto-hébergeable compatible avec YesCaptcha, construit avec FastAPI, Playwright et des modèles multimodaux compatibles OpenAI.
★ 869+4Évolution des étoiles sur les 7 derniers jours - #111
Un moteur d'entraînement simple et unifié pour modèles multimodaux. Léger, flexible et conçu pour le hacking à grande échelle.
★ 824+0Évolution des étoiles sur les 7 derniers jours - #112
[TMLR 2025🔥] Étude sur les modèles autorégressifs en vision.
★ 808+1Évolution des étoiles sur les 7 derniers jours - #113
Bibliothèque dédiée à la recherche en NLP et en vision par ordinateur sur les articles scientifiques.
★ 803+0Évolution des étoiles sur les 7 derniers jours - #114
Entraîner des modèles par apprentissage contrastif avec PyTorch.
★ 802+0Évolution des étoiles sur les 7 derniers jours - #115
Surveillance locale + vision IA — Framework de surveillance IA basé sur LAN et alimenté par smartphone, avec sortie d'événements structurés pour l'acquisition et l'analyse de données.
★ 768+10Évolution des étoiles sur les 7 derniers jours - #116
Liste d'articles sur les modèles multimodaux et les grands modèles de langage, utilisée uniquement pour enregistrer mes lectures quotidiennes sur arxiv.
★ 761+1Évolution des étoiles sur les 7 derniers jours - #117
[ECCV 2024] InstructIR : Restauration d'images de haute qualité suivant des instructions humaines https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0Évolution des étoiles sur les 7 derniers jours - #118
Paddle Multimodal Integration and eXploration, prenant en charge les tâches multimodales courantes, incluant des modèles de pré-entraînement multimodaux à grande échelle et une boîte à outils de modèles de diffusion, alliant haute performance et flexibilité.
★ 723-1Évolution des étoiles sur les 7 derniers jours - #119★ 689+1Évolution des étoiles sur les 7 derniers jours
- #120
Ce dépôt contient le code de "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026], et "MMEB-V3" [COLM 2026]
★ 682+2Évolution des étoiles sur les 7 derniers jours