multi-modality
Dépôts open source suivis étiquetés multi-modality, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de multi-modality sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés multi-modality.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) conçu pour atteindre et dépasser les capacités de GPT-4V
★ 25 005+9Évolution des étoiles sur les 7 derniers jours - #2
Dernières avancées sur les modèles de langage multimodaux (MLLM)
★ 17 994+8Évolution des étoiles sur les 7 derniers jours - #3
🏄 Embedding, raisonnement et classement évolutifs pour les images et les phrases avec CLIP.
★ 12 835+0Évolution des étoiles sur les 7 derniers jours - #4
MOSS-TTS-Nano est un modèle de synthèse vocale multilingue miniature open source développé par MOSI.AI et l'équipe OpenMOSS. Avec seulement 0,1 milliard de paramètres, il est conçu pour la génération de parole en temps réel, peut s'exécuter directement sur CPU sans GPU, et maintient une pile de déploiement suffisamment simple pour des démonstrations locales, le service web et l'intégration légère dans des produits.
★ 4 279+51Évolution des étoiles sur les 7 derniers jours - #5
Otter, un modèle multimodal basé sur OpenFlamingo (version open source du Flamingo de DeepMind), entraîné sur MIMIC-IT, offrant de meilleures capacités de suivi d'instructions et d'apprentissage en contexte.
★ 3 437+2Évolution des étoiles sur les 7 derniers jours - #6
InternLM-XComposer2.5-OmniLive : un système multimodal complet pour les interactions vidéo et audio en streaming à long terme.
★ 2 925+1Évolution des étoiles sur les 7 derniers jours - #7
Algorithmes et publications sur le suivi d'objets 3D.
★ 1 028+2Évolution des étoiles sur les 7 derniers jours - #8★ 979+1Évolution des étoiles sur les 7 derniers jours
- #9★ 729+2Évolution des étoiles sur les 7 derniers jours
- #10★ 671+2Évolution des étoiles sur les 7 derniers jours
- #11
Chatbot Arena rencontre la multimodalité ! Multi-Modality Arena vous permet d'évaluer des modèles vision-langage côte à côte en fournissant des images en entrée. Prend en charge MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 et bien d'autres !
★ 566+0Évolution des étoiles sur les 7 derniers jours