image-captioning
Dépôts open source suivis étiquetés image-captioning, triés par étoiles.
Sujets associés
Sujets qui apparaissent souvent aux côtés de image-captioning sur un même dépôt.
Ascensions récentes
Dépôts créés au cours des 90 derniers jours et étiquetés image-captioning.
Aucun nouveau dépôt étiqueté avec ce sujet au cours des 90 derniers jours.
- #1★ 11 261-1Évolution des étoiles sur les 7 derniers jours
- #2
Modèle Keras pour générer du code HTML à partir de maquettes de sites web dessinées à la main. Implémente une architecture de légendage d'images pour les images sources dessinées.
★ 5 143+0Évolution des étoiles sur les 7 derniers jours - #3
InternGPT (iGPT) est une plateforme de démonstration open source pour présenter facilement vos modèles d'IA. Prend désormais en charge DragGAN, ChatGPT, ImageBind, le chat multimodal type GPT-4, SAM, l'édition d'image interactive, etc. Essayez-le sur igpt.opengvlab.com
★ 3 205+0Évolution des étoiles sur les 7 derniers jours - #4
Dépôt officiel d'OFA (ICML 2022). Article : OFA : Unifier les architectures, les tâches et les modalités via un framework d'apprentissage séquence-à-séquence simple.
★ 2 557+0Évolution des étoiles sur les 7 derniers jours - #5
Classe Swift simple fournissant toutes les configurations nécessaires pour créer une vue caméra personnalisée dans votre application
★ 1 395-1Évolution des étoiles sur les 7 derniers jours - #6★ 1 348+2Évolution des étoiles sur les 7 derniers jours
- #7★ 1 309+0Évolution des étoiles sur les 7 derniers jours
- #8
Une liste d'articles sur des travaux récents en vision par ordinateur (CV)
★ 973+1Évolution des étoiles sur les 7 derniers jours - #9
VTuber IA utilisant LLM, ASR, TTS, OCR, CV et d'autres technologies pour diffuser en direct ou jouer à Minecraft avec vous.
★ 802+4Évolution des étoiles sur les 7 derniers jours - #10
👁️ + 💬 + 🎧 = 🤖 Liste sélectionnée des principaux modèles de fondation et multimodaux ! [Article + Code + Exemples + Tutoriels]
★ 637+0Évolution des étoiles sur les 7 derniers jours - #11
Nœuds ComfyUI pour les modèles vision-langage : Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Inclut également la détection à vocabulaire ouvert, la segmentation SAM2/SAM3, le raisonnement temporel vidéo, GGUF via llama.cpp et des API LLM/VLM hébergées.
★ 588-1Évolution des étoiles sur les 7 derniers jours - #12
[CVPR 2021] VirTex : Apprentissage de représentations visuelles à partir d'annotations textuelles
★ 563+0Évolution des étoiles sur les 7 derniers jours