image-captioning
Erfasste Open-Source-Repos mit dem Tag image-captioning, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit image-captioning am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit image-captioning getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1★ 11.261-1Sterne-Änderung der letzten 7 Tage
- #2
Keras-Modell zur Generierung von HTML-Code aus handgezeichneten Website-Mockups. Implementiert eine Bildbeschreibungsarchitektur für gezeichnete Quellbilder.
★ 5.143+0Sterne-Änderung der letzten 7 Tage - #3
InternGPT (iGPT) ist eine Open-Source-Demoplattform zur einfachen Präsentation von KI-Modellen. Unterstützt nun DragGAN, ChatGPT, ImageBind, multimodalen Chat wie GPT-4, SAM, interaktive Bildbearbeitung und mehr. Testen Sie es unter igpt.opengvlab.com
★ 3.205+0Sterne-Änderung der letzten 7 Tage - #4
Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Sterne-Änderung der letzten 7 Tage - #5
Einfache Swift-Klasse, die alle Konfigurationen bereitstellt, die Sie zum Erstellen einer benutzerdefinierten Kameraansicht in Ihrer App benötigen
★ 1.395-1Sterne-Änderung der letzten 7 Tage - #6★ 1.348+2Sterne-Änderung der letzten 7 Tage
- #7★ 1.309+0Sterne-Änderung der letzten 7 Tage
- #8
:fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)
★ 973+1Sterne-Änderung der letzten 7 Tage - #9
KI-VTuber mit LLM, ASR, TTS, OCR, CV und weiteren Technologien zum Livestreaming oder um mit dir Minecraft zu spielen.
★ 803+4Sterne-Änderung der letzten 7 Tage - #10
👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]
★ 637+0Sterne-Änderung der letzten 7 Tage - #11
ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.
★ 588-1Sterne-Änderung der letzten 7 Tage - #12★ 563+0Sterne-Änderung der letzten 7 Tage