Zum Hauptinhalt springen
buildradar
Sign in
Thema · image-captioning

image-captioning

Erfasste Open-Source-Repos mit dem Tag image-captioning, sortiert nach Sternen.

Repos
12
Sterne gesamt
29.780
Sterne im Schnitt
2.482
Anteil
0,00%

Themen, die häufig gemeinsam mit image-captioning am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit image-captioning getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • LAVIS@salesforce

    LAVIS – Eine All-in-One-Bibliothek für Language-Vision Intelligence

    11.261-1Sterne-Änderung der letzten 7 Tage
  • sketch-code@ashnkumar

    Keras-Modell zur Generierung von HTML-Code aus handgezeichneten Website-Mockups. Implementiert eine Bildbeschreibungsarchitektur für gezeichnete Quellbilder.

    5.143+0Sterne-Änderung der letzten 7 Tage
  • InternGPT@OpenGVLab

    InternGPT (iGPT) ist eine Open-Source-Demoplattform zur einfachen Präsentation von KI-Modellen. Unterstützt nun DragGAN, ChatGPT, ImageBind, multimodalen Chat wie GPT-4, SAM, interaktive Bildbearbeitung und mehr. Testen Sie es unter igpt.opengvlab.com

    3.205+0Sterne-Änderung der letzten 7 Tage
  • OFA@OFA-Sys

    Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2.557+0Sterne-Änderung der letzten 7 Tage
  • CameraManager@imaginary-cloud

    Einfache Swift-Klasse, die alle Konfigurationen bereitstellt, die Sie zum Erstellen einer benutzerdefinierten Kameraansicht in Ihrer App benötigen

    1.395-1Sterne-Änderung der letzten 7 Tage
  • taggui@jhc13

    Tag-Manager und Bildbeschrifter für Bilddatensätze

    1.348+2Sterne-Änderung der letzten 7 Tage
  • prismer@NVlabs

    Die Implementierung von „Prismer: A Vision-Language Model with Multi-Task Experts“.

    1.309+0Sterne-Änderung der letzten 7 Tage
  • :fire: :fire: :fire: Eine Literaturliste zu einigen aktuellen Arbeiten im Bereich Computer Vision (CV)

    973+1Sterne-Änderung der letzten 7 Tage
  • ZerolanLiveRobot@AkagawaTsurunaki

    KI-VTuber mit LLM, ASR, TTS, OCR, CV und weiteren Technologien zum Livestreaming oder um mit dir Minecraft zu spielen.

    803+4Sterne-Änderung der letzten 7 Tage
  • 👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]

    637+0Sterne-Änderung der letzten 7 Tage
  • ComfyUI_VLM_nodes@gokayfem

    ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.

    588-1Sterne-Änderung der letzten 7 Tage
  • virtex@kdexd

    [CVPR 2021] VirTex: Erlernen visueller Repräsentationen aus Textannotationen

    563+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen