Zum Hauptinhalt springen
buildradar
Sign in
Thema · vision-language

vision-language

Erfasste Open-Source-Repos mit dem Tag vision-language, sortiert nach Sternen.

Repos
18
Sterne gesamt
35.353
Sterne im Schnitt
1.964
Anteil
0,00%

Themen, die häufig gemeinsam mit vision-language am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit vision-language getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • GroundingDINO@IDEA-Research

    [ECCV 2024] Offizielle Implementierung des Papers „Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection“

    10.536+14Sterne-Änderung der letzten 7 Tage
  • Chinese-CLIP@OFA-Sys

    Chinesische Version von CLIP für chinesische cross-modale Suche und Repräsentationsgenerierung.

    6.001+1Sterne-Änderung der letzten 7 Tage
  • OFA@OFA-Sys

    Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2.557+0Sterne-Änderung der letzten 7 Tage
  • Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.

    1.961+1Sterne-Änderung der letzten 7 Tage
  • AdvancedLiterateMachinery@AlibabaResearch

    Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.

    1.835+1Sterne-Änderung der letzten 7 Tage
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.

    1.507+1Sterne-Änderung der letzten 7 Tage
  • awesome-japanese-llm@llm-jp

    Übersicht japanischer LLMs

    1.428+1Sterne-Änderung der letzten 7 Tage
  • DriveLM@OpenDriveLab

    [ECCV 2024 Oral] DriveLM: Fahren mit visueller Graph-Frage-Antwort

    1.340+1Sterne-Änderung der letzten 7 Tage
  • ONE-PEACE@OFA-Sys

    Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Sterne-Änderung der letzten 7 Tage
  • TinyLLaVA_Factory@TinyLLaVA

    Ein Framework für kleine, große multimodale Modelle

    1.004+1Sterne-Änderung der letzten 7 Tage
  • calvin@mees

    CALVIN - Ein Benchmark für Language-Conditioned Policy Learning für Long-Horizon-Roboter-Manipulationsaufgaben

    983+8Sterne-Änderung der letzten 7 Tage
  • AlphaCLIP@SunzeY

    [CVPR 2024] Alpha-CLIP: Ein CLIP-Modell, das sich auf beliebige Bereiche konzentriert

    874+0Sterne-Änderung der letzten 7 Tage
  • Open-GroundingDino@longzw1997

    Dies ist die Implementierung durch Dritte des Papers Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.

    846+2Sterne-Änderung der letzten 7 Tage
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Erweiterung von LLaVA mit Phi-3 und LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0Sterne-Änderung der letzten 7 Tage
  • daclip-uir@Algolzw

    [ICLR 2024] Steuerung von Vision-Language-Modellen zur universellen Bildrestaurierung. 5. Platz in der NTIRE 2024 Restore Any Image Model in the Wild Challenge.

    817+1Sterne-Änderung der letzten 7 Tage
  • SEED@AILab-CVC

    Offizielle Implementierung von SEED-LLaMA (ICLR 2024).

    641-1Sterne-Änderung der letzten 7 Tage
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Sterne-Änderung der letzten 7 Tage
  • RemoteCLIP@ChenDelong1999

    Offizielles Repository zum Paper „RemoteCLIP: A Vision Language Foundation Model for Remote Sensing“ (IEEE TGRS)

    591+4Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen