vision-language
Erfasste Open-Source-Repos mit dem Tag vision-language, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit vision-language am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit vision-language getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
[ECCV 2024] Offizielle Implementierung des Papers „Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection“
★ 10.536+14Sterne-Änderung der letzten 7 Tage - #2
Chinesische Version von CLIP für chinesische cross-modale Suche und Repräsentationsgenerierung.
★ 6.001+1Sterne-Änderung der letzten 7 Tage - #3
Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Sterne-Änderung der letzten 7 Tage - #4
Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.
★ 1.961+1Sterne-Änderung der letzten 7 Tage - #5
Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.
★ 1.835+1Sterne-Änderung der letzten 7 Tage - #6
[ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.
★ 1.507+1Sterne-Änderung der letzten 7 Tage - #7
Übersicht japanischer LLMs
★ 1.428+1Sterne-Änderung der letzten 7 Tage - #8★ 1.340+1Sterne-Änderung der letzten 7 Tage
- #9
Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Sterne-Änderung der letzten 7 Tage - #10
Ein Framework für kleine, große multimodale Modelle
★ 1.004+1Sterne-Änderung der letzten 7 Tage - #11
CALVIN - Ein Benchmark für Language-Conditioned Policy Learning für Long-Horizon-Roboter-Manipulationsaufgaben
★ 983+8Sterne-Änderung der letzten 7 Tage - #12
[CVPR 2024] Alpha-CLIP: Ein CLIP-Modell, das sich auf beliebige Bereiche konzentriert
★ 874+0Sterne-Änderung der letzten 7 Tage - #13
Dies ist die Implementierung durch Dritte des Papers Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection.
★ 846+2Sterne-Änderung der letzten 7 Tage - #14
🔥🔥 LLaVA++: Erweiterung von LLaVA mit Phi-3 und LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842+0Sterne-Änderung der letzten 7 Tage - #15
[ICLR 2024] Steuerung von Vision-Language-Modellen zur universellen Bildrestaurierung. 5. Platz in der NTIRE 2024 Restore Any Image Model in the Wild Challenge.
★ 817+1Sterne-Änderung der letzten 7 Tage - #16★ 641-1Sterne-Änderung der letzten 7 Tage
- #17★ 596—Sterne-Änderung der letzten 7 Tage
- #18
Offizielles Repository zum Paper „RemoteCLIP: A Vision Language Foundation Model for Remote Sensing“ (IEEE TGRS)
★ 591+4Sterne-Änderung der letzten 7 Tage