vision-and-language
Erfasste Open-Source-Repos mit dem Tag vision-and-language, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit vision-and-language am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit vision-and-language getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
Ein zentrales Repository für aktuelle Forschung zu generativer KI, Interview-Ressourcen, Notebooks und vieles mehr!
★ 29.211+213Sterne-Änderung der letzten 7 Tage - #2★ 11.261-1Sterne-Änderung der letzten 7 Tage
- #3
Optimierung des Fine-Tuning-Prozesses für multimodale Modelle: PaliGemma 2, Florence-2 und Qwen2.5-VL
★ 2.695+1Sterne-Änderung der letzten 7 Tage - #4
[EMNLP-2024] Erstellen Sie multimodale Sprachagenten für schnelles Prototyping und Produktion
★ 2.666+1Sterne-Änderung der letzten 7 Tage - #5
Code für das ICML 2021 (Long Talk) Paper: "ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision".
★ 1.538+0Sterne-Änderung der letzten 7 Tage - #6
Übersicht japanischer LLMs
★ 1.428+1Sterne-Änderung der letzten 7 Tage - #7★ 1.393+0Sterne-Änderung der letzten 7 Tage
- #8★ 1.309+0Sterne-Änderung der letzten 7 Tage
- #9★ 1.088+1Sterne-Änderung der letzten 7 Tage
- #10
Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Sterne-Änderung der letzten 7 Tage - #11
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Befähigung großer Sprachmodelle zum Verständnis von Punktwolken
★ 1.053+2Sterne-Änderung der letzten 7 Tage - #12
[ICML2024 (Oral)] Offizielle PyTorch-Implementierung von DoRA: Weight-Decomposed Low-Rank Adaptation
★ 994+1Sterne-Änderung der letzten 7 Tage - #13
CALVIN - Ein Benchmark für Language-Conditioned Policy Learning für Long-Horizon-Roboter-Manipulationsaufgaben
★ 985+8Sterne-Änderung der letzten 7 Tage - #14
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), das weltweit erste Modell, das natürlichsprachliche Antworten generieren kann, die nahtlos in Objektdegmentierungsmasken integriert sind.
★ 967+0Sterne-Änderung der letzten 7 Tage - #15
Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2025 Paper. 🔥 [Paper + Code + Demo]
★ 895+1Sterne-Änderung der letzten 7 Tage - #16
[CVPR 2024] Alpha-CLIP: Ein CLIP-Modell, das sich auf beliebige Bereiche konzentriert
★ 874+0Sterne-Änderung der letzten 7 Tage - #17
Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2024 Paper. 🔥 [Paper + Code + Demo]
★ 735+0Sterne-Änderung der letzten 7 Tage - #18
KI-Forschungsplattform für Reinforcement Learning aus echten Panoramabildern.
★ 713+2Sterne-Änderung der letzten 7 Tage - #19
Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2023 Paper. 🔥 [Paper + Code]
★ 649+0Sterne-Änderung der letzten 7 Tage - #20
Erstellung einer Software zur automatischen Überwachung bei Online-Prüfungen
★ 634-1Sterne-Änderung der letzten 7 Tage - #21
Eine kuratierte Liste für Vision-and-Language Navigation. Begleitend zum ACL 2022 Paper „Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions“
★ 607+2Sterne-Änderung der letzten 7 Tage - #22
Eine kuratierte Liste großartiger Ressourcen zu Vision und Sprache (noch im Aufbau... bleiben Sie dran!)
★ 564+0Sterne-Änderung der letzten 7 Tage - #23
Dieses Repository listet relevante Paper auf, die in unserem Survey-Paper A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models zusammengefasst sind.
★ 513+0Sterne-Änderung der letzten 7 Tage