vision-language-model
Erfasste Open-Source-Repos mit dem Tag vision-language-model, sortiert nach Sternen.
- #31★ 1.309+0Sterne-Änderung der letzten 7 Tage
- #32
Vollständig offenes Framework für demokratisiertes multimodales Training
★ 1.195+1Sterne-Änderung der letzten 7 Tage - #33
Diese Reihe nimmt Sie mit auf eine Reise von den Grundlagen der NLP und Computer Vision bis hin zu den neuesten Vision-Language-Modellen.
★ 1.179+0Sterne-Änderung der letzten 7 Tage - #34★ 1.153-25Sterne-Änderung der letzten 7 Tage
- #35
Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode
★ 1.136+18Sterne-Änderung der letzten 7 Tage - #36★ 979-1Sterne-Änderung der letzten 7 Tage
- #37
[CVPR 2024 🔥] Grounding Large Multimodal Model (GLaMM), das weltweit erste Modell, das natürlichsprachliche Antworten generieren kann, die nahtlos in Objektdegmentierungsmasken integriert sind.
★ 967+0Sterne-Änderung der letzten 7 Tage - #38
[CVPR 2024 Highlight🔥] Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
★ 941+0Sterne-Änderung der letzten 7 Tage - #39
Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2025 Paper. 🔥 [Paper + Code + Demo]
★ 895+1Sterne-Änderung der letzten 7 Tage - #40
[CVPR 2024] Alpha-CLIP: Ein CLIP-Modell, das sich auf beliebige Bereiche konzentriert
★ 874+0Sterne-Änderung der letzten 7 Tage - #41
DeepSeek-Harness-native Integration für agent-vision-toolkit: Bild-Q&A, Long-Screenshot-OCR, UI-Wiederherstellung, Grounding, Pixel-Diff, Artifacts und Web-UI.
★ 856+15Sterne-Änderung der letzten 7 Tage - #42
VoxPoser: Kombinierbare 3D-Wertkarten für die Robotermanipulation mit Sprachmodellen
★ 834+1Sterne-Änderung der letzten 7 Tage - #43★ 833+4Sterne-Änderung der letzten 7 Tage
- #44★ 832+0Sterne-Änderung der letzten 7 Tage
- #45
Eine kuratierte Liste von 3D-Vision-Papern mit Bezug zur Robotik im Zeitalter großer Modelle wie LLMs/VLMs, inspiriert von awesome-computer-vision, einschließlich Papers, Codes und zugehörigen Websites
★ 821+1Sterne-Änderung der letzten 7 Tage - #46
Eine kuratierte Liste fantastischer Prompt-/Adapter-Lernmethoden für Vision-Language-Modelle wie CLIP.
★ 797+1Sterne-Änderung der letzten 7 Tage - #47
[ICLR 2026] Die offizielle Implementierung von „Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model“
★ 725+4Sterne-Änderung der letzten 7 Tage - #48
OmniVinci ist ein omnimodales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.
★ 677+0Sterne-Änderung der letzten 7 Tage - #49★ 642+0Sterne-Änderung der letzten 7 Tage
- #50
PILOT: Eine Toolbox für vortrainiertes, modellbasiertes kontinuierliches Lernen.
★ 600+3Sterne-Änderung der letzten 7 Tage - #51
Evaluierung von Text-zu-Bild/Video/3D-Modellen mit VQAScore.
★ 600+0Sterne-Änderung der letzten 7 Tage - #52
[CVPR 2026] SpatialVID: Ein umfangreicher Video-Datensatz mit räumlichen Annotationen.
★ 600+1Sterne-Änderung der letzten 7 Tage - #53★ 596—Sterne-Änderung der letzten 7 Tage
- #54
[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
★ 586+0Sterne-Änderung der letzten 7 Tage - #55
LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.
★ 577+0Sterne-Änderung der letzten 7 Tage - #56
Cambrian-S: Auf dem Weg zur räumlichen Super-Sensorik in Videos
★ 567+0Sterne-Änderung der letzten 7 Tage - #57
Chatbot Arena trifft auf Multimodalität! Multi-Modality Arena ermöglicht es, Vision-Language-Modelle nebeneinander zu benchmarken, während Bilder als Eingaben bereitgestellt werden. Unterstützt MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 und viele weitere!
★ 566+0Sterne-Änderung der letzten 7 Tage - #58
Flame ist ein Open-Source multimodales KI-System zur Umwandlung von UI-Design-Mockups in hochwertigen React-Code. Es nutzt Vision-Language-Modelle und automatisierte Workflows, um die Lücke zwischen Design und Frontend-Entwicklung zu schließen.
★ 562+0Sterne-Änderung der letzten 7 Tage - #59
Code und Implementierungsrichtlinien für das Paper Counting Anything. Projektseite: https://mengqi-lei.github.io/count-anything-projectpage/
★ 538+1Sterne-Änderung der letzten 7 Tage