vlm
Erfasste Open-Source-Repos mit dem Tag vlm, sortiert nach Sternen.
- #31
NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.
★ 1.840+10Sterne-Änderung der letzten 7 Tage - #32
🚀🚀🚀 Eine Sammlung großartiger öffentlicher YOLO-Objekterkennungsprojekte und zugehöriger Objekterkennungsdatensätze.
★ 1.783-2Sterne-Änderung der letzten 7 Tage - #33
Deklarative Möglichkeit, KI-Modelle in React Native auf dem Gerät auszuführen, angetrieben von ExecuTorch.
★ 1.707+5Sterne-Änderung der letzten 7 Tage - #34
OpenGUI ist ein Android-GUI-Agent-Framework für telefonbasierte KI, die echte mobile Apps über die GUI sehen, planen und bedienen kann.
★ 1.624+38Sterne-Änderung der letzten 7 Tage - #35
Modellkomprimierungs-Toolkit für verbesserte Benutzerfreundlichkeit, Vollständigkeit und Effizienz.
★ 1.619+58Sterne-Änderung der letzten 7 Tage - #36
Awesome-Jailbreak-on-LLMs ist eine Sammlung von hochmodernen, neuartigen und spannenden Jailbreak-Methoden für LLMs. Sie enthält Arbeiten, Code, Datensätze, Evaluierungen und Analysen.
★ 1.610+5Sterne-Änderung der letzten 7 Tage - #37★ 1.507+2Sterne-Änderung der letzten 7 Tage
- #38
Flugzeugentwurfsoptimierung, beschleunigt durch Computational-Graph-Transformationen (z. B. automatische Differenzierung). Kombinierbare Analysewerkzeuge für Aerodynamik, Antrieb, Strukturen, Trajektoriendesign und vieles mehr.
★ 1.323+4Sterne-Änderung der letzten 7 Tage - #39
Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.
★ 1.310+2Sterne-Änderung der letzten 7 Tage - #40
JoyCaption ist ein Visual Language Model (VLM) zur Bildbeschriftung, das von Grund auf als freies, offenes und unzensiertes Modell für die Community entwickelt wurde, um es beim Training von Diffusion-Modellen zu verwenden.
★ 1.248+1Sterne-Änderung der letzten 7 Tage - #41★ 1.195+1Sterne-Änderung der letzten 7 Tage
- #42
InternRobotics' offene Plattform zum Erstellen verallgemeinerter Navigations-Fundamentmodelle.
★ 1.090+18Sterne-Änderung der letzten 7 Tage - #43★ 1.053+0Sterne-Änderung der letzten 7 Tage
- #44
MindSpore + 🤗Huggingface: Führen Sie beliebige Transformers/Diffusers-Modelle auf MindSpore aus – mit nahtloser Kompatibilität und Beschleunigung.
★ 920+0Sterne-Änderung der letzten 7 Tage - #45
🚀 Native PyTorch-Bibliothek für das verteilte Training von LLMs/VLMs mit integrierter Hugging-Face-Unterstützung
★ 906+25Sterne-Änderung der letzten 7 Tage - #46
[Neuer Agenten-Modus] GPT-Assistent für Android für alle Szenarien, aktivierbar über Lautstärketasten für Sprachinteraktion. Unterstützt Internetzugriff, Fotografieren, Vorlagen, Parsen von PDF- und Office-Dokumenten, Agenten-Modus usw.
★ 901+1Sterne-Änderung der letzten 7 Tage - #47
UniWorld: Hochauflösende semantische Encoder für einheitliches visuelles Verstehen und Generieren
★ 890+0Sterne-Änderung der letzten 7 Tage - #48★ 888+0Sterne-Änderung der letzten 7 Tage
- #49★ 874+1Sterne-Änderung der letzten 7 Tage
- #50
Einheitliche Codebasis für fortschrittliche Weltmodelle.
★ 866+2Sterne-Änderung der letzten 7 Tage - #51
Offizielles Repository zum Übersichtsartikel „LLM × DATA“
★ 821+2Sterne-Änderung der letzten 7 Tage - #52
Eine kuratierte Liste von 3D-Vision-Papern mit Bezug zur Robotik im Zeitalter großer Modelle wie LLMs/VLMs, inspiriert von awesome-computer-vision, einschließlich Papers, Codes und zugehörigen Websites
★ 821+2Sterne-Änderung der letzten 7 Tage - #53
🚀🚀🚀 Eine Sammlung großartiger öffentlicher Projekte zu Large Language Models (LLM), Vision Language Models (VLM), Vision Language Action (VLA), AI Generated Content (AIGC) sowie den zugehörigen Datensätzen und Anwendungen.
★ 815+1Sterne-Änderung der letzten 7 Tage - #54
MobileGym: Eine verifizierbare und hochparallele Simulationsplattform für die Forschung zu mobilen GUI-Agenten · Im Browser laufender Android-Emulator · Browser-hosted Android Simulator · Verifizierbare Evaluierung · Skalierbares Online-RL-Training
★ 786+10Sterne-Änderung der letzten 7 Tage - #55
[CVPR 2026🔥] 🧑🎨 OmniLottie, ein Open-Source-Generator für multimodale, instruierte Vektoranimationen, der Lottie-JSONs erstellt.
★ 774+3Sterne-Änderung der letzten 7 Tage - #56
Dingo: Ein umfassendes Tool zur Qualitätsbewertung von KI-Daten, -Modellen und -Anwendungen
★ 754+4Sterne-Änderung der letzten 7 Tage - #57
[CVPR 2024 🔥] GeoChat, das erste Grounded Large Vision Language Model für die Erdbeobachtung
★ 751+7Sterne-Änderung der letzten 7 Tage - #58
[ECCV 2026] SparkVSR: Interaktive Video-Super-Resolution durch spärliche Keyframe-Propagierung
★ 702+3Sterne-Änderung der letzten 7 Tage - #59
Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].
★ 682+2Sterne-Änderung der letzten 7 Tage - #60
Produktionsreife C++ Edge-AI-Engine für Videoanalysen und On-Device VLM auf Sophon, Rockchip RKNN und x86, inklusive visueller Orchestrierung, Echtzeit-OSD, Ereignisverwaltung und reproduzierbaren Benchmarks.
★ 658+47Sterne-Änderung der letzten 7 Tage