Zum Hauptinhalt springen
buildradar
Sign in
Thema · vlm

vlm

Erfasste Open-Source-Repos mit dem Tag vlm, sortiert nach Sternen.

77 Repos
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.

    1.840+10Sterne-Änderung der letzten 7 Tage
  • 🚀🚀🚀 Eine Sammlung großartiger öffentlicher YOLO-Objekterkennungsprojekte und zugehöriger Objekterkennungsdatensätze.

    1.783-2Sterne-Änderung der letzten 7 Tage
  • react-native-executorch@software-mansion

    Deklarative Möglichkeit, KI-Modelle in React Native auf dem Gerät auszuführen, angetrieben von ExecuTorch.

    1.707+5Sterne-Änderung der letzten 7 Tage
  • OpenGUI@Core-Mate

    OpenGUI ist ein Android-GUI-Agent-Framework für telefonbasierte KI, die echte mobile Apps über die GUI sehen, planen und bedienen kann.

    1.624+38Sterne-Änderung der letzten 7 Tage
  • AngelSlim@Tencent

    Modellkomprimierungs-Toolkit für verbesserte Benutzerfreundlichkeit, Vollständigkeit und Effizienz.

    1.619+58Sterne-Änderung der letzten 7 Tage
  • Awesome-Jailbreak-on-LLMs ist eine Sammlung von hochmodernen, neuartigen und spannenden Jailbreak-Methoden für LLMs. Sie enthält Arbeiten, Code, Datensätze, Evaluierungen und Analysen.

    1.610+5Sterne-Änderung der letzten 7 Tage
  • unblink@zapdos-labs

    Kameraüberwachung mit VLM

    1.507+2Sterne-Änderung der letzten 7 Tage
  • AeroSandbox@peterdsharpe

    Flugzeugentwurfsoptimierung, beschleunigt durch Computational-Graph-Transformationen (z. B. automatische Differenzierung). Kombinierbare Analysewerkzeuge für Aerodynamik, Antrieb, Strukturen, Trajektoriendesign und vieles mehr.

    1.323+4Sterne-Änderung der letzten 7 Tage
  • Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.

    1.310+2Sterne-Änderung der letzten 7 Tage
  • joycaption@fpgaminer

    JoyCaption ist ein Visual Language Model (VLM) zur Bildbeschriftung, das von Grund auf als freies, offenes und unzensiertes Modell für die Community entwickelt wurde, um es beim Training von Diffusion-Modellen zu verwenden.

    1.248+1Sterne-Änderung der letzten 7 Tage
  • CogAgent@zai-org

    Ein Open-Source-End-to-End-VLM-basierter GUI-Agent

    1.195+1Sterne-Änderung der letzten 7 Tage
  • InternNav@InternRobotics

    InternRobotics' offene Plattform zum Erstellen verallgemeinerter Navigations-Fundamentmodelle.

    1.090+18Sterne-Änderung der letzten 7 Tage
  • Bunny@BAAI-DCAI

    Eine Familie leichter multimodaler Modelle.

    1.053+0Sterne-Änderung der letzten 7 Tage
  • MindAct@candle-org

    MindSpore + 🤗Huggingface: Führen Sie beliebige Transformers/Diffusers-Modelle auf MindSpore aus – mit nahtloser Kompatibilität und Beschleunigung.

    920+0Sterne-Änderung der letzten 7 Tage
  • Automodel@NVIDIA-NeMo

    🚀 Native PyTorch-Bibliothek für das verteilte Training von LLMs/VLMs mit integrierter Hugging-Face-Unterstützung

    906+25Sterne-Änderung der letzten 7 Tage
  • gpt-assistant-android@Skythinker616

    [Neuer Agenten-Modus] GPT-Assistent für Android für alle Szenarien, aktivierbar über Lautstärketasten für Sprachinteraktion. Unterstützt Internetzugriff, Fotografieren, Vorlagen, Parsen von PDF- und Office-Dokumenten, Agenten-Modus usw.

    901+1Sterne-Änderung der letzten 7 Tage
  • UniWorld@PKU-YuanGroup

    UniWorld: Hochauflösende semantische Encoder für einheitliches visuelles Verstehen und Generieren

    890+0Sterne-Änderung der letzten 7 Tage
  • NEO@EvolvingLMMs-Lab

    NEO Series: Native Vision-Language-Modelle von Grund auf

    888+0Sterne-Änderung der letzten 7 Tage
  • UniPic@SkyworkAI

    Open-Source SOTA-Modell zur Multi-Bild-Bearbeitung

    874+1Sterne-Änderung der letzten 7 Tage
  • OpenWorldLib@OpenDCAI

    Einheitliche Codebasis für fortschrittliche Weltmodelle.

    866+2Sterne-Änderung der letzten 7 Tage
  • Offizielles Repository zum Übersichtsartikel „LLM × DATA“

    821+2Sterne-Änderung der letzten 7 Tage
  • Eine kuratierte Liste von 3D-Vision-Papern mit Bezug zur Robotik im Zeitalter großer Modelle wie LLMs/VLMs, inspiriert von awesome-computer-vision, einschließlich Papers, Codes und zugehörigen Websites

    821+2Sterne-Änderung der letzten 7 Tage
  • 🚀🚀🚀 Eine Sammlung großartiger öffentlicher Projekte zu Large Language Models (LLM), Vision Language Models (VLM), Vision Language Action (VLA), AI Generated Content (AIGC) sowie den zugehörigen Datensätzen und Anwendungen.

    815+1Sterne-Änderung der letzten 7 Tage
  • mobilegym@Purewhiter

    MobileGym: Eine verifizierbare und hochparallele Simulationsplattform für die Forschung zu mobilen GUI-Agenten · Im Browser laufender Android-Emulator · Browser-hosted Android Simulator · Verifizierbare Evaluierung · Skalierbares Online-RL-Training

    786+10Sterne-Änderung der letzten 7 Tage
  • OmniLottie@OpenVGLab

    [CVPR 2026🔥] 🧑‍🎨 OmniLottie, ein Open-Source-Generator für multimodale, instruierte Vektoranimationen, der Lottie-JSONs erstellt.

    774+3Sterne-Änderung der letzten 7 Tage
  • dingo@MigoXLab

    Dingo: Ein umfassendes Tool zur Qualitätsbewertung von KI-Daten, -Modellen und -Anwendungen

    754+4Sterne-Änderung der letzten 7 Tage
  • GeoChat@mbzuai-oryx

    [CVPR 2024 🔥] GeoChat, das erste Grounded Large Vision Language Model für die Erdbeobachtung

    751+7Sterne-Änderung der letzten 7 Tage
  • SparkVSR@taco-group

    [ECCV 2026] SparkVSR: Interaktive Video-Super-Resolution durch spärliche Keyframe-Propagierung

    702+3Sterne-Änderung der letzten 7 Tage
  • VLM2Vec@TIGER-AI-Lab

    Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].

    682+2Sterne-Änderung der letzten 7 Tage
  • cosmo-edge@cosmo-wander-ai

    Produktionsreife C++ Edge-AI-Engine für Videoanalysen und On-Device VLM auf Sophon, Rockchip RKNN und x86, inklusive visueller Orchestrierung, Echtzeit-OSD, Ereignisverwaltung und reproduzierbaren Benchmarks.

    658+47Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen