Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal-ai

multimodal-ai

Erfasste Open-Source-Repos mit dem Tag multimodal-ai, sortiert nach Sternen.

Repos
13
Sterne gesamt
38.644
Sterne im Schnitt
2.973
Anteil
0,00%

Themen, die häufig gemeinsam mit multimodal-ai am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit multimodal-ai getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • 🚀 Ein wirklich Open-Source-Toolkit für KI-Avatare (digitale Menschen) zur Offline-Videogenerierung und zum Klonen digitaler Menschen.

    14.992+65Sterne-Änderung der letzten 7 Tage
  • AgnesAI-Models@AgnesAI-Labs

    Offizielles Agnes AI Gateway und Modellkatalog für OpenAI-kompatible Text-, Bild-, Video- und Agenten-Workflows.

    5.044+28Sterne-Änderung der letzten 7 Tage
  • Multimodale generative Medien-Skills für KI-Agents (Claude Code, Cursor, Gemini CLI). Hochwertige Bild-, Video- und Audio-Generierung powered by muapi.ai.

    4.205+19Sterne-Änderung der letzten 7 Tage
  • Mano-P@Mininglamp-AI

    Mano-P: Open-Source-GUI-VLA-Agent für Edge-Geräte. #1 auf OSWorld (spezialisiert, 58,2 %). Läuft lokal auf Apple M4 Mac mini/MacBook – keine Daten verlassen Ihr Gerät. Mano-P ist ein Open-Source-GUI-VLA-Projekt, das Inferenz lokal auf Mac mini/MacBook oder über KI Beschleuniger unterstützt und rein visuell gesteuerte, plattformübergreifende GUI-Automatisierung ermöglicht. Daten werden vollständig lokal verarbeitet, mit Unterstützung für komplexe, mehrstufige Aufgabenplanung und -ausführung.

    2.615+15Sterne-Änderung der letzten 7 Tage
  • EVA-OS@AutoArk

    EVA OS — Ein echtes multimodales AIOS für Hardware der nächsten Generation, das Ihre Geräte „lebendig“ und so intelligent wie ein echtes Gehirn macht.

    1.869+87Sterne-Änderung der letzten 7 Tage
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.

    1.840+10Sterne-Änderung der letzten 7 Tage
  • OpenGUI@Core-Mate

    OpenGUI ist ein Android-GUI-Agent-Framework für telefonbasierte KI, die echte mobile Apps über die GUI sehen, planen und bedienen kann.

    1.624+38Sterne-Änderung der letzten 7 Tage
  • vllm-mlx@waybarrios

    Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.

    1.557+6Sterne-Änderung der letzten 7 Tage
  • Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.

    1.310+2Sterne-Änderung der letzten 7 Tage
  • xiaoyaosearch@dtsola

    XiaoyaoSearch versteht deine Worte und Bilder und findet jede lokale Datei mit KI, sodass die Suche so einfach wie ein Chat wird.

    1.083+0Sterne-Änderung der letzten 7 Tage
  • opendroid@yashab-cyber

    Ihr offener autonomer Android-Agent – Ein produktionsbereiter, selbstplanender KI-Assistent, angetrieben von lokalen/fernen LLMs und barrierefreiheitsgesteuerter Bildschirmautomatisierung.

    1.021+43Sterne-Änderung der letzten 7 Tage
  • vectordb-recipes@lancedb

    Ressourcen, Beispiele und Tutorials für multimodale KI, RAG und Agenten unter Verwendung von Vektorsuche und LLMs

    973-1Sterne-Änderung der letzten 7 Tage
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen