Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal

multimodal

Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.

148 Repos
  • stability-sdk@Stability-AI

    SDK für die Interaktion mit stability.ai APIs (z. B. Stable-Diffusion-Inferenz)

    2.435-1Sterne-Änderung der letzten 7 Tage
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis

    2.411+0Sterne-Änderung der letzten 7 Tage
  • InternVideo@OpenGVLab

    [ECCV2024] Video Foundation Models & Data für multimodales Verständnis

    2.374+5Sterne-Änderung der letzten 7 Tage
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: Generieren Sie hochwertige synthetische Daten von Grund auf oder aus Seed-Daten.

    2.197+7Sterne-Änderung der letzten 7 Tage
  • genai-processors@google-gemini

    GenAI Processors ist eine lightweight Python-Bibliothek, die eine effiziente, parallele Inhaltsverarbeitung ermöglicht.

    2.120+0Sterne-Änderung der letzten 7 Tage
  • claude-real-video@HUANGCHIHHUNGLeo

    Lassen Sie Claude (oder ein beliebiges LLM) ein Video tatsächlich ansehen – szenenbewusste, deduplizierte Frames + Transkript, von einer URL oder einer lokalen Datei. Läuft lokal, MIT-lizenziert.

    2.109+20Sterne-Änderung der letzten 7 Tage
  • parlor@fikrikarim

    On-Device, multimodale Echtzeit-KI mit ähnlichen Funktionen wie GPT-Live

    2.048+7Sterne-Änderung der letzten 7 Tage
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Repository für die Show-o-Serie, ein einziger Transformer zur Vereinigung multimodaler Verstehensprozesse und Generierung.

    1.975+1Sterne-Änderung der letzten 7 Tage
  • Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.

    1.961+1Sterne-Änderung der letzten 7 Tage
  • BitNet@kyegomez

    Implementierung von „BitNet: Scaling 1-bit Transformers for Large Language Models“ in PyTorch

    1.946+0Sterne-Änderung der letzten 7 Tage
  • AdvancedLiterateMachinery@AlibabaResearch

    Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.

    1.835+1Sterne-Änderung der letzten 7 Tage
  • DeTikZify@potamides

    Synthese von Grafikprogrammen für wissenschaftliche Abbildungen und Skizzen mit TikZ.

    1.818+1Sterne-Änderung der letzten 7 Tage
  • Das selbstkodierende System für Ihre App — Alan AI SDK für Android

    1.807-1Sterne-Änderung der letzten 7 Tage
  • Das Self-Coding-System für Ihre App — Alan AI SDK für Flutter

    1.756-1Sterne-Änderung der letzten 7 Tage
  • alan-sdk-ionic@alan-ai

    Das Self-Coding-System für Ihre App — Alan AI SDK für Ionic

    1.649-1Sterne-Änderung der letzten 7 Tage
  • pixeltable@pixeltable

    Einheitliches multimodales Backend für KI-Daten-Apps

    1.619+5Sterne-Änderung der letzten 7 Tage
  • mllm@UbiquitousLearning

    Schnelles multimodales LLM auf mobilen Geräten

    1.602+3Sterne-Änderung der letzten 7 Tage
  • thepipe@emcf

    Erhalte saubere Daten aus schwierigen Dokumenten, unterstützt durch Vision-Language-Modelle ⚡

    1.524+0Sterne-Änderung der letzten 7 Tage
  • Ovis@ATH-MaaS

    Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.

    1.514+2Sterne-Änderung der letzten 7 Tage
  • ha-llmvision@valentinfrlch

    Visuelle Intelligenz für Ihr Zuhause.

    1.454+10Sterne-Änderung der letzten 7 Tage
  • awesome-japanese-llm@llm-jp

    Übersicht japanischer LLMs

    1.428+1Sterne-Änderung der letzten 7 Tage
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.422+521Sterne-Änderung der letzten 7 Tage
  • SDT@dailenson

    Dieses Repository ist die offizielle Implementierung von Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023).

    1.406-1Sterne-Änderung der letzten 7 Tage
  • airunner@Capsize-Games

    Offline-Inferenz-Engine für Kunst, Echtzeit-Sprachkonversationen, LLM-gestützte Chatbots und automatisierte Workflows

    1.314+0Sterne-Änderung der letzten 7 Tage
  • Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.

    1.310+2Sterne-Änderung der letzten 7 Tage
  • claude-video-vision@jordanrendric

    Verleiht Claude die Fähigkeit, Videos anzusehen und zu verstehen — Claude Code-Plugin mit Frame-Extraktion und multimodaler Audioanalyse

    1.281+6Sterne-Änderung der letzten 7 Tage
  • UForm@unum-cloud

    Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️

    1.247+1Sterne-Änderung der letzten 7 Tage
  • xtreme1@xtreme1-io

    Xtreme1 ist eine All-in-One-Datenkennzeichnungs- und Annotationsplattform für multimodales Datentraining und unterstützt 3D-LiDAR-Punktwolken, Bilder und LLMs.

    1.239+2Sterne-Änderung der letzten 7 Tage
  • LLaMA-Mesh@nv-tlabs

    Verknüpfung von 3D-Mesh-Generierung mit Sprachmodellen

    1.167+0Sterne-Änderung der letzten 7 Tage
  • doc7@magicrew

    Konvertieren Sie Dokumente mit visueller Erkennung in KI-ready Markdown

    1.153-25Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen