Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal

multimodal

Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.

Repos
148
Sterne gesamt
627.042
Sterne im Schnitt
4.237
Anteil
0,03%

Themen, die häufig gemeinsam mit multimodal am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit multimodal getaggt wurden.

  • claude-real-video@HUANGCHIHHUNGLeo

    Lassen Sie Claude (oder ein beliebiges LLM) ein Video tatsächlich ansehen – szenenbewusste, deduplizierte Frames + Transkript, von einer URL oder einer lokalen Datei. Läuft lokal, MIT-lizenziert.

    2.109
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1.420
  • doc7@magicrew

    Konvertieren Sie Dokumente mit visueller Erkennung in KI-ready Markdown

    1.153
  • Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode

    1.136
  • dsh-vision-router@ysr666

    Augen für rein textbasierte DeepSeek Harness Agents: integrierte kostenlose Vision-Chain (kein Schlüssel) + pixelgenaue Vision-Tools (Fragen & Antworten, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots). Ein-Befehl-Installation, kein Python, Bildverarbeitung funktioniert wie normale Tool-Aufrufe.

    1.089
  • anything-llm@Mintplex-Labs

    Hören Sie auf, Ihre Intelligenz zu mieten. Eigen Sie sie mit AnythingLLM. Alles, was Sie für ein leistungsstarkes, lokal-first-Agentenerlebnis benötigen.

    65.534+163Sterne-Änderung der letzten 7 Tage
  • ai-agent-book@bojieli

    《Vertiefung des AI Agent: Designprinzipien und ingenieurtechnische Praxis》(Li Bo Jie)Open-Source-Hauptrepo: Vollständiger Text des Buches, kompilierte PDF-Version und zu den Kapiteln passender Code

    44.381+1.022Sterne-Änderung der letzten 7 Tage
  • UI-TARS-desktop@bytedance

    Der Open-Source Multimodal AI Agent Stack: Verbindet modernste KI-Modelle und Agenten-Infrastruktur

    38.817+75Sterne-Änderung der letzten 7 Tage
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.

    25.014+9Sterne-Änderung der letzten 7 Tage
  • unilm@microsoft

    Groß angelegtes selbstüberwachtes Vortraining über Aufgaben, Sprachen und Modalitäten hinweg

    22.203+7Sterne-Änderung der letzten 7 Tage
  • serve@jina-ai

    ☁️ Erstellen Sie multimodale KI-Anwendungen mit einem Cloud-nativen Stack

    21.859-2Sterne-Änderung der letzten 7 Tage
  • screenpipe@screenpipe

    YC (S26) | Open Computer History | Aufzeichnung des Bildschirms kontinuierlich lokal und Bereitstellung von Kontext an deine Agenten (Claude, Codex, Openclaw, Hermes, Runner...)

    21.376+80Sterne-Änderung der letzten 7 Tage
  • Janus@deepseek-ai

    Janus-Series: Unified Multimodal Understanding and Generation Models

    17.763+1Sterne-Änderung der letzten 7 Tage
  • ms-swift@modelscope

    Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).

    15.488+88Sterne-Änderung der letzten 7 Tage
  • rerun@rerun-io

    Visualisieren, abfragen und streamen Sie, um mit multimodalen Robotikdaten zu trainieren.

    11.387+15Sterne-Änderung der letzten 7 Tage
  • all-in-rag@datawhalechina

    🔍 Praxisleitfaden zur Entwicklung von LLM-Anwendungen Teil 1: RAG-Technologie-Full-Stack-Leitfaden, Online-Leseadresse: https://datawhalechina.github.io/all-in-rag/

    10.770+94Sterne-Änderung der letzten 7 Tage
  • runanywhere-sdks@RunanywhereAI

    Produktionsbereites Toolkit zum lokalen Ausführen von KI

    10.281+1Sterne-Änderung der letzten 7 Tage
  • pyod@yzhao062

    Eine Python-Bibliothek zur Anomalieerkennung in tabellarischen, Zeitreihen-, Graph-, Text-, Bild- und Audiodaten. Über 60 Detektoren, Benchmark-gestützte ADEngine-Orchestrierung und ein agentischer Workflow für KI-Agenten.

    9.978+1Sterne-Änderung der letzten 7 Tage
  • PixelRAG@StarTrail-org

    Das Ende des Web-Parsings. Der Beginn der skalierbaren, pixel-nativen Suche. Link: https://pixelrag.ai/

    9.848+60Sterne-Änderung der letzten 7 Tage
  • seatunnel@apache

    SeaTunnel ist ein multimodales, leistungsstarkes, verteiltes Tool zur Integration großer Datenmengen.

    9.612+12Sterne-Änderung der letzten 7 Tage
  • deeplake@activeloopai

    Deeplake ist eine KI-Daten-Runtime für Agenten. Es bietet serverloses Postgres mit einem multimodalen Data Lake, was eine skalierbare Abfrage und Training ermöglicht.

    9.229-1Sterne-Änderung der letzten 7 Tage
  • MobileAgent@X-PLUG

    Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie

    9.157+9Sterne-Änderung der letzten 7 Tage
  • BentoML@bentoml

    Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!

    8.817+4Sterne-Änderung der letzten 7 Tage
  • mlx-audio@Blaizzy

    Eine auf Apples MLX-Framework basierende Text-to-Speech (TTS)-, Speech-to-Text (STT)- und Speech-to-Speech (STS)-Bibliothek für effiziente Sprachanalyse auf Apple Silicon.

    7.826+23Sterne-Änderung der letzten 7 Tage
  • vllm-omni@vllm-project

    Ein Framework für effiziente Modellinferenz mit Omnimodalitätsmodellen

    6.593+136Sterne-Änderung der letzten 7 Tage
  • courses@SkalskiP

    Dieses Repository ist eine kuratierte Sammlung von Links zu verschiedenen Kursen und Ressourcen über Künstliche Intelligenz (KI)

    6.482+3Sterne-Änderung der letzten 7 Tage
  • genkit@genkit-ai

    Open-Source-Framework zum Erstellen agentenbasierter Apps in JavaScript, Go, Dart und Python, entwickelt und produktiv genutzt von Google.

    6.394+10Sterne-Änderung der letzten 7 Tage
  • ai-notes@swyxio

    Notizen für Softwareingenieure, die sich in neue KI-Entwicklungen einarbeiten. Dient als Datenspeicher für Artikel auf https://latent.space und Produkt-Brainstorming, enthält jedoch bereinigte kanonische Referenzen im Ordner /Resources.

    6.247+0Sterne-Änderung der letzten 7 Tage
  • VLM-R1@om-ai-lab

    Visuelles Verstehen mit RL-basierten VLMs lösen

    6.018+4Sterne-Änderung der letzten 7 Tage
  • pyspur@PySpur-Dev

    Eine visuelle Spielwiese für agentenbasierte Workflows: Iterieren Sie 10x schneller über Ihre Agenten

    5.779-1Sterne-Änderung der letzten 7 Tage
  • Daft@Eventual-Inc

    Hochleistungs-Daten-Engine für KI- und multimodale Workloads. Verarbeitet Bilder, Audio, Video und strukturierte Daten in beliebigem Maßstab.

    5.736+4Sterne-Änderung der letzten 7 Tage
  • UltraRAG@OpenBMB

    Ein Low-Code-MCP-Framework zum Erstellen komplexer und innovativer RAG-Pipelines

    5.678+4Sterne-Änderung der letzten 7 Tage
  • mmf@facebookresearch

    Ein modulares Framework für multimodale Vision- & Language-Forschung von Facebook AI Research (FAIR)

    5.633-1Sterne-Änderung der letzten 7 Tage
  • xtuner@InternLM

    Eine Trainings-Engine der nächsten Generation für extrem große MoE-Modelle

    5.188+3Sterne-Änderung der letzten 7 Tage
  • align-anything@PKU-Alignment

    Align Anything: Training von Multimodus-Modellen mit Feedback

    4.671+3Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen