Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal

multimodal

Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.

148 Repos
  • Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode

    1.136+18Sterne-Änderung der letzten 7 Tage
  • Das Self-Coding-System für Ihre App — Alan AI SDK für Cordova

    1.132+0Sterne-Änderung der letzten 7 Tage
  • MOVA@OpenMOSS

    MOVA: Auf dem Weg zu skalierbarer und synchronisierter Video-Audio-Generierung

    1.108+3Sterne-Änderung der letzten 7 Tage
  • sglang-omni@sgl-project

    SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.

    1.105+130Sterne-Änderung der letzten 7 Tage
  • Aria@rhymes-ai

    Codebasis für Aria – ein Open Multimodal Native MoE

    1.088+1Sterne-Änderung der letzten 7 Tage
  • XrayGLM@WangRongsheng

    🩺 Das erste chinesische multimodale medizinische Modell zur Analyse von Thorax-Röntgenbildern | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.

    1.084+2Sterne-Änderung der letzten 7 Tage
  • dsh-vision-router@ysr666

    Augen für rein textbasierte DeepSeek Harness Agents: integrierte kostenlose Vision-Chain (kein Schlüssel) + pixelgenaue Vision-Tools (Fragen & Antworten, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots). Ein-Befehl-Installation, kein Python, Bildverarbeitung funktioniert wie normale Tool-Aufrufe.

    1.077+54Sterne-Änderung der letzten 7 Tage
  • VisCPM@OpenBMB

    [ICLR'24 Spotlight] Chinesische und englische multimodale Large-Model-Serie (Chat and Paint) | Basiert auf dem CPM-Basismodell für multimodale chinesisch-englische Großmodelle

    1.061-1Sterne-Änderung der letzten 7 Tage
  • ONE-PEACE@OFA-Sys

    Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities

    1.060+0Sterne-Änderung der letzten 7 Tage
  • PointLLM@InternRobotics

    [ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Befähigung großer Sprachmodelle zum Verständnis von Punktwolken

    1.053+2Sterne-Änderung der letzten 7 Tage
  • CLIP4Clip@ArrowLuo

    Eine offizielle Implementierung für „CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval“

    1.031+0Sterne-Änderung der letzten 7 Tage
  • Awesome-MCoT@yaotingwangofficial

    Multimodal Chain-of-Thought Reasoning: Eine umfassende Übersicht

    1.025+2Sterne-Änderung der letzten 7 Tage
  • tongflow@tong-io

    TongFlow — Multimodales GenAI Studio

    1.016+37Sterne-Änderung der letzten 7 Tage
  • vectordb-recipes@lancedb

    Ressourcen, Beispiele und Tutorials für multimodale KI, RAG und Agenten unter Verwendung von Vektorsuche und LLMs

    973-1Sterne-Änderung der letzten 7 Tage
  • verl-omni@verl-project

    Multimodales RL-Trainingsframework für Diffusions- und Omni-Modelle

    955+60Sterne-Änderung der letzten 7 Tage
  • rag-time@microsoft

    RAG Time: Eine 5-wöchige Lernreise zur Beherrschung von RAG

    903+4Sterne-Änderung der letzten 7 Tage
  • Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2025 Paper. 🔥 [Paper + Code + Demo]

    895+1Sterne-Änderung der letzten 7 Tage
  • NEO@EvolvingLMMs-Lab

    NEO Series: Native Vision-Language-Modelle von Grund auf

    888+0Sterne-Änderung der letzten 7 Tage
  • AnyGPT@OpenMOSS

    Code für „AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling“

    882+0Sterne-Änderung der letzten 7 Tage
  • ohmycaptcha@shenhao-stu

    ⚡ Selbst hostbarer, YesCaptcha-kompatibler Captcha-Solver, entwickelt mit FastAPI, Playwright und OpenAI-kompatiblen multimodalen Modellen.

    869+4Sterne-Änderung der letzten 7 Tage
  • lmms-engine@EvolvingLMMs-Lab

    Eine einfache, einheitliche Trainings-Engine für multimodale Modelle. Schlank, flexibel und für skalierbares Hacking konzipiert.

    824+0Sterne-Änderung der letzten 7 Tage
  • [TMLR 2025🔥] Eine Übersicht über autoregressive Modelle in der Vision.

    808+1Sterne-Änderung der letzten 7 Tage
  • papermage@allenai

    Bibliothek zur Unterstützung von NLP- und CV-Forschung zu wissenschaftlichen Arbeiten

    803+0Sterne-Änderung der letzten 7 Tage
  • contrastors@nomic-ai

    Modelle kontrastiv trainieren in PyTorch

    802+0Sterne-Änderung der letzten 7 Tage
  • Lokales Monitoring + KI-Vision – Ein LAN-basiertes, Smartphone-gestütztes KI-Monitoring-Framework mit strukturiertem Event-Output für Datenerfassung und -analyse.

    762+4Sterne-Änderung der letzten 7 Tage
  • Eine Liste von Arbeiten zu multimodalen und großen Sprachmodellen, die ausschließlich dazu dient, gelesene Paper aus dem täglichen ArXiv für den Eigenbedarf zu dokumentieren.

    761+1Sterne-Änderung der letzten 7 Tage
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: Hochwertige Bildwiederherstellung nach menschlichen Anweisungen https://huggingface.co/spaces/marcosv/InstructIR

    741+0Sterne-Änderung der letzten 7 Tage
  • PaddleMIX@PaddlePaddle

    Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.

    723-1Sterne-Änderung der letzten 7 Tage
  • MMRec@enoche

    Eine Toolbox für multimodale Empfehlungen. Integriert über 10 Modelle...

    689+1Sterne-Änderung der letzten 7 Tage
  • VLM2Vec@TIGER-AI-Lab

    Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].

    682+2Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen