multimodal
Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.
- #91
Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode
★ 1.136+18Sterne-Änderung der letzten 7 Tage - #92
Das Self-Coding-System für Ihre App — Alan AI SDK für Cordova
★ 1.132+0Sterne-Änderung der letzten 7 Tage - #93★ 1.108+3Sterne-Änderung der letzten 7 Tage
- #94
SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.
★ 1.105+130Sterne-Änderung der letzten 7 Tage - #95★ 1.088+1Sterne-Änderung der letzten 7 Tage
- #96
🩺 Das erste chinesische multimodale medizinische Modell zur Analyse von Thorax-Röntgenbildern | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.
★ 1.084+2Sterne-Änderung der letzten 7 Tage - #97
Augen für rein textbasierte DeepSeek Harness Agents: integrierte kostenlose Vision-Chain (kein Schlüssel) + pixelgenaue Vision-Tools (Fragen & Antworten, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots). Ein-Befehl-Installation, kein Python, Bildverarbeitung funktioniert wie normale Tool-Aufrufe.
★ 1.077+54Sterne-Änderung der letzten 7 Tage - #98
[ICLR'24 Spotlight] Chinesische und englische multimodale Large-Model-Serie (Chat and Paint) | Basiert auf dem CPM-Basismodell für multimodale chinesisch-englische Großmodelle
★ 1.061-1Sterne-Änderung der letzten 7 Tage - #99
Ein allgemeines Repräsentationsmodell über Bild-, Audio- und Sprachmodalitäten. Paper: ONE-PEACE: Exploring One General Representation Model Toward Unlimited Modalities
★ 1.060+0Sterne-Änderung der letzten 7 Tage - #100
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Befähigung großer Sprachmodelle zum Verständnis von Punktwolken
★ 1.053+2Sterne-Änderung der letzten 7 Tage - #101
Eine offizielle Implementierung für „CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval“
★ 1.031+0Sterne-Änderung der letzten 7 Tage - #102
Multimodal Chain-of-Thought Reasoning: Eine umfassende Übersicht
★ 1.025+2Sterne-Änderung der letzten 7 Tage - #103★ 1.016+37Sterne-Änderung der letzten 7 Tage
- #104
Ressourcen, Beispiele und Tutorials für multimodale KI, RAG und Agenten unter Verwendung von Vektorsuche und LLMs
★ 973-1Sterne-Änderung der letzten 7 Tage - #105★ 955+60Sterne-Änderung der letzten 7 Tage
- #106★ 903+4Sterne-Änderung der letzten 7 Tage
- #107
Dieses Repository ist eine kuratierte Sammlung der spannendsten und einflussreichsten CVPR 2025 Paper. 🔥 [Paper + Code + Demo]
★ 895+1Sterne-Änderung der letzten 7 Tage - #108★ 888+0Sterne-Änderung der letzten 7 Tage
- #109★ 882+0Sterne-Änderung der letzten 7 Tage
- #110
⚡ Selbst hostbarer, YesCaptcha-kompatibler Captcha-Solver, entwickelt mit FastAPI, Playwright und OpenAI-kompatiblen multimodalen Modellen.
★ 869+4Sterne-Änderung der letzten 7 Tage - #111
Eine einfache, einheitliche Trainings-Engine für multimodale Modelle. Schlank, flexibel und für skalierbares Hacking konzipiert.
★ 824+0Sterne-Änderung der letzten 7 Tage - #112
[TMLR 2025🔥] Eine Übersicht über autoregressive Modelle in der Vision.
★ 808+1Sterne-Änderung der letzten 7 Tage - #113
Bibliothek zur Unterstützung von NLP- und CV-Forschung zu wissenschaftlichen Arbeiten
★ 803+0Sterne-Änderung der letzten 7 Tage - #114
Modelle kontrastiv trainieren in PyTorch
★ 802+0Sterne-Änderung der letzten 7 Tage - #115
Lokales Monitoring + KI-Vision – Ein LAN-basiertes, Smartphone-gestütztes KI-Monitoring-Framework mit strukturiertem Event-Output für Datenerfassung und -analyse.
★ 762+4Sterne-Änderung der letzten 7 Tage - #116
Eine Liste von Arbeiten zu multimodalen und großen Sprachmodellen, die ausschließlich dazu dient, gelesene Paper aus dem täglichen ArXiv für den Eigenbedarf zu dokumentieren.
★ 761+1Sterne-Änderung der letzten 7 Tage - #117
[ECCV 2024] InstructIR: Hochwertige Bildwiederherstellung nach menschlichen Anweisungen https://huggingface.co/spaces/marcosv/InstructIR
★ 741+0Sterne-Änderung der letzten 7 Tage - #118
Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.
★ 723-1Sterne-Änderung der letzten 7 Tage - #119★ 689+1Sterne-Änderung der letzten 7 Tage
- #120
Dieses Repository enthält den Code für „VLM2Vec / MMEB“ [ICLR 2025], „VLM2Vec-V2 / MMEB-V2“ [TMLR 2026] und „MMEB-V3“ [COLM 2026].
★ 682+2Sterne-Änderung der letzten 7 Tage