multimodal
Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.
- #61
SDK für die Interaktion mit stability.ai APIs (z. B. Stable-Diffusion-Inferenz)
★ 2.435-1Sterne-Änderung der letzten 7 Tage - #62
mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis
★ 2.411+0Sterne-Änderung der letzten 7 Tage - #63
[ECCV2024] Video Foundation Models & Data für multimodales Verständnis
★ 2.374+5Sterne-Änderung der letzten 7 Tage - #64
🎨 NeMo Data Designer: Generieren Sie hochwertige synthetische Daten von Grund auf oder aus Seed-Daten.
★ 2.197+7Sterne-Änderung der letzten 7 Tage - #65
GenAI Processors ist eine lightweight Python-Bibliothek, die eine effiziente, parallele Inhaltsverarbeitung ermöglicht.
★ 2.120+0Sterne-Änderung der letzten 7 Tage - #66
Lassen Sie Claude (oder ein beliebiges LLM) ein Video tatsächlich ansehen – szenenbewusste, deduplizierte Frames + Transkript, von einer URL oder einer lokalen Datei. Läuft lokal, MIT-lizenziert.
★ 2.109+20Sterne-Änderung der letzten 7 Tage - #67★ 2.048+7Sterne-Änderung der letzten 7 Tage
- #68
[ICLR & NeurIPS 2025] Repository für die Show-o-Serie, ein einziger Transformer zur Vereinigung multimodaler Verstehensprozesse und Generierung.
★ 1.975+1Sterne-Änderung der letzten 7 Tage - #69
Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.
★ 1.961+1Sterne-Änderung der letzten 7 Tage - #70
Implementierung von „BitNet: Scaling 1-bit Transformers for Large Language Models“ in PyTorch
★ 1.946+0Sterne-Änderung der letzten 7 Tage - #71
Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.
★ 1.835+1Sterne-Änderung der letzten 7 Tage - #72
Synthese von Grafikprogrammen für wissenschaftliche Abbildungen und Skizzen mit TikZ.
★ 1.818+1Sterne-Änderung der letzten 7 Tage - #73
Das selbstkodierende System für Ihre App — Alan AI SDK für Android
★ 1.807-1Sterne-Änderung der letzten 7 Tage - #74
Das Self-Coding-System für Ihre App — Alan AI SDK für Flutter
★ 1.756-1Sterne-Änderung der letzten 7 Tage - #75
Das Self-Coding-System für Ihre App — Alan AI SDK für Ionic
★ 1.649-1Sterne-Änderung der letzten 7 Tage - #76
Einheitliches multimodales Backend für KI-Daten-Apps
★ 1.619+5Sterne-Änderung der letzten 7 Tage - #77★ 1.602+3Sterne-Änderung der letzten 7 Tage
- #78
Erhalte saubere Daten aus schwierigen Dokumenten, unterstützt durch Vision-Language-Modelle ⚡
★ 1.524+0Sterne-Änderung der letzten 7 Tage - #79
Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.
★ 1.514+2Sterne-Änderung der letzten 7 Tage - #80
Visuelle Intelligenz für Ihr Zuhause.
★ 1.454+10Sterne-Änderung der letzten 7 Tage - #81
Übersicht japanischer LLMs
★ 1.428+1Sterne-Änderung der letzten 7 Tage - #82
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.422+521Sterne-Änderung der letzten 7 Tage - #83
Dieses Repository ist die offizielle Implementierung von Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023).
★ 1.406-1Sterne-Änderung der letzten 7 Tage - #84
Offline-Inferenz-Engine für Kunst, Echtzeit-Sprachkonversationen, LLM-gestützte Chatbots und automatisierte Workflows
★ 1.314+0Sterne-Änderung der letzten 7 Tage - #85
Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.
★ 1.310+2Sterne-Änderung der letzten 7 Tage - #86
Verleiht Claude die Fähigkeit, Videos anzusehen und zu verstehen — Claude Code-Plugin mit Frame-Extraktion und multimodaler Audioanalyse
★ 1.281+6Sterne-Änderung der letzten 7 Tage - #87
Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️
★ 1.247+1Sterne-Änderung der letzten 7 Tage - #88
Xtreme1 ist eine All-in-One-Datenkennzeichnungs- und Annotationsplattform für multimodales Datentraining und unterstützt 3D-LiDAR-Punktwolken, Bilder und LLMs.
★ 1.239+2Sterne-Änderung der letzten 7 Tage - #89
Verknüpfung von 3D-Mesh-Generierung mit Sprachmodellen
★ 1.167+0Sterne-Änderung der letzten 7 Tage - #90★ 1.153-25Sterne-Änderung der letzten 7 Tage