multimodal
Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.
- #121
✨✨ Neueste Papers und Benchmarks zum Reasoning mit Foundation Models
★ 657+1Sterne-Änderung der letzten 7 Tage - #122
MOSS-Audio ist ein Open-Source-Grundlagenmodell für einheitliches Audioverständnis, das Sprache, Klänge, Musik, Beschriftung, Q&A und Reasoning in realen Szenarien ermöglicht.
★ 656+5Sterne-Änderung der letzten 7 Tage - #123★ 641-1Sterne-Änderung der letzten 7 Tage
- #124
Projektseite für „Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement“
★ 639+0Sterne-Änderung der letzten 7 Tage - #125
👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]
★ 637+0Sterne-Änderung der letzten 7 Tage - #126
Offizielle Implementierung für „Blended Latent Diffusion“ [SIGGRAPH 2023]
★ 632+0Sterne-Änderung der letzten 7 Tage - #127
Second Brain ist ein agentenbasiertes Framework, das als Betriebssystem fungiert und lokale Dateiintelligenz, Workflow-Automatisierung sowie LLMs nutzt, um Aufgaben zu erledigen und über mehrere Modalitäten und Messaging-Plattformen zu kommunizieren.
★ 631+12Sterne-Änderung der letzten 7 Tage - #128
Dieses Repository bietet Programme zum Erstellen von Retrieval-Augmented-Generation (RAG)-Code für generative KI mit LlamaIndex, Deep Lake und Pinecone unter Nutzung von OpenAI- und Hugging-Face-Modellen für Generierung und Evaluierung.
★ 624+2Sterne-Änderung der letzten 7 Tage - #129
Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.
★ 623+0Sterne-Änderung der letzten 7 Tage - #130
Hunyuan3D-Omni: Ein einheitliches Framework für die steuerbare Erstellung von 3D-Assets
★ 618+3Sterne-Änderung der letzten 7 Tage - #131★ 606—Sterne-Änderung der letzten 7 Tage
- #132
[ECCV 2024] Tokenize Anything via Prompting
★ 600+0Sterne-Änderung der letzten 7 Tage - #133
Dieses Repository enthält Evaluierungscode für das Paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"
★ 594+1Sterne-Änderung der letzten 7 Tage - #134
Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.
★ 592+11Sterne-Änderung der letzten 7 Tage - #135
Offizielle Implementierung für „Blended Diffusion for Text-driven Editing of Natural Images“ [CVPR 2022].
★ 589+0Sterne-Änderung der letzten 7 Tage - #136
[ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung
★ 586+0Sterne-Änderung der letzten 7 Tage - #137
Browser-Automatisierung erstellen, als würde man einen Menschen mit GPT-4 Vision anleiten.
★ 586+0Sterne-Änderung der letzten 7 Tage - #138
RAI ist ein herstellerunabhängiges Agenten-Framework für physische KI-Robotik, das ROS 2-Tools für komplexe Aktionen, Szenarien, freie Schnittstellenausführung, Protokollzusammenfassungen und Sprachinteraktion nutzt.
★ 582+6Sterne-Änderung der letzten 7 Tage - #139★ 579+13Sterne-Änderung der letzten 7 Tage
- #140
LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.
★ 577+0Sterne-Änderung der letzten 7 Tage - #141
Das selbstkodierende System für Ihre App – Alan AI SDK für React Native.
★ 575+0Sterne-Änderung der letzten 7 Tage - #142
Ein multimodaler MCP-KI-Agent mit Augen und Ohren.
★ 575-1Sterne-Änderung der letzten 7 Tage - #143★ 572+1Sterne-Änderung der letzten 7 Tage
- #144★ 568+0Sterne-Änderung der letzten 7 Tage
- #145
Flame ist ein Open-Source multimodales KI-System zur Umwandlung von UI-Design-Mockups in hochwertigen React-Code. Es nutzt Vision-Language-Modelle und automatisierte Workflows, um die Lücke zwischen Design und Frontend-Entwicklung zu schließen.
★ 562+0Sterne-Änderung der letzten 7 Tage - #146
Eine zentrale Anlaufstelle für verschiedene branchenspezifische Schemata zur Verwendung mit VLMs.
★ 555+0Sterne-Änderung der letzten 7 Tage - #147
Awesome Multimodal Modeling [Umfasst MLLM, UMM und NMM].
★ 543+2Sterne-Änderung der letzten 7 Tage - #148
Offizieller Code für "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"
★ 508+1Sterne-Änderung der letzten 7 Tage