Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal

multimodal

Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.

148 Repos
  • ✨✨ Neueste Papers und Benchmarks zum Reasoning mit Foundation Models

    657+1Sterne-Änderung der letzten 7 Tage
  • MOSS-Audio@OpenMOSS

    MOSS-Audio ist ein Open-Source-Grundlagenmodell für einheitliches Audioverständnis, das Sprache, Klänge, Musik, Beschriftung, Q&A und Reasoning in realen Szenarien ermöglicht.

    656+5Sterne-Änderung der letzten 7 Tage
  • SEED@AILab-CVC

    Offizielle Implementierung von SEED-LLaMA (ICLR 2024).

    641-1Sterne-Änderung der letzten 7 Tage
  • Seg-Zero@JIA-Lab-research

    Projektseite für „Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement“

    639+0Sterne-Änderung der letzten 7 Tage
  • 👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]

    637+0Sterne-Änderung der letzten 7 Tage
  • blended-latent-diffusion@omriav

    Offizielle Implementierung für „Blended Latent Diffusion“ [SIGGRAPH 2023]

    632+0Sterne-Änderung der letzten 7 Tage
  • second-brain@henrydaum

    Second Brain ist ein agentenbasiertes Framework, das als Betriebssystem fungiert und lokale Dateiintelligenz, Workflow-Automatisierung sowie LLMs nutzt, um Aufgaben zu erledigen und über mehrere Modalitäten und Messaging-Plattformen zu kommunizieren.

    631+12Sterne-Änderung der letzten 7 Tage
  • RAG-Driven-Generative-AI@Denis2054

    Dieses Repository bietet Programme zum Erstellen von Retrieval-Augmented-Generation (RAG)-Code für generative KI mit LlamaIndex, Deep Lake und Pinecone unter Nutzung von OpenAI- und Hugging-Face-Modellen für Generierung und Evaluierung.

    624+2Sterne-Änderung der letzten 7 Tage
  • VisualThinker-R1-Zero@turningpoint-ai

    Erkunden Sie den multimodalen „Aha-Moment“ am 2B-Modell.

    623+0Sterne-Änderung der letzten 7 Tage
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: Ein einheitliches Framework für die steuerbare Erstellung von 3D-Assets

    618+3Sterne-Änderung der letzten 7 Tage
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    606Sterne-Änderung der letzten 7 Tage
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenize Anything via Prompting

    600+0Sterne-Änderung der letzten 7 Tage
  • MMMU@MMMU-Benchmark

    Dieses Repository enthält Evaluierungscode für das Paper "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI"

    594+1Sterne-Änderung der letzten 7 Tage
  • Relax@redai-studio

    Eine asynchrone Reinforcement-Learning-Engine für skaliertes Omni-Modal Post-Training.

    592+11Sterne-Änderung der letzten 7 Tage
  • blended-diffusion@omriav

    Offizielle Implementierung für „Blended Diffusion for Text-driven Editing of Natural Images“ [CVPR 2022].

    589+0Sterne-Änderung der letzten 7 Tage
  • Groma@FoundationVision

    [ECCV2024] Grounded Multimodal Large Language Model mit lokalisierter visueller Tokenisierung

    586+0Sterne-Änderung der letzten 7 Tage
  • AI-Employe@vignshwarar

    Browser-Automatisierung erstellen, als würde man einen Menschen mit GPT-4 Vision anleiten.

    586+0Sterne-Änderung der letzten 7 Tage
  • rai@RobotecAI

    RAI ist ein herstellerunabhängiges Agenten-Framework für physische KI-Robotik, das ROS 2-Tools für komplexe Aktionen, Szenarien, freie Schnittstellenausführung, Protokollzusammenfassungen und Sprachinteraktion nutzt.

    582+6Sterne-Änderung der letzten 7 Tage
  • motis@motis-project

    Multimodales Routing, Geocodierung und Kartenelemente

    579+13Sterne-Änderung der letzten 7 Tage
  • LLaVA-Mini@ictnlp

    LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.

    577+0Sterne-Änderung der letzten 7 Tage
  • Das selbstkodierende System für Ihre App – Alan AI SDK für React Native.

    575+0Sterne-Änderung der letzten 7 Tage
  • multimodal-agents-course@the-ai-merge

    Ein multimodaler MCP-KI-Agent mit Augen und Ohren.

    575-1Sterne-Änderung der letzten 7 Tage
  • psi@microsoft

    Plattform für Situated Intelligence

    572+1Sterne-Änderung der letzten 7 Tage
  • clip.cpp@monatis

    CLIP-Inferenz in reinem C/C++ ohne zusätzliche Abhängigkeiten

    568+0Sterne-Änderung der letzten 7 Tage
  • Flame-Code-VLM@Flame-Code-VLM

    Flame ist ein Open-Source multimodales KI-System zur Umwandlung von UI-Design-Mockups in hochwertigen React-Code. Es nutzt Vision-Language-Modelle und automatisierte Workflows, um die Lücke zwischen Design und Frontend-Entwicklung zu schließen.

    562+0Sterne-Änderung der letzten 7 Tage
  • vlmrun-hub@vlm-run

    Eine zentrale Anlaufstelle für verschiedene branchenspezifische Schemata zur Verwendung mit VLMs.

    555+0Sterne-Änderung der letzten 7 Tage
  • Awesome Multimodal Modeling [Umfasst MLLM, UMM und NMM].

    543+2Sterne-Änderung der letzten 7 Tage
  • EVF-SAM@hustvl

    Offizieller Code für "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"

    508+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen