Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal

multimodal

Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.

148 Repos
  • tree-of-thoughts@kyegomez

    Plug-and-Play-Implementierung von Tree of Thoughts: Gezielte Problemlösung mit Large Language Models, die das logische Denken des Modells um mindestens 70 % steigert

    4.592+0Sterne-Änderung der letzten 7 Tage
  • Kuratierte Tutorials und Ressourcen für Large Language Models, AI Painting und mehr.

    4.537+2Sterne-Änderung der letzten 7 Tage
  • img2dataset@rom1504

    Große Mengen von Bild-URLs einfach in einen Bilddatensatz umwandeln. Kann 100 Millionen URLs auf einer Maschine in 20 Stunden herunterladen, skalieren und verpacken.

    4.445+2Sterne-Änderung der letzten 7 Tage
  • lmms-eval@EvolvingLMMs-Lab

    All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben

    4.390+7Sterne-Änderung der letzten 7 Tage
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM ist ein Open-Source-Großmodell-Ökosystem unter Leitung des Zentrums für kognitive Berechnung und natürliche Sprache des IDEA Research Institute und dient als Infrastruktur für chinesisches AIGC und kognitive Intelligenz.

    4.122-1Sterne-Änderung der letzten 7 Tage
  • MOSS-TTS@OpenMOSS

    Die MOSS‑TTS-Familie ist eine Open-Source-Modellfamilie zur Sprach- und Klangerzeugung von MOSI.AI und dem OpenMOSS-Team. Sie wurde für Szenarien in der realen Welt mit hoher Wiedergabetreue, starkem Ausdruck und hoher Komplexität entwickelt und deckt stabile Langform-Sprache, Dialoge mit mehreren Sprechern, Sprach-/Charakterdesign, Umgebungs-Soundeffekte und Echtzeit-Streaming-TTS ab.

    4.058+18Sterne-Änderung der letzten 7 Tage
  • mmpretrain@open-mmlab

    OpenMMLab Pre-training Toolbox und Benchmark

    3.850-1Sterne-Änderung der letzten 7 Tage
  • modlens@liustack

    Das erste Vision-Plugin für DeepSeek Harness und die Vision-Brücke für jeden reinen Text-Coding-Agenten. Bild einfügen, strukturierte JSON-Beweise erhalten (OCR, Layout, Semantik).

    3.839+83Sterne-Änderung der letzten 7 Tage
  • SimpleMem@aiming-lab

    SimpleMem: Effizientes, lebenslanges Gedächtnis für LLM-Agenten – Text & Multimodal

    3.735+9Sterne-Änderung der letzten 7 Tage
  • morphik-core@morphik-org

    Open-Source-Multimodal-Retrieval-Engine (Morphik Core). Von Morphik – KI-Back-Office für Pflegeheime und Seniorenresidenzen (morphik.ai).

    3.710-1Sterne-Änderung der letzten 7 Tage
  • Von Chain-of-Thought-Prompting bis zu OpenAI o1 und DeepSeek-R1 🍓

    3.681+3Sterne-Änderung der letzten 7 Tage
  • NExT-GPT@NExT-GPT

    Code und Modelle für das ICML 2024-Paper, NExT-GPT: Any-to-Any Multimodal Large Language Model

    3.634-2Sterne-Änderung der letzten 7 Tage
  • mteb@embeddings-benchmark

    MTEB: State-of-the-Art-Evaluierung von Embeddings über Sprachen und Modalitäten hinweg

    3.414+5Sterne-Änderung der letzten 7 Tage
  • InternGPT@OpenGVLab

    InternGPT (iGPT) ist eine Open-Source-Demoplattform zur einfachen Präsentation von KI-Modellen. Unterstützt nun DragGAN, ChatGPT, ImageBind, multimodalen Chat wie GPT-4, SAM, interaktive Bildbearbeitung und mehr. Testen Sie es unter igpt.opengvlab.com

    3.205+0Sterne-Änderung der letzten 7 Tage
  • vortex@vortex-data

    Ein erweiterbares, hochmodernes Framework für spaltenbasierte Komprimierung und das schnellste FOSS-Spaltendateiformat. Ehemals bei @spiraldb, jetzt ein Inkubationsprojekt bei LFAI&Data, einem Teil der Linux Foundation.

    3.171+8Sterne-Änderung der letzten 7 Tage
  • torchscale@microsoft

    Grundlagen-Architektur für (M)LLMs

    3.139+1Sterne-Änderung der letzten 7 Tage
  • docarray@docarray

    Repräsentieren, Senden, Speichern und Durchsuchen multimodaler Daten

    3.123-1Sterne-Änderung der letzten 7 Tage
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: Benchmarking multimodaler Agents für offene Aufgaben in echten Computerumgebungen

    3.118+6Sterne-Änderung der letzten 7 Tage
  • ai@TanStack

    🤖 Typsicheres, providerunabhängiges TypeScript AI SDK für Streaming-Chat, Tool-Aufrufe, Agenten und multimodale Apps über OpenAI, Anthropic, Gemini, React, Vue, Svelte und Solid.

    3.057+15Sterne-Änderung der letzten 7 Tage
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen

    2.925-1Sterne-Änderung der letzten 7 Tage
  • datachain@datachain-ai

    Die Kontextschicht für unstrukturierte Daten: typisierte, versionierte Datensätze über S3, GCS, Azure

    2.816+5Sterne-Änderung der letzten 7 Tage
  • clip-retrieval@rom1504

    Einfaches Berechnen von Clip-Einbettungen und Erstellen eines Clip-Abrufsystems damit.

    2.796+1Sterne-Änderung der letzten 7 Tage
  • autodistill@autodistill

    Bilder für die Inferenz ohne Kennzeichnung (Nutzung von Foundation Models zum Trainieren überwachter Modelle).

    2.770+3Sterne-Änderung der letzten 7 Tage
  • maestro@roboflow

    Optimierung des Fine-Tuning-Prozesses für multimodale Modelle: PaliGemma 2, Florence-2 und Qwen2.5-VL

    2.695+1Sterne-Änderung der letzten 7 Tage
  • OmAgent@om-ai-lab

    [EMNLP-2024] Erstellen Sie multimodale Sprachagenten für schnelles Prototyping und Produktion

    2.666+1Sterne-Änderung der letzten 7 Tage
  • generative-ai@genieincodebottle

    Umfassende Ressourcen zu Generative AI, einschließlich einer detaillierten Roadmap, Projekten, Anwendungsfällen, Interviewvorbereitung und Programmiervorbereitung.

    2.610+1Sterne-Änderung der letzten 7 Tage
  • OFA@OFA-Sys

    Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2.557+0Sterne-Änderung der letzten 7 Tage
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl: Die leistungsstarke Familie multimodaler Large Language Models

    2.539+0Sterne-Änderung der letzten 7 Tage
  • HuixiangDou@InternLM

    HuixiangDou: Bewältigung von Gruppenchatszenarien mit LLM-basierter technischer Unterstützung.

    2.502+2Sterne-Änderung der letzten 7 Tage
  • (ෆ`꒳´ෆ) Eine Übersicht über Text-zu-Bild-Generierung und -Synthese.

    2.444+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen