Zum Hauptinhalt springen
buildradar
Sign in
Thema · multi-modal

multi-modal

Erfasste Open-Source-Repos mit dem Tag multi-modal, sortiert nach Sternen.

Repos
42
Sterne gesamt
189.535
Sterne im Schnitt
4.513
Anteil
0,01%

Themen, die häufig gemeinsam mit multi-modal am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit multi-modal getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • agentscope@agentscope-ai

    Agenten bauen und ausführen, die Sie sehen, verstehen und vertrauen können.

    30.463+420Sterne-Änderung der letzten 7 Tage
  • MiniCPM-V@OpenBMB

    Ein Pocket-Sized MLLM für ultraschnelle Bild- und Video-Verarbeitung auf Ihrem Telefon

    26.283+27Sterne-Änderung der letzten 7 Tage
  • ten-framework@TEN-framework

    Open-Source-Framework für konversationelle Sprach-KI-Agenten

    11.102+10Sterne-Änderung der letzten 7 Tage
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL Family: Eine bahnbrechende Open-Source-Alternative zu GPT-4o. Ein Open-Source-Multimodal-Dialogmodell, das der Leistung von GPT-4o nahekommt.

    10.150+3Sterne-Änderung der letzten 7 Tage
  • modelscope@modelscope

    ModelScope: Das Konzept von Model-as-a-Service zum Leben erwecken.

    9.121+4Sterne-Änderung der letzten 7 Tage
  • big-AGI@enricoros

    KI-Suite, angetrieben von modernen Modellen, die erweiterte KI/AGI-Funktionen bereitstellt. Beinhaltet KI-Personas, AGI-Funktionen, erstklassige Beam-Multimodell-Chats, Text-to-Image, Sprache, Antwort-Streaming, Code-Hervorhebung und -Ausführung, PDF-Import, Voreinstellungen für Entwickler und vieles mehr. On-Premise oder in der Cloud bereitstellbar.

    7.108+1Sterne-Änderung der letzten 7 Tage
  • data-juicer@datajuicer

    Datenverarbeitung für und mit Foundation Models! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷

    6.975+26Sterne-Änderung der letzten 7 Tage
  • CogVLM@zai-org

    Ein hochmodernes visuelles Open-Source-Sprachmodell | Multimodales vortrainiertes Modell

    6.744+0Sterne-Änderung der letzten 7 Tage
  • valhalla@valhalla

    Open-Source-Routing-Engine für OpenStreetMap

    6.154+24Sterne-Änderung der letzten 7 Tage
  • Chinese-CLIP@OFA-Sys

    Chinesische Version von CLIP für chinesische cross-modale Suche und Repräsentationsgenerierung.

    6.001+1Sterne-Änderung der letzten 7 Tage
  • DALLE-pytorch@lucidrains

    Implementierung / Replikation von DALL-E, OpenAIs Text-to-Image-Transformer, in Pytorch

    5.626-2Sterne-Änderung der letzten 7 Tage
  • marqo@marqo-ai

    E-Commerce-Suche und -Entdeckung - marqo.ai

    5.031-1Sterne-Änderung der letzten 7 Tage
  • DeepKE@zjunlp

    [EMNLP 2022] Ein offenes Toolkit zur Extraktion und Konstruktion von Wissensgraphen

    4.476+1Sterne-Änderung der letzten 7 Tage
  • VLMEvalKit@open-compass

    Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks

    4.375+13Sterne-Änderung der letzten 7 Tage
  • OmniGen@VectorSpaceLab

    OmniGen: Einheitliche Bildgenerierung. https://arxiv.org/pdf/2409.11340

    4.342+1Sterne-Änderung der letzten 7 Tage
  • VisualGLM-6B@zai-org

    Multimodales, chinesisch-englisches Dialogsprachmodell | 多模态中英双语对话语言模型

    4.155+0Sterne-Änderung der letzten 7 Tage
  • LLamaSharp@SciSharp

    Eine C#/.NET-Bibliothek zum effizienten Ausführen von LLMs (🦙LLaMA/LLaVA) auf Ihrem lokalen Gerät.

    3.790+2Sterne-Änderung der letzten 7 Tage
  • Video-LLaVA@PKU-YuanGroup

    【EMNLP 2024🔥】Video-LLaVA: Erlernen einer vereinten visuellen Repräsentation durch Ausrichtung vor der Projektion

    3.500+1Sterne-Änderung der letzten 7 Tage
  • py-xiaozhi@huangjunsen0406

    Open-Source-KI-Assistenten-Ökosystem mit MCP-Integrationen, multimodalen Workflows, IoT-Unterstützung und plattformübergreifender Sprachinteraktion.

    3.463+9Sterne-Änderung der letzten 7 Tage
  • docarray@docarray

    Repräsentieren, Senden, Speichern und Durchsuchen multimodaler Daten

    3.123-1Sterne-Änderung der letzten 7 Tage
  • LISA@JIA-Lab-research

    Projektseite für „LISA: Reasoning Segmentation via Large Language Model“

    2.674+0Sterne-Änderung der letzten 7 Tage
  • CogVLM2@zai-org

    Open-Source-Multimodell auf GPT4V-Niveau basierend auf Llama3-8B

    2.433+0Sterne-Änderung der letzten 7 Tage
  • MoE-LLaVA@PKU-YuanGroup

    【TMM 2025🔥】Mixture-of-Experts für Large Vision-Language Models

    2.322+0Sterne-Änderung der letzten 7 Tage
  • RecSysPapers@tangxyw

    Eine Sammlung von Industrie-Klassikern und bahnbrechenden Papers aus den Bereichen Empfehlung, Werbung und Suche.

    2.188-1Sterne-Änderung der letzten 7 Tage
  • MotionGPT@OpenMotionLab

    [NeurIPS 2023] MotionGPT: Human Motion as a Foreign Language, ein einheitliches Bewegungs-Sprach-Generierungsmodell mit LLMs

    1.963+1Sterne-Änderung der letzten 7 Tage
  • GPTDiscord@Kav-K

    Eine robuste All-in-One-GPT-Schnittstelle für Discord. ChatGPT-ähnliche Konversationen, Bildgenerierung, KI-Moderation, benutzerdefinierte Indizes/Wissensdatenbanken, YouTube-Zusammenfasser und mehr!

    1.853-2Sterne-Änderung der letzten 7 Tage
  • SALMONN@bytedance

    SALMONN-Familie: Eine Suite fortschrittlicher multimodaler LLMs

    1.521+3Sterne-Änderung der letzten 7 Tage
  • MedMNIST@MedMNIST

    [pip install medmnist] 18 standardisierte Datensätze für die 2D- und 3D-Biomedizinische Bildklassifizierung

    1.399+0Sterne-Änderung der letzten 7 Tage
  • transfusion-pytorch@lucidrains

    PyTorch-Implementierung von Transfusion („Predict the Next Token and Diffuse Images with One Multi-Modal Model“) von MetaAI

    1.398+3Sterne-Änderung der letzten 7 Tage
  • Dieses Repository sammelt Arbeiten für „A Survey on Knowledge Distillation of Large Language Models“. Wir unterteilen KD in Wissensbeschaffungs- und Distillationsalgorithmen und untersuchen die Fähigkeiten- und vertikale Distillation von LLMs.

    1.306+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen