Zum Hauptinhalt springen
buildradar
Sign in
Thema · multimodal-large-language-models

multimodal-large-language-models

Erfasste Open-Source-Repos mit dem Tag multimodal-large-language-models, sortiert nach Sternen.

Repos
32
Sterne gesamt
66.902
Sterne im Schnitt
2.091
Anteil
0,00%

Themen, die häufig gemeinsam mit multimodal-large-language-models am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit multimodal-large-language-models getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • :sparkles::sparkles: Neueste Fortschritte bei multimodalen Large Language Models

    17.996+2Sterne-Änderung der letzten 7 Tage
  • MobileAgent@X-PLUG

    Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie

    9.157+9Sterne-Änderung der letzten 7 Tage
  • star-vector@joanrod

    StarVector ist ein Basismodell zur SVG-Generierung, das Vektorisierung in eine Code-Generierungsaufgabe umwandelt. Unter Verwendung einer Vision-Language-Modellarchitektur verarbeitet StarVector sowohl visuelle als auch textuelle Eingaben, um qualitativ hochwertigen SVG-Code mit bemerkenswerter Präzision zu erzeugen.

    4.567+6Sterne-Änderung der letzten 7 Tage
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni ist ein latenzarmes und qualitativ hochwertiges End-to-End-Sprachinteraktionsmodell auf Basis von Llama-3.1-8B-Instruct mit dem Ziel, Sprachfunktionen auf GPT-4o-Niveau zu erreichen.

    3.147+1Sterne-Änderung der letzten 7 Tage
  • VideoPipe@sherlockchou86

    Ein plattformübergreifendes Framework zur Videostrukturierung (Videoanalyse) basierend auf CV-Modellen und mLLMs.

    2.933+0Sterne-Änderung der letzten 7 Tage
  • VITA@VITA-MLLM

    ✨✨[NeurIPS 2025] VITA-1.5: Auf dem Weg zu Echtzeit-Vision- und Sprachinteraktion auf GPT-4o-Niveau

    2.532-1Sterne-Änderung der letzten 7 Tage
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis

    2.411+0Sterne-Änderung der letzten 7 Tage
  • cambrian@cambrian-mllm

    Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.

    2.014+1Sterne-Änderung der letzten 7 Tage
  • RPG-DiffusionMaster@YangLing0818

    [ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs (RPG)

    1.844+0Sterne-Änderung der letzten 7 Tage
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, ein Vision-Language-Grundlagenmodell für allgemeines multimodales Verständnis und Schließen, das bei 38 von 60 öffentlichen Benchmarks branchenführende Ergebnisse erzielt.

    1.586+0Sterne-Änderung der letzten 7 Tage
  • Ovis@ATH-MaaS

    Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.

    1.514+2Sterne-Änderung der letzten 7 Tage
  • Awesome Unified Multimodal Models

    1.314+1Sterne-Änderung der letzten 7 Tage
  • VideoChat@Henry-23

    Interaktiver digitaler Mensch in Echtzeit mit anpassbarem Erscheinungsbild und Stimme, Unterstützung für Stimmenklonen und einer Dialogverzögerung von nur 3 Sekunden.

    1.303-1Sterne-Änderung der letzten 7 Tage
  • PyTorch-Implementierung von Audio Flamingo: Eine Reihe fortgeschrittener Sprachmodelle zum Audioverständnis

    1.184+2Sterne-Änderung der letzten 7 Tage
  • SLAM-LLM@X-LANCE

    Ein Framework für Sprach-, Audio-, Musik- und Textverarbeitung mit Large Language Models

    1.058+2Sterne-Änderung der letzten 7 Tage
  • Bunny@BAAI-DCAI

    Eine Familie leichter multimodaler Modelle.

    1.053+0Sterne-Änderung der letzten 7 Tage
  • Awesome-MCoT@yaotingwangofficial

    Multimodal Chain-of-Thought Reasoning: Eine umfassende Übersicht

    1.025+2Sterne-Änderung der letzten 7 Tage
  • Eine Sammlung von Ressourcen zu Anwendungen des multimodalen Lernens in der medizinischen Bildgebung.

    975+1Sterne-Änderung der letzten 7 Tage
  • NEO@EvolvingLMMs-Lab

    NEO Series: Native Vision-Language-Modelle von Grund auf

    888+0Sterne-Änderung der letzten 7 Tage
  • Video-MME@MME-Benchmarks

    ✨✨ [CVPR 2025] Video-MME: Der allererste umfassende Evaluierungsbenchmark für multimodale LLMs in der Videoanalyse

    791+2Sterne-Änderung der letzten 7 Tage
  • LLaVA-Plus-Codebase@LLaVA-VL

    LLaVA-Plus: Große Sprach- und Bildassistenten, die sich einstecken lassen und lernen, Fähigkeiten zu nutzen

    770+0Sterne-Änderung der letzten 7 Tage
  • MovieChat@wenhaochai

    [CVPR 2024] MovieChat: Von dichten Token zu sparsamem Speicher für das Verständnis langer Videos

    706+0Sterne-Änderung der letzten 7 Tage
  • unicom@deepglint

    Visuelles Repräsentationsmodell im großen Maßstab

    702+0Sterne-Änderung der letzten 7 Tage
  • MPP-LLaVA@Coobiw

    Persönliches Projekt: MPP-Qwen14B & MPP-Qwen-Next (Multimodale Pipeline-Parallelisierung basierend auf Qwen-LM). Unterstützt [Video/Bild/Multi-Bild] {SFT/Konversationen}. Lassen Sie sich nicht von Armut in Ihrer Vorstellungskraft einschränken! Trainieren Sie Ihr eigenes LLaVA-ähnliches MLLM (8B/14B) auf einer RTX3090/4090 mit 24 GB.

    686+0Sterne-Änderung der letzten 7 Tage
  • OmniVinci@NVlabs

    OmniVinci ist ein omnimodales LLM für das gemeinsame Verständnis von Vision, Audio und Sprache.

    677+0Sterne-Änderung der letzten 7 Tage
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Korrektur von Halluzinationen bei multimodalen Large Language Models

    650+1Sterne-Änderung der letzten 7 Tage
  • Liquid@FoundationVision

    (Akzeptiert bei IJCV) Liquid: Sprachmodelle sind skalierbare und einheitliche multimodale Generatoren

    640+0Sterne-Änderung der letzten 7 Tage
  • Vitron@SkyworkAI

    NeurIPS 2024 Paper: Ein einheitliches Pixel-basiertes Vision LLM für Verständnis, Generierung, Segmentierung und Bearbeitung

    577+1Sterne-Änderung der letzten 7 Tage
  • LLaVA-Mini@ictnlp

    LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.

    577+0Sterne-Änderung der letzten 7 Tage
  • cambrian-s@cambrian-mllm

    Cambrian-S: Auf dem Weg zur räumlichen Super-Sensorik in Videos

    567-1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen