Zum Hauptinhalt springen
buildradar
Sign in
Thema · mllm

mllm

Erfasste Open-Source-Repos mit dem Tag mllm, sortiert nach Sternen.

Repos
36
Sterne gesamt
92.042
Sterne im Schnitt
2.557
Anteil
0,00%

Themen, die häufig gemeinsam mit mllm am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit mllm getaggt wurden.

  • SenseNova-Vision@OpenSenseNova

    Vision als vereinheitlichte multimodale Generierung

    671
  • unilm@microsoft

    Groß angelegtes selbstüberwachtes Vortraining über Aufgaben, Sprachen und Modalitäten hinweg

    22.196+3Sterne-Änderung der letzten 7 Tage
  • Agent-S@simular-ai

    Agent S: ein offenes agentenbasiertes Framework, das Computer wie ein Mensch bedient

    12.202+20Sterne-Änderung der letzten 7 Tage
  • MobileAgent@X-PLUG

    Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie

    9.148+32Sterne-Änderung der letzten 7 Tage
  • SpatialLM@manycore-research

    [NeurIPS 2025] SpatialLM: Training von Large Language Models für die strukturierte Innenraummodellierung

    4.725+11Sterne-Änderung der letzten 7 Tage
  • MagicQuill@robbyant-research

    [CVPR'25] Offizielle Implementierungen für das Paper – MagicQuill: Ein intelligentes interaktives Bildbearbeitungssystem

    3.690+0Sterne-Änderung der letzten 7 Tage
  • Von Chain-of-Thought-Prompting bis zu OpenAI o1 und DeepSeek-R1 🍓

    3.681+5Sterne-Änderung der letzten 7 Tage
  • NExT-GPT@NExT-GPT

    Code und Modelle für das ICML 2024-Paper, NExT-GPT: Any-to-Any Multimodal Large Language Model

    3.635-1Sterne-Änderung der letzten 7 Tage
  • Eagle@NVlabs

    Eagle: Vision-Language-Modelle der nächsten Generation mit datenzentrierten Strategien

    3.494+50Sterne-Änderung der letzten 7 Tage
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen

    2.925+1Sterne-Änderung der letzten 7 Tage
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis

    2.411+2Sterne-Änderung der letzten 7 Tage
  • cambrian@cambrian-mllm

    Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.

    2.014+0Sterne-Änderung der letzten 7 Tage
  • 🚀🚀🚀 Eine Sammlung großartiger öffentlicher YOLO-Objekterkennungsprojekte und zugehöriger Objekterkennungsdatensätze.

    1.784+2Sterne-Änderung der letzten 7 Tage
  • Sa2VA@bytedance

    Offizielles Repository für die Pixel-LLM Codebasis: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1. Lösung für LSVOS)

    1.666+4Sterne-Änderung der letzten 7 Tage
  • Rex-Omni@IDEA-Research

    [CVPR2026] Detect Anything via Next Point Prediction

    1.565+4Sterne-Änderung der letzten 7 Tage
  • Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.

    1.309+2Sterne-Änderung der letzten 7 Tage
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Vollständig offenes Framework für demokratisiertes multimodales Training

    1.195+6Sterne-Änderung der letzten 7 Tage
  • Bunny@BAAI-DCAI

    Eine Familie leichter multimodaler Modelle.

    1.053+1Sterne-Änderung der letzten 7 Tage
  • OpenEMMA@taco-group

    OpenEMMA, eine freizügig lenzenzierte Open-Source-"Reproduktion" von Waymos EMMA-Modell.

    951+1Sterne-Änderung der letzten 7 Tage
  • NEO@EvolvingLMMs-Lab

    NEO Series: Native Vision-Language-Modelle von Grund auf

    888+4Sterne-Änderung der letzten 7 Tage
  • JarvisArt@LYL1015

    [NeurIPS' 2025] JarvisArt: Befreiung der menschlichen künstlerischen Kreativität durch einen intelligenten Fotoretusche-Agenten

    862+3Sterne-Änderung der letzten 7 Tage
  • Osprey@CircleRadon

    [CVPR2024] Der Code für „Osprey: Pixel Understanding with Visual Instruction Tuning“

    843+0Sterne-Änderung der letzten 7 Tage
  • FSDrive@MIV-XJTU

    [NeurIPS 2025 Spotlight] Offizielle Implementierung für „FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving“

    827+1Sterne-Änderung der letzten 7 Tage
  • 4KAgent@taco-group

    [NeurIPS 2025] 4KAgent: Agentenbasiertes Any-Image-zu-4K-Super-Resolution. Ein intelligenter Computer-Vision-Agent, der jedes Bild auf magische Weise in perfektes 4K wiederherstellen kann!

    819+1Sterne-Änderung der letzten 7 Tage
  • 🚀🚀🚀 Eine Sammlung großartiger öffentlicher Projekte zu Large Language Models (LLM), Vision Language Models (VLM), Vision Language Action (VLA), AI Generated Content (AIGC) sowie den zugehörigen Datensätzen und Anwendungen.

    814+0Sterne-Änderung der letzten 7 Tage
  • Ein Repository zur Auflistung von Publikationen über Scene Graph Generation und Anwendungen.

    724+5Sterne-Änderung der letzten 7 Tage
  • MPP-LLaVA@Coobiw

    Persönliches Projekt: MPP-Qwen14B & MPP-Qwen-Next (Multimodale Pipeline-Parallelisierung basierend auf Qwen-LM). Unterstützt [Video/Bild/Multi-Bild] {SFT/Konversationen}. Lassen Sie sich nicht von Armut in Ihrer Vorstellungskraft einschränken! Trainieren Sie Ihr eigenes LLaVA-ähnliches MLLM (8B/14B) auf einer RTX3090/4090 mit 24 GB.

    686+2Sterne-Änderung der letzten 7 Tage
  • SenseNova-Vision@OpenSenseNova

    Vision als vereinheitlichte multimodale Generierung

    671+12Sterne-Änderung der letzten 7 Tage
  • Woodpecker@VITA-MLLM

    ✨✨Woodpecker: Korrektur von Halluzinationen bei multimodalen Large Language Models

    649+1Sterne-Änderung der letzten 7 Tage
  • FakeShield@zhipeixu

    [ICLR 2025] FakeShield: Erklärbare Erkennung und Lokalisierung von Bildfälschungen mittels multimodaler großer Sprachmodelle

    623+1Sterne-Änderung der letzten 7 Tage
  • Emotion-LLaMA@ZebangCheng

    Emotion-LLaMA: Multimodale Emotionserkennung und -analyse mit Instruction Tuning

    616+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen