mllm
Erfasste Open-Source-Repos mit dem Tag mllm, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit mllm am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit mllm getaggt wurden.
- #1
Vision als vereinheitlichte multimodale Generierung
★ 671
- #1
Groß angelegtes selbstüberwachtes Vortraining über Aufgaben, Sprachen und Modalitäten hinweg
★ 22.196+3Sterne-Änderung der letzten 7 Tage - #2
Agent S: ein offenes agentenbasiertes Framework, das Computer wie ein Mensch bedient
★ 12.202+20Sterne-Änderung der letzten 7 Tage - #3
Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie
★ 9.148+32Sterne-Änderung der letzten 7 Tage - #4
[NeurIPS 2025] SpatialLM: Training von Large Language Models für die strukturierte Innenraummodellierung
★ 4.725+11Sterne-Änderung der letzten 7 Tage - #5
[CVPR'25] Offizielle Implementierungen für das Paper – MagicQuill: Ein intelligentes interaktives Bildbearbeitungssystem
★ 3.690+0Sterne-Änderung der letzten 7 Tage - #6
Von Chain-of-Thought-Prompting bis zu OpenAI o1 und DeepSeek-R1 🍓
★ 3.681+5Sterne-Änderung der letzten 7 Tage - #7
Code und Modelle für das ICML 2024-Paper, NExT-GPT: Any-to-Any Multimodal Large Language Model
★ 3.635-1Sterne-Änderung der letzten 7 Tage - #8★ 3.494+50Sterne-Änderung der letzten 7 Tage
- #9
InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen
★ 2.925+1Sterne-Änderung der letzten 7 Tage - #10
mPLUG-DocOwl: Ein modulares multimodales großes Sprachmodell zum Dokumentenverständnis
★ 2.411+2Sterne-Änderung der letzten 7 Tage - #11
Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.
★ 2.014+0Sterne-Änderung der letzten 7 Tage - #12
🚀🚀🚀 Eine Sammlung großartiger öffentlicher YOLO-Objekterkennungsprojekte und zugehöriger Objekterkennungsdatensätze.
★ 1.784+2Sterne-Änderung der letzten 7 Tage - #13
Offizielles Repository für die Pixel-LLM Codebasis: Sa2VA (T-PAMI-26), SAMTok (CVPR-26), VRT (Arxiv-25), SaSaSa2VA (1. Lösung für LSVOS)
★ 1.666+4Sterne-Änderung der letzten 7 Tage - #14★ 1.565+4Sterne-Änderung der letzten 7 Tage
- #15
Kuratierter visueller Katalog mit über 155 Vision-Language-Modell-Architekturen (VLM/MLLM): Paper, Diagramme, Trainingsrezepte, Datensätze und eine Release-Timeline für multimodale KI-Agenten.
★ 1.309+2Sterne-Änderung der letzten 7 Tage - #16
Vollständig offenes Framework für demokratisiertes multimodales Training
★ 1.195+6Sterne-Änderung der letzten 7 Tage - #17★ 1.053+1Sterne-Änderung der letzten 7 Tage
- #18
OpenEMMA, eine freizügig lenzenzierte Open-Source-"Reproduktion" von Waymos EMMA-Modell.
★ 951+1Sterne-Änderung der letzten 7 Tage - #19★ 888+4Sterne-Änderung der letzten 7 Tage
- #20
[NeurIPS' 2025] JarvisArt: Befreiung der menschlichen künstlerischen Kreativität durch einen intelligenten Fotoretusche-Agenten
★ 862+3Sterne-Änderung der letzten 7 Tage - #21
[CVPR2024] Der Code für „Osprey: Pixel Understanding with Visual Instruction Tuning“
★ 843+0Sterne-Änderung der letzten 7 Tage - #22
[NeurIPS 2025 Spotlight] Offizielle Implementierung für „FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving“
★ 827+1Sterne-Änderung der letzten 7 Tage - #23
[NeurIPS 2025] 4KAgent: Agentenbasiertes Any-Image-zu-4K-Super-Resolution. Ein intelligenter Computer-Vision-Agent, der jedes Bild auf magische Weise in perfektes 4K wiederherstellen kann!
★ 819+1Sterne-Änderung der letzten 7 Tage - #24
🚀🚀🚀 Eine Sammlung großartiger öffentlicher Projekte zu Large Language Models (LLM), Vision Language Models (VLM), Vision Language Action (VLA), AI Generated Content (AIGC) sowie den zugehörigen Datensätzen und Anwendungen.
★ 814+0Sterne-Änderung der letzten 7 Tage - #25
Ein Repository zur Auflistung von Publikationen über Scene Graph Generation und Anwendungen.
★ 724+5Sterne-Änderung der letzten 7 Tage - #26
Persönliches Projekt: MPP-Qwen14B & MPP-Qwen-Next (Multimodale Pipeline-Parallelisierung basierend auf Qwen-LM). Unterstützt [Video/Bild/Multi-Bild] {SFT/Konversationen}. Lassen Sie sich nicht von Armut in Ihrer Vorstellungskraft einschränken! Trainieren Sie Ihr eigenes LLaVA-ähnliches MLLM (8B/14B) auf einer RTX3090/4090 mit 24 GB.
★ 686+2Sterne-Änderung der letzten 7 Tage - #27
Vision als vereinheitlichte multimodale Generierung
★ 671+12Sterne-Änderung der letzten 7 Tage - #28
✨✨Woodpecker: Korrektur von Halluzinationen bei multimodalen Large Language Models
★ 649+1Sterne-Änderung der letzten 7 Tage - #29
[ICLR 2025] FakeShield: Erklärbare Erkennung und Lokalisierung von Bildfälschungen mittels multimodaler großer Sprachmodelle
★ 623+1Sterne-Änderung der letzten 7 Tage - #30
Emotion-LLaMA: Multimodale Emotionserkennung und -analyse mit Instruction Tuning
★ 616+1Sterne-Änderung der letzten 7 Tage