llava
Erfasste Open-Source-Repos mit dem Tag llava, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit llava am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit llava getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.
★ 25.014+12Sterne-Änderung der letzten 7 Tage - #2
SUPIR zielt auf die Entwicklung praktischer Algorithmen zur fotorealistischen Bildwiederherstellung in freier Wildbahn ab. Unsere neue Online-Demo ist ebenfalls auf suppixel.ai verfügbar.
★ 5.649+0Sterne-Änderung der letzten 7 Tage - #3
MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.
★ 5.462+41Sterne-Änderung der letzten 7 Tage - #4
Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks
★ 4.375+15Sterne-Änderung der letzten 7 Tage - #5
Chinesische NLP-Lösungen (große Sprachmodelle, Daten, Modelle, Training, Inferenz)
★ 3.836+2Sterne-Änderung der letzten 7 Tage - #6
Eine C#/.NET-Bibliothek zum effizienten Ausführen von LLMs (🦙LLaMA/LLaVA) auf Ihrem lokalen Gerät.
★ 3.790+3Sterne-Änderung der letzten 7 Tage - #7★ 3.511+46Sterne-Änderung der letzten 7 Tage
- #8
[EMNLP-2024] Erstellen Sie multimodale Sprachagenten für schnelles Prototyping und Produktion
★ 2.666+1Sterne-Änderung der letzten 7 Tage - #9
[ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.
★ 1.507+1Sterne-Änderung der letzten 7 Tage - #10★ 1.348+2Sterne-Änderung der letzten 7 Tage
- #11
Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️
★ 1.247+2Sterne-Änderung der letzten 7 Tage - #12
Vollständig offenes Framework für demokratisiertes multimodales Training
★ 1.195+3Sterne-Änderung der letzten 7 Tage - #13
Ein Framework für kleine, große multimodale Modelle
★ 1.004+1Sterne-Änderung der letzten 7 Tage - #14
🔥🔥 LLaVA++: Erweiterung von LLaVA mit Phi-3 und LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)
★ 842+0Sterne-Änderung der letzten 7 Tage - #15★ 794+1Sterne-Änderung der letzten 7 Tage
- #16
Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.
★ 724+1Sterne-Änderung der letzten 7 Tage - #17
Eine umfassende Frontend-Sammlung und Übersicht von Vision-Language-Model-Papern und -Modellen auf GitHub. Kontinuierliche Updates.
★ 705+5Sterne-Änderung der letzten 7 Tage - #18
👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]
★ 637+0Sterne-Änderung der letzten 7 Tage - #19
ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.
★ 589+1Sterne-Änderung der letzten 7 Tage - #20
LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.
★ 577+0Sterne-Änderung der letzten 7 Tage - #21
KI-gestützter Assistent für tägliche Aufgaben, basierend auf Llama 3, DeepSeek R1 und weiteren Modellen von HuggingFace.
★ 530+0Sterne-Änderung der letzten 7 Tage