Zum Hauptinhalt springen
buildradar
Sign in
Thema · llava

llava

Erfasste Open-Source-Repos mit dem Tag llava, sortiert nach Sternen.

Repos
21
Sterne gesamt
66.002
Sterne im Schnitt
3.143
Anteil
0,00%

Themen, die häufig gemeinsam mit llava am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit llava getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.

    25.014+12Sterne-Änderung der letzten 7 Tage
  • SUPIR@Fanghua-Yu

    SUPIR zielt auf die Entwicklung praktischer Algorithmen zur fotorealistischen Bildwiederherstellung in freier Wildbahn ab. Unsere neue Online-Demo ist ebenfalls auf suppixel.ai verfügbar.

    5.649+0Sterne-Änderung der letzten 7 Tage
  • mlx-vlm@Blaizzy

    MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.

    5.462+41Sterne-Änderung der letzten 7 Tage
  • VLMEvalKit@open-compass

    Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks

    4.375+15Sterne-Änderung der letzten 7 Tage
  • zero_nlp@yuanzhoulvpi2017

    Chinesische NLP-Lösungen (große Sprachmodelle, Daten, Modelle, Training, Inferenz)

    3.836+2Sterne-Änderung der letzten 7 Tage
  • LLamaSharp@SciSharp

    Eine C#/.NET-Bibliothek zum effizienten Ausführen von LLMs (🦙LLaMA/LLaVA) auf Ihrem lokalen Gerät.

    3.790+3Sterne-Änderung der letzten 7 Tage
  • Eagle@NVlabs

    Eagle: Vision-Language-Modelle der nächsten Generation mit datenzentrierten Strategien

    3.511+46Sterne-Änderung der letzten 7 Tage
  • OmAgent@om-ai-lab

    [EMNLP-2024] Erstellen Sie multimodale Sprachagenten für schnelles Prototyping und Produktion

    2.666+1Sterne-Änderung der letzten 7 Tage
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.

    1.507+1Sterne-Änderung der letzten 7 Tage
  • taggui@jhc13

    Tag-Manager und Bildbeschrifter für Bilddatensätze

    1.348+2Sterne-Änderung der letzten 7 Tage
  • UForm@unum-cloud

    Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️

    1.247+2Sterne-Änderung der letzten 7 Tage
  • LLaVA-OneVision-2@EvolvingLMMs-Lab

    Vollständig offenes Framework für demokratisiertes multimodales Training

    1.195+3Sterne-Änderung der letzten 7 Tage
  • TinyLLaVA_Factory@TinyLLaVA

    Ein Framework für kleine, große multimodale Modelle

    1.004+1Sterne-Änderung der letzten 7 Tage
  • LLaVA-pp@mbzuai-oryx

    🔥🔥 LLaVA++: Erweiterung von LLaVA mit Phi-3 und LLaMA-3 (LLaVA LLaMA-3, LLaVA Phi-3)

    842+0Sterne-Änderung der letzten 7 Tage
  • machina@PsyChip

    Videoüberwachungssystem basierend auf OpenCV, YOLO und LLAVA

    794+1Sterne-Änderung der letzten 7 Tage
  • PaddleMIX@PaddlePaddle

    Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.

    724+1Sterne-Änderung der letzten 7 Tage
  • Eine umfassende Frontend-Sammlung und Übersicht von Vision-Language-Model-Papern und -Modellen auf GitHub. Kontinuierliche Updates.

    705+5Sterne-Änderung der letzten 7 Tage
  • 👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]

    637+0Sterne-Änderung der letzten 7 Tage
  • ComfyUI_VLM_nodes@gokayfem

    ComfyUI-Knoten für Vision-Language-Modelle: Qwen3-VL, Moondream 3, Florence-2, SmolVLM2, InternVL, Gemma 3, MiniCPM-V. Plus Open-Vocabulary-Erkennung, SAM2/SAM3-Segmentierung, Video-Temporal-Reasoning, GGUF über llama.cpp und gehostete LLM/VLM-APIs.

    589+1Sterne-Änderung der letzten 7 Tage
  • LLaVA-Mini@ictnlp

    LLaVA-Mini ist ein einheitliches großes multimodales Modell (LMM), das die effiziente Analyse von Bildern, hochauflösenden Bildern und Videos unterstützt.

    577+0Sterne-Änderung der letzten 7 Tage
  • llama-assistant@nrl-ai

    KI-gestützter Assistent für tägliche Aufgaben, basierend auf Llama 3, DeepSeek R1 und weiteren Modellen von HuggingFace.

    530+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen