Zum Hauptinhalt springen
buildradar
Sign in
Thema · multi-modality

multi-modality

Erfasste Open-Source-Repos mit dem Tag multi-modality, sortiert nach Sternen.

Repos
11
Sterne gesamt
70.438
Sterne im Schnitt
6.403
Anteil
0,00%

Themen, die häufig gemeinsam mit multi-modality am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit multi-modality getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.

    25.005+9Sterne-Änderung der letzten 7 Tage
  • :sparkles::sparkles: Neueste Fortschritte bei multimodalen Large Language Models

    17.994+8Sterne-Änderung der letzten 7 Tage
  • clip-as-service@jina-ai

    🏄 Skalierbares Embedding, Reasoning und Ranking für Bilder und Sätze mit CLIP

    12.835+0Sterne-Änderung der letzten 7 Tage
  • MOSS-TTS-Nano@OpenMOSS

    MOSS-TTS-Nano ist ein Open-Source-Modell zur mehrsprachigen Miniatur-Sprachgenerierung von MOSI.AI und dem OpenMOSS-Team. Mit nur 0,1 Milliarden Parametern ist es für die Echtzeit-Sprachgenerierung konzipiert, läuft direkt auf der CPU ohne GPU und hält den Bereitstellungsstack einfach genug für lokale Demos, Web-Serving und die Integration in leichtgewichtige Produkte.

    4.279+51Sterne-Änderung der letzten 7 Tage
  • Otter@EvolvingLMMs-Lab

    🦦 Otter, ein multimodales Modell basierend auf OpenFlamingo (Open-Source-Version von DeepMinds Flamingo), trainiert auf MIMIC-IT mit verbesserten Fähigkeiten zur Befehlsausfolgung und zum In-Context-Lernen.

    3.437+2Sterne-Änderung der letzten 7 Tage
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen

    2.925+1Sterne-Änderung der letzten 7 Tage
  • Algorithmen und Publikationen zur 3D-Objektverfolgung

    1.028+2Sterne-Änderung der letzten 7 Tage
  • VisRAG@OpenBMB

    Parsing-freies RAG, unterstützt durch VLMs

    979+1Sterne-Änderung der letzten 7 Tage
  • Long-RL@NVlabs

    Long-RL: Skalierung von RL auf lange Sequenzen (NeurIPS 2025)

    729+2Sterne-Änderung der letzten 7 Tage
  • MINIMA@LSXI7

    [CVPR 2025] MINIMA: Modality Invariant Image Matching

    671+2Sterne-Änderung der letzten 7 Tage
  • Multi-Modality-Arena@OpenGVLab

    Chatbot Arena trifft auf Multimodalität! Multi-Modality Arena ermöglicht es, Vision-Language-Modelle nebeneinander zu benchmarken, während Bilder als Eingaben bereitgestellt werden. Unterstützt MiniGPT-4, LLaMA-Adapter V2, LLaVA, BLIP-2 und viele weitere!

    566+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen