Zum Hauptinhalt springen
buildradar
Sign in
Thema · vision-language-model

vision-language-model

Erfasste Open-Source-Repos mit dem Tag vision-language-model, sortiert nach Sternen.

Repos
59
Sterne gesamt
150.825
Sterne im Schnitt
2.556
Anteil
0,01%

Themen, die häufig gemeinsam mit vision-language-model am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit vision-language-model getaggt wurden.

  • doc7@magicrew

    Konvertieren Sie Dokumente mit visueller Erkennung in KI-ready Markdown

    1.153
  • Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode

    1.136
  • dsh-vision-toolkit@Anionex

    DeepSeek-Harness-native Integration für agent-vision-toolkit: Bild-Q&A, Long-Screenshot-OCR, UI-Wiederherstellung, Grounding, Pixel-Diff, Artifacts und Web-UI.

    854
  • OraRL@HVision-NKU

    🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.

    152
  • LLaVA@haotian-liu

    [NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.

    25.014+9Sterne-Änderung der letzten 7 Tage
  • X-AnyLabeling@CVHub520

    X-AnyLabeling: Eine leichte, effiziente und einheitliche plattformübergreifende Desktop-Anwendung zur Annotation von Text-, Bild-, Video- und multimodalen Daten, die vielseitige integrierte Tools mit modernen KI-Modellen und flexiblem Multi-Format-Export kombiniert.

    10.313+59Sterne-Änderung der letzten 7 Tage
  • InternVL@OpenGVLab

    [CVPR 2024 Oral] InternVL Family: Eine bahnbrechende Open-Source-Alternative zu GPT-4o. Ein Open-Source-Multimodal-Dialogmodell, das der Leistung von GPT-4o nahekommt.

    10.150+3Sterne-Änderung der letzten 7 Tage
  • minimind-v@jingyaogong

    👀 Trainieren Sie ein VLM mit 65 Millionen Parametern von Grund auf in nur 2 Stunden!

    8.535+40Sterne-Änderung der letzten 7 Tage
  • Qwen-VL@QwenLM

    Das offizielle Repository von Qwen-VL (通义千问-VL), einem von Alibaba Cloud vorgeschlagenen Chat- und vortrainierten Large Vision Language Model.

    6.727+1Sterne-Änderung der letzten 7 Tage
  • MineContext@volcengine

    MineContext ist Ihr proaktiver, kontextbewusster KI-Partner (Context-Engineering + ChatGPT Pulse)

    5.497+1Sterne-Änderung der letzten 7 Tage
  • mlx-vlm@Blaizzy

    MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.

    5.462+25Sterne-Änderung der letzten 7 Tage
  • align-anything@PKU-Alignment

    Align Anything: Training von Multimodus-Modellen mit Feedback

    4.671+3Sterne-Änderung der letzten 7 Tage
  • lmms-eval@EvolvingLMMs-Lab

    All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben

    4.390+7Sterne-Änderung der letzten 7 Tage
  • DeepSeek-VL@deepseek-ai

    DeepSeek-VL: Auf dem Weg zum realen Vision-Language-Verständnis

    4.177+2Sterne-Änderung der letzten 7 Tage
  • MiniMax-01@MiniMax-AI

    Das offizielle Repository von MiniMax-Text-01 und MiniMax-VL-01, Large Language Model & Vision Language Model basierend auf Linear Attention

    3.467+0Sterne-Änderung der letzten 7 Tage
  • MGM@JIA-Lab-research

    Offizielles Repo für „Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models“

    3.327+0Sterne-Änderung der letzten 7 Tage
  • VLM_survey@jingyi0000

    Sammlung von fantastischen Vision-Language-Modellen für visuelle Aufgaben.

    3.126+0Sterne-Änderung der letzten 7 Tage
  • OGAM@off-grid-ai

    Das Schweizer Taschenmesser für Offline-KI. Chatten, sehen, sprechen und Bilder generieren auf deinem Smartphone oder Mac – GGUF-LLMs, Vision, Whisper-Sprache-zu-Text, Stable Diffusion, Tool-Aufrufe und lokale Netzwerkserver. Läuft auf CPU, GPU oder NPU. Kein Konto, kein API-Key, null Daten verlassen dein Gerät.

    3.038+17Sterne-Änderung der letzten 7 Tage
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen

    2.925-1Sterne-Änderung der letzten 7 Tage
  • colpali@illuin-tech

    Der Code, der zum Trainieren und Ausführen von Inferenz mit den ColVision-Modellen (z. B. ColPali, ColQwen2 und ColSmol) verwendet wird.

    2.809+7Sterne-Änderung der letzten 7 Tage
  • Cradle@BAAI-Agents

    Das Cradle-Framework ist ein erster Versuch einer allgemeinen Computersteuerung (GCC). Cradle unterstützt Agents dabei, jede Computeraufgabe durch starke Argumentationsfähigkeiten, Selbstverbesserung und Skill-Kuratierung in einer standardisierten allgemeinen Umgebung mit minimalen Anforderungen zu meistern.

    2.578+2Sterne-Änderung der letzten 7 Tage
  • Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.

    1.961+1Sterne-Änderung der letzten 7 Tage
  • ShowUI@showlab

    [CVPR 2025] Open-Source, End-to-End, Vision-Language-Action-Modell für GUI-Agenten und Computer-Nutzung.

    1.896+2Sterne-Änderung der letzten 7 Tage
  • Awesome-LLM4AD@Thinklab-SJTU

    Eine kuratierte Liste großartiger Ressourcen zu LLM/VLM/VLA/Modellen für das autonome Fahren (LLM4AD) (kontinuierlich aktualisiert)

    1.890-2Sterne-Änderung der letzten 7 Tage
  • video-search-and-summarization@NVIDIA-AI-Blueprints

    NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.

    1.840+10Sterne-Änderung der letzten 7 Tage
  • AdvancedLiterateMachinery@AlibabaResearch

    Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.

    1.835+1Sterne-Änderung der letzten 7 Tage
  • Seed1.5-VL@ByteDance-Seed

    Seed1.5-VL, ein Vision-Language-Grundlagenmodell für allgemeines multimodales Verständnis und Schließen, das bei 38 von 60 öffentlichen Benchmarks branchenführende Ergebnisse erzielt.

    1.586+0Sterne-Änderung der letzten 7 Tage
  • vllm-mlx@waybarrios

    Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.

    1.557+6Sterne-Änderung der letzten 7 Tage
  • thepipe@emcf

    Erhalte saubere Daten aus schwierigen Dokumenten, unterstützt durch Vision-Language-Modelle ⚡

    1.524+0Sterne-Änderung der letzten 7 Tage
  • [ICCV 2025] Implementierung für Describe Anything: Detaillierte lokalisierte Bild- und Video-Beschriftung

    1.517+3Sterne-Änderung der letzten 7 Tage
  • Ovis@ATH-MaaS

    Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.

    1.514+2Sterne-Änderung der letzten 7 Tage
  • awesome-japanese-llm@llm-jp

    Übersicht japanischer LLMs

    1.428+1Sterne-Änderung der letzten 7 Tage
  • mlx-tune@ARahim3

    Fine-Tuning von LLMs auf Ihrem Mac mit Apple Silicon. SFT-, DPO-, GRPO-, Vision-, TTS-, STT-, Embedding- und OCR-Fine-Tuning – nativ auf MLX. Unsloth-kompatible API.

    1.398+8Sterne-Änderung der letzten 7 Tage
  • Awesome Unified Multimodal Models

    1.314+1Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen