vision-language-model
Erfasste Open-Source-Repos mit dem Tag vision-language-model, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit vision-language-model am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit vision-language-model getaggt wurden.
- #1★ 1.153
- #2
Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode
★ 1.136 - #3
DeepSeek-Harness-native Integration für agent-vision-toolkit: Bild-Q&A, Long-Screenshot-OCR, UI-Wiederherstellung, Grounding, Pixel-Diff, Artifacts und Web-UI.
★ 854 - #4
🎬 OraRL — Annotations as Rollouts for efficient, scalable reinforcement learning of unified video MLLMs.
★ 152
- #1
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.
★ 25.014+9Sterne-Änderung der letzten 7 Tage - #2
X-AnyLabeling: Eine leichte, effiziente und einheitliche plattformübergreifende Desktop-Anwendung zur Annotation von Text-, Bild-, Video- und multimodalen Daten, die vielseitige integrierte Tools mit modernen KI-Modellen und flexiblem Multi-Format-Export kombiniert.
★ 10.313+59Sterne-Änderung der letzten 7 Tage - #3
[CVPR 2024 Oral] InternVL Family: Eine bahnbrechende Open-Source-Alternative zu GPT-4o. Ein Open-Source-Multimodal-Dialogmodell, das der Leistung von GPT-4o nahekommt.
★ 10.150+3Sterne-Änderung der letzten 7 Tage - #4
👀 Trainieren Sie ein VLM mit 65 Millionen Parametern von Grund auf in nur 2 Stunden!
★ 8.535+40Sterne-Änderung der letzten 7 Tage - #5
Das offizielle Repository von Qwen-VL (通义千问-VL), einem von Alibaba Cloud vorgeschlagenen Chat- und vortrainierten Large Vision Language Model.
★ 6.727+1Sterne-Änderung der letzten 7 Tage - #6
MineContext ist Ihr proaktiver, kontextbewusster KI-Partner (Context-Engineering + ChatGPT Pulse)
★ 5.497+1Sterne-Änderung der letzten 7 Tage - #7
MLX-VLM ist ein Paket für Inferenz und Fine-Tuning von Vision Language Models (VLMs) auf dem Mac mit MLX.
★ 5.462+25Sterne-Änderung der letzten 7 Tage - #8
Align Anything: Training von Multimodus-Modellen mit Feedback
★ 4.671+3Sterne-Änderung der letzten 7 Tage - #9
All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben
★ 4.390+7Sterne-Änderung der letzten 7 Tage - #10
DeepSeek-VL: Auf dem Weg zum realen Vision-Language-Verständnis
★ 4.177+2Sterne-Änderung der letzten 7 Tage - #11
Das offizielle Repository von MiniMax-Text-01 und MiniMax-VL-01, Large Language Model & Vision Language Model basierend auf Linear Attention
★ 3.467+0Sterne-Änderung der letzten 7 Tage - #12
Offizielles Repo für „Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models“
★ 3.327+0Sterne-Änderung der letzten 7 Tage - #13
Sammlung von fantastischen Vision-Language-Modellen für visuelle Aufgaben.
★ 3.126+0Sterne-Änderung der letzten 7 Tage - #14
Das Schweizer Taschenmesser für Offline-KI. Chatten, sehen, sprechen und Bilder generieren auf deinem Smartphone oder Mac – GGUF-LLMs, Vision, Whisper-Sprache-zu-Text, Stable Diffusion, Tool-Aufrufe und lokale Netzwerkserver. Läuft auf CPU, GPU oder NPU. Kein Konto, kein API-Key, null Daten verlassen dein Gerät.
★ 3.038+17Sterne-Änderung der letzten 7 Tage - #15
InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen
★ 2.925-1Sterne-Änderung der letzten 7 Tage - #16
Der Code, der zum Trainieren und Ausführen von Inferenz mit den ColVision-Modellen (z. B. ColPali, ColQwen2 und ColSmol) verwendet wird.
★ 2.809+7Sterne-Änderung der letzten 7 Tage - #17
Das Cradle-Framework ist ein erster Versuch einer allgemeinen Computersteuerung (GCC). Cradle unterstützt Agents dabei, jede Computeraufgabe durch starke Argumentationsfähigkeiten, Selbstverbesserung und Skill-Kuratierung in einer standardisierten allgemeinen Umgebung mit minimalen Anforderungen zu meistern.
★ 2.578+2Sterne-Änderung der letzten 7 Tage - #18
Eine Open-Source-Implementierung zum Fine-Tuning der Qwen-VL-Serie von Alibaba Cloud.
★ 1.961+1Sterne-Änderung der letzten 7 Tage - #19
[CVPR 2025] Open-Source, End-to-End, Vision-Language-Action-Modell für GUI-Agenten und Computer-Nutzung.
★ 1.896+2Sterne-Änderung der letzten 7 Tage - #20
Eine kuratierte Liste großartiger Ressourcen zu LLM/VLM/VLA/Modellen für das autonome Fahren (LLM4AD) (kontinuierlich aktualisiert)
★ 1.890-2Sterne-Änderung der letzten 7 Tage - #21
NVIDIA AI Blueprint für Video-Suche und -Zusammenfassung (VSS) ist eine GPU-beschleunigte Referenzarchitektur zum Erstellen von Video-Analytik-Agenten mit verifizierten Echtzeit-Benachrichtigungen, visueller Q&A und automatisierter Berichterstellung. Der VSS Blueprint verwendet Vision Language Models (VLMs) wie NVIDIA Cosmos, LLMs wie NVIDIA Nemotron, RAG und NVIDIA NIMs.
★ 1.840+10Sterne-Änderung der letzten 7 Tage - #22
Eine Sammlung originaler, innovativer Ideen und Algorithmen für Advanced Literate Machinery. Dieses Projekt wird vom OCR-Team im Language Technology Lab, Tongyi Lab der Alibaba Group gepflegt.
★ 1.835+1Sterne-Änderung der letzten 7 Tage - #23
Seed1.5-VL, ein Vision-Language-Grundlagenmodell für allgemeines multimodales Verständnis und Schließen, das bei 38 von 60 öffentlichen Benchmarks branchenführende Ergebnisse erzielt.
★ 1.586+0Sterne-Änderung der letzten 7 Tage - #24
Leistungsstarker, mit OpenAI und Anthropic kompatibler LLM-Inferenzserver für Apple Silicon. Nativer MLX, Continuous Batching, multimodale Modelle, MCP-Tool-Aufrufe und Claude-Code-Unterstützung.
★ 1.557+6Sterne-Änderung der letzten 7 Tage - #25
Erhalte saubere Daten aus schwierigen Dokumenten, unterstützt durch Vision-Language-Modelle ⚡
★ 1.524+0Sterne-Änderung der letzten 7 Tage - #26
[ICCV 2025] Implementierung für Describe Anything: Detaillierte lokalisierte Bild- und Video-Beschriftung
★ 1.517+3Sterne-Änderung der letzten 7 Tage - #27
Eine neuartige Architektur für multimodale große Sprachmodelle (MLLM), die darauf ausgelegt ist, visuelle und textuelle Einbettungen strukturell auszurichten.
★ 1.514+2Sterne-Änderung der letzten 7 Tage - #28
Übersicht japanischer LLMs
★ 1.428+1Sterne-Änderung der letzten 7 Tage - #29
Fine-Tuning von LLMs auf Ihrem Mac mit Apple Silicon. SFT-, DPO-, GRPO-, Vision-, TTS-, STT-, Embedding- und OCR-Fine-Tuning – nativ auf MLX. Unsloth-kompatible API.
★ 1.398+8Sterne-Änderung der letzten 7 Tage - #30
Awesome Unified Multimodal Models
★ 1.314+1Sterne-Änderung der letzten 7 Tage