multimodal
Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit multimodal am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit multimodal getaggt wurden.
- #1
Lassen Sie Claude (oder ein beliebiges LLM) ein Video tatsächlich ansehen – szenenbewusste, deduplizierte Frames + Transkript, von einer URL oder einer lokalen Datei. Läuft lokal, MIT-lizenziert.
★ 2.109 - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1.420 - #3★ 1.153
- #4
Ein Vision-Toolkit und Skill für rein textbasierte LLMs – Bild-Frage-Antwort, OCR bei langen Screenshots, Frontend-UI-Wiederherstellung und GUI-Automatisierung mit optionaler nahtloser Integration für Codex, Claude Code, Pi, Oh My Pi und OpenCode
★ 1.136 - #5
Augen für rein textbasierte DeepSeek Harness Agents: integrierte kostenlose Vision-Chain (kein Schlüssel) + pixelgenaue Vision-Tools (Fragen & Antworten, Grounding, Zuschneiden, Pixel-Diff, Farben, OCR, SVG-Trace, Freistellen, Screenshots). Ein-Befehl-Installation, kein Python, Bildverarbeitung funktioniert wie normale Tool-Aufrufe.
★ 1.089
- #1
Hören Sie auf, Ihre Intelligenz zu mieten. Eigen Sie sie mit AnythingLLM. Alles, was Sie für ein leistungsstarkes, lokal-first-Agentenerlebnis benötigen.
★ 65.534+163Sterne-Änderung der letzten 7 Tage - #2
《Vertiefung des AI Agent: Designprinzipien und ingenieurtechnische Praxis》(Li Bo Jie)Open-Source-Hauptrepo: Vollständiger Text des Buches, kompilierte PDF-Version und zu den Kapiteln passender Code
★ 44.381+1.022Sterne-Änderung der letzten 7 Tage - #3
Der Open-Source Multimodal AI Agent Stack: Verbindet modernste KI-Modelle und Agenten-Infrastruktur
★ 38.817+75Sterne-Änderung der letzten 7 Tage - #4
[NeurIPS'23 Oral] Visual Instruction Tuning (LLaVA) in Richtung GPT-4V-Niveaufähigkeiten und darüber hinaus gebaut.
★ 25.014+9Sterne-Änderung der letzten 7 Tage - #5
Groß angelegtes selbstüberwachtes Vortraining über Aufgaben, Sprachen und Modalitäten hinweg
★ 22.203+7Sterne-Änderung der letzten 7 Tage - #6★ 21.859-2Sterne-Änderung der letzten 7 Tage
- #7
YC (S26) | Open Computer History | Aufzeichnung des Bildschirms kontinuierlich lokal und Bereitstellung von Kontext an deine Agenten (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.376+80Sterne-Änderung der letzten 7 Tage - #8★ 17.763+1Sterne-Änderung der letzten 7 Tage
- #9
Verwenden Sie PEFT oder Vollparameter für CPT/SFT/DPO/GRPO von über 600 LLMs und über 300 MLLMs (AAAI 2025).
★ 15.488+88Sterne-Änderung der letzten 7 Tage - #10
Visualisieren, abfragen und streamen Sie, um mit multimodalen Robotikdaten zu trainieren.
★ 11.387+15Sterne-Änderung der letzten 7 Tage - #11
🔍 Praxisleitfaden zur Entwicklung von LLM-Anwendungen Teil 1: RAG-Technologie-Full-Stack-Leitfaden, Online-Leseadresse: https://datawhalechina.github.io/all-in-rag/
★ 10.770+94Sterne-Änderung der letzten 7 Tage - #12
Produktionsbereites Toolkit zum lokalen Ausführen von KI
★ 10.281+1Sterne-Änderung der letzten 7 Tage - #13
Eine Python-Bibliothek zur Anomalieerkennung in tabellarischen, Zeitreihen-, Graph-, Text-, Bild- und Audiodaten. Über 60 Detektoren, Benchmark-gestützte ADEngine-Orchestrierung und ein agentischer Workflow für KI-Agenten.
★ 9.978+1Sterne-Änderung der letzten 7 Tage - #14
Das Ende des Web-Parsings. Der Beginn der skalierbaren, pixel-nativen Suche. Link: https://pixelrag.ai/
★ 9.848+60Sterne-Änderung der letzten 7 Tage - #15
SeaTunnel ist ein multimodales, leistungsstarkes, verteiltes Tool zur Integration großer Datenmengen.
★ 9.612+12Sterne-Änderung der letzten 7 Tage - #16
Deeplake ist eine KI-Daten-Runtime für Agenten. Es bietet serverloses Postgres mit einem multimodalen Data Lake, was eine skalierbare Abfrage und Training ermöglicht.
★ 9.229-1Sterne-Änderung der letzten 7 Tage - #17
Mobile-Agent: Die leistungsstarke GUI-Agenten-Familie
★ 9.157+9Sterne-Änderung der letzten 7 Tage - #18
Der einfachste Weg, KI-Apps und -Modelle bereitzustellen – Erstellen Sie Modell-Inferenz-APIs, Job-artige Warteschlangen, LLM-Apps, Multi-Modell-Pipelines und mehr!
★ 8.817+4Sterne-Änderung der letzten 7 Tage - #19
Eine auf Apples MLX-Framework basierende Text-to-Speech (TTS)-, Speech-to-Text (STT)- und Speech-to-Speech (STS)-Bibliothek für effiziente Sprachanalyse auf Apple Silicon.
★ 7.826+23Sterne-Änderung der letzten 7 Tage - #20★ 6.593+136Sterne-Änderung der letzten 7 Tage
- #21
Dieses Repository ist eine kuratierte Sammlung von Links zu verschiedenen Kursen und Ressourcen über Künstliche Intelligenz (KI)
★ 6.482+3Sterne-Änderung der letzten 7 Tage - #22
Open-Source-Framework zum Erstellen agentenbasierter Apps in JavaScript, Go, Dart und Python, entwickelt und produktiv genutzt von Google.
★ 6.394+10Sterne-Änderung der letzten 7 Tage - #23
Notizen für Softwareingenieure, die sich in neue KI-Entwicklungen einarbeiten. Dient als Datenspeicher für Artikel auf https://latent.space und Produkt-Brainstorming, enthält jedoch bereinigte kanonische Referenzen im Ordner /Resources.
★ 6.247+0Sterne-Änderung der letzten 7 Tage - #24★ 6.018+4Sterne-Änderung der letzten 7 Tage
- #25
Eine visuelle Spielwiese für agentenbasierte Workflows: Iterieren Sie 10x schneller über Ihre Agenten
★ 5.779-1Sterne-Änderung der letzten 7 Tage - #26
Hochleistungs-Daten-Engine für KI- und multimodale Workloads. Verarbeitet Bilder, Audio, Video und strukturierte Daten in beliebigem Maßstab.
★ 5.736+4Sterne-Änderung der letzten 7 Tage - #27★ 5.678+4Sterne-Änderung der letzten 7 Tage
- #28
Ein modulares Framework für multimodale Vision- & Language-Forschung von Facebook AI Research (FAIR)
★ 5.633-1Sterne-Änderung der letzten 7 Tage - #29★ 5.188+3Sterne-Änderung der letzten 7 Tage
- #30
Align Anything: Training von Multimodus-Modellen mit Feedback
★ 4.671+3Sterne-Änderung der letzten 7 Tage