multimodal
Erfasste Open-Source-Repos mit dem Tag multimodal, sortiert nach Sternen.
- #31
Plug-and-Play-Implementierung von Tree of Thoughts: Gezielte Problemlösung mit Large Language Models, die das logische Denken des Modells um mindestens 70 % steigert
★ 4.592+0Sterne-Änderung der letzten 7 Tage - #32
Kuratierte Tutorials und Ressourcen für Large Language Models, AI Painting und mehr.
★ 4.537+2Sterne-Änderung der letzten 7 Tage - #33
Große Mengen von Bild-URLs einfach in einen Bilddatensatz umwandeln. Kann 100 Millionen URLs auf einer Maschine in 20 Stunden herunterladen, skalieren und verpacken.
★ 4.445+2Sterne-Änderung der letzten 7 Tage - #34
All-in-One Multimodales Evaluierungs-Toolkit für Text-, Bild-, Video- und Audio-Aufgaben
★ 4.390+7Sterne-Änderung der letzten 7 Tage - #35
Fengshenbang-LM ist ein Open-Source-Großmodell-Ökosystem unter Leitung des Zentrums für kognitive Berechnung und natürliche Sprache des IDEA Research Institute und dient als Infrastruktur für chinesisches AIGC und kognitive Intelligenz.
★ 4.122-1Sterne-Änderung der letzten 7 Tage - #36
Die MOSS‑TTS-Familie ist eine Open-Source-Modellfamilie zur Sprach- und Klangerzeugung von MOSI.AI und dem OpenMOSS-Team. Sie wurde für Szenarien in der realen Welt mit hoher Wiedergabetreue, starkem Ausdruck und hoher Komplexität entwickelt und deckt stabile Langform-Sprache, Dialoge mit mehreren Sprechern, Sprach-/Charakterdesign, Umgebungs-Soundeffekte und Echtzeit-Streaming-TTS ab.
★ 4.058+18Sterne-Änderung der letzten 7 Tage - #37
OpenMMLab Pre-training Toolbox und Benchmark
★ 3.850-1Sterne-Änderung der letzten 7 Tage - #38
Das erste Vision-Plugin für DeepSeek Harness und die Vision-Brücke für jeden reinen Text-Coding-Agenten. Bild einfügen, strukturierte JSON-Beweise erhalten (OCR, Layout, Semantik).
★ 3.839+83Sterne-Änderung der letzten 7 Tage - #39
SimpleMem: Effizientes, lebenslanges Gedächtnis für LLM-Agenten – Text & Multimodal
★ 3.735+9Sterne-Änderung der letzten 7 Tage - #40
Open-Source-Multimodal-Retrieval-Engine (Morphik Core). Von Morphik – KI-Back-Office für Pflegeheime und Seniorenresidenzen (morphik.ai).
★ 3.710-1Sterne-Änderung der letzten 7 Tage - #41
Von Chain-of-Thought-Prompting bis zu OpenAI o1 und DeepSeek-R1 🍓
★ 3.681+3Sterne-Änderung der letzten 7 Tage - #42
Code und Modelle für das ICML 2024-Paper, NExT-GPT: Any-to-Any Multimodal Large Language Model
★ 3.634-2Sterne-Änderung der letzten 7 Tage - #43
MTEB: State-of-the-Art-Evaluierung von Embeddings über Sprachen und Modalitäten hinweg
★ 3.414+5Sterne-Änderung der letzten 7 Tage - #44
InternGPT (iGPT) ist eine Open-Source-Demoplattform zur einfachen Präsentation von KI-Modellen. Unterstützt nun DragGAN, ChatGPT, ImageBind, multimodalen Chat wie GPT-4, SAM, interaktive Bildbearbeitung und mehr. Testen Sie es unter igpt.opengvlab.com
★ 3.205+0Sterne-Änderung der letzten 7 Tage - #45
Ein erweiterbares, hochmodernes Framework für spaltenbasierte Komprimierung und das schnellste FOSS-Spaltendateiformat. Ehemals bei @spiraldb, jetzt ein Inkubationsprojekt bei LFAI&Data, einem Teil der Linux Foundation.
★ 3.171+8Sterne-Änderung der letzten 7 Tage - #46
Grundlagen-Architektur für (M)LLMs
★ 3.139+1Sterne-Änderung der letzten 7 Tage - #47★ 3.123-1Sterne-Änderung der letzten 7 Tage
- #48
[NeurIPS 2024] OSWorld: Benchmarking multimodaler Agents für offene Aufgaben in echten Computerumgebungen
★ 3.118+6Sterne-Änderung der letzten 7 Tage - #49
🤖 Typsicheres, providerunabhängiges TypeScript AI SDK für Streaming-Chat, Tool-Aufrufe, Agenten und multimodale Apps über OpenAI, Anthropic, Gemini, React, Vue, Svelte und Solid.
★ 3.057+15Sterne-Änderung der letzten 7 Tage - #50
InternLM-XComposer2.5-OmniLive: Ein umfassendes multimodales System für langfristige Streaming-Video- und Audio-Interaktionen
★ 2.925-1Sterne-Änderung der letzten 7 Tage - #51
Die Kontextschicht für unstrukturierte Daten: typisierte, versionierte Datensätze über S3, GCS, Azure
★ 2.816+5Sterne-Änderung der letzten 7 Tage - #52
Einfaches Berechnen von Clip-Einbettungen und Erstellen eines Clip-Abrufsystems damit.
★ 2.796+1Sterne-Änderung der letzten 7 Tage - #53
Bilder für die Inferenz ohne Kennzeichnung (Nutzung von Foundation Models zum Trainieren überwachter Modelle).
★ 2.770+3Sterne-Änderung der letzten 7 Tage - #54
Optimierung des Fine-Tuning-Prozesses für multimodale Modelle: PaliGemma 2, Florence-2 und Qwen2.5-VL
★ 2.695+1Sterne-Änderung der letzten 7 Tage - #55
[EMNLP-2024] Erstellen Sie multimodale Sprachagenten für schnelles Prototyping und Produktion
★ 2.666+1Sterne-Änderung der letzten 7 Tage - #56
Umfassende Ressourcen zu Generative AI, einschließlich einer detaillierten Roadmap, Projekten, Anwendungsfällen, Interviewvorbereitung und Programmiervorbereitung.
★ 2.610+1Sterne-Änderung der letzten 7 Tage - #57
Offizielles Repository von OFA (ICML 2022). Paper: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2.557+0Sterne-Änderung der letzten 7 Tage - #58★ 2.539+0Sterne-Änderung der letzten 7 Tage
- #59
HuixiangDou: Bewältigung von Gruppenchatszenarien mit LLM-basierter technischer Unterstützung.
★ 2.502+2Sterne-Änderung der letzten 7 Tage - #60
(ෆ`꒳´ෆ) Eine Übersicht über Text-zu-Bild-Generierung und -Synthese.
★ 2.444+0Sterne-Änderung der letzten 7 Tage