clip
Erfasste Open-Source-Repos mit dem Tag clip, sortiert nach Sternen.
Verwandte Themen
Themen, die häufig gemeinsam mit clip am selben Repo auftauchen.
Neue Aufsteiger
Repos, die in den letzten 90 Tagen erstellt und mit clip getaggt wurden.
In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.
- #1
X-AnyLabeling: Eine leichte, effiziente und einheitliche plattformübergreifende Desktop-Anwendung zur Annotation von Text-, Bild-, Video- und multimodalen Daten, die vielseitige integrierte Tools mit modernen KI-Modellen und flexiblem Multi-Format-Export kombiniert.
★ 10.254+107Sterne-Änderung der letzten 7 Tage - #2
Chinesische Version von CLIP für chinesische cross-modale Suche und Repräsentationsgenerierung.
★ 6.001+7Sterne-Änderung der letzten 7 Tage - #3
Open-Source-Push-Dienst ohne App, sofort einsatzbereit unter iOS 14+ via QR-Code. Unterstützt auch Quick Apps, iOS- und Mac-Clients, Android-Clients sowie eigene Geräte
★ 5.022+2Sterne-Änderung der letzten 7 Tage - #4
Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks
★ 4.371+10Sterne-Änderung der letzten 7 Tage - #5
OpenMMLab Pre-training Toolbox und Benchmark
★ 3.850+3Sterne-Änderung der letzten 7 Tage - #6
Chinesische NLP-Lösungen (große Sprachmodelle, Daten, Modelle, Training, Inferenz)
★ 3.836+0Sterne-Änderung der letzten 7 Tage - #7
Sammlung von fantastischen Vision-Language-Modellen für visuelle Aufgaben.
★ 3.126-1Sterne-Änderung der letzten 7 Tage - #8
Bild-zu-Prompt mit BLIP und CLIP
★ 2.984+1Sterne-Änderung der letzten 7 Tage - #9
Einfaches Berechnen von Clip-Einbettungen und Erstellen eines Clip-Abrufsystems damit.
★ 2.796+2Sterne-Änderung der letzten 7 Tage - #10
🥂 Meistere hCaptcha-Herausforderungen elegant mit multimodalen großen Sprachmodellen.
★ 2.483+8Sterne-Änderung der letzten 7 Tage - #11
Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.
★ 2.014+0Sterne-Änderung der letzten 7 Tage - #12
Schnelle Android-UI-Entwicklung, die plagt, was native Steuerelemente nicht tun
★ 1.958-1Sterne-Änderung der letzten 7 Tage - #13
Unverzichtbare Ressource für alle, die mit der OpenAI Vision API experimentieren und darauf aufbauen möchten 🔥
★ 1.690+0Sterne-Änderung der letzten 7 Tage - #14
Fügen Sie jeder Sicherheitskamera Objekterkennung, Tracking, mobile Benachrichtigungen und Suche hinzu.
★ 1.557+323Sterne-Änderung der letzten 7 Tage - #15
[ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.
★ 1.507+0Sterne-Änderung der letzten 7 Tage - #16
Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️
★ 1.247+3Sterne-Änderung der letzten 7 Tage - #17
Awesome-Liste für die Forschung zu CLIP (Contrastive Language-Image Pre-Training).
★ 1.227+0Sterne-Änderung der letzten 7 Tage - #18
Diese Reihe nimmt Sie mit auf eine Reise von den Grundlagen der NLP und Computer Vision bis hin zu den neuesten Vision-Language-Modellen.
★ 1.179+1Sterne-Änderung der letzten 7 Tage - #19
Eine offizielle Implementierung für „CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval“
★ 1.031+0Sterne-Änderung der letzten 7 Tage - #20
🔥🔥🔥 Kostenlose Offline-KI-Algorithmen-Toolbox für Java mit Unterstützung für Gesichtserkennung, Liveness-Erkennung, Gesichtsausdruckserkennung, Objekterkennung, Instanzsegmentierung, Fußgängererkennung, OCR-Texterkennung, Nummernschilderkennung, Tabellenerkennung, ASR+TTS, maschinelle Übersetzung und mehr. Einfach über Maven einbinden. Unterstützt PyTorch, TensorFlow und integriert gängige Modelle wie Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5), Whisper usw.
★ 906+2Sterne-Änderung der letzten 7 Tage - #21
CLIP + FFT/DWT/RGB = Text zu Bild/Video
★ 789-1Sterne-Änderung der letzten 7 Tage - #22
Eine neue Generation von CLIP mit starker feingranularer Diskriminationsfähigkeit (ICML 2026 und ICML 2025)
★ 731+3Sterne-Änderung der letzten 7 Tage - #23
Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.
★ 724+0Sterne-Änderung der letzten 7 Tage - #24
Eine umfassende Frontend-Sammlung und Übersicht von Vision-Language-Model-Papern und -Modellen auf GitHub. Kontinuierliche Updates.
★ 705+5Sterne-Änderung der letzten 7 Tage - #25★ 704+18Sterne-Änderung der letzten 7 Tage
- #26★ 687+0Sterne-Änderung der letzten 7 Tage
- #27
Twitch-Stream-, Video- und Clip-Downloader/Recorder. Diese GUI-Anwendung hilft Ihnen beim Herunterladen und Aufnehmen von Twitch-Videos, einschließlich Streams und VODs.
★ 676+1Sterne-Änderung der letzten 7 Tage - #28
Extrahieren von Videofunktionen aus Rohvideos unter Verwendung mehrerer GPUs. Wir unterstützen RAFT-Flow-Frames sowie S3D-, I3D-, R(2+1)D-, VGGish-, CLIP- und TIMM-Modelle.
★ 655+0Sterne-Änderung der letzten 7 Tage - #29
👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]
★ 637+0Sterne-Änderung der letzten 7 Tage - #30
Keras beit, caformer, CMT, CoAtNet, convnext, davit, dino, efficientdet, edgenext, efficientformer, efficientnet, eva, fasternet, fastervit, fastvit, flexivit, gcvit, ghostnet, gpvit, hornet, hiera, iformer, inceptionnext, lcnet, levit, maxvit, mobilevit, moganet, nat, nfnets, pvt, swin, tinynet, tinyvit, uniformer, volo, vanillanet, yolor, yolov7, yolov8, yolox, gpt2, llama2, alias kecam
★ 626+0Sterne-Änderung der letzten 7 Tage