Zum Hauptinhalt springen
buildradar
Sign in
Thema · clip

clip

Erfasste Open-Source-Repos mit dem Tag clip, sortiert nach Sternen.

Repos
36
Sterne gesamt
68.961
Sterne im Schnitt
1.916
Anteil
0,00%

Themen, die häufig gemeinsam mit clip am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit clip getaggt wurden.

In den letzten 90 Tagen kam kein neues Repo mit diesem Thema dazu.

  • X-AnyLabeling@CVHub520

    X-AnyLabeling: Eine leichte, effiziente und einheitliche plattformübergreifende Desktop-Anwendung zur Annotation von Text-, Bild-, Video- und multimodalen Daten, die vielseitige integrierte Tools mit modernen KI-Modellen und flexiblem Multi-Format-Export kombiniert.

    10.254+107Sterne-Änderung der letzten 7 Tage
  • Chinese-CLIP@OFA-Sys

    Chinesische Version von CLIP für chinesische cross-modale Suche und Repräsentationsgenerierung.

    6.001+7Sterne-Änderung der letzten 7 Tage
  • pushdeer@easychen

    Open-Source-Push-Dienst ohne App, sofort einsatzbereit unter iOS 14+ via QR-Code. Unterstützt auch Quick Apps, iOS- und Mac-Clients, Android-Clients sowie eigene Geräte

    5.022+2Sterne-Änderung der letzten 7 Tage
  • VLMEvalKit@open-compass

    Open-Source-Evaluierungs-Toolkit für Large Multi-Modality Models (LMMs), unterstützt über 220 LMMs und 80+ Benchmarks

    4.371+10Sterne-Änderung der letzten 7 Tage
  • mmpretrain@open-mmlab

    OpenMMLab Pre-training Toolbox und Benchmark

    3.850+3Sterne-Änderung der letzten 7 Tage
  • zero_nlp@yuanzhoulvpi2017

    Chinesische NLP-Lösungen (große Sprachmodelle, Daten, Modelle, Training, Inferenz)

    3.836+0Sterne-Änderung der letzten 7 Tage
  • VLM_survey@jingyi0000

    Sammlung von fantastischen Vision-Language-Modellen für visuelle Aufgaben.

    3.126-1Sterne-Änderung der letzten 7 Tage
  • clip-interrogator@pharmapsychotic

    Bild-zu-Prompt mit BLIP und CLIP

    2.984+1Sterne-Änderung der letzten 7 Tage
  • clip-retrieval@rom1504

    Einfaches Berechnen von Clip-Einbettungen und Erstellen eines Clip-Abrufsystems damit.

    2.796+2Sterne-Änderung der letzten 7 Tage
  • 🥂 Meistere hCaptcha-Herausforderungen elegant mit multimodalen großen Sprachmodellen.

    2.483+8Sterne-Änderung der letzten 7 Tage
  • cambrian@cambrian-mllm

    Cambrian-1 ist eine Familie multimodaler LLMs mit einem visionszentrierten Design.

    2.014+0Sterne-Änderung der letzten 7 Tage
  • RWidgetHelper@RuffianZhong

    Schnelle Android-UI-Entwicklung, die plagt, was native Steuerelemente nicht tun

    1.958-1Sterne-Änderung der letzten 7 Tage
  • Unverzichtbare Ressource für alle, die mit der OpenAI Vision API experimentieren und darauf aufbauen möchten 🔥

    1.690+0Sterne-Änderung der letzten 7 Tage
  • clearcam@roryclear

    Fügen Sie jeder Sicherheitskamera Objekterkennung, Tracking, mobile Benachrichtigungen und Suche hinzu.

    1.557+323Sterne-Änderung der letzten 7 Tage
  • Video-ChatGPT@mbzuai-oryx

    [ACL 2024 🔥] Video-ChatGPT ist ein Video-Konversationsmodell, das sinnvolle Gespräche über Videos generieren kann. Es kombiniert die Fähigkeiten von LLMs mit einem vortrainierten visuellen Encoder, der für die spatiotemporale Videorepräsentation angepasst ist. Wir stellen außerdem ein rigoroses 'Quantitative Evaluation Benchmarking' für videobasierte Konversationsmodelle vor.

    1.507+0Sterne-Änderung der letzten 7 Tage
  • UForm@unum-cloud

    Taschengroße multimodale KI für Inhaltsverständnis und -generierung über mehrsprachige Texte, Bilder und 🔜 Videos, bis zu 5x schneller als OpenAI CLIP und LLaVA 🖼️ & 🖋️

    1.247+3Sterne-Änderung der letzten 7 Tage
  • Awesome-CLIP@yzhuoning

    Awesome-Liste für die Forschung zu CLIP (Contrastive Language-Image Pre-Training).

    1.227+0Sterne-Änderung der letzten 7 Tage
  • vlms-zero-to-hero@SkalskiP

    Diese Reihe nimmt Sie mit auf eine Reise von den Grundlagen der NLP und Computer Vision bis hin zu den neuesten Vision-Language-Modellen.

    1.179+1Sterne-Änderung der letzten 7 Tage
  • CLIP4Clip@ArrowLuo

    Eine offizielle Implementierung für „CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval“

    1.031+0Sterne-Änderung der letzten 7 Tage
  • SmartJavaAI@geekwenjie

    🔥🔥🔥 Kostenlose Offline-KI-Algorithmen-Toolbox für Java mit Unterstützung für Gesichtserkennung, Liveness-Erkennung, Gesichtsausdruckserkennung, Objekterkennung, Instanzsegmentierung, Fußgängererkennung, OCR-Texterkennung, Nummernschilderkennung, Tabellenerkennung, ASR+TTS, maschinelle Übersetzung und mehr. Einfach über Maven einbinden. Unterstützt PyTorch, TensorFlow und integriert gängige Modelle wie Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5), Whisper usw.

    906+2Sterne-Änderung der letzten 7 Tage
  • aphantasia@eps696

    CLIP + FFT/DWT/RGB = Text zu Bild/Video

    789-1Sterne-Änderung der letzten 7 Tage
  • FG-CLIP@360CVGroup

    Eine neue Generation von CLIP mit starker feingranularer Diskriminationsfähigkeit (ICML 2026 und ICML 2025)

    731+3Sterne-Änderung der letzten 7 Tage
  • PaddleMIX@PaddlePaddle

    Paddle Multimodal Integration and eXploration, unterstützt gängige multimodale Aufgaben, einschließlich End-to-End-Trainingsmodellen für große multimodale Daten und einer Diffusion-Model-Toolbox. Ausgezeichnet durch hohe Leistung und Flexibilität.

    724+0Sterne-Änderung der letzten 7 Tage
  • Eine umfassende Frontend-Sammlung und Übersicht von Vision-Language-Model-Papern und -Modellen auf GitHub. Kontinuierliche Updates.

    705+5Sterne-Änderung der letzten 7 Tage
  • TrailSnap@LC044

    TrailSnap | KI-gestütztes Open-Source-Fotoalbum für Reise- und Lebenserinnerungen.

    704+18Sterne-Änderung der letzten 7 Tage
  • LLM2CLIP@microsoft

    LLM2CLIP verbessert bestehende State-of-the-Art CLIP-Modelle signifikant.

    687+0Sterne-Änderung der letzten 7 Tage
  • TwitchLink@devhotteok

    Twitch-Stream-, Video- und Clip-Downloader/Recorder. Diese GUI-Anwendung hilft Ihnen beim Herunterladen und Aufnehmen von Twitch-Videos, einschließlich Streams und VODs.

    676+1Sterne-Änderung der letzten 7 Tage
  • video_features@v-iashin

    Extrahieren von Videofunktionen aus Rohvideos unter Verwendung mehrerer GPUs. Wir unterstützen RAFT-Flow-Frames sowie S3D-, I3D-, R(2+1)D-, VGGish-, CLIP- und TIMM-Modelle.

    655+0Sterne-Änderung der letzten 7 Tage
  • 👁️ + 💬 + 🎧 = 🤖 Kuratierte Liste der besten Foundation- und multimodalen Modelle! [Paper + Code + Beispiele + Tutorials]

    637+0Sterne-Änderung der letzten 7 Tage
  • Keras beit, caformer, CMT, CoAtNet, convnext, davit, dino, efficientdet, edgenext, efficientformer, efficientnet, eva, fasternet, fastervit, fastvit, flexivit, gcvit, ghostnet, gpvit, hornet, hiera, iformer, inceptionnext, lcnet, levit, maxvit, mobilevit, moganet, nat, nfnets, pvt, swin, tinynet, tinyvit, uniformer, volo, vanillanet, yolor, yolov7, yolov8, yolox, gpt2, llama2, alias kecam

    626+0Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen