clip
Repositorios de código abierto monitorizados etiquetados con clip, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a clip en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con clip.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
X-AnyLabeling: una aplicación de escritorio multiplataforma ligera, eficiente y unificada para anotar texto, imágenes, video y datos multimodales, que combina herramientas versátiles integradas con modelos de IA de última generación y una exportación flexible en múltiples formatos.
★ 10.313+59Variación de estrellas de los últimos 7 días - #2
Versión en chino de CLIP que logra la recuperación y generación de representaciones multimodales en chino.
★ 6001+1Variación de estrellas de los últimos 7 días - #3
Servicio de notificación de código abierto sin app, listo para usar escaneando el código QR en iOS14+. También es compatible con Quick App, clientes de iOS/Mac, cliente de Android y dispositivos caseros
★ 5022-1Variación de estrellas de los últimos 7 días - #4
Kit de herramientas de evaluación de código abierto para grandes modelos multimodales (LMMs), compatible con más de 220 LMMs y más de 80 benchmarks
★ 4375+13Variación de estrellas de los últimos 7 días - #5
Caja de herramientas de preentrenamiento y Benchmark de OpenMMLab
★ 3850-1Variación de estrellas de los últimos 7 días - #6
Solución NLP en chino (grandes modelos, datos, modelos, entrenamiento, inferencia)
★ 3836+2Variación de estrellas de los últimos 7 días - #7
Colección de increíbles modelos de lenguaje y visión para tareas de visión
★ 3126+0Variación de estrellas de los últimos 7 días - #8
Imagen a prompt con BLIP y CLIP
★ 2984+1Variación de estrellas de los últimos 7 días - #9
Calcula fácilmente incrustaciones de CLIP y construye un sistema de recuperación basado en ellas
★ 2796+1Variación de estrellas de los últimos 7 días - #10
🥂 Enfréntate elegantemente a los desafíos de hCaptcha usando modelos de lenguaje grande multimodales.
★ 2483-1Variación de estrellas de los últimos 7 días - #11
Cambrian-1 es una familia de LLM multimodales con un diseño centrado en la visión.
★ 2014+1Variación de estrellas de los últimos 7 días - #12
Desarrollo rápido de interfaz de usuario para Android, diseñado para resolver las limitaciones de los controles nativos
★ 1958+0Variación de estrellas de los últimos 7 días - #13
Recurso imprescindible para cualquiera que desee experimentar y construir sobre la API de visión de OpenAI 🔥
★ 1690+0Variación de estrellas de los últimos 7 días - #14
Añada detección de objetos, seguimiento, notificaciones móviles y búsqueda a cualquier cámara de seguridad.
★ 1557+255Variación de estrellas de los últimos 7 días - #15
[ACL 2024] Video-ChatGPT es un modelo de conversación de video capaz de generar diálogos significativos sobre videos. Combina las capacidades de los LLMs con un codificador visual preentrenado adaptado para la representación espaciotemporal de video. También introducimos un riguroso 'Quantitative Evaluation Benchmarking' para modelos conversacionales basados en video.
★ 1507+1Variación de estrellas de los últimos 7 días - #16
IA multimodal de bolsillo para la comprensión y generación de contenido en textos multilingües, imágenes y próximamente video, hasta 5 veces más rápida que OpenAI CLIP y LLaVA.
★ 1247+1Variación de estrellas de los últimos 7 días - #17
Lista de recursos seleccionados para la investigación sobre CLIP (Contrastive Language-Image Pre-Training).
★ 1227+0Variación de estrellas de los últimos 7 días - #18
Esta serie te guiará desde los fundamentos de la PNL y la visión por computadora hasta la vanguardia de los modelos de visión y lenguaje.
★ 1179+0Variación de estrellas de los últimos 7 días - #19
Una implementación oficial de "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"
★ 1032+0Variación de estrellas de los últimos 7 días - #20
Caja de herramientas de algoritmos de IA offline gratuita para Java, que admite reconocimiento facial, detección de vida, reconocimiento de expresiones, detección de objetos, segmentación de instancias, detección de peatones, OCR, reconocimiento de matrículas, reconocimiento de tablas, ASR+TTS, traducción automática y más. Se utiliza mediante Maven. Compatible con PyTorch y Tensorflow, e integra modelos como Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR(PPOCRv5) y Whisper.
★ 908+3Variación de estrellas de los últimos 7 días - #21
CLIP + FFT/DWT/RGB = texto a imagen/video
★ 789+0Variación de estrellas de los últimos 7 días - #22
Nueva generación de CLIP con fuerte capacidad de discriminación de grano fino, ICML2026 e ICML2025
★ 733+2Variación de estrellas de los últimos 7 días - #23
Paddle Multimodal Integration and eXploration, que soporta tareas multimodales convencionales, incluyendo modelos de preentrenamiento multimodal a gran escala de extremo a extremo y un conjunto de herramientas de modelos de difusión. Equipado con alto rendimiento y flexibilidad.
★ 723-1Variación de estrellas de los últimos 7 días - #24
TrailSnap | Álbum de fotos de código abierto impulsado por IA para recuerdos de viajes y vida.
★ 711+13Variación de estrellas de los últimos 7 días - #25
Una colección completa de recursos sobre modelos de lenguaje visual, incluyendo artículos y repositorios de modelos. Actualización continua.
★ 706+3Variación de estrellas de los últimos 7 días - #26
LLM2CLIP mejora significativamente los modelos CLIP, que ya son de última generación.
★ 688+1Variación de estrellas de los últimos 7 días - #27
Descargador/grabador de transmisiones, videos y clips de Twitch. Esta herramienta con interfaz gráfica ayuda a descargar y grabar videos de Twitch, incluyendo transmisiones y VODs.
★ 681+4Variación de estrellas de los últimos 7 días - #28
Extrae características de video de videos sin procesar utilizando múltiples GPU. Soportamos marcos de flujo RAFT, así como modelos S3D, I3D, R(2+1)D, VGGish, CLIP y TIMM.
★ 656+0Variación de estrellas de los últimos 7 días - #29
👁️ + 💬 + 🎧 = 🤖 Lista curada de los mejores modelos fundamentales y multimodales. [Artículos + Código + Ejemplos + Tutoriales]
★ 637+0Variación de estrellas de los últimos 7 días - #30
Keras beit, caformer, CMT, CoAtNet, convnext, davit, dino, efficientdet, edgenext, efficientformer, efficientnet, eva, fasternet, fastervit, fastvit, flexivit, gcvit, ghostnet, gpvit, hornet, hiera, iformer, inceptionnext, lcnet, levit, maxvit, mobilevit, moganet, nat, nfnets, pvt, swin, tinynet, tinyvit, uniformer, volo, vanillanet, yolor, yolov7, yolov8, yolox, gpt2, llama2, alias kecam
★ 626+0Variación de estrellas de los últimos 7 días