multimodal
Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.
- #61
SDK para interactuar con las API de stability.ai (p. ej. inferencia de stable diffusion)
★ 2435-1Variación de estrellas de los últimos 7 días - #62
mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos
★ 2411+0Variación de estrellas de los últimos 7 días - #63
[ECCV2024] Modelos base de video y datos para comprensión multimodal
★ 2374+5Variación de estrellas de los últimos 7 días - #64
🎨 NeMo Data Designer: Genera datos sintéticos de alta calidad desde cero o a partir de datos semilla.
★ 2197+7Variación de estrellas de los últimos 7 días - #65
GenAI Processors es una biblioteca ligera de Python que permite el procesamiento de contenido eficiente y en paralelo.
★ 2120+0Variación de estrellas de los últimos 7 días - #66
Permite que Claude (o cualquier LLM) vea realmente un video: fotogramas conscientes de escenas y deduplicados + transcripción, desde una URL o archivo local. Se ejecuta localmente, bajo licencia MIT.
★ 2109+20Variación de estrellas de los últimos 7 días - #67
IA multimodal en tiempo real y en el dispositivo con funciones similares a GPT-Live
★ 2048+7Variación de estrellas de los últimos 7 días - #68
[ICLR & NeurIPS 2025] Repositorio para la serie Show-o, un único Transformer para unificar la comprensión y generación multimodal.
★ 1975+1Variación de estrellas de los últimos 7 días - #69
Una implementación de código abierto para el ajuste fino de la serie Qwen-VL de Alibaba Cloud.
★ 1961+1Variación de estrellas de los últimos 7 días - #70
Implementación de "BitNet: Scaling 1-bit Transformers for Large Language Models" en PyTorch.
★ 1946+0Variación de estrellas de los últimos 7 días - #71
Una colección de ideas y algoritmos originales e innovadores hacia Advanced Literate Machinery. Este proyecto lo mantiene el equipo de OCR en el Language Technology Lab, Tongyi Lab, Alibaba Group.
★ 1835+1Variación de estrellas de los últimos 7 días - #72★ 1818+1Variación de estrellas de los últimos 7 días
- #73
El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android
★ 1807-1Variación de estrellas de los últimos 7 días - #74
El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.
★ 1756-1Variación de estrellas de los últimos 7 días - #75
El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.
★ 1649-1Variación de estrellas de los últimos 7 días - #76
Backend multimodal unificado para aplicaciones de datos de IA.
★ 1619+5Variación de estrellas de los últimos 7 días - #77★ 1602+3Variación de estrellas de los últimos 7 días
- #78
Obtén datos limpios de documentos complejos, potenciado por modelos de visión y lenguaje ⚡
★ 1524+0Variación de estrellas de los últimos 7 días - #79
Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.
★ 1514+2Variación de estrellas de los últimos 7 días - #80
Inteligencia visual para tu hogar.
★ 1454+10Variación de estrellas de los últimos 7 días - #81
Resumen de LLM en japonés - Descripción general de los LLM japoneses.
★ 1428+1Variación de estrellas de los últimos 7 días - #82
Este repositorio es la implementación oficial de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)
★ 1406-1Variación de estrellas de los últimos 7 días - #83
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1350+426Variación de estrellas de los últimos 7 días - #84
Motor de inferencia offline para arte, conversaciones de voz en tiempo real, chatbots impulsados por LLM y flujos de trabajo automatizados
★ 1314+0Variación de estrellas de los últimos 7 días - #85
Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.
★ 1310+2Variación de estrellas de los últimos 7 días - #86
Dale a Claude la capacidad de ver y entender videos: plugin de Claude Code con extracción de fotogramas y análisis de audio multimodal
★ 1281+6Variación de estrellas de los últimos 7 días - #87
IA multimodal de bolsillo para la comprensión y generación de contenido en textos multilingües, imágenes y próximamente video, hasta 5 veces más rápida que OpenAI CLIP y LLaVA.
★ 1247+1Variación de estrellas de los últimos 7 días - #88
Xtreme1 es una plataforma integral de etiquetado y anotación de datos para el entrenamiento de datos multimodales, compatible con nubes de puntos LiDAR 3D, imágenes y LLM.
★ 1239+2Variación de estrellas de los últimos 7 días - #89
Unificación de la generación de mallas 3D con modelos de lenguaje
★ 1167+0Variación de estrellas de los últimos 7 días - #90★ 1153-25Variación de estrellas de los últimos 7 días