multi-modal
Repositorios de código abierto monitorizados etiquetados con multi-modal, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a multi-modal en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con multi-modal.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
Construya y ejecute agentes que pueda ver, entender y en los que pueda confiar.
★ 30.463+420Variación de estrellas de los últimos 7 días - #2
Un MLLM de bolsillo para la comprensión ultraeficiente de imágenes y videos en tu teléfono
★ 26.283+27Variación de estrellas de los últimos 7 días - #3
Framework de código abierto para agentes de IA de voz conversacional
★ 11.102+10Variación de estrellas de los últimos 7 días - #4
[CVPR 2024 Oral] Familia InternVL: una alternativa de código abierto pionera a GPT-4o. Un modelo de diálogo multimodal de código abierto con un rendimiento cercano al de GPT-4o
★ 10.150+3Variación de estrellas de los últimos 7 días - #5
ModelScope: da vida al concepto de Model-as-a-Service.
★ 9121+4Variación de estrellas de los últimos 7 días - #6
Suite de IA impulsada por modelos de última generación que ofrece funciones avanzadas de IA/AGI. Incluye personajes de IA, funciones de AGI, chats multimodelo Beam de clase mundial, texto a imagen, voz, transmisión de respuestas, resaltado y ejecución de código, importación de PDF, ajustes preestablecidos para desarrolladores y mucho más. Despliegue local o en la nube.
★ 7108+1Variación de estrellas de los últimos 7 días - #7
¡Procesamiento de datos para y con modelos fundamentales! 🍎 🍋 🌽 ➡️ ➡️🍸 🍹 🍷
★ 6975+26Variación de estrellas de los últimos 7 días - #8★ 6744+0Variación de estrellas de los últimos 7 días
- #9★ 6154+24Variación de estrellas de los últimos 7 días
- #10
Versión en chino de CLIP que logra la recuperación y generación de representaciones multimodales en chino.
★ 6001+1Variación de estrellas de los últimos 7 días - #11
Implementación / replicación de DALL-E, el Transformer de texto a imagen de OpenAI, en PyTorch
★ 5626-2Variación de estrellas de los últimos 7 días - #12★ 5031-1Variación de estrellas de los últimos 7 días
- #13
[EMNLP 2022] Un kit de herramientas abierto para la extracción y construcción de grafos de conocimiento
★ 4476+1Variación de estrellas de los últimos 7 días - #14
Kit de herramientas de evaluación de código abierto para grandes modelos multimodales (LMMs), compatible con más de 220 LMMs y más de 80 benchmarks
★ 4375+13Variación de estrellas de los últimos 7 días - #15★ 4342+1Variación de estrellas de los últimos 7 días
- #16
Modelo de lenguaje conversacional multimodal en chino e inglés | 多模态中英双语对话语言模型
★ 4155+0Variación de estrellas de los últimos 7 días - #17
Una biblioteca de C#/.NET para ejecutar LLM (🦙LLaMA/LLaVA) en tu dispositivo local de manera eficiente.
★ 3790+2Variación de estrellas de los últimos 7 días - #18
【EMNLP 2024🔥】Video-LLaVA: Aprendizaje de representación visual unificada mediante alineación antes de la proyección
★ 3500+1Variación de estrellas de los últimos 7 días - #19
Ecosistema de asistente de IA de código abierto con integraciones de MCP, flujos de trabajo multimodales, soporte para IoT e interacción de voz multiplataforma.
★ 3463+9Variación de estrellas de los últimos 7 días - #20★ 3123-1Variación de estrellas de los últimos 7 días
- #21
Página del proyecto para "LISA: Segmentación de razonamiento mediante un modelo de lenguaje grande"
★ 2674+0Variación de estrellas de los últimos 7 días - #22★ 2433+0Variación de estrellas de los últimos 7 días
- #23★ 2322+0Variación de estrellas de los últimos 7 días
- #24
Una colección de artículos clásicos de la industria y de vanguardia en el campo de la recomendación, publicidad y búsqueda.
★ 2188-1Variación de estrellas de los últimos 7 días - #25
[NeurIPS 2023] MotionGPT: Human Motion as a Foreign Language, un modelo unificado de generación de movimiento y lenguaje mediante LLMs
★ 1963+1Variación de estrellas de los últimos 7 días - #26
Una interfaz de GPT robusta y todo en uno para Discord. Conversaciones al estilo de ChatGPT, generación de imágenes, moderación por IA, índices/base de conocimientos personalizados, resumidor de YouTube y más.
★ 1853-2Variación de estrellas de los últimos 7 días - #27★ 1521+3Variación de estrellas de los últimos 7 días
- #28
[pip install medmnist] 18 conjuntos de datos estandarizados para la clasificación de imágenes biomédicas 2D y 3D
★ 1399+0Variación de estrellas de los últimos 7 días - #29
Implementación en Pytorch de Transfusion, "Predecir el siguiente token y difundir imágenes con un modelo multimodal", de MetaAI
★ 1398+3Variación de estrellas de los últimos 7 días - #30
Este repositorio recopila artículos para "Una encuesta sobre la destilación de conocimiento de modelos de lenguaje grandes". Desglosamos la destilación de conocimiento en algoritmos de obtención y destilación de conocimiento, y exploramos la destilación de habilidades y vertical de los LLM.
★ 1306+1Variación de estrellas de los últimos 7 días