multimodal
Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.
- #121
✨✨Últimos artículos y benchmarks sobre razonamiento con modelos base
★ 657+1Variación de estrellas de los últimos 7 días - #122
MOSS-Audio es un modelo base de código abierto para la comprensión unificada de audio, que permite el procesamiento de voz, sonido, música, subtitulado, QA y razonamiento en escenarios del mundo real.
★ 656+5Variación de estrellas de los últimos 7 días - #123★ 641-1Variación de estrellas de los últimos 7 días
- #124
Página del proyecto para "Seg-Zero: Segmentación guiada por cadena de razonamiento mediante refuerzo cognitivo"
★ 639+0Variación de estrellas de los últimos 7 días - #125
👁️ + 💬 + 🎧 = 🤖 Lista curada de los mejores modelos fundamentales y multimodales. [Artículos + Código + Ejemplos + Tutoriales]
★ 637+0Variación de estrellas de los últimos 7 días - #126
Implementación oficial de "Blended Latent Diffusion" [SIGGRAPH 2023]
★ 632+0Variación de estrellas de los últimos 7 días - #127
Second Brain es un framework de agentes que actúa como un sistema operativo, utilizando inteligencia de archivos locales, automatización de flujos de trabajo y LLMs para completar tareas y comunicarse a través de múltiples modalidades y plataformas de mensajería.
★ 630+12Variación de estrellas de los últimos 7 días - #128
Este repositorio proporciona programas para crear código de Generación Aumentada por Recuperación (RAG) para IA generativa con LlamaIndex, Deep Lake y Pinecone, aprovechando el poder de los modelos de OpenAI y Hugging Face para la generación y evaluación.
★ 624+2Variación de estrellas de los últimos 7 días - #129
Explora el momento "Aha" multimodal en un modelo de 2B.
★ 623+0Variación de estrellas de los últimos 7 días - #130
Hunyuan3D-Omni: Un framework unificado para la generación controlable de activos 3D
★ 616+3Variación de estrellas de los últimos 7 días - #131
[ECCV 2024] Tokenización de cualquier cosa mediante prompts.
★ 600+0Variación de estrellas de los últimos 7 días - #132★ 596—Variación de estrellas de los últimos 7 días
- #133
Este repositorio contiene el código de evaluación para el artículo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI".
★ 593+1Variación de estrellas de los últimos 7 días - #134
Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.
★ 591+11Variación de estrellas de los últimos 7 días - #135
Implementación oficial de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]
★ 589+0Variación de estrellas de los últimos 7 días - #136
[ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada
★ 586+0Variación de estrellas de los últimos 7 días - #137
Crea automatizaciones de navegador como si estuvieras enseñando a un humano usando GPT-4 Vision.
★ 586+0Variación de estrellas de los últimos 7 días - #138
RAI es un framework de agentes agnóstico al proveedor para robótica de IA física, que utiliza herramientas de ROS 2 para realizar acciones complejas, escenarios definidos, ejecución de interfaz libre, resúmenes de registros, interacción por voz y más
★ 581+6Variación de estrellas de los últimos 7 días - #139★ 579+13Variación de estrellas de los últimos 7 días
- #140
LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.
★ 577+0Variación de estrellas de los últimos 7 días - #141
El sistema de autocodificación para tu aplicación: Alan AI SDK para React Native
★ 575+0Variación de estrellas de los últimos 7 días - #142
¡Un agente de IA multimodal MCP con ojos y oídos!
★ 575-1Variación de estrellas de los últimos 7 días - #143★ 572+1Variación de estrellas de los últimos 7 días
- #144★ 568+0Variación de estrellas de los últimos 7 días
- #145
Flame es un sistema de IA multimodal de código abierto diseñado para traducir maquetas de diseño de interfaz de usuario a código React de alta calidad. Aprovecha el modelado de lenguaje visual, la síntesis de datos automatizada y flujos de trabajo de entrenamiento estructurados para cerrar la brecha entre el diseño y el desarrollo front-end.
★ 562+0Variación de estrellas de los últimos 7 días - #146
Un centro para diversos esquemas específicos de la industria para su uso con VLM.
★ 555+0Variación de estrellas de los últimos 7 días - #147
Awesome Multimodal Modeling [cubre MLLM, UMM y NMM]
★ 543+2Variación de estrellas de los últimos 7 días - #148
Código oficial de "EVF-SAM: Fusión temprana de visión-lenguaje para el modelo Segment Anything con prompts de texto"
★ 508+1Variación de estrellas de los últimos 7 días