Saltar al contenido principal
buildradar
Sign in
Tema · multimodal

multimodal

Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.

148 repositorios
  • ✨✨Últimos artículos y benchmarks sobre razonamiento con modelos base

    657+1Variación de estrellas de los últimos 7 días
  • MOSS-Audio@OpenMOSS

    MOSS-Audio es un modelo base de código abierto para la comprensión unificada de audio, que permite el procesamiento de voz, sonido, música, subtitulado, QA y razonamiento en escenarios del mundo real.

    656+5Variación de estrellas de los últimos 7 días
  • SEED@AILab-CVC

    Implementación oficial de SEED-LLaMA (ICLR 2024).

    641-1Variación de estrellas de los últimos 7 días
  • Seg-Zero@JIA-Lab-research

    Página del proyecto para "Seg-Zero: Segmentación guiada por cadena de razonamiento mediante refuerzo cognitivo"

    639+0Variación de estrellas de los últimos 7 días
  • 👁️ + 💬 + 🎧 = 🤖 Lista curada de los mejores modelos fundamentales y multimodales. [Artículos + Código + Ejemplos + Tutoriales]

    637+0Variación de estrellas de los últimos 7 días
  • blended-latent-diffusion@omriav

    Implementación oficial de "Blended Latent Diffusion" [SIGGRAPH 2023]

    632+0Variación de estrellas de los últimos 7 días
  • second-brain@henrydaum

    Second Brain es un framework de agentes que actúa como un sistema operativo, utilizando inteligencia de archivos locales, automatización de flujos de trabajo y LLMs para completar tareas y comunicarse a través de múltiples modalidades y plataformas de mensajería.

    630+12Variación de estrellas de los últimos 7 días
  • RAG-Driven-Generative-AI@Denis2054

    Este repositorio proporciona programas para crear código de Generación Aumentada por Recuperación (RAG) para IA generativa con LlamaIndex, Deep Lake y Pinecone, aprovechando el poder de los modelos de OpenAI y Hugging Face para la generación y evaluación.

    624+2Variación de estrellas de los últimos 7 días
  • VisualThinker-R1-Zero@turningpoint-ai

    Explora el momento "Aha" multimodal en un modelo de 2B.

    623+0Variación de estrellas de los últimos 7 días
  • Hunyuan3D-Omni@Tencent-Hunyuan

    Hunyuan3D-Omni: Un framework unificado para la generación controlable de activos 3D

    616+3Variación de estrellas de los últimos 7 días
  • tokenize-anything@baaivision

    [ECCV 2024] Tokenización de cualquier cosa mediante prompts.

    600+0Variación de estrellas de los últimos 7 días
  • MOSS-VL@OpenMOSS

    An open-weight 11B model series for long-form and real-time video understanding

    596Variación de estrellas de los últimos 7 días
  • MMMU@MMMU-Benchmark

    Este repositorio contiene el código de evaluación para el artículo "MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI".

    593+1Variación de estrellas de los últimos 7 días
  • Relax@redai-studio

    Un motor de aprendizaje por refuerzo asíncrono para el post-entrenamiento omnimodal a gran escala.

    591+11Variación de estrellas de los últimos 7 días
  • blended-diffusion@omriav

    Implementación oficial de "Blended Diffusion for Text-driven Editing of Natural Images" [CVPR 2022]

    589+0Variación de estrellas de los últimos 7 días
  • Groma@FoundationVision

    [ECCV2024] Modelo de lenguaje multimodal fundamentado con tokenización visual localizada

    586+0Variación de estrellas de los últimos 7 días
  • AI-Employe@vignshwarar

    Crea automatizaciones de navegador como si estuvieras enseñando a un humano usando GPT-4 Vision.

    586+0Variación de estrellas de los últimos 7 días
  • rai@RobotecAI

    RAI es un framework de agentes agnóstico al proveedor para robótica de IA física, que utiliza herramientas de ROS 2 para realizar acciones complejas, escenarios definidos, ejecución de interfaz libre, resúmenes de registros, interacción por voz y más

    581+6Variación de estrellas de los últimos 7 días
  • motis@motis-project

    Enrutamiento multimodal, geocodificación y mosaicos de mapas.

    579+13Variación de estrellas de los últimos 7 días
  • LLaVA-Mini@ictnlp

    LLaVA-Mini es un modelo multimodal grande (LMM) unificado que admite la comprensión de imágenes, imágenes de alta resolución y videos de manera eficiente.

    577+0Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para tu aplicación: Alan AI SDK para React Native

    575+0Variación de estrellas de los últimos 7 días
  • multimodal-agents-course@the-ai-merge

    ¡Un agente de IA multimodal MCP con ojos y oídos!

    575-1Variación de estrellas de los últimos 7 días
  • psi@microsoft

    Plataforma para inteligencia situada (Situated Intelligence).

    572+1Variación de estrellas de los últimos 7 días
  • clip.cpp@monatis

    Inferencia de CLIP en C/C++ puro sin dependencias adicionales.

    568+0Variación de estrellas de los últimos 7 días
  • Flame-Code-VLM@Flame-Code-VLM

    Flame es un sistema de IA multimodal de código abierto diseñado para traducir maquetas de diseño de interfaz de usuario a código React de alta calidad. Aprovecha el modelado de lenguaje visual, la síntesis de datos automatizada y flujos de trabajo de entrenamiento estructurados para cerrar la brecha entre el diseño y el desarrollo front-end.

    562+0Variación de estrellas de los últimos 7 días
  • vlmrun-hub@vlm-run

    Un centro para diversos esquemas específicos de la industria para su uso con VLM.

    555+0Variación de estrellas de los últimos 7 días
  • Awesome Multimodal Modeling [cubre MLLM, UMM y NMM]

    543+2Variación de estrellas de los últimos 7 días
  • EVF-SAM@hustvl

    Código oficial de "EVF-SAM: Fusión temprana de visión-lenguaje para el modelo Segment Anything con prompts de texto"

    508+1Variación de estrellas de los últimos 7 días
← Volver a temas