Saltar al contenido principal
buildradar
Sign in
Tema · multimodal

multimodal

Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.

148 repositorios
  • Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas

    1136+18Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para su aplicación: Alan AI SDK para Cordova.

    1132+0Variación de estrellas de los últimos 7 días
  • sglang-omni@sgl-project

    SGLang-Omni permite un servicio de alto rendimiento para modelos de TTS, ASR, voz y modelos omni.

    1118+130Variación de estrellas de los últimos 7 días
  • MOVA@OpenMOSS

    MOVA: Hacia la generación de video y audio escalable y sincronizada

    1110+3Variación de estrellas de los últimos 7 días
  • Aria@rhymes-ai

    Base de código para Aria, un MoE nativo multimodal abierto.

    1088+1Variación de estrellas de los últimos 7 días
  • XrayGLM@WangRongsheng

    🩺 El primer modelo médico multimodal en chino capaz de analizar radiografías de tórax | The first Chinese Medical Multimodal Model that Chest Radiographs Summarization.

    1084+2Variación de estrellas de los últimos 7 días
  • dsh-vision-router@ysr666

    Ojos para agentes de DeepSeek Harness solo de texto: cadena de visión gratuita integrada (sin clave) + herramientas de visión a nivel de píxel (Q&A, grounding, recorte, diferencia de píxeles, colores, OCR, trazado SVG, recortes, capturas de pantalla). Instalación con un comando, sin Python, los turnos de imagen funcionan como turnos ordinarios de llamada a herramientas.

    1083+54Variación de estrellas de los últimos 7 días
  • VisCPM@OpenBMB

    [ICLR'24 spotlight] Serie de modelos multimodales grandes en chino e inglés (Chat y Paint) | Basado en la serie de modelos multimodales grandes bilingües chino-inglés CPM

    1061-1Variación de estrellas de los últimos 7 días
  • ONE-PEACE@OFA-Sys

    Un modelo de representación general para modalidades de visión, audio y lenguaje. Artículo: ONE-PEACE: Explorando un modelo de representación general hacia modalidades ilimitadas.

    1060+0Variación de estrellas de los últimos 7 días
  • PointLLM@InternRobotics

    [Candidato a mejor artículo en ECCV 2024 y TPAMI 2025] PointLLM: Potenciando a los modelos de lenguaje extenso para comprender nubes de puntos.

    1053+2Variación de estrellas de los últimos 7 días
  • CLIP4Clip@ArrowLuo

    Una implementación oficial de "CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval"

    1032+0Variación de estrellas de los últimos 7 días
  • Awesome-MCoT@yaotingwangofficial

    Razonamiento multimodal de cadena de pensamiento: un estudio exhaustivo

    1025+2Variación de estrellas de los últimos 7 días
  • tongflow@tong-io

    TongFlow — Estudio de IA generativa multimodal

    1017+37Variación de estrellas de los últimos 7 días
  • vectordb-recipes@lancedb

    Recursos, ejemplos y tutoriales para IA multimodal, RAG y agentes que utilizan búsqueda vectorial y LLM.

    973-1Variación de estrellas de los últimos 7 días
  • verl-omni@verl-project

    Framework de entrenamiento de aprendizaje por refuerzo multimodal para modelos de difusión y omnimodales

    959+60Variación de estrellas de los últimos 7 días
  • rag-time@microsoft

    RAG Time: Un viaje de aprendizaje de 5 semanas para dominar RAG

    903+4Variación de estrellas de los últimos 7 días
  • Este repositorio es una colección curada de los artículos más interesantes e influyentes de CVPR 2025. 🔥 [Artículo + Código + Demo]

    895+1Variación de estrellas de los últimos 7 días
  • NEO@EvolvingLMMs-Lab

    Serie NEO: modelos de visión-lenguaje nativos desde los principios fundamentales

    888+0Variación de estrellas de los últimos 7 días
  • AnyGPT@OpenMOSS

    Código para "AnyGPT: LLM multimodal unificado con modelado de secuencia discreta"

    881+0Variación de estrellas de los últimos 7 días
  • ohmycaptcha@shenhao-stu

    Solucionador de captchas compatible con YesCaptcha, autohospedable y construido con FastAPI, Playwright y modelos multimodales compatibles con OpenAI.

    869+4Variación de estrellas de los últimos 7 días
  • lmms-engine@EvolvingLMMs-Lab

    Un motor de entrenamiento multimodal simple y unificado. Ligero, flexible y diseñado para hackear a gran escala.

    824+0Variación de estrellas de los últimos 7 días
  • [TMLR 2025🔥] Un estudio sobre modelos autorregresivos en visión artificial.

    808+1Variación de estrellas de los últimos 7 días
  • papermage@allenai

    Biblioteca que soporta investigación en NLP y CV sobre artículos científicos

    803+0Variación de estrellas de los últimos 7 días
  • contrastors@nomic-ai

    Entrenamiento de modelos de forma contrastiva en Pytorch

    802+0Variación de estrellas de los últimos 7 días
  • Monitoreo local + visión por IA: marco de monitoreo de IA basado en LAN mediante smartphones, con salida de eventos estructurada para la adquisición y análisis de datos.

    768+4Variación de estrellas de los últimos 7 días
  • Lista de artículos sobre modelos multimodales y de lenguaje de gran escala, utilizada para registrar las lecturas diarias de arxiv para uso personal.

    761+1Variación de estrellas de los últimos 7 días
  • InstructIR@mv-lab

    [ECCV 2024] InstructIR: Restauración de imágenes de alta calidad siguiendo instrucciones humanas https://huggingface.co/spaces/marcosv/InstructIR

    741+0Variación de estrellas de los últimos 7 días
  • PaddleMIX@PaddlePaddle

    Paddle Multimodal Integration and eXploration, que soporta tareas multimodales convencionales, incluyendo modelos de preentrenamiento multimodal a gran escala de extremo a extremo y un conjunto de herramientas de modelos de difusión. Equipado con alto rendimiento y flexibilidad.

    723-1Variación de estrellas de los últimos 7 días
  • MMRec@enoche

    Una caja de herramientas para recomendación multimodal. Integra más de 10 modelos.

    689+1Variación de estrellas de los últimos 7 días
  • VLM2Vec@TIGER-AI-Lab

    Este repositorio contiene el código para "VLM2Vec / MMEB" [ICLR 2025], "VLM2Vec-V2 / MMEB-V2" [TMLR 2026] y "MMEB-V3" [COLM 2026].

    682+2Variación de estrellas de los últimos 7 días
← Volver a temas