Saltar al contenido principal
buildradar
Sign in
Tema · multimodal

multimodal

Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.

148 repositorios
  • tree-of-thoughts@kyegomez

    Implementación Plug and Play de Tree of Thoughts: resolución deliberada de problemas con Large Language Models que eleva el razonamiento del modelo en al menos un 70%

    4592+0Variación de estrellas de los últimos 7 días
  • Tutoriales y recursos seleccionados para Modelos de Lenguaje Grande (LLM), pintura con IA y más.

    4537+2Variación de estrellas de los últimos 7 días
  • img2dataset@rom1504

    Convierte fácilmente grandes conjuntos de URL de imágenes en un conjunto de datos de imágenes. Puede descargar, redimensionar y empaquetar 100M de URL en 20 horas en una sola máquina.

    4445+2Variación de estrellas de los últimos 7 días
  • lmms-eval@EvolvingLMMs-Lab

    Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio

    4390+7Variación de estrellas de los últimos 7 días
  • Fengshenbang-LM@IDEA-CCNL

    Fengshenbang-LM es un sistema de modelos abiertos de gran escala liderado por el Centro de Investigación de Computación Cognitiva y Lenguaje Natural del Instituto IDEA, convirtiéndose en la infraestructura para AIGC en chino e inteligencia cognitiva.

    4122-1Variación de estrellas de los últimos 7 días
  • MOSS-TTS@OpenMOSS

    MOSS‑TTS Family es una familia de modelos de código abierto para la generación de voz y sonido de MOSI.AI y el equipo OpenMOSS. Está diseñada para escenarios del mundo real complejos, de alta fidelidad y gran expresividad, que abarcan voz larga y estable, diálogo multilocutor, diseño de voz y personajes, efectos de sonido ambiental y TTS en streaming en tiempo real.

    4058+18Variación de estrellas de los últimos 7 días
  • mmpretrain@open-mmlab

    Caja de herramientas de preentrenamiento y Benchmark de OpenMMLab

    3850-1Variación de estrellas de los últimos 7 días
  • modlens@liustack

    El primer plugin de visión para DeepSeek Harness, y el puente de visión para cada agente de codificación de solo texto. Pega una imagen, obtén evidencia JSON estructurada (OCR, diseño, semántica). | El plugin de visión externo más potente de toda la red para DeepSeek Harness, que aporta capacidades de visión a modelos de solo texto como DeepSeek y GLM; pega una imagen para obtener evidencia JSON estructurada (OCR, diseño, semántica).

    3839+83Variación de estrellas de los últimos 7 días
  • SimpleMem@aiming-lab

    SimpleMem: Memoria continua eficiente para agentes de LLM — Texto y multimodal

    3735+9Variación de estrellas de los últimos 7 días
  • morphik-core@morphik-org

    Motor de recuperación multimodal de código abierto (Morphik Core). Por Morphik: backend de IA para enfermería especializada y residencias de ancianos (morphik.ai).

    3710-1Variación de estrellas de los últimos 7 días
  • Desde el prompting de Cadena de Pensamiento (Chain-of-Thought) hasta OpenAI o1 y DeepSeek-R1 🍓

    3681+3Variación de estrellas de los últimos 7 días
  • NExT-GPT@NExT-GPT

    Código y modelos para el artículo de ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de Cualquier-a-Cualquier

    3634-2Variación de estrellas de los últimos 7 días
  • mteb@embeddings-benchmark

    MTEB: Evaluación de vanguardia de incrustaciones en varios idiomas y modalidades.

    3414+5Variación de estrellas de los últimos 7 días
  • InternGPT@OpenGVLab

    InternGPT (iGPT) es una plataforma de demostración de código abierto donde puedes mostrar fácilmente tus modelos de IA. Ahora es compatible con DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edición interactiva de imágenes, etc. Pruébalo en igpt.opengvlab.com

    3205+0Variación de estrellas de los últimos 7 días
  • vortex@vortex-data

    Un framework extensible y de última generación para compresión columnar, y el formato de archivo columnar FOSS más rápido. Anteriormente en @spiraldb, ahora es un proyecto en fase de incubación en LFAI&Data, parte de la Linux Foundation.

    3171+8Variación de estrellas de los últimos 7 días
  • torchscale@microsoft

    Arquitectura base para (M)LLMs

    3139+1Variación de estrellas de los últimos 7 días
  • docarray@docarray

    Representar, enviar, almacenar y buscar datos multimodales

    3123-1Variación de estrellas de los últimos 7 días
  • OSWorld@xlang-ai

    [NeurIPS 2024] OSWorld: Evaluación comparativa de agentes multimodales para tareas abiertas en entornos informáticos reales

    3118+6Variación de estrellas de los últimos 7 días
  • ai@TanStack

    🤖 SDK de IA en TypeScript con tipado seguro e independiente del proveedor para chat en streaming, llamada a herramientas, agentes y aplicaciones multimodales en OpenAI, Anthropic, Gemini, React, Vue, Svelte y Solid.

    3057+15Variación de estrellas de los últimos 7 días
  • InternLM-XComposer@InternLM

    InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración

    2925-1Variación de estrellas de los últimos 7 días
  • datachain@datachain-ai

    La capa de contexto para datos no estructurados: conjuntos de datos tipados y versionados sobre S3, GCS y Azure

    2816+5Variación de estrellas de los últimos 7 días
  • clip-retrieval@rom1504

    Calcula fácilmente incrustaciones de CLIP y construye un sistema de recuperación basado en ellas

    2796+1Variación de estrellas de los últimos 7 días
  • autodistill@autodistill

    Imágenes para inferencia sin etiquetado (utiliza modelos fundacionales para entrenar modelos supervisados).

    2770+3Variación de estrellas de los últimos 7 días
  • maestro@roboflow

    Optimiza el proceso de ajuste fino (fine-tuning) para modelos multimodales: PaliGemma 2, Florence-2 y Qwen2.5-VL.

    2695+1Variación de estrellas de los últimos 7 días
  • OmAgent@om-ai-lab

    [EMNLP-2024] Construye agentes de lenguaje multimodales para prototipado rápido y producción

    2666+1Variación de estrellas de los últimos 7 días
  • generative-ai@genieincodebottle

    Recursos completos sobre IA generativa, incluyendo una hoja de ruta detallada, proyectos, casos de uso, preparación para entrevistas y preparación de código.

    2610+1Variación de estrellas de los últimos 7 días
  • OFA@OFA-Sys

    Repositorio oficial de OFA (ICML 2022). Artículo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

    2557+0Variación de estrellas de los últimos 7 días
  • mPLUG-Owl@X-PLUG

    mPLUG-Owl: La potente familia de modelos de lenguaje grandes multimodales

    2539+0Variación de estrellas de los últimos 7 días
  • HuixiangDou@InternLM

    HuixiangDou: Superando escenarios de chat grupal con asistencia técnica basada en LLM

    2502+2Variación de estrellas de los últimos 7 días
  • (ෆ`꒳´ෆ) Un estudio sobre generación y síntesis de texto a imagen.

    2444+0Variación de estrellas de los últimos 7 días
← Volver a temas