Saltar al contenido principal
buildradar
Sign in
Tema · multimodal

multimodal

Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.

148 repositorios
  • stability-sdk@Stability-AI

    SDK para interactuar con las API de stability.ai (p. ej. inferencia de stable diffusion)

    2435-1Variación de estrellas de los últimos 7 días
  • mPLUG-DocOwl@X-PLUG

    mPLUG-DocOwl: Modelo de lenguaje grande multimodal modularizado para la comprensión de documentos

    2411+0Variación de estrellas de los últimos 7 días
  • InternVideo@OpenGVLab

    [ECCV2024] Modelos base de video y datos para comprensión multimodal

    2374+5Variación de estrellas de los últimos 7 días
  • DataDesigner@NVIDIA-NeMo

    🎨 NeMo Data Designer: Genera datos sintéticos de alta calidad desde cero o a partir de datos semilla.

    2197+7Variación de estrellas de los últimos 7 días
  • genai-processors@google-gemini

    GenAI Processors es una biblioteca ligera de Python que permite el procesamiento de contenido eficiente y en paralelo.

    2120+0Variación de estrellas de los últimos 7 días
  • claude-real-video@HUANGCHIHHUNGLeo

    Permite que Claude (o cualquier LLM) vea realmente un video: fotogramas conscientes de escenas y deduplicados + transcripción, desde una URL o archivo local. Se ejecuta localmente, bajo licencia MIT.

    2109+20Variación de estrellas de los últimos 7 días
  • parlor@fikrikarim

    IA multimodal en tiempo real y en el dispositivo con funciones similares a GPT-Live

    2048+7Variación de estrellas de los últimos 7 días
  • Show-o@showlab

    [ICLR & NeurIPS 2025] Repositorio para la serie Show-o, un único Transformer para unificar la comprensión y generación multimodal.

    1975+1Variación de estrellas de los últimos 7 días
  • Una implementación de código abierto para el ajuste fino de la serie Qwen-VL de Alibaba Cloud.

    1961+1Variación de estrellas de los últimos 7 días
  • BitNet@kyegomez

    Implementación de "BitNet: Scaling 1-bit Transformers for Large Language Models" en PyTorch.

    1946+0Variación de estrellas de los últimos 7 días
  • AdvancedLiterateMachinery@AlibabaResearch

    Una colección de ideas y algoritmos originales e innovadores hacia Advanced Literate Machinery. Este proyecto lo mantiene el equipo de OCR en el Language Technology Lab, Tongyi Lab, Alibaba Group.

    1835+1Variación de estrellas de los últimos 7 días
  • DeTikZify@potamides

    Síntesis de programas gráficos para figuras científicas y bocetos con TikZ.

    1818+1Variación de estrellas de los últimos 7 días
  • El sistema de autoprogramación para tu aplicación — Alan AI SDK para Android

    1807-1Variación de estrellas de los últimos 7 días
  • El sistema de autocodificación para tu aplicación: Alan AI SDK para Flutter.

    1756-1Variación de estrellas de los últimos 7 días
  • alan-sdk-ionic@alan-ai

    El sistema de autocodificación para su aplicación: SDK de Alan AI para Ionic.

    1649-1Variación de estrellas de los últimos 7 días
  • pixeltable@pixeltable

    Backend multimodal unificado para aplicaciones de datos de IA.

    1619+5Variación de estrellas de los últimos 7 días
  • mllm@UbiquitousLearning

    LLM multimodal rápido para dispositivos móviles.

    1602+3Variación de estrellas de los últimos 7 días
  • thepipe@emcf

    Obtén datos limpios de documentos complejos, potenciado por modelos de visión y lenguaje ⚡

    1524+0Variación de estrellas de los últimos 7 días
  • Ovis@ATH-MaaS

    Una novedosa arquitectura de modelo de lenguaje multimodal (MLLM) diseñada para alinear estructuralmente incrustaciones visuales y textuales.

    1514+2Variación de estrellas de los últimos 7 días
  • ha-llmvision@valentinfrlch

    Inteligencia visual para tu hogar.

    1454+10Variación de estrellas de los últimos 7 días
  • awesome-japanese-llm@llm-jp

    Resumen de LLM en japonés - Descripción general de los LLM japoneses.

    1428+1Variación de estrellas de los últimos 7 días
  • SDT@dailenson

    Este repositorio es la implementación oficial de Disentangling Writer and Character Styles for Handwriting Generation (CVPR 2023)

    1406-1Variación de estrellas de los últimos 7 días
  • WeMM-Embedding@Tencent

    WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.

    1350+426Variación de estrellas de los últimos 7 días
  • airunner@Capsize-Games

    Motor de inferencia offline para arte, conversaciones de voz en tiempo real, chatbots impulsados por LLM y flujos de trabajo automatizados

    1314+0Variación de estrellas de los últimos 7 días
  • Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.

    1310+2Variación de estrellas de los últimos 7 días
  • claude-video-vision@jordanrendric

    Dale a Claude la capacidad de ver y entender videos: plugin de Claude Code con extracción de fotogramas y análisis de audio multimodal

    1281+6Variación de estrellas de los últimos 7 días
  • UForm@unum-cloud

    IA multimodal de bolsillo para la comprensión y generación de contenido en textos multilingües, imágenes y próximamente video, hasta 5 veces más rápida que OpenAI CLIP y LLaVA.

    1247+1Variación de estrellas de los últimos 7 días
  • xtreme1@xtreme1-io

    Xtreme1 es una plataforma integral de etiquetado y anotación de datos para el entrenamiento de datos multimodales, compatible con nubes de puntos LiDAR 3D, imágenes y LLM.

    1239+2Variación de estrellas de los últimos 7 días
  • LLaMA-Mesh@nv-tlabs

    Unificación de la generación de mallas 3D con modelos de lenguaje

    1167+0Variación de estrellas de los últimos 7 días
  • doc7@magicrew

    Convierte documentos en Markdown listo para IA con comprensión visual.

    1153-25Variación de estrellas de los últimos 7 días
← Volver a temas