multimodal
Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a multimodal en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con multimodal.
- #1
Permite que Claude (o cualquier LLM) vea realmente un video: fotogramas conscientes de escenas y deduplicados + transcripción, desde una URL o archivo local. Se ejecuta localmente, bajo licencia MIT.
★ 2109 - #2
WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval.
★ 1363 - #3★ 1153
- #4
Kit de herramientas visuales y habilidades diseñadas para modelos de solo texto para "ver" imágenes, compatible con comprensión de múltiples imágenes, preguntas y respuestas sobre imágenes, restauración de UI frontend, automatización de GUI, con integración opcional y fluida a múltiples agentes principales, reconocimiento directo de imágenes pegadas
★ 1136 - #5
Ojos para agentes de DeepSeek Harness solo de texto: cadena de visión gratuita integrada (sin clave) + herramientas de visión a nivel de píxel (Q&A, grounding, recorte, diferencia de píxeles, colores, OCR, trazado SVG, recortes, capturas de pantalla). Instalación con un comando, sin Python, los turnos de imagen funcionan como turnos ordinarios de llamada a herramientas.
★ 1084
- #1
Deja de alquilar tu inteligencia. Adóptala con AnythingLLM. Todo lo que necesitas para una potente experiencia de agente de primer orden local.
★ 65.534+163Variación de estrellas de los últimos 7 días - #2
Repositorio principal de código abierto de "Understanding AI Agents: Design Principles and Engineering Practices" (por Bojie Li): texto completo, PDF compilado y código por capítulos
★ 44.381+1022Variación de estrellas de los últimos 7 días - #3
La pila de agentes de IA multimodales de código abierto: conectando modelos de IA de vanguardia e infraestructura de agentes
★ 38.817+75Variación de estrellas de los últimos 7 días - #4
[NeurIPS'23 Oral] Ajuste de instrucciones visuales (LLaVA) diseñado para alcanzar capacidades del nivel de GPT-4V y superiores.
★ 25.014+9Variación de estrellas de los últimos 7 días - #5
Preentrenamiento autosupervisado a gran escala en múltiples tareas, idiomas y modalidades
★ 22.203+7Variación de estrellas de los últimos 7 días - #6★ 21.859-2Variación de estrellas de los últimos 7 días
- #7
YC (S26) | Open Computer History | Graba tu pantalla continuamente de forma local y proporciona contexto a tus agentes (Claude, Codex, Openclaw, Hermes, Runner...)
★ 21.376+80Variación de estrellas de los últimos 7 días - #8★ 17.763+1Variación de estrellas de los últimos 7 días
- #9
Usa PEFT o parámetros completos para CPT/SFT/DPO/GRPO en más de 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) y más de 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).
★ 15.488+88Variación de estrellas de los últimos 7 días - #10★ 11.387+15Variación de estrellas de los últimos 7 días
- #11
🔍 Práctica de desarrollo de aplicaciones con modelos grandes 1: Guía completa de la tecnología RAG, dirección de lectura en línea: https://datawhalechina.github.io/all-in-rag/
★ 10.770+94Variación de estrellas de los últimos 7 días - #12
Herramientas listas para producción para ejecutar IA de forma local.
★ 10.281+1Variación de estrellas de los últimos 7 días - #13
Una biblioteca de Python para la detección de anomalías en datos tabulares, de series temporales, de grafos, de texto, de imágenes y de audio. Más de 60 detectores, orquestación ADEngine respaldada por benchmarks y un flujo de trabajo agéntico para agentes de IA.
★ 9978+1Variación de estrellas de los últimos 7 días - #14
El fin del análisis web. El comienzo de la búsqueda nativa de píxeles escalable. Enlace: https://pixelrag.ai/
★ 9848+60Variación de estrellas de los últimos 7 días - #15
SeaTunnel es una herramienta de integración de datos masivos multimodal, de alto rendimiento y distribuida.
★ 9612+12Variación de estrellas de los últimos 7 días - #16
Deeplake es un entorno de ejecución de datos de IA para agentes. Proporciona Postgres sin servidor con un datalake multimodal, lo que permite la recuperación y el entrenamiento escalables.
★ 9229-1Variación de estrellas de los últimos 7 días - #17
Mobile-Agent: La potente familia de agentes GUI
★ 9157+9Variación de estrellas de los últimos 7 días - #18
La forma más sencilla de servir aplicaciones y modelos de IA: ¡crea APIs de inferencia de modelos, colas de trabajos, aplicaciones LLM, pipelines de múltiples modelos y más!
★ 8817+4Variación de estrellas de los últimos 7 días - #19
Una biblioteca de texto a voz (TTS), voz a texto (STT) y voz a voz (STS) construida sobre el framework MLX de Apple, que proporciona un análisis de voz eficiente en Apple Silicon.
★ 7826+23Variación de estrellas de los últimos 7 días - #20★ 6593+136Variación de estrellas de los últimos 7 días
- #21
Este repositorio es una colección seleccionada de enlaces a varios cursos y recursos sobre Inteligencia Artificial (IA).
★ 6482+3Variación de estrellas de los últimos 7 días - #22
Framework de código abierto para crear aplicaciones de agentes en JavaScript, Go, Dart y Python, creado y utilizado en producción por Google
★ 6394+10Variación de estrellas de los últimos 7 días - #23
Notas para ingenieros de software que se ponen al día con los nuevos desarrollos de IA. Sirve como almacén de datos para los escritos de https://latent.space y lluvia de ideas de productos, pero contiene referencias canónicas depuradas bajo la carpeta /Resources.
★ 6247+0Variación de estrellas de los últimos 7 días - #24★ 6018+4Variación de estrellas de los últimos 7 días
- #25
Un entorno visual para flujos de trabajo de agentes: itera sobre tus agentes 10 veces más rápido
★ 5779-1Variación de estrellas de los últimos 7 días - #26
Motor de datos de alto rendimiento para IA y cargas de trabajo multimodales. Procesa imágenes, audio, video y datos estructurados a cualquier escala
★ 5736+4Variación de estrellas de los últimos 7 días - #27
Un framework MCP de código bajo para construir pipelines RAG complejos e innovadores
★ 5678+4Variación de estrellas de los últimos 7 días - #28
Un framework modular para la investigación multimodal de visión y lenguaje de Facebook AI Research (FAIR)
★ 5633-1Variación de estrellas de los últimos 7 días - #29
Un motor de entrenamiento de próxima generación diseñado para modelos MoE ultra grandes
★ 5188+3Variación de estrellas de los últimos 7 días - #30
Align Anything: Entrenamiento de modelos de todas las modalidades con retroalimentación
★ 4671+3Variación de estrellas de los últimos 7 días