multimodal-ai
Repositorios de código abierto monitorizados etiquetados con multimodal-ai, ordenados por estrellas.
Temas relacionados
Temas que aparecen con frecuencia junto a multimodal-ai en un mismo repositorio.
Emergentes recientes
Repositorios creados en los últimos 90 días, etiquetados con multimodal-ai.
No hay repositorios nuevos con este tema en los últimos 90 días.
- #1
🚀 Kit de herramientas de avatar de IA (humano digital) verdaderamente de código abierto para la generación de video sin conexión y clonación de humanos digitales.
★ 14.992+65Variación de estrellas de los últimos 7 días - #2
Puerta de enlace de Agnes AI oficial y catálogo de modelos para flujos de trabajo de texto, imágenes, video y agentes compatibles con OpenAI.
★ 5044+28Variación de estrellas de los últimos 7 días - #3
Habilidades de medios generativos multimodales para agentes de IA (Claude Code, Cursor, Gemini CLI). Generación de imágenes, videos y audio de alta calidad impulsada por muapi.ai.
★ 4205+19Variación de estrellas de los últimos 7 días - #4
Mano-P: Agente GUI-VLA de código abierto para dispositivos edge. N.º 1 en OSWorld (especializado, 58.2%). Se ejecuta localmente en Mac mini/MacBook con Apple M4; ningún dato sale de tu dispositivo. Mano-P es un proyecto GUI-VLA de código abierto que admite la inferencia ejecutada localmente en Mac mini/MacBook o a través de aceleradores de cálculo, logrando operaciones de automatización de GUI multiplataforma impulsadas puramente por visión. Los datos se procesan completamente de forma local, admitiendo la planificación y ejecución de tareas complejas de múltiples pasos.
★ 2615+15Variación de estrellas de los últimos 7 días - #5
EVA OS: un sistema operativo de IA multimodal en tiempo real para hardware de próxima generación, que permite que tus dispositivos estén "vivos" y sean tan inteligentes como un cerebro real.
★ 1869+87Variación de estrellas de los últimos 7 días - #6
NVIDIA AI Blueprint para búsqueda y resumen de video (VSS) es una arquitectura de referencia acelerada por GPU para construir agentes de análisis de video con alertas verificadas en tiempo real, preguntas y respuestas visuales, y generación automatizada de informes. El Blueprint VSS utiliza modelos de lenguaje visual (VLMs) como NVIDIA Cosmos, LLMs como NVIDIA Nemotron, RAG y NVIDIA NIMs.
★ 1840+10Variación de estrellas de los últimos 7 días - #7
OpenGUI es un framework de agente GUI para Android para IA de uso telefónico que puede ver, planificar y operar aplicaciones móviles reales a través de la GUI.
★ 1624+38Variación de estrellas de los últimos 7 días - #8
Servidor de inferencia LLM de alto rendimiento compatible con OpenAI y Anthropic para Apple Silicon. Incluye MLX nativo, procesamiento por lotes continuo, modelos multimodales, llamadas a herramientas MCP y soporte para Claude Code.
★ 1557+6Variación de estrellas de los últimos 7 días - #9
Catálogo visual curado de más de 155 arquitecturas de modelos de visión-lenguaje (VLM/MLLM): artículos, diagramas, recetas de entrenamiento, conjuntos de datos y una línea de tiempo de lanzamiento para agentes de IA multimodal.
★ 1310+2Variación de estrellas de los últimos 7 días - #10
XiaoyaoSearch: Entiende tus palabras, lee tus imágenes y encuentra cualquier archivo local con IA. Haciendo que la búsqueda sea tan sencilla como chatear.
★ 1083+0Variación de estrellas de los últimos 7 días - #11
Tu agente autónomo de Android abierto: un asistente de IA listo para producción con autoplanificación, impulsado por LLMs locales/remotos y automatización de pantalla basada en accesibilidad.
★ 1021+43Variación de estrellas de los últimos 7 días - #12
Recursos, ejemplos y tutoriales para IA multimodal, RAG y agentes que utilizan búsqueda vectorial y LLM.
★ 973-1Variación de estrellas de los últimos 7 días - #13★ 596—Variación de estrellas de los últimos 7 días