multimodal
Repositorios de código abierto monitorizados etiquetados con multimodal, ordenados por estrellas.
- #31
Implementación Plug and Play de Tree of Thoughts: resolución deliberada de problemas con Large Language Models que eleva el razonamiento del modelo en al menos un 70%
★ 4592+0Variación de estrellas de los últimos 7 días - #32
Tutoriales y recursos seleccionados para Modelos de Lenguaje Grande (LLM), pintura con IA y más.
★ 4537+2Variación de estrellas de los últimos 7 días - #33
Convierte fácilmente grandes conjuntos de URL de imágenes en un conjunto de datos de imágenes. Puede descargar, redimensionar y empaquetar 100M de URL en 20 horas en una sola máquina.
★ 4445+2Variación de estrellas de los últimos 7 días - #34
Kit de herramientas de evaluación multimodal todo en uno para tareas de texto, imagen, video y audio
★ 4390+7Variación de estrellas de los últimos 7 días - #35
Fengshenbang-LM es un sistema de modelos abiertos de gran escala liderado por el Centro de Investigación de Computación Cognitiva y Lenguaje Natural del Instituto IDEA, convirtiéndose en la infraestructura para AIGC en chino e inteligencia cognitiva.
★ 4122-1Variación de estrellas de los últimos 7 días - #36
MOSS‑TTS Family es una familia de modelos de código abierto para la generación de voz y sonido de MOSI.AI y el equipo OpenMOSS. Está diseñada para escenarios del mundo real complejos, de alta fidelidad y gran expresividad, que abarcan voz larga y estable, diálogo multilocutor, diseño de voz y personajes, efectos de sonido ambiental y TTS en streaming en tiempo real.
★ 4058+18Variación de estrellas de los últimos 7 días - #37
Caja de herramientas de preentrenamiento y Benchmark de OpenMMLab
★ 3850-1Variación de estrellas de los últimos 7 días - #38
El primer plugin de visión para DeepSeek Harness, y el puente de visión para cada agente de codificación de solo texto. Pega una imagen, obtén evidencia JSON estructurada (OCR, diseño, semántica). | El plugin de visión externo más potente de toda la red para DeepSeek Harness, que aporta capacidades de visión a modelos de solo texto como DeepSeek y GLM; pega una imagen para obtener evidencia JSON estructurada (OCR, diseño, semántica).
★ 3839+83Variación de estrellas de los últimos 7 días - #39★ 3735+9Variación de estrellas de los últimos 7 días
- #40
Motor de recuperación multimodal de código abierto (Morphik Core). Por Morphik: backend de IA para enfermería especializada y residencias de ancianos (morphik.ai).
★ 3710-1Variación de estrellas de los últimos 7 días - #41
Desde el prompting de Cadena de Pensamiento (Chain-of-Thought) hasta OpenAI o1 y DeepSeek-R1 🍓
★ 3681+3Variación de estrellas de los últimos 7 días - #42
Código y modelos para el artículo de ICML 2024, NExT-GPT: Modelo de Lenguaje Grande Multimodal de Cualquier-a-Cualquier
★ 3634-2Variación de estrellas de los últimos 7 días - #43
MTEB: Evaluación de vanguardia de incrustaciones en varios idiomas y modalidades.
★ 3414+5Variación de estrellas de los últimos 7 días - #44
InternGPT (iGPT) es una plataforma de demostración de código abierto donde puedes mostrar fácilmente tus modelos de IA. Ahora es compatible con DragGAN, ChatGPT, ImageBind, chat multimodal como GPT-4, SAM, edición interactiva de imágenes, etc. Pruébalo en igpt.opengvlab.com
★ 3205+0Variación de estrellas de los últimos 7 días - #45
Un framework extensible y de última generación para compresión columnar, y el formato de archivo columnar FOSS más rápido. Anteriormente en @spiraldb, ahora es un proyecto en fase de incubación en LFAI&Data, parte de la Linux Foundation.
★ 3171+8Variación de estrellas de los últimos 7 días - #46
Arquitectura base para (M)LLMs
★ 3139+1Variación de estrellas de los últimos 7 días - #47★ 3123-1Variación de estrellas de los últimos 7 días
- #48
[NeurIPS 2024] OSWorld: Evaluación comparativa de agentes multimodales para tareas abiertas en entornos informáticos reales
★ 3118+6Variación de estrellas de los últimos 7 días - #49
🤖 SDK de IA en TypeScript con tipado seguro e independiente del proveedor para chat en streaming, llamada a herramientas, agentes y aplicaciones multimodales en OpenAI, Anthropic, Gemini, React, Vue, Svelte y Solid.
★ 3057+15Variación de estrellas de los últimos 7 días - #50
InternLM-XComposer2.5-OmniLive: Un sistema multimodal completo para interacciones de video y audio en streaming de larga duración
★ 2925-1Variación de estrellas de los últimos 7 días - #51
La capa de contexto para datos no estructurados: conjuntos de datos tipados y versionados sobre S3, GCS y Azure
★ 2816+5Variación de estrellas de los últimos 7 días - #52
Calcula fácilmente incrustaciones de CLIP y construye un sistema de recuperación basado en ellas
★ 2796+1Variación de estrellas de los últimos 7 días - #53
Imágenes para inferencia sin etiquetado (utiliza modelos fundacionales para entrenar modelos supervisados).
★ 2770+3Variación de estrellas de los últimos 7 días - #54
Optimiza el proceso de ajuste fino (fine-tuning) para modelos multimodales: PaliGemma 2, Florence-2 y Qwen2.5-VL.
★ 2695+1Variación de estrellas de los últimos 7 días - #55
[EMNLP-2024] Construye agentes de lenguaje multimodales para prototipado rápido y producción
★ 2666+1Variación de estrellas de los últimos 7 días - #56
Recursos completos sobre IA generativa, incluyendo una hoja de ruta detallada, proyectos, casos de uso, preparación para entrevistas y preparación de código.
★ 2610+1Variación de estrellas de los últimos 7 días - #57
Repositorio oficial de OFA (ICML 2022). Artículo: OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework
★ 2557+0Variación de estrellas de los últimos 7 días - #58★ 2539+0Variación de estrellas de los últimos 7 días
- #59
HuixiangDou: Superando escenarios de chat grupal con asistencia técnica basada en LLM
★ 2502+2Variación de estrellas de los últimos 7 días - #60
(ෆ`꒳´ෆ) Un estudio sobre generación y síntesis de texto a imagen.
★ 2444+0Variación de estrellas de los últimos 7 días