FireRedTeam
Repositorios de código abierto monitorizados de FireRedTeam, ordenados por estrellas.
- #1
FireRed-OpenStoryline es un agente de edición de video con IA que transforma la edición manual en dirección impulsada por intenciones a través de interacción en lenguaje natural, planificación impulsada por LLM y orquestación precisa de herramientas. Facilita la creación transparente con participación humana y habilidades de estilo reutilizables para una narrativa consistente y profesional.
★ 3352+96Variación de estrellas de los últimos 7 días - #2
Modelos ASR de grado industrial de código abierto que admiten mandarín, dialectos chinos e inglés, logrando un nuevo SOTA en benchmarks públicos de ASR en mandarín, y ofreciendo además una capacidad excepcional de reconocimiento de letras de canciones.
★ 1975+9Variación de estrellas de los últimos 7 días - #3
Sistema TTS de transmisión de larga duración para la generación de diálogos multilocutor
★ 1430+4Variación de estrellas de los últimos 7 días - #4
FireRed-Image-Edit es un modelo base de edición de imágenes potente que logra un rendimiento de vanguardia de código abierto con seguimiento preciso de instrucciones, generación de alta fidelidad, consistencia de identidad superior y fusión fluida de múltiples elementos.
★ 1350+8Variación de estrellas de los últimos 7 días - #5
Un sistema TTS fundamental potenciado por LLM de código abierto
★ 920+1Variación de estrellas de los últimos 7 días - #6
StoryMaker: hacia personajes consistentes en la generación de texto a imagen.
★ 723+1Variación de estrellas de los últimos 7 días - #7
Un sistema ASR integral de grado industrial con módulos ASR, VAD, LID y Punc. FireRedASR2 admite chino (mandarín, más de 20 dialectos/acentos), inglés, cambio de código, y reconocimiento de voz y canto. FireRedVAD admite voz/canto/música en más de 100 idiomas. FireRedLID admite más de 100 idiomas y más de 20 dialectos chinos. FireRedPunc admite chino e inglés.
★ 665+7Variación de estrellas de los últimos 7 días - #8
Una solución totalmente autohospedada para la interacción de voz dúplex completo
★ 584+2Variación de estrellas de los últimos 7 días - #9
Detección de actividad de voz y eventos de audio de grado industrial de última generación, compatible con más de 100 idiomas, superando a Silero-VAD, TEN-VAD, FunASR-VAD y WebRTC-VAD.
★ 517+8Variación de estrellas de los últimos 7 días