whisper
Repositorios de código abierto monitorizados etiquetados con whisper, ordenados por estrellas.
- #61
Ajuste fino de LLM en tu Mac con Apple Silicon. SFT, DPO, GRPO, Vision, TTS, STT, Embedding y ajuste fino de OCR, de forma nativa en MLX. API compatible con Unsloth.
★ 1398+8Variación de estrellas de los últimos 7 días - #62
Aplicación Whisper con múltiples backends. Extremadamente rápida, optimizada para Mac-arm, fácil de instalar. Transcribe archivos locales o URLs usando Whisper AI de forma privada y gratuita.
★ 1394+0Variación de estrellas de los últimos 7 días - #63
Transcripción controlable. Literal (incluyendo muletillas, pausas, tartamudeos, sonidos vocales) o intencionada (lo que el hablante quiso decir, optimizado para legibilidad) con marcas de tiempo a nivel de palabra.
★ 1371+13Variación de estrellas de los últimos 7 días - #64★ 1347+6Variación de estrellas de los últimos 7 días
- #65
Cliente de línea de comandos para Whisper, compatible con el cliente original de OpenAI y basado en CTranslate2.
★ 1346+2Variación de estrellas de los últimos 7 días - #66
Conversión de voz a texto con función push-to-talk para compositores de Wayland.
★ 1338+42Variación de estrellas de los últimos 7 días - #67
Gp.nvim: plugin de IA para Neovim que ofrece sesiones de ChatGPT, operaciones de texto/código y conversión de voz a texto [OpenAI, Ollama, Anthropic, etc.]
★ 1320+0Variación de estrellas de los últimos 7 días - #68
MTools es una potente aplicación de escritorio multifuncional que integra procesamiento de audio y vídeo, edición de imágenes, operaciones de texto y herramientas de codificación, con funciones de IA integradas. Diseñado para simplificar tu flujo de trabajo y mejorar la productividad.
★ 1305+5Variación de estrellas de los últimos 7 días - #69
Dale a Claude la capacidad de ver y entender videos: plugin de Claude Code con extracción de fotogramas y análisis de audio multimodal
★ 1281+6Variación de estrellas de los últimos 7 días - #70
Whisper es un formato de base de datos de series temporales basado en archivos para Graphite
★ 1262+0Variación de estrellas de los últimos 7 días - #71
Operador de inferencia de IA para Kubernetes. La forma más sencilla de servir modelos de ML en producción. Compatible con VLM, LLM, embeddings y conversión de voz a texto.
★ 1256+2Variación de estrellas de los últimos 7 días - #72
Ajuste fino del modelo de reconocimiento de voz Whisper para admitir entrenamiento sin datos de marcas de tiempo, con datos de marcas de tiempo y sin datos de voz. Acelera la inferencia y admite despliegue en la web, en escritorio con Windows y en Android
★ 1222-1Variación de estrellas de los últimos 7 días - #73★ 1199+3Variación de estrellas de los últimos 7 días
- #74
Conversión de voz a texto nativa para Linux: sistema de dictado global rápido, preciso, privado y hackeable
★ 1189+10Variación de estrellas de los últimos 7 días - #75
Genera subtítulos para vídeo y audio, creando archivos SRT. Sin necesidad de solicitar APIs de terceros, implementa la transcripción de audio de forma local. Un marco de generación de subtítulos de vídeo basado en Transformer.
★ 1179+3Variación de estrellas de los últimos 7 días - #76★ 1150+1Variación de estrellas de los últimos 7 días
- #77
VTuber con IA para streaming en YouTube/Twitch.
★ 1116+2Variación de estrellas de los últimos 7 días - #78
La aplicación de iOS de código abierto que hace que la transcripción de voz de calidad sea más accesible en dispositivos móviles.
★ 1102+8Variación de estrellas de los últimos 7 días - #79
💬📝 Una pequeña aplicación de dictado que utiliza el modelo de reconocimiento de voz Whisper de OpenAI.
★ 1100+2Variación de estrellas de los últimos 7 días - #80★ 1006-2Variación de estrellas de los últimos 7 días
- #81
Whisper-Flow es un framework diseñado para permitir la transcripción en tiempo real de contenido de audio utilizando el modelo Whisper de OpenAI. En lugar de procesar archivos completos tras la carga ("modo por lotes"), Whisper-Flow acepta un flujo continuo de fragmentos de audio y produce transcripciones incrementales de inmediato.
★ 964+28Variación de estrellas de los últimos 7 días - #82
Servicio de transcripción y diarización offline autohospedado con resúmenes mediante LLM
★ 948+2Variación de estrellas de los últimos 7 días - #83
Este proyecto proporciona una API con soporte de acceso a nivel de usuario para transcribir voz a texto utilizando un modelo Whisper ASR ajustado y procesado.
★ 914+0Variación de estrellas de los últimos 7 días - #84
OpenCluely es una alternativa gratuita y de código abierto a Cluely, diseñada para entrevistas técnicas como DSA, OAs y CP. Ofrece una superposición invisible, ayuda de IA en tiempo real, procesamiento inteligente de imágenes para capturar preguntas y soporte multilingüe: 100% personalizable y privado.
★ 912+41Variación de estrellas de los últimos 7 días - #85
Biblioteca de C# para Twitch Chat, Whisper, API y PubSub. Permite chatear, enviar mensajes privados, suscribirse a eventos de stream y modificar canales o cuentas. Compatible con todo lo que soporte .NETStandard 2.0.
★ 892+3Variación de estrellas de los últimos 7 días - #86
Generación por lotes de archivos de subtítulos para videos locales, con capacidad de traducción a otros idiomas. Soporte multiplataforma para Windows y macOS.
★ 873+2Variación de estrellas de los últimos 7 días - #87★ 868+0Variación de estrellas de los últimos 7 días
- #88
Un paquete no oficial de OpenAI para Unity que permite utilizar la API de OpenAI directamente en el motor de juegos Unity
★ 843+1Variación de estrellas de los últimos 7 días - #89
Cree aplicaciones web de voz a texto en tiempo real utilizando Whisper de OpenAI https://openai.com/blog/whisper/
★ 835+0Variación de estrellas de los últimos 7 días - #90
Implementación en Golang de un servidor Graphite/Carbon con arquitectura clásica: Agente -> Caché -> Persistidor.
★ 829+0Variación de estrellas de los últimos 7 días