speech-to-text
Erfasste Open-Source-Repos mit dem Tag speech-to-text, sortiert nach Sternen.
- #31
Open-Source-Sprach-KI-Plattform. Self-Hosted-Alternative zu Vapi und Retell. On-Premise, BYOK für Speech-to-Speech oder LLM/STT/TTS, mit visuellem Workflow-Builder, MCP-nativ und Telefonie-Unterstützung.
★ 5.568+45Sterne-Änderung der letzten 7 Tage - #32
Open-Source-KI-Tool zur Videolokalisierung: automatischer Download von YouTube/Bilibili-Videos, Untertitelung und Übersetzung, Stimmklon-Synchronisation, Audiospur-Mischung und Untertitel-Einbettung.
★ 5.404+25Sterne-Änderung der letzten 7 Tage - #33
Spracherkennungstool für Text / Ein lokal laufendes Offline-Tool zur Audio- und Video-Untertitelung, das JSON-, SRT- und Reintextformate ausgibt.
★ 4.780+9Sterne-Änderung der letzten 7 Tage - #34
JAX-Implementierung des Whisper-Modells von OpenAI für eine bis zu 70-fache Beschleunigung auf TPUs.
★ 4.679-1Sterne-Änderung der letzten 7 Tage - #35★ 4.624+0Sterne-Änderung der letzten 7 Tage
- #36
Untertitelerzeugung auf dem Gerät, die sich direkt mit DaVinci Resolve, Premiere und After Effects verbindet.
★ 4.122+20Sterne-Änderung der letzten 7 Tage - #37
Leichtgewichtige und leistungsstarke Echtzeit-Audio-/Sprachübersetzungstool basierend auf Windows LiveCaptions.
★ 3.637+33Sterne-Änderung der letzten 7 Tage - #38
Taste gedrückt halten, sprechen, loslassen – KI-optimierter Text erscheint an Ihrem Cursor in jeder App. Open-Source-Spracheingabe für macOS & Windows.
★ 3.403+44Sterne-Änderung der letzten 7 Tage - #39
OpenAI Whisper ASR Webservice API
★ 3.328+2Sterne-Änderung der letzten 7 Tage - #40
Whisper & Faster-Whisper Standalone-Executables für alle, die sich nicht mit Python herumschlagen möchten.
★ 3.171+2Sterne-Änderung der letzten 7 Tage - #41
LLaMA-Omni ist ein latenzarmes und qualitativ hochwertiges End-to-End-Sprachinteraktionsmodell auf Basis von Llama-3.1-8B-Instruct mit dem Ziel, Sprachfunktionen auf GPT-4o-Niveau zu erreichen.
★ 3.147+1Sterne-Änderung der letzten 7 Tage - #42
Open-Source-, lokale und selbst gehostete Sprachassistenten-Alternative als Konkurrenz zu Amazon Echo/Google Home
★ 3.101+1Sterne-Änderung der letzten 7 Tage - #43
Transkribieren Sie jegliches Audio in Text, übersetzen und bearbeiten Sie Untertitel 100% lokal mit einer Web-Benutzeroberfläche. Unterstützt durch Whisper-Modelle!
★ 3.068+2Sterne-Änderung der letzten 7 Tage - #44★ 2.864+0Sterne-Änderung der letzten 7 Tage
- #45
Mehrsprachige automatische Spracherkennung mit wortgenauen Zeitstempeln und Konfidenzwerten
★ 2.842+1Sterne-Änderung der letzten 7 Tage - #46
Open-Source-Meeting-Transkriptions-API für Google Meet, Microsoft Teams & Zoom. Automatisch beitretende Bots, Echtzeit-WebSocket-Transkripte, MCP-Server für KI-Agenten. Selbst gehostet oder als gehostetes SaaS.
★ 2.741+15Sterne-Änderung der letzten 7 Tage - #47
Modernste CoreML-Audiomodelle in Ihren Apps — Text-to-Speech, Speech-to-Text, Spracherkennung und Sprecherdiarisierung. In Swift, angetrieben von SOTA Open Source.
★ 2.723+13Sterne-Änderung der letzten 7 Tage - #48
Die Open-Source-Alternative zu Cluely – Ein blitzschneller, datenschutzorientierter KI-Assistent, der unbemerkt bei Meetings, Interviews und Gesprächen unterstützt. Mit Tauri für native Performance entwickelt, nur 10 MB groß. In Videoanrufen, Bildschirmfreigaben und Aufnahmen völlig unsichtbar.
★ 2.619+12Sterne-Änderung der letzten 7 Tage - #49
🐸STT – Das Deep-Learning-Toolkit für Speech-to-Text. Das Trainieren und Bereitstellen von STT-Modellen war noch nie so einfach.
★ 2.606+1Sterne-Änderung der letzten 7 Tage - #50★ 2.537+6Sterne-Änderung der letzten 7 Tage
- #51
🔊 Awesome-Liste für Whisper – ein von OpenAI entwickeltes, KI-gestütztes Open-Source-Spracherkennungssystem
★ 2.375+1Sterne-Änderung der letzten 7 Tage - #52
Bildschirminhalt aufnehmen, Demo veröffentlichen. Kostenlos und Open Source, GPU-beschleunigt, keine Wasserzeichen, keine Abonnements. Windows, macOS, Linux. Aktiv gewartet.
★ 2.287+122Sterne-Änderung der letzten 7 Tage - #53
Open-Source und kostenlose Alternative zu Wispr Flow | Desktop-Sprach-Workflow der nächsten Generation für Chinesisch, integriert mit lokalem FunASR-Modell und konfigurierbaren großen Sprachmodellen.
★ 2.278+5Sterne-Änderung der letzten 7 Tage - #54
Eine All-in-One-Inferenz-Engine in reinem C++ für Audiomodelle, angetrieben von ggml. Unterstützt TTS, STT, VAD, Sprachkonvertierung, Musikgenerierung und mehr bei hochoptimierter Leistung. Keine Python-Abhängigkeit.
★ 2.214+115Sterne-Änderung der letzten 7 Tage - #55
ASR/STT-Untertitelgenerator. Verwendet Qwen3-ASR, lokale LLM, Whisper, TEN-VAD. Rauschrobust für JAV
★ 2.196+17Sterne-Änderung der letzten 7 Tage - #56
🎙 Spracherkennung mit dem Deep-Learning-Framework TensorFlow und Sequence-to-Sequence-neuronalen Netzen
★ 2.173+0Sterne-Änderung der letzten 7 Tage - #57★ 2.170+3Sterne-Änderung der letzten 7 Tage
- #58★ 2.046+1Sterne-Änderung der letzten 7 Tage
- #59★ 1.892+2Sterne-Änderung der letzten 7 Tage
- #60
ggml Speech-to-Text Inferenz für über 16 Modellfamilien
★ 1.872+19Sterne-Änderung der letzten 7 Tage