speech-to-text
Erfasste Open-Source-Repos mit dem Tag speech-to-text, sortiert nach Sternen.
- #121
Sammlung von Ressourcen zu Anwendungen von Large Language Models (LLMs) in der Audio-KI.
★ 738+1Sterne-Änderung der letzten 7 Tage - #122
Ein in PyTorch implementiertes Framework für die automatische Spracherkennung (Streaming und Non-Streaming), das sowohl Online- als auch Offline-Erkennung unterstützt, derzeit die Modelle Conformer, Squeezeformer und DeepSpeech2 sowie verschiedene Datenaugmentierungsmethoden unterstützt.
★ 727+0Sterne-Änderung der letzten 7 Tage - #123
Rapida ist eine Open-Source-End-to-End-Voice-AI-Orchestrierungsplattform zum Erstellen von Echtzeit-Sprachassistenten mit Audiostreaming, STT, TTS, VAD, Mehrkanalintegration, Agenten-Zustandsverwaltung und Observability.
★ 723+2Sterne-Änderung der letzten 7 Tage - #124★ 719+0Sterne-Änderung der letzten 7 Tage
- #125★ 718+0Sterne-Änderung der letzten 7 Tage
- #126
Sprach-API-Beispiele
★ 707+0Sterne-Änderung der letzten 7 Tage - #127
Speech-to-Text-Benchmark-Framework
★ 698+0Sterne-Änderung der letzten 7 Tage - #128
Eine kostenlose lokale Desktop-App zum Extrahieren von Untertiteln (SRT) aus Videos und Übersetzen in jede Sprache – unbegrenzte Nutzung, keine Registrierung, keine Cloud.
★ 684+27Sterne-Änderung der letzten 7 Tage - #129
Spracherkennung für React-Native-Expo-Projekte
★ 678+7Sterne-Änderung der letzten 7 Tage - #130
Transkribiert und übersetzt Sprache mithilfe von Whisper und LLMs (GPT, Claude etc.) in eine LRC-Datei.
★ 675+0Sterne-Änderung der letzten 7 Tage - #131★ 671+0Sterne-Änderung der letzten 7 Tage
- #132
:speech_balloon: /so.nus/ STT (Speech-to-Text) für Node mit Offline-Hotword-Erkennung
★ 638+0Sterne-Änderung der letzten 7 Tage - #133
Erstellung einer Software zur automatischen Überwachung bei Online-Prüfungen
★ 634-1Sterne-Änderung der letzten 7 Tage - #134
Schnelle, private und lokal arbeitende Sprach-App für Apple Silicon Macs – Diktierfunktion, Datei-/Medientranskription, Meeting-Aufzeichnung, Transformationen und ein öffentliches Automatisierungs-CLI. Kostenlos und Open Source.
★ 630+17Sterne-Änderung der letzten 7 Tage - #135★ 620+3Sterne-Änderung der letzten 7 Tage
- #136
Echtzeit-Transkription mit faster-whisper
★ 614+0Sterne-Änderung der letzten 7 Tage - #137
C++ ggml Runtime-Hub für mehrsprachige ASR- und TTS-Modelle: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2 sowie universelles Forced Alignment und mehr.
★ 612+22Sterne-Änderung der letzten 7 Tage - #138
Eine Open-Source-Sprach-IME (Tastatur) für Android unter Verwendung der Vosk-Bibliothek.
★ 581+3Sterne-Änderung der letzten 7 Tage - #139
Eine Python-Bibliothek zur Lösung von reCAPTCHA v2 und v3 mit Playwright
★ 579+5Sterne-Änderung der letzten 7 Tage - #140
Eine optimierte Speech-to-Text-Pipeline für das Whisper-Modell mit Unterstützung für mehrere Inferenz-Engines
★ 578+1Sterne-Änderung der letzten 7 Tage - #141
Eine modulare Node-Programmiersprache, Programm-Editor, Animationssystem, Toolkit, Router und Debugger für VRChat.
★ 563-2Sterne-Änderung der letzten 7 Tage - #142
Ein Overlay, das die Mikrofonberechtigung des Benutzers abfragt und Spracheingaben in einer anpassbaren Benutzeroberfläche als Text ausgibt.
★ 557+1Sterne-Änderung der letzten 7 Tage - #143
Liste der STT-APIs für koreanische Spracherkennung inklusive Leistungsbenchmarks
★ 547+1Sterne-Änderung der letzten 7 Tage - #144
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 544—Sterne-Änderung der letzten 7 Tage - #145
Blitzschnelle, kostenlose und lokale Sprachdiktat-Software für macOS mit On-Device-Transkription
★ 542+15Sterne-Änderung der letzten 7 Tage - #146
Eine Spracherkennungsbibliothek für den Browser, basierend auf einem WebAssembly-Build von Vosk.
★ 529+1Sterne-Änderung der letzten 7 Tage - #147
Phonetisaurus G2P
★ 521-1Sterne-Änderung der letzten 7 Tage - #148
Dieses Tool verwendet KI zur Bewertung Ihrer Aussprache
★ 517+2Sterne-Änderung der letzten 7 Tage - #149
Open-Source-Software für Audio- und Videotranskription
★ 515+2Sterne-Änderung der letzten 7 Tage - #150
Open-Source, lokaler und selbst gehosteter, hochoptimierter Sprachinferenz-Server mit Unterstützung für ASR/STT, TTS und LLM über WebRTC, REST und WS.
★ 512+0Sterne-Änderung der letzten 7 Tage