speech-recognition
Erfasste Open-Source-Repos mit dem Tag speech-recognition, sortiert nach Sternen.
- #121★ 719+0Sterne-Änderung der letzten 7 Tage
- #122★ 718+0Sterne-Änderung der letzten 7 Tage
- #123
Open-Source-Toolkit für End-to-End-Spracherkennung unter Verwendung von PyTorch-Lightning und Hydra.
★ 714+0Sterne-Änderung der letzten 7 Tage - #124★ 712+3Sterne-Änderung der letzten 7 Tage
- #125
Sprach-API-Beispiele
★ 708+0Sterne-Änderung der letzten 7 Tage - #126
Speech-to-Text-Benchmark-Framework
★ 697+0Sterne-Änderung der letzten 7 Tage - #127
Offline-Spracherkennung mit OpenAI Whisper und TensorFlow Lite für Android
★ 688+0Sterne-Änderung der letzten 7 Tage - #128
INTERSPEECH 2023-2024 Papers: Eine vollständige Sammlung einflussreicher und spannender Forschungspapiere der INTERSPEECH 2023-24 Konferenz. Entdecken Sie die neuesten Fortschritte in der Sprach- und Textverarbeitung. Code enthalten. Sternen Sie das Repository, um den Fortschritt der Sprachtechnologie zu unterstützen!
★ 684+0Sterne-Änderung der letzten 7 Tage - #129
Ein kostenloser Audiodatensatz gesprochener Ziffern. Eine Audio-Version von MNIST.
★ 678+0Sterne-Änderung der letzten 7 Tage - #130
Spracherkennung für React-Native-Expo-Projekte
★ 678+6Sterne-Änderung der letzten 7 Tage - #131
Ein industrietaugliches All-in-One-ASR-System auf dem neuesten Stand der Technik mit ASR-, VAD-, LID- und Punc-Modulen. FireRedASR2 unterstützt Chinesisch (Mandarin, über 20 Dialekte/Akzente), Englisch, Code-Switching sowie Sprache- und Gesangs-ASR. FireRedVAD unterstützt Sprache/Gesang/Musik in über 100 Sprachen. FireRedLID unterstützt über 100 Sprachen und über 20 chinesische Dialekte. FireRedPunc unterstützt Chinesisch und Englisch.
★ 672+13Sterne-Änderung der letzten 7 Tage - #132★ 671+0Sterne-Änderung der letzten 7 Tage
- #133
Befehlszeilenschnittstelle für die integrierten Spracherkennungs- und Transkriptionsfunktionen in macOS.
★ 669+0Sterne-Änderung der letzten 7 Tage - #134
ChatGPT zu Hause! Eine bessere Alternative zu kommerziellen Smart-Home-Assistenten, basierend auf dem Raspberry Pi mit LiteLLM und LangGraph.
★ 648+1Sterne-Änderung der letzten 7 Tage - #135
:speech_balloon: /so.nus/ STT (Speech-to-Text) für Node mit Offline-Hotword-Erkennung
★ 638+0Sterne-Änderung der letzten 7 Tage - #136
Android Input Method Editor (IME) basierend auf Whisper
★ 633+6Sterne-Änderung der letzten 7 Tage - #137
Echtzeit-Audioübersetzung, die System-Audio und Mikrofon erfasst, ASR (Whisper/SenseVoice) ausführt und via LLM-API mit Streaming-Anzeige übersetzt. Ideal für VTuber, Livestreamer und das Ansehen fremdsprachiger Inhalte.
★ 626+38Sterne-Änderung der letzten 7 Tage - #138
Echtzeit-Transkription mit faster-whisper
★ 614+0Sterne-Änderung der letzten 7 Tage - #139
C++ ggml Runtime-Hub für mehrsprachige ASR- und TTS-Modelle: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2 sowie universelles Forced Alignment und mehr.
★ 611+20Sterne-Änderung der letzten 7 Tage - #140
Connectionist Temporal Classification (CTC)-Decoder mit Wörterbuch und Sprachmodell.
★ 580+1Sterne-Änderung der letzten 7 Tage - #141
Eine optimierte Speech-to-Text-Pipeline für das Whisper-Modell mit Unterstützung für mehrere Inferenz-Engines
★ 578+1Sterne-Änderung der letzten 7 Tage - #142
Das selbstkodierende System für Ihre App – Alan AI SDK für React Native.
★ 575+0Sterne-Änderung der letzten 7 Tage - #143
Eine modulare Node-Programmiersprache, Programm-Editor, Animationssystem, Toolkit, Router und Debugger für VRChat.
★ 562-1Sterne-Änderung der letzten 7 Tage - #144
Ein Overlay, das die Mikrofonberechtigung des Benutzers abfragt und Spracheingaben in einer anpassbaren Benutzeroberfläche als Text ausgibt.
★ 557+1Sterne-Änderung der letzten 7 Tage - #145
SpeechIO Leaderboard: eine große, robuste und umfassende Benchmarking-Plattform für automatische Spracherkennung.
★ 553+3Sterne-Änderung der letzten 7 Tage - #146
Liste der STT-APIs für koreanische Spracherkennung inklusive Leistungsbenchmarks
★ 547+1Sterne-Änderung der letzten 7 Tage - #147
Blitzschnelle, kostenlose und lokale Sprachdiktat-Software für macOS mit On-Device-Transkription
★ 541+14Sterne-Änderung der letzten 7 Tage - #148
Hochwertiger, interaktiver Speech-to-Speech-Agent mit Streaming-Funktion in einer einzigen Datei.
★ 540+0Sterne-Änderung der letzten 7 Tage - #149
Engine für automatische Spracherkennung (ASR) und Text-to-Speech (TTS). Unterstützt Chinesisch, Englisch und weitere Sprachen mit hoher Genauigkeit und Multi-Rollen-Sprachsynthese
★ 530+1Sterne-Änderung der letzten 7 Tage - #150
Eine Spracherkennungsbibliothek für den Browser, basierend auf einem WebAssembly-Build von Vosk.
★ 529+1Sterne-Änderung der letzten 7 Tage