speech-recognition
Erfasste Open-Source-Repos mit dem Tag speech-recognition, sortiert nach Sternen.
- #91
Das Zentrum für Audio-KI-Forschung: Arbeiten, offene Modelle, Benchmarks und Datensätze über Audio-LLMs, Spracherkennung, TTS, Musik und Audiogenerierung.
★ 953+1Sterne-Änderung der letzten 7 Tage - #92
schlüsselfertiger, selbstgehosteter Offline-Transkriptions- und Diarisierungsdienst mit LLM-Zusammenfassung
★ 948+1Sterne-Änderung der letzten 7 Tage - #93
Whisper.net. Spracherkennung leicht gemacht mit Whisper Modellen.
★ 941+2Sterne-Änderung der letzten 7 Tage - #94★ 939+0Sterne-Änderung der letzten 7 Tage
- #95
Ein Python-basierter Desktop-Sprachassistent, der in der Lage ist, Systembefehle auszuführen, Spracherkennung und Text-to-Speech zu integrieren sowie asynchrone Benutzerinteraktionen zu verarbeiten.
★ 919+12Sterne-Änderung der letzten 7 Tage - #96
Optimierte Whisper-Modelle für Streaming und den Einsatz auf Geräten
★ 897+1Sterne-Änderung der letzten 7 Tage - #97
Ein sprechendes LLM, das auf deinem eigenen Computer ohne Internetverbindung läuft.
★ 891+3Sterne-Änderung der letzten 7 Tage - #98
:speech_balloon: SpeechPy – Eine Bibliothek für Sprachverarbeitung und -erkennung: http://speechpy.readthedocs.io/en/latest/
★ 883+0Sterne-Änderung der letzten 7 Tage - #99
End-to-End-Mandarin-Spracherkennung basierend auf PaddlePaddle, von den Grundlagen zur Praxis: ein super einfaches Einstiegsbeispiel und ein hochpraktisches Unternehmensprojekt. Unterstützt die aktuell beliebtesten Modelle DeepSpeech2, Conformer und Squeezeformer.
★ 870+0Sterne-Änderung der letzten 7 Tage - #100
💬 Spracherkennung für Ihre React-App
★ 842+2Sterne-Änderung der letzten 7 Tage - #101
Connectionist Temporal Classification (CTC) Decodierungsalgorithmen: Best Path, Beam Search, Lexicon Search, Prefix Search und Token Passing. Implementiert in Python.
★ 836+0Sterne-Änderung der letzten 7 Tage - #102
Erstellen Sie Echtzeit-Speech-to-Text-Web-Apps mit OpenAIs Whisper https://openai.com/blog/whisper/
★ 835+1Sterne-Änderung der letzten 7 Tage - #103★ 823+0Sterne-Änderung der letzten 7 Tage
- #104
🎤 Lobe TTS – Eine hochwertige und zuverlässige TTS/STT-Bibliothek für Server und Browser
★ 805+3Sterne-Änderung der letzten 7 Tage - #105
Sprache zu Text zu Sprache. Song wird jetzt abgespielt. Sendet Text als OSC-Nachrichten an VRChat zur Anzeige auf dem Avatar. (STTTS) (Sprache zu TTS) (VRC-STT-System) (VTuber-TTS)
★ 802+0Sterne-Änderung der letzten 7 Tage - #106
Kostenlose, Open-Source-basierte, 100 % offline funktionierende Sprachdiktat-Software für Linux. Sprechen und tippen Sie überall über whisper.cpp-, Whisper- und VOSK-Engines, GPU-beschleunigt, funktioniert unter X11 und Wayland!
★ 802+10Sterne-Änderung der letzten 7 Tage - #107
React-Native-Binding für whisper.cpp.
★ 800-1Sterne-Änderung der letzten 7 Tage - #108
Lokaler Sprach-Chatbot für ansprechende Konversationen, basierend auf Ollama, Hugging Face Transformers und dem Coqui TTS Toolkit
★ 787+0Sterne-Änderung der letzten 7 Tage - #109
Projekt, mit dem ein Mikrofon mit OpenAI Whisper verwendet werden kann.
★ 787+0Sterne-Änderung der letzten 7 Tage - #110
Der einfachste Weg, Audio in Swift zu transkribieren
★ 785+0Sterne-Änderung der letzten 7 Tage - #111★ 783+12Sterne-Änderung der letzten 7 Tage
- #112
Eine zu 100 % private KI-Sprachtranskriptions-App, die Sprache in über 100 Sprachen in Text umwandelt. Entwickelt mit Compose Multiplatform für Android und iOS unter Verwendung von Whisper AI – keine Cloud-Uploads, die gesamte Verarbeitung erfolgt auf dem Gerät für absolute Privatsphäre.
★ 777-1Sterne-Änderung der letzten 7 Tage - #113
📦 Schnelle Konvertierung zwischen chinesischen und arabischen Ziffern (Neueste Funktionen: Brüche, Datumsangaben, Temperaturen usw.)
★ 766+0Sterne-Änderung der letzten 7 Tage - #114★ 763+1Sterne-Änderung der letzten 7 Tage
- #115
Auf PaddlePaddle basierende Spracherkennung für Chinesisch. Ausgereiftes Projekt mit hervorragenden Erkennungsergebnissen. Unterstützt Training und Vorhersage unter Windows und Linux sowie auf Nvidia Jetson-Entwicklerboards.
★ 762+0Sterne-Änderung der letzten 7 Tage - #116★ 754+1Sterne-Änderung der letzten 7 Tage
- #117
Ausführen eines Speech-to-Text-Modells (whisper.cpp) in Unity3d auf Ihrem lokalen Computer.
★ 751+0Sterne-Änderung der letzten 7 Tage - #118
Allosaurus ist ein vortrainierter universeller Phonem-Erkenner für über 2000 Sprachen
★ 745+0Sterne-Änderung der letzten 7 Tage - #119
Private Spracherkennungs-Tastatur und ein -Dienst für Android, die lokal auf dem Gerät laufen.
★ 744+5Sterne-Änderung der letzten 7 Tage - #120
Ein in PyTorch implementiertes Framework für die automatische Spracherkennung (Streaming und Non-Streaming), das sowohl Online- als auch Offline-Erkennung unterstützt, derzeit die Modelle Conformer, Squeezeformer und DeepSpeech2 sowie verschiedene Datenaugmentierungsmethoden unterstützt.
★ 727+0Sterne-Änderung der letzten 7 Tage