speech
Erfasste Open-Source-Repos mit dem Tag speech, sortiert nach Sternen.
- #31★ 2.818+1Sterne-Änderung der letzten 7 Tage
- #32
💬 SpeechGPT ist eine Webanwendung, mit der du dich mit ChatGPT unterhalten kannst.
★ 2.750-1Sterne-Änderung der letzten 7 Tage - #33
Python-Bibliothek und CLI-Tool zur Schnittstellenanbindung an die Text-to-Speech-API von Google Translate
★ 2.628+0Sterne-Änderung der letzten 7 Tage - #34
Sprachaktivitätserkennung (VAD): Latenzarm, leistungsstark und leichtgewichtig
★ 2.256+7Sterne-Änderung der letzten 7 Tage - #35
Steuerbare und schnelle Text-to-Speech-Technologie für über 7000 Sprachen!
★ 2.207-1Sterne-Änderung der letzten 7 Tage - #36★ 2.170+3Sterne-Änderung der letzten 7 Tage
- #37
Kostenloser, hochwertiger Text-to-Speech-API-Endpunkt als Ersatz für OpenAI, Azure oder ElevenLabs
★ 2.075+5Sterne-Änderung der letzten 7 Tage - #38
Praat: Phonetik am Computer
★ 1.970+1Sterne-Änderung der letzten 7 Tage - #39★ 1.935+1Sterne-Änderung der letzten 7 Tage
- #40
Community-Liste von Start-ups, die mit KI in der Audio- und Musiktechnologie arbeiten
★ 1.769+1Sterne-Änderung der letzten 7 Tage - #41★ 1.521+3Sterne-Änderung der letzten 7 Tage
- #42
Allgemeine Sprachwiederherstellung
★ 1.375+0Sterne-Änderung der letzten 7 Tage - #43
Steuerbare Transkription. Wortgetreu (jede Füllwörter, Pausen, Stottern, Vokallaute) oder beabsichtigt (was der Sprecher sagen wollte, optimiert für Lesbarkeit) mit Zeitstempeln auf Wortebene.
★ 1.371+13Sterne-Änderung der letzten 7 Tage - #44
Relevante Forschungsarbeiten im Bereich der natürlichen Sprachverarbeitung (inkl. Lesepotizen), Modellreproduktionen und Datenverarbeitung (Code in TensorFlow- und PyTorch-Versionen)
★ 1.333+1Sterne-Änderung der letzten 7 Tage - #45
MTools ist eine leistungsstarke, vielseitige Desktop-Anwendung mit integrierten Audio- und Videoverarbeitungs-, Bildbearbeitungs-, Textbearbeitungs- und Codierungstools sowie KI-Erweiterungen. Entwickelt, um Ihren Arbeitsablauf zu vereinfachen und die Produktivität zu steigern.
★ 1.305+5Sterne-Änderung der letzten 7 Tage - #46
StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.
★ 1.288+0Sterne-Änderung der letzten 7 Tage - #47
Videos, Notizen und Experimente zum Verständnis von Deep Learning
★ 1.198+0Sterne-Änderung der letzten 7 Tage - #48★ 1.149-1Sterne-Änderung der letzten 7 Tage
- #49
[Inoffizielle] PyTorch-Implementierung von „Conformer: Convolution-augmented Transformer for Speech Recognition“ (INTERSPEECH 2020)
★ 1.132+1Sterne-Änderung der letzten 7 Tage - #50★ 1.040+1Sterne-Änderung der letzten 7 Tage
- #51
Ein Open-Source-LLM-basiertes TTS-Fundamentalsystem
★ 920+1Sterne-Änderung der letzten 7 Tage - #52
CNN-basiertes Toolkit zur Audiosegmentierung. Ermöglicht das Erkennen von Sprache, Musik, Rauschen und Sprechergeschlecht. Wurde für großangelegte Studien zur Geschlechtergerechtigkeit auf Basis der Sprechzeit pro Geschlecht entwickelt.
★ 910+1Sterne-Änderung der letzten 7 Tage - #53
DiffWave ist ein schneller, hochqualitativer neuronaler Vocoder und Wellenformsynthesizer.
★ 885+0Sterne-Änderung der letzten 7 Tage - #54★ 881-1Sterne-Änderung der letzten 7 Tage
- #55
End-to-End-Mandarin-Spracherkennung basierend auf PaddlePaddle, von den Grundlagen zur Praxis: ein super einfaches Einstiegsbeispiel und ein hochpraktisches Unternehmensprojekt. Unterstützt die aktuell beliebtesten Modelle DeepSpeech2, Conformer und Squeezeformer.
★ 870-1Sterne-Änderung der letzten 7 Tage - #56
Voxtral ASR & TTS läuft nativ und im Browser. Eine Rust-Implementierung von Mistrals Voxtral mini Echtzeit-ASR / TTS unter Verwendung des Burn ML Frameworks
★ 819+2Sterne-Änderung der letzten 7 Tage - #57
Ein interaktiver Omni-Avatar in Echtzeit, basiert auf LiveKit, mit dem sich nahtlos beliebige Open-Source-Avatar-Komponenten (Echtzeitmodell, Visualisierung, Sprache, Speicher, Suche usw.) integrieren lassen.
★ 813+4Sterne-Änderung der letzten 7 Tage - #58★ 771+0Sterne-Änderung der letzten 7 Tage
- #59★ 755+9Sterne-Änderung der letzten 7 Tage
- #60
Allosaurus ist ein vortrainierter universeller Phonem-Erkenner für über 2000 Sprachen
★ 746+4Sterne-Änderung der letzten 7 Tage