speech-recognition
Erfasste Open-Source-Repos mit dem Tag speech-recognition, sortiert nach Sternen.
- #61
💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien
★ 1.399+0Sterne-Änderung der letzten 7 Tage - #62
Fine-Tuning von LLMs auf Ihrem Mac mit Apple Silicon. SFT-, DPO-, GRPO-, Vision-, TTS-, STT-, Embedding- und OCR-Fine-Tuning – nativ auf MLX. Unsloth-kompatible API.
★ 1.398+8Sterne-Änderung der letzten 7 Tage - #63
Steuerbare Transkription. Wortgetreu (jede Füllwörter, Pausen, Stottern, Vokallaute) oder beabsichtigt (was der Sprecher sagen wollte, optimiert für Lesbarkeit) mit Zeitstempeln auf Wortebene.
★ 1.371+13Sterne-Änderung der letzten 7 Tage - #64
Whisper-Kommandozeilenclient, kompatibel mit dem originalen OpenAI-Client basierend auf CTranslate2.
★ 1.346+2Sterne-Änderung der letzten 7 Tage - #65
Ein persönlicher Assistent, der mit Python-Bibliotheken erstellt wurde. Er erledigt fast alles, darunter das Senden von E-Mails, optische Texterkennung, dynamische Nachrichtenberichterstattung zu jeder Zeit mit API-Integration, Erstellung von To-Do-Listen, Öffnen von Websites per Sprachbefehl, Musikwiedergabe, Wikipedia-Suche, Wörterbuch mit intelligenter Erkennung (d. h. automatischer Rechtschreibprüfung), Wetterbericht (Temperatur, Windgeschwindigkeit, Luftfeuchtigkeit).
★ 1.341+5Sterne-Änderung der letzten 7 Tage - #66★ 1.338+42Sterne-Änderung der letzten 7 Tage
- #67
StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.
★ 1.288+0Sterne-Änderung der letzten 7 Tage - #68
Pruna ist ein für Entwickler entwickeltes Modelloptimierungs-Framework, mit dem Sie schnellere, effizientere Modelle mit minimalem Overhead bereitstellen können.
★ 1.274+1Sterne-Änderung der letzten 7 Tage - #69
WebSocket-, gRPC- und WebRTC-Spracherkennungsserver basierend auf Vosk- und Kaldi-Bibliotheken
★ 1.262+1Sterne-Änderung der letzten 7 Tage - #70
Feinabstimmung des Whisper-Spracherkennungsmodells zur Unterstützung des Trainings ohne Zeitstempeldaten, mit Zeitstempeldaten und ohne Sprachdaten. Beschleunigt die Inferenz und unterstützt Web-, Windows-Desktop- und Android-Bereitstellung
★ 1.222-1Sterne-Änderung der letzten 7 Tage - #71★ 1.212-1Sterne-Änderung der letzten 7 Tage
- #72
💁 Fantastische Sammlung von Transformers-Modellen für die natürliche Sprachverarbeitung mit Papers, Videos, Blogs, offiziellem Repository sowie Colab-Notebooks. 🛫☑️
★ 1.179+0Sterne-Änderung der letzten 7 Tage - #73
Ein praktisches Labor zum Erstellen, Testen und Evaluieren von Apps mit dem Foundation Models-Framework von Apple.
★ 1.178+1Sterne-Änderung der letzten 7 Tage - #74
Ein privates Logbuch mit einem Team persönlicher KI-Assistenten. Agents lesen, was Sie aufzeichnen, und schlagen die nächsten Schritte vor — Sie genehmigen die Änderungen. Ende-zu-Ende-verschlüsselte Synchronisierung zwischen Ihren eigenen Geräten — Server sehen stets nur Geheimtext. Lokale KI optional.
★ 1.168+3Sterne-Änderung der letzten 7 Tage - #75
KI-Sprach-Toolkit für Apple Silicon – ASR, TTS, Speech-to-Speech, VAD und Diarisierung, angetrieben durch MLX und CoreML
★ 1.161+4Sterne-Änderung der letzten 7 Tage - #76
Irina – ein russischer Sprachassistent für die Offline-Nutzung. Unterstützt Fähigkeiten über Plugins.
★ 1.153+0Sterne-Änderung der letzten 7 Tage - #77★ 1.149-1Sterne-Änderung der letzten 7 Tage
- #78
[Inoffizielle] PyTorch-Implementierung von „Conformer: Convolution-augmented Transformer for Speech Recognition“ (INTERSPEECH 2020)
★ 1.132+1Sterne-Änderung der letzten 7 Tage - #79
Das Self-Coding-System für Ihre App — Alan AI SDK für Cordova
★ 1.132+0Sterne-Änderung der letzten 7 Tage - #80
SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.
★ 1.118+143Sterne-Änderung der letzten 7 Tage - #81
KI-Vtuber zum Streamen auf YouTube und Twitch.
★ 1.115+1Sterne-Änderung der letzten 7 Tage - #82
Die Open-Source-iOS-App, die hochwertige Sprachtranskription auf Mobilgeräten zugänglicher macht.
★ 1.102+8Sterne-Änderung der letzten 7 Tage - #83
💬📝 Eine kleine Diktier-App, die das Whisper-Spracherkennungsmodell von OpenAI nutzt.
★ 1.100+2Sterne-Änderung der letzten 7 Tage - #84
Echtzeit-Vollduplex-Spracherkennungsserver, basierend auf dem Kaldi-Toolkit und dem GStreamer-Framework.
★ 1.094+1Sterne-Änderung der letzten 7 Tage - #85
Offline-Spracherkennung für Android mit der Vosk-Bibliothek.
★ 1.056+0Sterne-Änderung der letzten 7 Tage - #86★ 1.040+1Sterne-Änderung der letzten 7 Tage
- #87
:zap: TensorFlowASR: Fast dem Stand der Technik entsprechende automatische Spracherkennung in Tensorflow 2. Unterstützte Sprachen, die Zeichen oder Subwörter verwenden können
★ 1.010+0Sterne-Änderung der letzten 7 Tage - #88
Ein Bearbeitungstool, das KI nutzt, um Videomaterial zu transkribieren, Inhalte zu verstehen und nach beliebigen Elementen zu suchen, integriert mit ChatGPT und anderen KI-Modellen
★ 1.009+2Sterne-Änderung der letzten 7 Tage - #89★ 984+4Sterne-Änderung der letzten 7 Tage
- #90
Near-Realtime-Audio-Transkription mit selbstgehostetem Whisper und WebSocket in Python/JS
★ 960+1Sterne-Änderung der letzten 7 Tage