asr
Erfasste Open-Source-Repos mit dem Tag asr, sortiert nach Sternen.
- #31
Echtzeit-Spracherkennung und Spracherkennungs-Erkennung (VAD) mit der nächsten Generation von Kaldi und ncnn ohne Internetverbindung. Unterstützt iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A usw.
★ 1.777-2Sterne-Änderung der letzten 7 Tage - #32
Bailing ist ein GPT-4o-ähnlicher Sprachchatbot, der über ASR+LLM+TTS realisiert wird, hervorragende große Sprachmodelle wie DeepSeek R1 integriert und openClaw anbindet.
★ 1.759+2Sterne-Änderung der letzten 7 Tage - #33
Speech Note Linux-App. Notizen erstellen, lesen und übersetzen mit Offline-Spracherkennung (Speech-to-Text), Sprachsynthese (Text-to-Speech) und maschineller Übersetzung.
★ 1.622+13Sterne-Änderung der letzten 7 Tage - #34
Analysieren von Videos mithilfe von LLMs, Computer Vision und automatischer Spracherkennung
★ 1.570+11Sterne-Änderung der letzten 7 Tage - #35
🎙️ KI-Diktier-App – Open Source und Local-First ⚡ 3x schneller tippen, keine Tastatur erforderlich. 🆓 Angetrieben von Open-Source-Modellen, offline funktionsfähig, schnell und präzise.
★ 1.520+14Sterne-Änderung der letzten 7 Tage - #36
Open-Source-LLM-basiertes ASR-Modellfamilie für Chinesisch, Dialekte, Akzente und mehrsprachige Sprache, mit FunASR, vLLM, Streaming- und llama.cpp-Runtimes.
★ 1.512+14Sterne-Änderung der letzten 7 Tage - #37
🍦 Speech-AI-Forge ist ein rund um TTS-Generierungsmodelle entwickeltes Projekt, das einen API-Server und ein Gradio-basiertes WebUI implementiert.
★ 1.418+2Sterne-Änderung der letzten 7 Tage - #38
Synchronisierte Übersetzung für Videos. Videovertonung
★ 1.413+3Sterne-Änderung der letzten 7 Tage - #39
Steuerbare Transkription. Wortgetreu (jede Füllwörter, Pausen, Stottern, Vokallaute) oder beabsichtigt (was der Sprecher sagen wollte, optimiert für Lesbarkeit) mit Zeitstempeln auf Wortebene.
★ 1.371+21Sterne-Änderung der letzten 7 Tage - #40★ 1.347+6Sterne-Änderung der letzten 7 Tage
- #41
Interaktiver digitaler Mensch in Echtzeit mit anpassbarem Erscheinungsbild und Stimme, Unterstützung für Stimmenklonen und einer Dialogverzögerung von nur 3 Sekunden.
★ 1.303+0Sterne-Änderung der letzten 7 Tage - #42
StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.
★ 1.288+1Sterne-Änderung der letzten 7 Tage - #43
WebSocket-, gRPC- und WebRTC-Spracherkennungsserver basierend auf Vosk- und Kaldi-Bibliotheken
★ 1.262+2Sterne-Änderung der letzten 7 Tage - #44
Feinabstimmung des Whisper-Spracherkennungsmodells zur Unterstützung des Trainings ohne Zeitstempeldaten, mit Zeitstempeldaten und ohne Sprachdaten. Beschleunigt die Inferenz und unterstützt Web-, Windows-Desktop- und Android-Bereitstellung
★ 1.222-1Sterne-Änderung der letzten 7 Tage - #45
KI-Sprach-Toolkit für Apple Silicon – ASR, TTS, Speech-to-Speech, VAD und Diarisierung, angetrieben durch MLX und CoreML
★ 1.161+11Sterne-Änderung der letzten 7 Tage - #46
Erste für die reale Welt entwickelte ASR-Grundlage – 7 atomare akustische Bedingungen, 54 zusammengesetzte Szenarien, 2,6 Mio. Samples und bis zu ca. 30 % Leistungssteigerung gegenüber SOTA, wo alle anderen Modelle versagen. **Du wirst zu MEGA-ASR zurückkehren, nachdem die anderen im Praxistest versagt haben. ⭐**
★ 1.136+3Sterne-Änderung der letzten 7 Tage - #47
[Inoffizielle] PyTorch-Implementierung von „Conformer: Convolution-augmented Transformer for Speech Recognition“ (INTERSPEECH 2020)
★ 1.132+1Sterne-Änderung der letzten 7 Tage - #48
SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.
★ 1.105+107Sterne-Änderung der letzten 7 Tage - #49
Offline-Spracherkennung für Android mit der Vosk-Bibliothek.
★ 1.056+0Sterne-Änderung der letzten 7 Tage - #50★ 1.055+4Sterne-Änderung der letzten 7 Tage
- #51
Vollständig lokale, private und plattformübergreifende Spracherkennung (Speech-to-Text) mit LLM-Nachbearbeitung
★ 1.051+13Sterne-Änderung der letzten 7 Tage - #52★ 1.040+0Sterne-Änderung der letzten 7 Tage
- #53★ 984+2Sterne-Änderung der letzten 7 Tage
- #54★ 939+0Sterne-Änderung der letzten 7 Tage
- #55
VocoType ist ein datenschutzfreundliches, lokales Spracheingabetool, das Sprache über Tastenkombinationen in Echtzeit in Text umwandelt und automatisch in die aktuelle Anwendung einfügt. Es unterstützt Speech-to-Text-MCP, KI-Textoptimierung, benutzerdefinierte Ersetzungswörterbücher, Audio-/Video-Transkription und weitere Funktionen, die die Spracheingabe effizienter und sicherer machen.
★ 924+2Sterne-Änderung der letzten 7 Tage - #56
Dieses Projekt stellt eine API mit Unterstützung für benutzerbasierte Zugriffskontrolle bereit, um Sprache mit einem feinabgestimmten und verarbeiteten Whisper-ASR-Modell in Text umzuwandeln.
★ 914+0Sterne-Änderung der letzten 7 Tage - #57
🔥🔥🔥 Kostenlose Offline-KI-Algorithmen-Toolbox für Java mit Unterstützung für Gesichtserkennung, Liveness-Erkennung, Gesichtsausdruckserkennung, Objekterkennung, Instanzsegmentierung, Fußgängererkennung, OCR-Texterkennung, Nummernschilderkennung, Tabellenerkennung, ASR+TTS, maschinelle Übersetzung und mehr. Einfach über Maven einbinden. Unterstützt PyTorch, TensorFlow und integriert gängige Modelle wie Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5), Whisper usw.
★ 908+1Sterne-Änderung der letzten 7 Tage - #58
Ein benutzerfreundliches Toolkit für Spracherkennung, -transkription, -konvertierung usw.
★ 873+0Sterne-Änderung der letzten 7 Tage - #59
End-to-End-Mandarin-Spracherkennung basierend auf PaddlePaddle, von den Grundlagen zur Praxis: ein super einfaches Einstiegsbeispiel und ein hochpraktisches Unternehmensprojekt. Unterstützt die aktuell beliebtesten Modelle DeepSpeech2, Conformer und Squeezeformer.
★ 870+0Sterne-Änderung der letzten 7 Tage - #60
GLM-ASR-Nano: Ein robustes Open-Source-Spracherkennungsmodell mit 1,5 Milliarden Parametern
★ 854+4Sterne-Änderung der letzten 7 Tage