asr
Erfasste Open-Source-Repos mit dem Tag asr, sortiert nach Sternen.
- #61
GLM-ASR-Nano: Ein robustes Open-Source-Spracherkennungsmodell mit 1,5 Milliarden Parametern
★ 854+3Sterne-Änderung der letzten 7 Tage - #62
Voxtral ASR & TTS läuft nativ und im Browser. Eine Rust-Implementierung von Mistrals Voxtral mini Echtzeit-ASR / TTS unter Verwendung des Burn ML Frameworks
★ 819+2Sterne-Änderung der letzten 7 Tage - #63
🎙️ Ein intelligenter Sprach-Produktivitätsassistent, der Sprache in sauberen Text, nützliche Aktionen und strukturiertes Wissen verwandelt. Er hilft Benutzern, Ideen zu erfassen, natürlich zu kommunizieren, wiederkehrende Aufgaben zu automatisieren und über verschiedene Apps und Workflows hinweg produktiv zu bleiben.
★ 807+5Sterne-Änderung der letzten 7 Tage - #64
KI-VTuber mit LLM, ASR, TTS, OCR, CV und weiteren Technologien zum Livestreaming oder um mit dir Minecraft zu spielen.
★ 803+5Sterne-Änderung der letzten 7 Tage - #65
Ein auf Kotlin basierendes LLM- und ASR-Spracheingabe-Tastatur-App für die Android-Plattform
★ 772+17Sterne-Änderung der letzten 7 Tage - #66
📦 Schnelle Konvertierung zwischen chinesischen und arabischen Ziffern (Neueste Funktionen: Brüche, Datumsangaben, Temperaturen usw.)
★ 766+0Sterne-Änderung der letzten 7 Tage - #67
Auf PaddlePaddle basierende Spracherkennung für Chinesisch. Ausgereiftes Projekt mit hervorragenden Erkennungsergebnissen. Unterstützt Training und Vorhersage unter Windows und Linux sowie auf Nvidia Jetson-Entwicklerboards.
★ 763+0Sterne-Änderung der letzten 7 Tage - #68
Ausführen eines Speech-to-Text-Modells (whisper.cpp) in Unity3d auf Ihrem lokalen Computer.
★ 751+1Sterne-Änderung der letzten 7 Tage - #69
Ein in PyTorch implementiertes Framework für die automatische Spracherkennung (Streaming und Non-Streaming), das sowohl Online- als auch Offline-Erkennung unterstützt, derzeit die Modelle Conformer, Squeezeformer und DeepSpeech2 sowie verschiedene Datenaugmentierungsmethoden unterstützt.
★ 727+0Sterne-Änderung der letzten 7 Tage - #70
Open-Source-Toolkit für End-to-End-Spracherkennung unter Verwendung von PyTorch-Lightning und Hydra.
★ 714+0Sterne-Änderung der letzten 7 Tage - #71
Offline-Spracherkennung mit OpenAI Whisper und TensorFlow Lite für Android
★ 688+0Sterne-Änderung der letzten 7 Tage - #72
INTERSPEECH 2023-2024 Papers: Eine vollständige Sammlung einflussreicher und spannender Forschungspapiere der INTERSPEECH 2023-24 Konferenz. Entdecken Sie die neuesten Fortschritte in der Sprach- und Textverarbeitung. Code enthalten. Sternen Sie das Repository, um den Fortschritt der Sprachtechnologie zu unterstützen!
★ 684+0Sterne-Änderung der letzten 7 Tage - #73★ 677+0Sterne-Änderung der letzten 7 Tage
- #74
Ein industrietaugliches All-in-One-ASR-System auf dem neuesten Stand der Technik mit ASR-, VAD-, LID- und Punc-Modulen. FireRedASR2 unterstützt Chinesisch (Mandarin, über 20 Dialekte/Akzente), Englisch, Code-Switching sowie Sprache- und Gesangs-ASR. FireRedVAD unterstützt Sprache/Gesang/Musik in über 100 Sprachen. FireRedLID unterstützt über 100 Sprachen und über 20 chinesische Dialekte. FireRedPunc unterstützt Chinesisch und Englisch.
★ 672+13Sterne-Änderung der letzten 7 Tage - #75★ 671+0Sterne-Änderung der letzten 7 Tage
- #76
Echtzeit-Audioübersetzung, die System-Audio und Mikrofon erfasst, ASR (Whisper/SenseVoice) ausführt und via LLM-API mit Streaming-Anzeige übersetzt. Ideal für VTuber, Livestreamer und das Ansehen fremdsprachiger Inhalte.
★ 626+38Sterne-Änderung der letzten 7 Tage - #77
Theorie, Arbeiten und Präsentationen zur Spracherkennung
★ 618+0Sterne-Änderung der letzten 7 Tage - #78
🤗 Optimum Intel: Beschleunigung der Inferenz mit Intel-Optimierungstools
★ 617+1Sterne-Änderung der letzten 7 Tage - #79
Kommerzielle Open-Source-Bibliothek für automatische Spracherkennung, sofort einsatzbereit, plattformübergreifend, mit gemischter chinesisch-englischer Erkennung. Eine plattformübergreifende Implementierung der ASR-Inferenz, basierend auf ONNXRuntime und FunASR. Wir bieten eine Reihe einfacherer APIs zum Aufrufen von ASR-Modellen.
★ 611+0Sterne-Änderung der letzten 7 Tage - #80
Open-Source-Plattform für Sprachagenten.
★ 592+2Sterne-Änderung der letzten 7 Tage - #81
Eine optimierte Speech-to-Text-Pipeline für das Whisper-Modell mit Unterstützung für mehrere Inferenz-Engines
★ 578+1Sterne-Änderung der letzten 7 Tage - #82
Eine plattformübergreifende Software zur Echtzeit-Untertitelanzeige.
★ 578+4Sterne-Änderung der letzten 7 Tage - #83
SpeechIO Leaderboard: eine große, robuste und umfassende Benchmarking-Plattform für automatische Spracherkennung.
★ 553+3Sterne-Änderung der letzten 7 Tage - #84
Eine Spracherkennungsbibliothek für den Browser, basierend auf einem WebAssembly-Build von Vosk.
★ 529+1Sterne-Änderung der letzten 7 Tage - #85
ICASSP 2023-2024 Papers: Eine vollständige Sammlung einflussreicher und spannender Forschungsarbeiten der ICASSP 2023-24 Konferenzen. Entdecken Sie die neuesten Fortschritte in Akustik, Sprach- und Signalverarbeitung. Inklusive Code.
★ 526+1Sterne-Änderung der letzten 7 Tage - #86
KI-Chatbot im Taschenformat, basierend auf einem RPI Zero 2w / 5
★ 513+10Sterne-Änderung der letzten 7 Tage - #87
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501+7Sterne-Änderung der letzten 7 Tage