Zum Hauptinhalt springen
buildradar
Sign in
Thema · asr

asr

Erfasste Open-Source-Repos mit dem Tag asr, sortiert nach Sternen.

85 Repos
  • sherpa-ncnn@k2-fsa

    Echtzeit-Spracherkennung und Spracherkennungs-Erkennung (VAD) mit der nächsten Generation von Kaldi und ncnn ohne Internetverbindung. Unterstützt iOS, Android, Linux, macOS, Windows, Raspberry Pi, VisionFive2, LicheePi4A usw.

    1.777-2Sterne-Änderung der letzten 7 Tage
  • bailing@wwbin2017

    Bailing ist ein GPT-4o-ähnlicher Sprachchatbot, der über ASR+LLM+TTS realisiert wird, hervorragende große Sprachmodelle wie DeepSeek R1 integriert und openClaw anbindet.

    1.759+2Sterne-Änderung der letzten 7 Tage
  • dsnote@mkiol

    Speech Note Linux-App. Notizen erstellen, lesen und übersetzen mit Offline-Spracherkennung (Speech-to-Text), Sprachsynthese (Text-to-Speech) und maschineller Übersetzung.

    1.622+13Sterne-Änderung der letzten 7 Tage
  • video-analyzer@byjlw

    Analysieren von Videos mithilfe von LLMs, Computer Vision und automatischer Spracherkennung

    1.570+11Sterne-Änderung der letzten 7 Tage
  • amical@amicalhq

    🎙️ KI-Diktier-App – Open Source und Local-First ⚡ 3x schneller tippen, keine Tastatur erforderlich. 🆓 Angetrieben von Open-Source-Modellen, offline funktionsfähig, schnell und präzise.

    1.520+14Sterne-Änderung der letzten 7 Tage
  • Fun-ASR@QwenAudio

    Open-Source-LLM-basiertes ASR-Modellfamilie für Chinesisch, Dialekte, Akzente und mehrsprachige Sprache, mit FunASR, vLLM, Streaming- und llama.cpp-Runtimes.

    1.512+14Sterne-Änderung der letzten 7 Tage
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge ist ein rund um TTS-Generierungsmodelle entwickeltes Projekt, das einen API-Server und ein Gradio-basiertes WebUI implementiert.

    1.418+2Sterne-Änderung der letzten 7 Tage
  • SoniTranslate@R3gm

    Synchronisierte Übersetzung für Videos. Videovertonung

    1.413+3Sterne-Änderung der letzten 7 Tage
  • CrisperWhisper@nyrahealth

    Steuerbare Transkription. Wortgetreu (jede Füllwörter, Pausen, Stottern, Vokallaute) oder beabsichtigt (was der Sprecher sagen wollte, optimiert für Lesbarkeit) mit Zeitstempeln auf Wortebene.

    1.371+21Sterne-Änderung der letzten 7 Tage
  • voicemode@mbailey

    Natürliche Sprachgespräche mit Claude Code

    1.347+6Sterne-Änderung der letzten 7 Tage
  • VideoChat@Henry-23

    Interaktiver digitaler Mensch in Echtzeit mit anpassbarem Erscheinungsbild und Stimme, Unterstützung für Stimmenklonen und einer Dialogverzögerung von nur 3 Sekunden.

    1.303+0Sterne-Änderung der letzten 7 Tage
  • StreamSpeech@ictnlp

    StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.

    1.288+1Sterne-Änderung der letzten 7 Tage
  • vosk-server@alphacep

    WebSocket-, gRPC- und WebRTC-Spracherkennungsserver basierend auf Vosk- und Kaldi-Bibliotheken

    1.262+2Sterne-Änderung der letzten 7 Tage
  • Whisper-Finetune@yeyupiaoling

    Feinabstimmung des Whisper-Spracherkennungsmodells zur Unterstützung des Trainings ohne Zeitstempeldaten, mit Zeitstempeldaten und ohne Sprachdaten. Beschleunigt die Inferenz und unterstützt Web-, Windows-Desktop- und Android-Bereitstellung

    1.222-1Sterne-Änderung der letzten 7 Tage
  • speech-swift@soniqo

    KI-Sprach-Toolkit für Apple Silicon – ASR, TTS, Speech-to-Speech, VAD und Diarisierung, angetrieben durch MLX und CoreML

    1.161+11Sterne-Änderung der letzten 7 Tage
  • Mega-ASR@xzf-thu

    Erste für die reale Welt entwickelte ASR-Grundlage – 7 atomare akustische Bedingungen, 54 zusammengesetzte Szenarien, 2,6 Mio. Samples und bis zu ca. 30 % Leistungssteigerung gegenüber SOTA, wo alle anderen Modelle versagen. **Du wirst zu MEGA-ASR zurückkehren, nachdem die anderen im Praxistest versagt haben. ⭐**

    1.136+3Sterne-Änderung der letzten 7 Tage
  • conformer@sooftware

    [Inoffizielle] PyTorch-Implementierung von „Conformer: Convolution-augmented Transformer for Speech Recognition“ (INTERSPEECH 2020)

    1.132+1Sterne-Änderung der letzten 7 Tage
  • sglang-omni@sgl-project

    SGLang-Omni ermöglicht hochleistungsfähiges Serving für TTS-, ASR-, Sprach- und Omni-Modelle.

    1.105+107Sterne-Änderung der letzten 7 Tage
  • Offline-Spracherkennung für Android mit der Vosk-Bibliothek.

    1.056+0Sterne-Änderung der letzten 7 Tage
  • violin@shang-zhu

    Open-Source-Fähigkeit zur Videoübersetzung

    1.055+4Sterne-Änderung der letzten 7 Tage
  • murmure@Kieirra

    Vollständig lokale, private und plattformübergreifende Spracherkennung (Speech-to-Text) mit LLM-Nachbearbeitung

    1.051+13Sterne-Änderung der letzten 7 Tage
  • pykaldi@pykaldi

    Ein Python-Wrapper für Kaldi

    1.040+0Sterne-Änderung der letzten 7 Tage
  • sherpa@k2-fsa

    Speech-to-Text-Server-Framework mit Kaldi der nächsten Generation

    984+2Sterne-Änderung der letzten 7 Tage
  • espresso@freewym

    Espresso: Ein schnelles End-to-End Neural Speech Recognition Toolkit

    939+0Sterne-Änderung der letzten 7 Tage
  • vocotype-cli@233stone

    VocoType ist ein datenschutzfreundliches, lokales Spracheingabetool, das Sprache über Tastenkombinationen in Echtzeit in Text umwandelt und automatisch in die aktuelle Anwendung einfügt. Es unterstützt Speech-to-Text-MCP, KI-Textoptimierung, benutzerdefinierte Ersetzungswörterbücher, Audio-/Video-Transkription und weitere Funktionen, die die Spracheingabe effizienter und sicherer machen.

    924+2Sterne-Änderung der letzten 7 Tage
  • whisper.api@innovatorved

    Dieses Projekt stellt eine API mit Unterstützung für benutzerbasierte Zugriffskontrolle bereit, um Sprache mit einem feinabgestimmten und verarbeiteten Whisper-ASR-Modell in Text umzuwandeln.

    914+0Sterne-Änderung der letzten 7 Tage
  • SmartJavaAI@geekwenjie

    🔥🔥🔥 Kostenlose Offline-KI-Algorithmen-Toolbox für Java mit Unterstützung für Gesichtserkennung, Liveness-Erkennung, Gesichtsausdruckserkennung, Objekterkennung, Instanzsegmentierung, Fußgängererkennung, OCR-Texterkennung, Nummernschilderkennung, Tabellenerkennung, ASR+TTS, maschinelle Übersetzung und mehr. Einfach über Maven einbinden. Unterstützt PyTorch, TensorFlow und integriert gängige Modelle wie Mtcnn, InsightFace, SeetaFace6, YOLOv8~v12, PaddleOCR (PPOCRv5), Whisper usw.

    908+1Sterne-Änderung der letzten 7 Tage
  • Easy-Voice-Toolkit@Spr-Aachen

    Ein benutzerfreundliches Toolkit für Spracherkennung, -transkription, -konvertierung usw.

    873+0Sterne-Änderung der letzten 7 Tage
  • PPASR@yeyupiaoling

    End-to-End-Mandarin-Spracherkennung basierend auf PaddlePaddle, von den Grundlagen zur Praxis: ein super einfaches Einstiegsbeispiel und ein hochpraktisches Unternehmensprojekt. Unterstützt die aktuell beliebtesten Modelle DeepSpeech2, Conformer und Squeezeformer.

    870+0Sterne-Änderung der letzten 7 Tage
  • GLM-ASR@zai-org

    GLM-ASR-Nano: Ein robustes Open-Source-Spracherkennungsmodell mit 1,5 Milliarden Parametern

    854+4Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen