Zum Hauptinhalt springen
buildradar
Sign in
Thema · speech

speech

Erfasste Open-Source-Repos mit dem Tag speech, sortiert nach Sternen.

74 Repos
  • MARS5-TTS@Camb-ai

    MARS5-Sprachmodell (TTS) von CAMB.AI

    2.818+1Sterne-Änderung der letzten 7 Tage
  • speechgpt@hahahumble

    💬 SpeechGPT ist eine Webanwendung, mit der du dich mit ChatGPT unterhalten kannst.

    2.750-1Sterne-Änderung der letzten 7 Tage
  • gTTS@pndurette

    Python-Bibliothek und CLI-Tool zur Schnittstellenanbindung an die Text-to-Speech-API von Google Translate

    2.628+0Sterne-Änderung der letzten 7 Tage
  • ten-vad@TEN-framework

    Sprachaktivitätserkennung (VAD): Latenzarm, leistungsstark und leichtgewichtig

    2.256+7Sterne-Änderung der letzten 7 Tage
  • IMS-Toucan@DigitalPhonetics

    Steuerbare und schnelle Text-to-Speech-Technologie für über 7000 Sprachen!

    2.207-1Sterne-Änderung der letzten 7 Tage
  • soloud@jarikomppa

    Kostenlose, einfache und portable Audio-Engine für Spiele

    2.170+3Sterne-Änderung der letzten 7 Tage
  • openai-edge-tts@travisvn

    Kostenloser, hochwertiger Text-to-Speech-API-Endpunkt als Ersatz für OpenAI, Azure oder ElevenLabs

    2.075+5Sterne-Änderung der letzten 7 Tage
  • Praat: Phonetik am Computer

    1.970+1Sterne-Änderung der letzten 7 Tage
  • julius@julius-speech

    Open-Source-Engine für kontinuierliche Spracherkennung mit großem Vokabular

    1.935+1Sterne-Änderung der letzten 7 Tage
  • Community-Liste von Start-ups, die mit KI in der Audio- und Musiktechnologie arbeiten

    1.769+1Sterne-Änderung der letzten 7 Tage
  • SALMONN@bytedance

    SALMONN-Familie: Eine Suite fortschrittlicher multimodaler LLMs

    1.521+3Sterne-Änderung der letzten 7 Tage
  • voicefixer@haoheliu

    Allgemeine Sprachwiederherstellung

    1.375+0Sterne-Änderung der letzten 7 Tage
  • CrisperWhisper@nyrahealth

    Steuerbare Transkription. Wortgetreu (jede Füllwörter, Pausen, Stottern, Vokallaute) oder beabsichtigt (was der Sprecher sagen wollte, optimiert für Lesbarkeit) mit Zeitstempeln auf Wortebene.

    1.371+13Sterne-Änderung der letzten 7 Tage
  • nlp-paper@DengBoCong

    Relevante Forschungsarbeiten im Bereich der natürlichen Sprachverarbeitung (inkl. Lesepotizen), Modellreproduktionen und Datenverarbeitung (Code in TensorFlow- und PyTorch-Versionen)

    1.333+1Sterne-Änderung der letzten 7 Tage
  • MTools@HG-ha

    MTools ist eine leistungsstarke, vielseitige Desktop-Anwendung mit integrierten Audio- und Videoverarbeitungs-, Bildbearbeitungs-, Textbearbeitungs- und Codierungstools sowie KI-Erweiterungen. Entwickelt, um Ihren Arbeitsablauf zu vereinfachen und die Produktivität zu steigern.

    1.305+5Sterne-Änderung der letzten 7 Tage
  • StreamSpeech@ictnlp

    StreamSpeech ist ein All-in-One-Modell für nahtlose Offline- und Simultanspracherkennung, -sprachübersetzung und -sprachsynthese.

    1.288+0Sterne-Änderung der letzten 7 Tage
  • Deep-Learning-Experiments@roatienza

    Videos, Notizen und Experimente zum Verständnis von Deep Learning

    1.198+0Sterne-Änderung der letzten 7 Tage
  • lhotse@lhotse-speech

    Werkzeuge zur Verarbeitung multimodaler Daten in Machine-Learning-Projekten.

    1.149-1Sterne-Änderung der letzten 7 Tage
  • conformer@sooftware

    [Inoffizielle] PyTorch-Implementierung von „Conformer: Convolution-augmented Transformer for Speech Recognition“ (INTERSPEECH 2020)

    1.132+1Sterne-Änderung der letzten 7 Tage
  • pykaldi@pykaldi

    Ein Python-Wrapper für Kaldi

    1.040+1Sterne-Änderung der letzten 7 Tage
  • FireRedTTS@FireRedTeam

    Ein Open-Source-LLM-basiertes TTS-Fundamentalsystem

    920+1Sterne-Änderung der letzten 7 Tage
  • inaSpeechSegmenter@ina-foss

    CNN-basiertes Toolkit zur Audiosegmentierung. Ermöglicht das Erkennen von Sprache, Musik, Rauschen und Sprechergeschlecht. Wurde für großangelegte Studien zur Geschlechtergerechtigkeit auf Basis der Sprechzeit pro Geschlecht entwickelt.

    910+1Sterne-Änderung der letzten 7 Tage
  • diffwave@lmnt-com

    DiffWave ist ein schneller, hochqualitativer neuronaler Vocoder und Wellenformsynthesizer.

    885+0Sterne-Änderung der letzten 7 Tage
  • AnyGPT@OpenMOSS

    Code für „AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling“

    881-1Sterne-Änderung der letzten 7 Tage
  • PPASR@yeyupiaoling

    End-to-End-Mandarin-Spracherkennung basierend auf PaddlePaddle, von den Grundlagen zur Praxis: ein super einfaches Einstiegsbeispiel und ein hochpraktisches Unternehmensprojekt. Unterstützt die aktuell beliebtesten Modelle DeepSpeech2, Conformer und Squeezeformer.

    870-1Sterne-Änderung der letzten 7 Tage
  • Voxtral ASR & TTS läuft nativ und im Browser. Eine Rust-Implementierung von Mistrals Voxtral mini Echtzeit-ASR / TTS unter Verwendung des Burn ML Frameworks

    819+2Sterne-Änderung der letzten 7 Tage
  • AlphaAvatar@AlphaAvatar

    Ein interaktiver Omni-Avatar in Echtzeit, basiert auf LiveKit, mit dem sich nahtlos beliebige Open-Source-Avatar-Komponenten (Echtzeitmodell, Visualisierung, Sprache, Speicher, Suche usw.) integrieren lassen.

    813+4Sterne-Änderung der letzten 7 Tage
  • XR3Player@goxr3plus

    🎧 🎼 Der fortschrittlichste JavaFX Media Player.

    771+0Sterne-Änderung der letzten 7 Tage
  • cboard@cboard-org

    System für Unterstützte Kommunikation (AAC) mit Sprachsynthese für den Browser

    755+9Sterne-Änderung der letzten 7 Tage
  • allosaurus@xinjli

    Allosaurus ist ein vortrainierter universeller Phonem-Erkenner für über 2000 Sprachen

    746+4Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen