Zum Hauptinhalt springen
buildradar
Sign in
Thema · stt

stt

Erfasste Open-Source-Repos mit dem Tag stt, sortiert nach Sternen.

Repos
32
Sterne gesamt
108.877
Sterne im Schnitt
3.402
Anteil
0,01%

Themen, die häufig gemeinsam mit stt am selben Repo auftauchen.

Neue Aufsteiger

Repos, die in den letzten 90 Tagen erstellt und mit stt getaggt wurden.

  • floe-guard@Floe-Labs

    Ausgabenzähler und Budget-Limitierung für KI-Sprachagenten. Erfasst STT + TTS + LLM + Telefonie pro Anruf (Pipecat, LiveKit – Python & TypeScript). Stoppt den nächsten Turn, bevor das Budget überschritten wird. Lokal, kein Konto, keine Telemetrie. Entwickelt von Floe – Kostenkontrolle für Voice AI.

    434
  • khoj@khoj-ai

    Dein KI‑Zweitgehirn. Selbst‑hostbar. Erhalte Antworten aus dem Web oder deinen Dokumenten. Erstelle benutzerdefinierte Agents, plane Automatisierungen, führe tiefgehende Forschung durch. Transformiere jedes Online‑ oder lokale LLM in deine persönliche, autonome KI (gpt, claude, gemini, llama, qwen, mistral). Loslegen – kostenlos.

    36.787+149Sterne-Änderung der letzten 7 Tage
  • vosk-api@alphacep

    Offline-Spracherkennungs-API für Android, iOS, Raspberry Pi und Server mit Python, Java, C# und Node.

    15.084+17Sterne-Änderung der letzten 7 Tage
  • moonshine@moonshine-ai

    Sprach-zu-Text, Absichtserkennung (Intent Recognition) und Text-zu-Sprache mit sehr geringer Latenz zum Erstellen von Sprachagenten und -schnittstellen

    10.964+52Sterne-Änderung der letzten 7 Tage
  • Vision-Agents@GetStream

    Open Vision Agents von Stream. Erstellen Sie schnell Sprach- und Bild-Agenten mit beliebigen Modell- oder Video-Anbietern. Nutzt das Edge-Netzwerk von Stream für ultra-gringe Latenzen.

    8.104+9Sterne-Änderung der letzten 7 Tage
  • stt@jianchang512

    Spracherkennungstool für Text / Ein lokal laufendes Offline-Tool zur Audio- und Video-Untertitelung, das JSON-, SRT- und Reintextformate ausgibt.

    4.771+7Sterne-Änderung der letzten 7 Tage
  • whishper@pluja

    Transkribieren Sie jegliches Audio in Text, übersetzen und bearbeiten Sie Untertitel 100% lokal mit einer Web-Benutzeroberfläche. Unterstützt durch Whisper-Modelle!

    3.067+5Sterne-Änderung der letzten 7 Tage
  • STT@coqui-ai

    🐸STT – Das Deep-Learning-Toolkit für Speech-to-Text. Das Trainieren und Bereitstellen von STT-Modellen war noch nie so einfach.

    2.605+1Sterne-Änderung der letzten 7 Tage
  • 🎙 Spracherkennung mit dem Deep-Learning-Framework TensorFlow und Sequence-to-Sequence-neuronalen Netzen

    2.173+1Sterne-Änderung der letzten 7 Tage
  • ElatoAI@akdeb

    Echtzeit-Sprach-KI-Spielzeug mit über 100 Modellen auf Arduino ESP32 mit sicheren WebSockets und Edge-Funktionen für KI-Begleiter und -Geräte

    1.937+4Sterne-Änderung der letzten 7 Tage
  • Lernen Sie Ava kennen, den WhatsApp Agent

    1.673+1Sterne-Änderung der letzten 7 Tage
  • dsnote@mkiol

    Speech Note Linux-App. Notizen erstellen, lesen und übersetzen mit Offline-Spracherkennung (Speech-to-Text), Sprachsynthese (Text-to-Speech) und maschineller Übersetzung.

    1.620+7Sterne-Änderung der letzten 7 Tage
  • dicio-android@DicioTeam

    Dicio-Assistenten-App für Android

    1.462+17Sterne-Änderung der letzten 7 Tage
  • Speech-AI-Forge@lenML

    🍦 Speech-AI-Forge ist ein rund um TTS-Generierungsmodelle entwickeltes Projekt, das einen API-Server und ein Gradio-basiertes WebUI implementiert.

    1.418+4Sterne-Änderung der letzten 7 Tage
  • SoniTranslate@R3gm

    Synchronisierte Übersetzung für Videos. Videovertonung

    1.413+5Sterne-Änderung der letzten 7 Tage
  • 💎 Eine Liste barrierefreier Sprachkorpora für ASR, TTS und andere Sprachtechnologien

    1.399+0Sterne-Änderung der letzten 7 Tage
  • Eine Java-Enterprise-Managementplattform für Xiaozhi ESP32, die eine integrierte Frontend- und Backend- sowie Serverlösung für Gerätemonitoring, Stimmanpassung, Rollenwechsel und Chat-Protokollverwaltung bietet

    1.337+0Sterne-Änderung der letzten 7 Tage
  • gp.nvim@Robitx

    Gp.nvim (GPT prompt) Neovim AI-Plugin: ChatGPT-Sitzungen & instruierbare Text-/Code-Operationen & Spracherkennung [OpenAI, Ollama, Anthropic, ..]

    1.320+0Sterne-Änderung der letzten 7 Tage
  • my-translator@phuc-nt

    Echtzeit-Sprachübersetzung — macOS & Windows, kostenlose TTS, kein Server, nur Ihre API-Schlüssel

    1.277+3Sterne-Änderung der letzten 7 Tage
  • sokuji@kizuna-ai-lab

    Zwei-Wege-Echtzeit-Sprachübersetzung für zweisprachige Meetings – erkennt automatisch die gesprochene Sprache und übersetzt in beide Richtungen, in der Cloud oder vollständig offline auf dem Gerät. Desktop (Windows · macOS · Linux) + Browser-Erweiterung (Chrome · Edge) für Zoom, Meet, Teams & jede beliebige App.

    1.164+37Sterne-Änderung der letzten 7 Tage
  • nobodywho@nobodywho-ooo

    NobodyWho ist eine Inferenz-Engine, mit der Sie LLMs lokal und effizient auf jedem Gerät ausführen können.

    1.081+11Sterne-Änderung der letzten 7 Tage
  • lobe-tts@lobehub

    🎤 Lobe TTS – Eine hochwertige und zuverlässige TTS/STT-Bibliothek für Server und Browser

    805+2Sterne-Änderung der letzten 7 Tage
  • voxt@hehehai

    🎙️ Ein intelligenter Sprach-Produktivitätsassistent, der Sprache in sauberen Text, nützliche Aktionen und strukturiertes Wissen verwandelt. Er hilft Benutzern, Ideen zu erfassen, natürlich zu kommunizieren, wiederkehrende Aufgaben zu automatisieren und über verschiedene Apps und Workflows hinweg produktiv zu bleiben.

    801+6Sterne-Änderung der letzten 7 Tage
  • Sprache zu Text zu Sprache. Song wird jetzt abgespielt. Sendet Text als OSC-Nachrichten an VRChat zur Anzeige auf dem Avatar. (STTTS) (Sprache zu TTS) (VRC-STT-System) (VTuber-TTS)

    799+1Sterne-Änderung der letzten 7 Tage
  • mlx-audio-swift@Blaizzy

    Ein modulares Swift-SDK zur Audioverarbeitung mit MLX auf Apple Silicon

    768+5Sterne-Änderung der letzten 7 Tage
  • Ausführen eines Speech-to-Text-Modells (whisper.cpp) in Unity3d auf Ihrem lokalen Computer.

    750-2Sterne-Änderung der letzten 7 Tage
  • mlx-omni-server@madroidmaq

    MLX Omni Server ist ein lokaler Inferenz-Server, der auf Apples MLX-Framework basiert und speziell für Apple Silicon (M-Series) Chips entwickelt wurde. Er implementiert OpenAI-kompatible API-Endpunkte und ermöglicht so eine nahtlose Integration mit bestehenden OpenAI SDK Clients, während er die Leistung der lokalen ML-Inferenz nutzt.

    741+5Sterne-Änderung der letzten 7 Tage
  • cheetah@Picovoice

    Auf Deep Learning basierende On-Device-Streaming-Speech-to-Text-Engine

    671+0Sterne-Änderung der letzten 7 Tage
  • sonus@evancohen

    :speech_balloon: /so.nus/ STT (Speech-to-Text) für Node mit Offline-Hotword-Erkennung

    638+0Sterne-Änderung der letzten 7 Tage
  • Eine React-Komponente, die das Korrigieren automatischer Transkriptionen von Audio und Video einfacher und schneller macht. Von BBC News Labs. - In Arbeit

    621+0Sterne-Änderung der letzten 7 Tage
  • CrispASR@CrispStrobe

    C++ ggml Runtime-Hub für mehrsprachige ASR- und TTS-Modelle: Cohere Transcribe, Parakeet TDT, Voxtral, Canary 1B v2 sowie universelles Forced Alignment und mehr.

    599+26Sterne-Änderung der letzten 7 Tage
← Zurück zu den Themen