メインコンテンツへスキップ
buildradar
ログイン
トピック · speech-to-text

speech-to-text

speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

152 件のリポジトリ
  • オーディオAIにおける大規模言語モデル(LLM)の応用に関するリソース集

    738+0直近 7 日のスター増減
  • MASR@yeyupiaoling

    PyTorchで実装されたストリーミングおよび非ストリーミングの自動音声認識フレームワーク。オンラインおよびオフライン認識の両方に対応しており、現在Conformer、Squeezeformer、DeepSpeech2モデルをサポートし、多様なデータ拡張手法を備えています。

    727+0直近 7 日のスター増減
  • voice-ai@rapidaai

    Rapidaは、音声ストリーミング、STT、TTS、VAD、マルチチャネル統合、エージェント状態管理、オブザーバビリティを備えたリアルタイム会話型音声エージェントを構築するための、オープンソースのエンドツーエンド音声AIオーケストレーションプラットフォームです。

    723+4直近 7 日のスター増減
  • adapt@MycroftAI

    Adapt Intent Parser

    719+0直近 7 日のスター増減
  • curses@mmpneo

    OBS、VRChat、Twitchチャット、Discord向けの音声認識(Speech to Text)およびKB入力字幕

    718-1直近 7 日のスター増減
  • speech-demo@Baidu-AIP

    音声APIのサンプル

    707-1直近 7 日のスター増減
  • 音声認識(Speech-to-Text)のベンチマークフレームワーク

    698+1直近 7 日のスター増減
  • WhisperSubTranslate@Blue-B

    動画から字幕(SRT)を抽出し、あらゆる言語に翻訳するための無料のローカルデスクトップアプリ — 無制限利用、登録不要、クラウド不要。

    684+15直近 7 日のスター増減
  • React Native Expoプロジェクト向けの音声認識

    678+4直近 7 日のスター増減
  • openlrc@zh-plus

    Whisper と LLM (GPT、Claude など) を使用して音声を文字起こしし、LRC ファイルに翻訳するツール

    675+0直近 7 日のスター増減
  • cheetah@Picovoice

    ディープラーニングを活用した、デバイス上のストリーミング音声認識エンジン

    671+0直近 7 日のスター増減
  • sonus@evancohen

    :speech_balloon: /so.nus/ オフラインホットワード検知機能を備えたNode向けSTT(音声認識)

    638+0直近 7 日のスター増減
  • Proctoring-AI@vardanagarwal

    オンライン試験監視の自動モニタリング用ソフトウェアの作成

    634-1直近 7 日のスター増減
  • macparakeet@moona3k

    Apple Silicon Mac向けの高速でプライベートなローカルファースト音声アプリ。音声入力、ファイル/メディアの文字起こし、会議の録音、変換(Transforms)、および公開オートメーションCLIを提供。無料かつオープンソース。

    630+14直近 7 日のスター増減
  • pindrop@watzon

    WhisperKitのローカル音声認識を使用した、ネイティブなmacOSメニューバー用音声入力アプリ

    620+1直近 7 日のスター増減
  • CrispASR@CrispStrobe

    多言語 ASR および TTS モデル(Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2 など)向けの C++ 製 ggml ランタイムハブ。汎用フォースドアライメント機能なども搭載

    614+11直近 7 日のスター増減
  • speech-to-text@reriiasu

    faster-whisperを使用したリアルタイム文字起こし

    614+0直近 7 日のスター増減
  • Sayboard@ElishaAz

    Vosk ライブラリを使用した Android 向けオープンソースのオンデバイス音声 IME(キーボード)

    582+3直近 7 日のスター増減
  • Playwright を使用して reCAPTCHA v2 および v3 を解決するための Python ライブラリ

    579+3直近 7 日のスター増減
  • WhisperS2T@shashikg

    複数の推論エンジンをサポートする、Whisperモデル向けの最適化されたSpeech-to-Textパイプライン

    578+0直近 7 日のスター増減
  • VRCOSC@VolcanicArts

    VRChat向けに作られたモジュール式のノードプログラミング言語、プログラムクリエイター、アニメーションシステム、ツールキット、ルーター、デバッガー

    563+0直近 7 日のスター増減
  • 🗣 カスタマイズ可能な UI でユーザーの音声許可を取得し、音声をテキストとして入力するオーバーレイ

    557+1直近 7 日のスター増減
  • 韓国語音声認識 STT API リストと各パフォーマンスベンチマーク。

    547+0直近 7 日のスター増減
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    547+22直近 7 日のスター増減
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    544+11直近 7 日のスター増減
  • vosk-browser@ccoreilly

    Vosk の WebAssembly ビルドによりブラウザ上で動作する音声認識ライブラリ

    529+1直近 7 日のスター増減
  • Phonetisaurus@AdolfVonKleist

    Phonetisaurus G2P

    521-1直近 7 日のスター増減
  • AIを使用して発音を評価するツールです。

    518+1直近 7 日のスター増減
  • transcribee@bugbakery

    オープンソースの音声・動画文字起こしソフトウェア

    515+0直近 7 日のスター増減
  • opentypeless@tover0314-w

    Open-source AI voice typing for macOS, Windows, and Linux. Press a hotkey, speak naturally, get polished text in any app.

    512直近 7 日のスター増減
← トピック一覧に戻る