メインコンテンツへスキップ
buildradar
ログイン
トピック · speech-to-text

speech-to-text

speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。

152 件のリポジトリ
  • dograh@dograh-hq

    オープンソースの音声AIプラットフォーム。VapiやRetellのセルフホスト型代替品。Speech to SpeechまたはLLM/STT/TTSに対応したオンプレミス、BYOK環境。ビジュアルワークフロービルダー、MCPネイティブ、テレフォニーサポート付き。

    5,568+0直近 7 日のスター増減
  • YouDub-webui@liuzhao1225

    オープンソースのAI動画ローカライゼーションツール:YouTube/Bilibili動画のダウンロード、字幕認識と翻訳、音声クローン吹き替え、音源ミキシング、字幕エンコードを自動実行。

    5,404+0直近 7 日のスター増減
  • stt@jianchang512

    音声認識からテキストへのツール / オフラインで動作するローカルの音・動画から字幕へのツール。JSON、SRT字幕、プレーンテキスト形式で出力。

    4,780+0直近 7 日のスター増減
  • whisper-jax@sanchit-gandhi

    TPU上で最大70倍の高速化を実現する、OpenAIのWhisperモデルのJAX実装

    4,679+0直近 7 日のスター増減
  • fastrtc@gradio-app

    リアルタイム通信のためのpythonライブラリ。

    4,624+0直近 7 日のスター増減
  • auto-subs@tmoroney

    DaVinci Resolve、Premiere、After Effectsに直接接続するオンデバイス字幕生成機能。

    4,122+0直近 7 日のスター増減
  • Windows LiveCaptions をベースにした、軽量かつ強力なリアルタイム音声・スピーチ翻訳ツール

    3,637+0直近 7 日のスター増減
  • openless@Open-Less

    キーを押しながら話して放すと、AI が洗練したテキストがどのアプリでもカーソル位置に入力されます。macOS & Windows 向けのオープンソース音声入力。

    3,403+0直近 7 日のスター増減
  • OpenAI Whisper ASR Web サービス API

    3,328+0直近 7 日のスター増減
  • Python の導入を避けたい人のための Whisper および Faster-Whisper のスタンドアロン実行ファイル

    3,171+0直近 7 日のスター増減
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni は、Llama-3.1-8B-Instruct を基に構築された低レイテンシかつ高品質なエンドツーエンドの音声インタラクションモデルで、GPT-4o レベルの音声機能の実現を目指しています。

    3,147+0直近 7 日のスター増減
  • willow@HeyWillow

    Amazon Echo や Google Home の競合となる、オープンソースかつローカルでセルフホスト可能な音声アシスタントの代替

    3,101+0直近 7 日のスター増減
  • whishper@pluja

    Web UIを使って、あらゆる音声を100%ローカルでテキスト化、翻訳、字幕編集ができるツール。whisperモデルを採用!

    3,068+0直近 7 日のスター増減
  • lingvo@tensorflow

    Lingvo

    2,864+0直近 7 日のスター増減
  • whisper-timestamped@linto-ai

    単語レベルのタイムスタンプと信頼度を備えた多言語自動音声認識

    2,842+0直近 7 日のスター増減
  • vexa@Vexa-ai

    Google Meet、Microsoft Teams、Zoom向けのオープンソースの会議文字起こしAPI。ボットの自動参加、リアルタイムWebSocket文字起こし、AIエージェント向けMCPサーバーを搭載。セルフホストまたはSaaSを利用可能。

    2,741+0直近 7 日のスター増減
  • FluidAudio@FluidInference

    アプリ内で最先端の CoreML 音声モデルを利用可能に — テキスト読み上げ、音声認識、音声区間検出、話者ダイアライゼーション。Swift 製、SOTA のオープンソースを活用。

    2,723+0直近 7 日のスター増減
  • pluely@iamsrikanthnani

    Cluely のオープンソース代替品 - 会議、面接、会話中に誰にも気づかれることなくシームレスに動作する、超高速でプライバシーファーストな AI アシスタント。Tauri製でネイティブのパフォーマンスを実現し、わずか 10MB。ビデオ通話、画面共有、録画でも完全に検出されません。

    2,619+0直近 7 日のスター増減
  • STT@coqui-ai

    🐸STT - 音声認識(Speech-to-Text)のためのディープラーニングツールキット。STT モデルのトレーニングとデプロイがかつてないほど簡単になりました。

    2,606+0直近 7 日のスター増減
  • foundry-local@microsoft
    2,537+0直近 7 日のスター増減
  • awesome-whisper@sindresorhus

    🔊 OpenAI が開発したオープンソースの AI 音声認識システム Whisper に関する素晴らしいリソースのまとめ

    2,375+0直近 7 日のスター増減
  • openscreen@getopenscreen

    画面を録画してデモを公開。無料かつオープンソース、GPU アクセラレーション対応、ウォーターマークなし、サブスクリプションなし。Windows、macos、Linux に対応。アクティブにメンテナンス中。

    2,287+0直近 7 日のスター増減
  • ququ@yan5xu

    オープンソースで無料の Wispr Flow 代替案 | FunASR ローカルモデルと設定可能な大規模言語モデルを統合した次世代中国語デスクトップ音声ワークフロー

    2,278+0直近 7 日のスター増減
  • audio.cpp@0xShug0

    ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。

    2,214+0直近 7 日のスター増減
  • WhisperJAV@meizhong986

    ASR/STT字幕ジェネレーター。Qwen3-ASR、ローカルLLM、Whisper、TEN-VADを使用。JAV向けにノイズ耐性を強化。

    2,196+0直近 7 日のスター増減
  • 🎙 tensorflowディープラーニングフレームワークと、sequence-to-sequenceニューラルネットワークを使用した音声認識

    2,173+0直近 7 日のスター増減
  • soloud@jarikomppa

    ゲーム向けの、無料で使いやすく、ポータブルなオーディオエンジン。

    2,170+0直近 7 日のスター増減
  • vad@ricky0123

    シンプルな API を備えたブラウザ用音声活動検出(VAD)

    2,046+0直近 7 日のスター増減
  • audapolis@bugbakery

    自動文字起こし機能付き音声エディタ

    1,892+0直近 7 日のスター増減
  • transcribe.cpp@handy-computer

    16以上のモデルファミリーに対応したggml音声認識(speech-to-text)推論

    1,872+0直近 7 日のスター増減
← トピック一覧に戻る