speech-to-text
speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #91
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 1,018+424直近 7 日のスター増減 - #92
:zap: TensorFlowASR: TensorFlow 2 によるほぼ最高水準の自動音声認識。文字またはサブワードを使用できる言語をサポート
★ 1,010+0直近 7 日のスター増減 - #93★ 1,006-1直近 7 日のスター増減
- #94
Whisper-Flowは、OpenAIのWhisperモデルを使用して音声コンテンツのリアルタイム文字起こしを実現するためのフレームワークです。アップロード後にファイル全体を処理する(「バッチモード」)のではなく、Whisper-Flowは音声チャンクの連続ストリームを受け取り、即座にインクリメンタルな文字起こしを生成します。
★ 964+25直近 7 日のスター増減 - #95
Python/JS におけるセルフホスト型 Whisper と WebSocket を使用したほぼリアルタイムの文字起こし
★ 960+0直近 7 日のスター増減 - #96
Botium 音声処理
★ 943+0直近 7 日のスター増減 - #97
Whisper.net。Whisperモデルを使用して音声認識をシンプルに実現
★ 942+1直近 7 日のスター増減 - #98★ 928+2直近 7 日のスター増減
- #99
.NET MAUIのサンプル集
★ 915+0直近 7 日のスター増減 - #100★ 911+2直近 7 日のスター増減
- #101
ストリーミングおよびオンデバイス利用向けに最適化されたWhisperモデル
★ 897-1直近 7 日のスター増減 - #102★ 896+4直近 7 日のスター増減
- #103
PaddlePaddleに基づくエンドツーエンドの中国語音声認識。入門から実践まで、非常にシンプルな入門ケースと実用的なエンタープライズプロジェクト。現在最も人気のDeepSpeech2、Conformer、Squeezeformerモデルをサポート
★ 870-1直近 7 日のスター増減 - #104
💬 Reactアプリ向けの音声認識
★ 842+0直近 7 日のスター増減 - #105
OpenAI の Whisper を使用したリアルタイム speech2text Web アプリの構築 (https://openai.com/blog/whisper/)
★ 835+0直近 7 日のスター増減 - #106★ 823-1直近 7 日のスター増減
- #107
一站式全自动字幕生成软件,下载、转录、翻译、压制全流程覆盖,无需人工介入 / One-stop automated subtitle generator. Handles downloading, transcription, translation, and hardcoding—zero human intervention required.
★ 811+3直近 7 日のスター増減 - #108
Linux向けの無料、オープンソース、完全オフラインの音声ディクテーション。whisper.cpp、Whisper、VOSKエンジンを使用し、どこでも音声入力が可能。GPUアクセラレーション対応、X11およびWaylandで動作!
★ 809+17直近 7 日のスター増減 - #109★ 805-1直近 7 日のスター増減
- #110
音声からテキスト、そして音声へ。現在再生中の楽曲。テキストをOSCメッセージとしてVRChatに送信し、アバター上に表示します。(STTTS) (Speech to TTS) (VRC STTシステム) (VTuber TTS)
★ 804+5直近 7 日のスター増減 - #111★ 788+1直近 7 日のスター増減
- #112
OpenAI whisper でマイクを使用できるようにするプロジェクト
★ 787+0直近 7 日のスター増減 - #113
🎤 Swift で最も簡単にオーディオを文字起こしする方法
★ 785+0直近 7 日のスター増減 - #114
100% プライベートな AI 音声文字起こしアプリ。Whisper AI を使用し、Android と iOS 向けに Compose Multiplatform で構築されており、クラウドへのアップロードなしでデバイス上で処理が完結します。
★ 779+4直近 7 日のスター増減 - #115
BiBi Keyboard: Kotlin をベースにした Android プラットフォーム向けの LLM および ASR 音声入力キーボードアプリ
★ 774+15直近 7 日のスター増減 - #116
Apple Silicon上のMLXで音声処理を行うためのモジュール式Swift SDK
★ 774+5直近 7 日のスター増減 - #117
PaddlePaddle をベースに実装された音声認識、中国語音声認識。プロジェクトは充実しており、認識精度も良好。Windows および Linux でのトレーニングと予測をサポートし、Nvidia Jetson 開発ボードでの予測もサポートします。
★ 763+1直近 7 日のスター増減 - #118★ 754+1直近 7 日のスター増減
- #119
ローカルマシンの Unity3d で音声認識モデル (whisper.cpp) を実行する。
★ 751+1直近 7 日のスター増減 - #120
Android 向けのプライベートでオンデバイスな音声認識キーボードおよびサービス。
★ 745+2直近 7 日のスター増減