speech-to-text
speech-to-text がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
speech-to-text と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、speech-to-text がタグ付けされたリポジトリ。
- #1
ggml を活用した、音声モデル向けのオールインワンかつ純粋な C++ 推論エンジン。TTS、STT、VAD、音声変換、音楽生成などを高度に最適化されたパフォーマンスでサポートします。Python 依存関係はありません。
★ 2,214 - #2
面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。
★ 970 - #3
Lightning-fast, free, local first voice dictation for macOS with on-device transcription
★ 541 - #4
Browser-only Canva-style presentation studio, powered by local Web AI.
★ 541 - #5
Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.
★ 501
- #1
OpenAIのWhisperモデルのC/C++ポート
★ 53,389+103直近 7 日のスター増減 - #2★ 30,916+280直近 7 日のスター増減
- #3
プライバシー優先のAI会議アシスタント。Rustベースで、Parakeet/Whisperのライブ文字起こし、話者ダイアライゼーション、Ollama要約を4倍高速化。100%ローカル処理。クラウド不要。Meetily (Meetly Ai - https://meetily.ai) はmacOSおよびWindows向けのNo.1セルフホスト型オープンソースAI会議ノートテイカー。議事録の書き方を知る
★ 30,252+195直近 7 日のスター増減 - #4★ 25,859+113直近 7 日のスター増減
- #5
CTranslate2による高速なWhisper文字起こし
★ 25,206+71直近 7 日のスター増減 - #6★ 23,864+61直近 7 日のスター増減
- #7
YC (S26) | Open Computer History | 画面をローカルで継続的に記録し、エージェント(Claude, Codex, Openclaw, Hermes, Runner...)にコンテキストを提供
★ 21,376+80直近 7 日のスター増減 - #8
トレーニング、推論、ストリーミングASR、VAD、句読点、話者ダイアライゼーションパイプライン、およびOpenAI互換/MCPサービングのためのオープンソース音声認識ツールキット
★ 20,136+64直近 7 日のスター増減 - #9
動画をある言語から別の言語に翻訳し、ダビングと字幕を埋め込む。
★ 18,871+38直近 7 日のスター増減 - #10★ 17,476+1直近 7 日のスター増減
- #11★ 15,474+3直近 7 日のスター増減
- #12★ 15,101+17直近 7 日のスター増減
- #13
VoiceStudioは、完全にローカルで動作するオープンソースのElevenLabs代替ツールです。646言語で音声クローニング、音声デザイン、ビデオダビング、ディクテーション、文字起こし、オーディオブック作成に対応しています。
★ 14,835+2,880直近 7 日のスター増減 - #14
インターネット接続なしで、次世代Kaldiとonnxruntimeを使用した音声認識(Speech-to-text)、テキスト読み上げ(text-to-speech)、話者ダイアライゼーション、音声強調、ソース分離、VADを提供。組み込みシステム、Android、iOS、HarmonyOS、Raspberry Pi、RISC-V、RK NPU、Axera NPU、Ascend NPU、x86_64サーバー、websocketサーバー/クライアントをサポートし、12のプログラミング言語に対応。
★ 14,575+95直近 7 日のスター増減 - #15
オープンソースモデルでボイスエージェントを構築
★ 13,015+82直近 7 日のスター増減 - #16
クリエイターと開発者のためのGradio WebUI。主要なTTS (Edge-TTS, kokoro) およびゼロショット音声クローニング (E2 & F5-TTS, CosyVoice) を特徴とし、Whisperオーディオ処理、YouTubeダウンロード、Demucsによるボーカル分離、多言語翻訳に対応。
★ 12,730+54直近 7 日のスター増減 - #17
PyTorchベースの音声ツールキット
★ 11,802+10直近 7 日のスター増減 - #18
ストリーミングASR、話者ダイアライゼーション、翻訳、およびOpenAI/Deepgram互換APIを備えたリアルタイムローカル音声認識
★ 10,990+16直近 7 日のスター増減 - #19
高度な音声アクティビティ検出、ウェイクワード起動、即時文字起こしを備えた、堅牢で効率的、低遅延の音声認識ライブラリ。
★ 10,108+18直近 7 日のスター増減 - #20
Mandarin、Cantonese、English、Japanese、Korean向けのオープンソースのSenseVoiceSmallモデル。ASR、言語ID、感情認識、音声イベント検出に対応。
★ 9,209+37直近 7 日のスター増減 - #21
Python用の音声認識モジュール。複数のエンジンとAPIをサポートし、オンラインおよびオフラインに対応。
★ 8,987+0直近 7 日のスター増減 - #22
深層学習ベースの中国語音声認識システム (Deep-Learning-Based Chinese Speech Recognition System)
★ 8,386+0直近 7 日のスター増減 - #23
AppleのMLXフレームワーク上に構築された、テキスト読み上げ (TTS)、音声認識 (STT)、音声合成 (STS) のライブラリ。Apple Silicon上での効率的な音声分析を提供。
★ 7,826+23直近 7 日のスター増減 - #24★ 6,815-1直近 7 日のスター増減
- #25
Apple Silicon向けオンデバイス音声AI
★ 6,353+8直近 7 日のスター増減 - #26★ 6,210+13直近 7 日のスター増減
- #27
ローカル(Nvidia Parakeet/Whisper)およびクラウドモデル(BYOK)を備えた音声入力(Voice-to-text)辞書アプリ。プライバシー優先でクロスプラットフォーム対応。
★ 6,133+305直近 7 日のスター増減 - #28
Silero Models: 驚くほどシンプルな事前学習済みテキスト読み上げモデル
★ 6,084-1直近 7 日のスター増減 - #29★ 5,931+1,108直近 7 日のスター増減
- #30
OpenAI Whisperに基づく話者ダイアライゼーション付き自動音声認識
★ 5,634+1直近 7 日のスター増減