stt
stt がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
関連トピック
stt と同じリポジトリに頻繁に登場するトピック。
最近の急上昇
直近 90 日以内に作成され、stt がタグ付けされたリポジトリ。
- #1
AI音声エージェント用の利用メーターと予算制限ゲート。通話ごとのSTT + TTS + LLM + テレフォニーを標準で計測(Pipecat、LiveKit — Python & TypeScript)。予算上限を超える前に次回のターンをハードストップ。ローカル動作、アカウント不要、テレメトリーなし。FloeによるVoice AI向けコスト管理。
★ 434
- #1
あなたのAIセカンドブレイン。自己ホスト可能。Webまたはドキュメントから回答を取得。カスタムエージェントの構築、自動化のスケジュール設定、深層リサーチを実行。あらゆるオンラインまたはローカルのLLMを、あなた専用の自律型AI (gpt, claude, gemini, llama, qwen, mistral) に変換。無料で開始しましょう。
★ 36,787+149直近 7 日のスター増減 - #2★ 15,084+17直近 7 日のスター増減
- #3★ 10,964+52直近 7 日のスター増減
- #4
StreamによるOpen Vision Agents。任意のモデルまたはビデオプロバイダーを使用して、音声およびビジョンエージェントを迅速に構築できます。超低遅延のためにStreamのエッジネットワークを利用しています。
★ 8,104+9直近 7 日のスター増減 - #5★ 4,771+7直近 7 日のスター増減
- #6★ 3,066+5直近 7 日のスター増減
- #7★ 2,605+1直近 7 日のスター増減
- #8
🎙 tensorflowディープラーニングフレームワークと、sequence-to-sequenceニューラルネットワークを使用した音声認識
★ 2,173+1直近 7 日のスター増減 - #9
Arduino ESP32向けの100種類以上のモデルを搭載したリアルタイム音声AIトイ。セキュアなWebsocketとAIコンパニオン・デバイス向けのEdge Functionsに対応。
★ 1,937+4直近 7 日のスター増減 - #10
WhatsAppエージェント、Avaのご紹介
★ 1,673+1直近 7 日のスター増減 - #11
Speech Note Linux アプリ。オフラインでの音声文字変換(Speech to Text)、音声合成(Text to Speech)、機械翻訳を使用したメモ作成、読み上げ、翻訳機能を提供します。
★ 1,620+7直近 7 日のスター増減 - #12
Android用Dicioアシスタントアプリ
★ 1,462+17直近 7 日のスター増減 - #13
🍦 Speech-AI-Forgeは、TTS生成モデルを中心に開発されたプロジェクトで、APIサーバーとGradioベースのWebUIを実装しています。
★ 1,418+4直近 7 日のスター増減 - #14
動画の同期翻訳。動画の吹き替え
★ 1,413+5直近 7 日のスター増減 - #15
💎 ASR、TTS、その他の音声技術向けにアクセス可能な音声コーパスのリスト
★ 1,399+0直近 7 日のスター増減 - #16
小智 ESP32 向けの Java エンタープライズレベル管理プラットフォーム。デバイス監視、音声カスタマイズ、キャラクター切り替え、対話履歴管理のためのフロントエンド、バックエンド、およびサーバーサイドの統合ソリューション
★ 1,337+0直近 7 日のスター増減 - #17
Gp.nvim (GPT prompt) Neovim AIプラグイン:ChatGPTセッション、指示可能なテキスト/コード操作、音声文字変換 [OpenAI, Ollama, Anthropic, ..]
★ 1,320+0直近 7 日のスター増減 - #18
リアルタイム音声翻訳 — macOS および Windows、無料 TTS、サーバー不要、ご自身の API キーのみ使用
★ 1,277+3直近 7 日のスター増減 - #19
バイリンガル会議向けのリアルタイム双方向音声翻訳 — 話された言語を自動検出し、クラウドまたはデバイス上で完全にオフラインで双方向に翻訳します。デスクトップ(Windows・macOS・Linux)に加え、Zoom、Meet、Teams やあらゆるアプリに対応するブラウザ拡張機能(Chrome・Edge)を備えています。
★ 1,164+37直近 7 日のスター増減 - #20★ 1,081+11直近 7 日のスター増減
- #21★ 805+2直近 7 日のスター増減
- #22
🎙️ 音声をきれいなテキスト、有用なアクション、構造化された知識に変換するインテリジェントな音声生産性アシスタント。アイデアの記録、自然なコミュニケーション、反復作業の自動化を支援し、さまざまなアプリやワークフローで生産性を維持します。
★ 801+6直近 7 日のスター増減 - #23
音声からテキスト、そして音声へ。現在再生中の楽曲。テキストをOSCメッセージとしてVRChatに送信し、アバター上に表示します。(STTTS) (Speech to TTS) (VRC STTシステム) (VTuber TTS)
★ 799+1直近 7 日のスター増減 - #24
Apple Silicon上のMLXで音声処理を行うためのモジュール式Swift SDK
★ 768+5直近 7 日のスター増減 - #25
ローカルマシンの Unity3d で音声認識モデル (whisper.cpp) を実行する。
★ 750-2直近 7 日のスター増減 - #26
MLX Omni Server は、Apple の MLX フレームワークを搭載し、Apple Silicon(Mシリーズ)チップ用に特別に設計されたローカル推論サーバーです。OpenAI 互換の API エンドポイントを実装しており、既存の OpenAI SDK クライアントとシームレスに統合しながら、ローカルでの ML 推論の性能を活用できます。
★ 741+5直近 7 日のスター増減 - #27★ 671+0直近 7 日のスター増減
- #28★ 638+0直近 7 日のスター増減
- #29
音声や映像の自動文字起こしの修正をより簡単かつ迅速にするためのReactコンポーネント。BBC News Labs開発。- 開発中
★ 621+0直近 7 日のスター増減 - #30
多言語 ASR および TTS モデル(Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2 など)向けの C++ 製 ggml ランタイムハブ。汎用フォースドアライメント機能なども搭載
★ 599+26直近 7 日のスター増減