본문으로 건너뛰기
buildradar
로그인
토픽 · speech-to-text

speech-to-text

speech-to-text 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
152
총 스타
640,857
평균 스타
4,216
비중
0.03%

같은 리포지토리에 speech-to-text 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 speech-to-text 태그가 달린 리포지토리예요.

  • audio.cpp@0xShug0

    ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.

    2,214
  • LiveStream-Agent-Studio@HanyuanWang

    面向抖音直播电商的 Windows 本地 AI Agent Studio,贯通主播发现、直播洞察、直播复盘与短视频内容编导的统一智能工作流。

    1,018
  • localstudio@ErickWendel

    Browser-only Canva-style presentation studio, powered by local Web AI.

    547
  • Talkify@tornikegomareli

    Lightning-fast, free, local first voice dictation for macOS with on-device transcription

    544
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    502
  • whisper.cpp@ggml-org

    C/C++로 포팅된 OpenAI의 Whisper 모델

    53,389+0최근 7일 스타 변화
  • Handy@cjpais

    완전 오프라인으로 작동하는 무료 오픈소스 확장형 음성 인식(speech-to-text) 애플리케이션

    30,916+0최근 7일 스타 변화
  • meetily@Zackriya-Solutions

    프라이버시를 최우선으로 하는 AI 미팅 어시스턴트입니다. Rust 기반으로 제작되었으며, 4배 더 빠른 Parakeet/Whisper 실시간 전사, 화자 분할, Ollama 요약 기능을 제공합니다. 100% 로컬 처리로 클라우드가 필요하지 않습니다. Meetily는 macOS 및 Windows를 위한 최고의 자체 호스팅 오픈 소스 AI 회의록 작성 도구입니다.

    30,252+0최근 7일 스타 변화
  • llamafile@mozilla-ai

    단일 파일로 LLM을 배포하고 실행하세요.

    25,859+0최근 7일 스타 변화
  • faster-whisper@SYSTRAN

    CTranslate2를 사용한 더 빠른 Whisper 전사

    25,206+0최근 7일 스타 변화
  • whisperX@m-bain

    WhisperX: 단어 수준 타임스탬프(& 화자 분리)를 지원하는 자동 음성 인식

    23,864+0최근 7일 스타 변화
  • screenpipe@screenpipe

    YC (S26) | 오픈 컴퓨터 히스토리 | 로컬에서 화면을 지속적으로 녹화하고 에이전트(Claude, Codex, Openclaw, Hermes, Runner 등)에 컨텍스트 제공

    21,376+0최근 7일 스타 변화
  • FunASR@modelscope

    학습, 추론, 스트리밍 ASR, VAD, 구두점, 화자 분리 파이프라인, OpenAI 호환/MCP 서빙을 위한 오픈소스 음성 인식 툴킷.

    20,136+0최근 7일 스타 변화
  • pyvideotrans@jianchang512

    영상의 언어를 다른 언어로 번역하고 더빙 및 자막을 삽입합니다.

    18,871+0최근 7일 스타 변화
  • leon@leon-ai

    🧠 Leon은 오픈소스 개인 비서입니다.

    17,476+0최근 7일 스타 변화
  • kaldi@kaldi-asr

    kaldi-asr/kaldi는 Kaldi 프로젝트의 공식 저장소입니다.

    15,474+0최근 7일 스타 변화
  • vosk-api@alphacep

    Python, Java, C#, Node를 지원하는 Android, iOS, Raspberry Pi 및 서버용 오프라인 음성 인식 API

    15,101+0최근 7일 스타 변화
  • VoiceStudio@debpalash

    VoiceStudio는 완전 로컬 환경에서 실행되는 오픈 소스 ElevenLabs 대안으로, 646개 언어의 음성 복제, 음성 디자인, 비디오 더빙, 받아쓰기, 전사 및 오디오북 생성을 지원합니다.

    14,835+0최근 7일 스타 변화
  • sherpa-onnx@k2-fsa

    인터넷 연결 없이 onnxruntime과 차세대 Kaldi를 사용하는 음성 인식, 음성 합성, 화자 분할, 음성 강화, 소스 분리 및 VAD. 임베디드 시스템, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 서버, websocket 서버/클라이언트 지원 및 12개 프로그래밍 언어 지원

    14,575+0최근 7일 스타 변화
  • speech-to-speech@huggingface

    오픈 소스 모델로 음성 에이전트 구축

    13,015+0최근 7일 스타 변화
  • voice-pro@abus-aikorea

    크리에이터와 개발자를 위한 Gradio WebUI. 주요 TTS(Edge-TTS, kokoro) 및 제로샷 음성 복제(E2 & F5-TTS, CosyVoice)를 지원하며, Whisper 오디오 처리, YouTube 다운로드, Demucs 보컬 분리 및 다국어 번역 기능을 제공합니다.

    12,730+0최근 7일 스타 변화
  • speechbrain@speechbrain

    PyTorch 기반 음성 툴킷

    11,802+0최근 7일 스타 변화
  • WhisperLiveKit@QuentinFuxa

    스트리밍 ASR, 화자 분리, 번역, OpenAI/Deepgram 호환 API를 지원하는 실시간 로컬 음성 인식(STT) 도구

    10,990+0최근 7일 스타 변화
  • RealtimeSTT@KoljaB

    고급 음성 활동 감지, 웨이크 워드 활성화 및 즉각적인 전사를 지원하는 견고하고 효율적인 저지연 음성 텍스트 변환(STT) 라이브러리.

    10,108+0최근 7일 스타 변화
  • SenseVoice@QwenAudio

    중국어, 광동어, 영어, 일본어, 한국어 ASR, 언어 식별, 감정 인식 및 오디오 이벤트 감지를 위한 오픈 소스 SenseVoiceSmall 모델입니다.

    9,209+0최근 7일 스타 변화
  • 온라인 및 오프라인에서 여러 엔진과 API를 지원하는 Python용 음성 인식 모듈

    8,987+0최근 7일 스타 변화
  • 딥러닝 기반 중국어 음성 인식 시스템

    8,386+0최근 7일 스타 변화
  • mlx-audio@Blaizzy

    Apple의 MLX 프레임워크를 기반으로 구축된 텍스트 음성 변환(TTS), 음성 텍스트 변환(STT) 및 음성 간 변환(STS) 라이브러리로, Apple Silicon에서 효율적인 음성 분석을 제공합니다.

    7,826+0최근 7일 스타 변화
  • annyang@TalAter

    💬 웹사이트를 위한 음성 인식

    6,815+0최근 7일 스타 변화
  • argmax-oss-swift@argmaxinc

    Apple Silicon을 위한 온디바이스 음성 AI

    6,353+0최근 7일 스타 변화
  • FunClip@modelscope

    FunASR 기반 비디오 전사, 자막 생성 및 로컬 Gradio UI가 포함된 LLM 지원 클리핑 도구.

    6,210+0최근 7일 스타 변화
  • openwhispr@OpenWhispr

    로컬(Nvidia Parakeet/Whisper) 및 클라우드 모델(BYOK)을 지원하는 음성 텍스트 변환(받아쓰기) 앱. 개인정보 보호 우선 및 크로스플랫폼 지원.

    6,133+0최근 7일 스타 변화
  • silero-models@snakers4

    Silero Models: 매우 간단하게 사용할 수 있는 사전 학습된 텍스트 음성 변환(TTS) 모델

    6,084+0최근 7일 스타 변화
  • ODS@Osmantic

    PC, Mac, Linux 시스템을 AI 서버로 전환하세요. LLM 추론, 채팅 UI, 음성, 에이전트, 워크플로, RAG, 이미지 생성을 지원합니다.

    5,931+0최근 7일 스타 변화
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisper 기반 화자 분리(Speaker Diarization)를 지원하는 자동 음성 인식(ASR)

    5,634+0최근 7일 스타 변화
← 토픽 목록으로