본문으로 건너뛰기
buildradar
Sign in
토픽 · speech-to-text

speech-to-text

speech-to-text 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리 152개
  • dograh@dograh-hq

    오픈소스 음성 AI 플랫폼. Vapi 및 Retell의 셀프 호스팅 대안. 온프레미스, 음성 간(Speech to Speech) 또는 LLM/STT/TTS 전반의 BYOK 지원, 시각적 워크플로우 빌더, MCP 네이티브 및 telephony 지원.

    5,568+0최근 7일 스타 변화
  • YouDub-webui@liuzhao1225

    오픈 소스 AI 비디오 로컬라이제이션 도구: YouTube/Bilibili 비디오 다운로드, 자막 인식 및 번역, 음성 복제 더빙, 오디오 트랙 믹싱 및 자막 삽입을 자동으로 수행합니다.

    5,404+0최근 7일 스타 변화
  • stt@jianchang512

    음성 인식 텍스트 변환 도구 / JSON, SRT 자막, 순수 텍스트 형식으로 출력하는 오프라인 로컬 오디오/비디오 자막 변환 도구

    4,780+0최근 7일 스타 변화
  • whisper-jax@sanchit-gandhi

    TPU에서 최대 70배 속도 향상을 제공하는 OpenAI Whisper 모델의 JAX 구현

    4,679+0최근 7일 스타 변화
  • fastrtc@gradio-app

    실시간 통신을 위한 파이썬 라이브러리

    4,624+0최근 7일 스타 변화
  • auto-subs@tmoroney

    DaVinci Resolve, Premiere, After Effects에 직접 연결되는 온디바이스 자막 생성

    4,122+0최근 7일 스타 변화
  • Windows LiveCaptions 기반의 가볍고 강력한 실시간 오디오/음성 번역 도구

    3,637+0최근 7일 스타 변화
  • openless@Open-Less

    키를 누르고 말한 뒤 놓으면 어떤 앱에서든 커서에 AI로 다듬어진 텍스트가 입력됩니다. macOS 및 Windows용 오픈소스 음성 입력 도구

    3,403+0최근 7일 스타 변화
  • OpenAI Whisper ASR 웹서비스 API

    3,328+0최근 7일 스타 변화
  • Python을 다루기 귀찮은 분들을 위한 Whisper 및 Faster-Whisper 독립형 실행 파일.

    3,171+0최근 7일 스타 변화
  • BayLing-Speech@BayLing-Models

    LLaMA-Omni는 Llama-3.1-8B-Instruct 기반의 저지연 고품질 엔드투엔드 음성 상호작용 모델로, GPT-4o 수준의 음성 기능 구현을 목표로 합니다.

    3,147+0최근 7일 스타 변화
  • willow@HeyWillow

    오픈 소스, 로컬 및 자체 호스팅 기반의 Amazon Echo/Google Home 경쟁 음성 어시스턴트 대안

    3,101+0최근 7일 스타 변화
  • whishper@pluja

    웹 UI를 사용하여 100% 로컬에서 오디오를 텍스트로 변환하고 자막을 번역 및 편집합니다. Whisper 모델 구동!

    3,068+0최근 7일 스타 변화
  • lingvo@tensorflow

    Lingvo

    2,864+0최근 7일 스타 변화
  • whisper-timestamped@linto-ai

    단어 수준 타임스탬프와 신뢰도를 제공하는 다국어 자동 음성 인식

    2,842+0최근 7일 스타 변화
  • vexa@Vexa-ai

    Google Meet, Microsoft Teams 및 Zoom을 위한 오픈소스 미팅 전사 API. 자동 참가 봇, 실시간 WebSocket 전사, AI 에이전트를 위한 MCP 서버. 셀프 호스팅 또는 SaaS 이용 가능.

    2,741+0최근 7일 스타 변화
  • FluidAudio@FluidInference

    앱에서 사용하는 프론티어 CoreML 오디오 모델 — 텍스트 음성 변환, 음성 텍스트 변환, 음성 활동 감지 및 화자 분리. Swift 기반, SOTA 오픈소스 구동.

    2,723+0최근 7일 스타 변화
  • pluely@iamsrikanthnani

    Cluely의 오픈 소스 대안 - 회의, 면접, 대화 중 상대방 모르게 원활하게 작동하는 초고속, 프라이버시 우선 AI 어시스턴트. Tauri로 빌드되어 네이티브 성능을 제공하며 용량은 불과 10MB입니다. 화상 통화, 화면 공유, 녹화 시 전혀 감지되지 않습니다.

    2,619+0최근 7일 스타 변화
  • STT@coqui-ai

    🐸STT - 음성 인식(Speech-to-Text)을 위한 딥러닝 툴킷. STT 모델 학습과 배포가 그 어느 때 보다 쉬워집니다.

    2,606+0최근 7일 스타 변화
  • foundry-local@microsoft
    2,537+0최근 7일 스타 변화
  • awesome-whisper@sindresorhus

    🔊 OpenAI가 개발한 오픈소스 AI 기반 음성 인식 시스템인 Whisper를 위한 멋진 목록

    2,375+0최근 7일 스타 변화
  • openscreen@getopenscreen

    화면을 녹화하고 데모를 공유하세요. 무료 오픈소스, GPU 가속, 워터마크 없음, 구독 없음. Windows, macOS, Linux 지원. 활발히 유지보수 중.

    2,287+0최근 7일 스타 변화
  • ququ@yan5xu

    오픈소스 무료 Wispr Flow 대안 | FunASR 로컬 모델 및 설정 가능한 대규모 언어 모델이 통합된 차세대 중국어 데스크톱 음성 워크플로

    2,278+0최근 7일 스타 변화
  • audio.cpp@0xShug0

    ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.

    2,214+0최근 7일 스타 변화
  • WhisperJAV@meizhong986

    ASR/STT 자막 생성기. Qwen3-ASR, 로컬 LLM, Whisper, TEN-VAD 사용. JAV에 대한 노이즈 저항성 제공

    2,196+0최근 7일 스타 변화
  • tensorflow 딥러닝 프레임워크와 시퀀스 대 시퀀스 신경망을 사용한 음성 인식

    2,173+0최근 7일 스타 변화
  • soloud@jarikomppa

    게임용 무료, 간편 및 휴대용 오디오 엔진

    2,170+0최근 7일 스타 변화
  • vad@ricky0123

    간단한 API를 제공하는 브라우저용 음성 활동 감지기(VAD)

    2,046+0최근 7일 스타 변화
  • audapolis@bugbakery

    자동 전사가 지원되는 음성 오디오 편집기

    1,892+0최근 7일 스타 변화
  • transcribe.cpp@handy-computer

    16개 이상의 모델 계열을 지원하는 ggml 음성 인식 추론

    1,872+0최근 7일 스타 변화
← 토픽 목록으로