본문으로 건너뛰기
buildradar
Sign in
토픽 · asr

asr

asr 태그가 달린 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.

리포지토리
86
총 스타
261,812
평균 스타
3,044
비중
0.01%

같은 리포지토리에 asr 태그와 자주 함께 쓰이는 토픽이에요.

최근 라이징

최근 90일 안에 만들어지고 asr 태그가 달린 리포지토리예요.

  • audio.cpp@0xShug0

    ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.

    2,214
  • Audar-ASR-V1@AudarAI

    Arabic-first generative speech recognition — Audar-ASR-V1 (Flash + Turbo). #1 on the Open Universal Arabic ASR Leaderboard. Model cards, benchmarks & inference.

    501
  • hayamimi@oboroge0

    早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.

    327
  • whisperX@m-bain

    WhisperX: 단어 수준 타임스탬프(& 화자 분리)를 지원하는 자동 음성 인식

    23,864+61최근 7일 스타 변화
  • FunASR@modelscope

    학습, 추론, 스트리밍 ASR, VAD, 구두점, 화자 분리 파이프라인, OpenAI 호환/MCP 서빙을 위한 오픈소스 음성 인식 툴킷.

    20,136+64최근 7일 스타 변화
  • Speech@NVIDIA-NeMo

    대형 언어 모델, 멀티모달, 음성 AI(자동 음성 인식 및 텍스트 음성 변환) 연구자와 개발자를 위해 구축된 확장 가능한 생성형 AI 프레임워크

    18,379+21최근 7일 스타 변화
  • vosk-api@alphacep

    Python, Java, C#, Node를 지원하는 Android, iOS, Raspberry Pi 및 서버용 오프라인 음성 인식 API

    15,101+17최근 7일 스타 변화
  • sherpa-onnx@k2-fsa

    인터넷 연결 없이 onnxruntime과 차세대 Kaldi를 사용하는 음성 인식, 음성 합성, 화자 분할, 음성 강화, 소스 분리 및 VAD. 임베디드 시스템, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 서버, websocket 서버/클라이언트 지원 및 12개 프로그래밍 언어 지원

    14,575+95최근 7일 스타 변화
  • PaddleSpeech@PaddlePaddle

    자기 지도 학습 모델, 구두점이 포함된 SOTA/스트리밍 ASR, 텍스트 프론트엔드가 포함된 스트리밍 TTS, 화자 인증 시스템, 엔드투엔드 음성 번역 및 키워드 스포팅을 포함하는 사용하기 쉬운 음성 툴킷. NAACL2022 최우수 시연상(Best Demo Award) 수상

    12,676+5최근 7일 스타 변화
  • speechbrain@speechbrain

    PyTorch 기반 음성 툴킷

    11,802+10최근 7일 스타 변화
  • SenseVoice@QwenAudio

    중국어, 광동어, 영어, 일본어, 한국어 ASR, 언어 식별, 감정 인식 및 오디오 이벤트 감지를 위한 오픈 소스 SenseVoiceSmall 모델입니다.

    9,209+37최근 7일 스타 변화
  • 주어진 YouTube 동영상의 자막을 가져올 수 있는 Python API입니다. 자동 생성된 자막도 지원하며, 다른 Selenium 기반 솔루션과 달리 API 키나 헤드리스 브라우저가 필요하지 않습니다!

    8,143+14최근 7일 스타 변화
  • wukong-robot@wzpan

    🤖 wukong-robot은 간단하고 유연하며 우수한 중국어 음성 대화 로봇/스마트 스피커 프로젝트로, ChatGPT 멀티턴 대화 기능을 지원하며 뇌-컴퓨터 상호작용을 지원하는 최초의 오픈 소스 스마트 스피커 프로젝트일 수도 있습니다.

    7,126+2최근 7일 스타 변화
  • FunClip@modelscope

    FunASR 기반 비디오 전사, 자막 생성 및 로컬 Gradio UI가 포함된 LLM 지원 클리핑 도구.

    6,210+13최근 7일 스타 변화
  • whisper-diarization@MahmoudAshraf97

    OpenAI Whisper 기반 화자 분리(Speaker Diarization)를 지원하는 자동 음성 인식(ASR)

    5,634+1최근 7일 스타 변화
  • Recorder@xiangyuecn

    HTML5 JS 녹음(mp3, wav, ogg, webm, amr, g711a, g711u 포맷). PC, Android, 일부 iOS 웹 브라우저, 하이브리드 앱(Android/iOS 소스 제공), 위챗 지원. ASR 음성 인식 텍스트 변환, H5 음성 통화 채팅 예제, DTMF 인코딩/디코딩 제공

    5,631+3최근 7일 스타 변화
  • wenet@wenet-e2e

    프로덕션 우선 및 프로덕션 준비가 완료된 엔드투엔드 음성 인식 툴킷

    5,229+1최근 7일 스타 변화
  • LLPlayer@umlx5h

    이중 자막, AI 생성 자막, 실시간 번역 등을 제공하는 언어 학습용 미디어 플레이어!

    4,070+12최근 7일 스타 변화
  • Streamer-Sales@PeterH0323

    Streamer-Sales 쌰오관 — 쇼호스트 LLM 대형 모델🛒🎁, 주어진 상품의 특징에 따라 사용자의 구매 의욕을 자극하는 각도로 상품을 설명할 수 있는 쇼호스트 LLM 대형 모델입니다.🚀⭐ 상세한 데이터 생성 프로세스 포함❗ 📦 또한 LMDeploy 가속 추론🚀, RAG 검색 augmentation 생성 📚, TTS 텍스트 음성 변환🔊, 디지털 휴먼 생성 🦸, Agent를 이용한 실시간 정보 웹 검색🌐, ASR 음성 텍스트 변환🎙️, Vue 생태계 기반 프론트엔드🍍, FastAPI 기반 백엔드🗝️, Docker-compose 패키지 배포🐋 통합

    3,764+1최근 7일 스타 변화
  • openless@Open-Less

    키를 누르고 말한 뒤 놓으면 어떤 앱에서든 커서에 AI로 다듬어진 텍스트가 입력됩니다. macOS 및 Windows용 오픈소스 음성 입력 도구

    3,403+44최근 7일 스타 변화
  • OpenAI Whisper ASR 웹서비스 API

    3,328+2최근 7일 스타 변화
  • Python을 다루기 귀찮은 분들을 위한 Whisper 및 Faster-Whisper 독립형 실행 파일.

    3,171+2최근 7일 스타 변화
  • GPA@AutoArk

    [AutoArk] GPA(General Purpose Audio)는 하나의 작은 모델로 ASR, TTS 및 음성 변환을 수행할 수 있습니다!

    3,061+164최근 7일 스타 변화
  • faster-whisper-GUI@CheshireCC

    PySide6를 사용한 faster_whisper GUI

    2,995+4최근 7일 스타 변화
  • lingvo@tensorflow

    Lingvo

    2,864+0최근 7일 스타 변화
  • whisper-timestamped@linto-ai

    단어 수준 타임스탬프와 신뢰도를 제공하는 다국어 자동 음성 인식

    2,842+1최근 7일 스타 변화
  • FluidAudio@FluidInference

    앱에서 사용하는 프론티어 CoreML 오디오 모델 — 텍스트 음성 변환, 음성 텍스트 변환, 음성 활동 감지 및 화자 분리. Swift 기반, SOTA 오픈소스 구동.

    2,723+13최근 7일 스타 변화
  • STT@coqui-ai

    🐸STT - 음성 인식(Speech-to-Text)을 위한 딥러닝 툴킷. STT 모델 학습과 배포가 그 어느 때 보다 쉬워집니다.

    2,606+1최근 7일 스타 변화
  • AudioNotes@harry0703

    오디오 및 비디오 콘텐츠를 빠르게 추출하여 구조화된 markdown 노트로 정리

    2,483+7최근 7일 스타 변화
  • audio.cpp@0xShug0

    ggml 기반의 오디오 모델용 올인원 순수 C++ 추론 엔진. 고조율된 성능으로 TTS, STT, VAD, 음성 변환, 음악 생성 등을 지원합니다. Python 의존성이 없습니다.

    2,214+115최근 7일 스타 변화
  • FireRedASR@FireRedTeam

    만다린, 중국 방언 및 영어를 지원하는 오픈 소스 산업용 ASR 모델로, 공인된 만다린 ASR 벤치마크에서 새로운 SOTA를 달성하는 동시에 뛰어난 가사 인식 기능도 제공합니다.

    1,975+2최근 7일 스타 변화
  • transcribe.cpp@handy-computer

    16개 이상의 모델 계열을 지원하는 ggml 음성 인식 추론

    1,872+19최근 7일 스타 변화
  • T2/T3/T5AI/ESP32 등을 지원하는 차세대 AI+IoT 프레임워크 – 빠른 IoT 및 AI Agent 하드웨어 통합

    1,816+5최근 7일 스타 변화
← 토픽 목록으로