speech-to-speech huggingface
Build local voice agents with open-source models
- 주요 언어
- Python
- Stars
- 12,039
- Forks
- 1,475
태그
- CLI 도구
- AI 에이전트
- 음성 AI
- 실시간
- 로컬 배포
- 파이썬
요약
오픈소스 모델만으로 저지연 로컬 음성 에이전트를 구축할 수 있는 모듈형 파이프라인입니다. VAD→STT→LLM→TTS 4단계를 큐로 연결하며 각 구성 요소를 CLI 플래그로 자유롭게 교체할 수 있습니다. OpenAI Realtime 호환 WebSocket API를 제공해 기존 클라이언트를 그대로 연결할 수 있고, LLM은 호스팅 제공자나 로컬 vLLM·llama.cpp 서버에 연결해 완전 로컬 스택도 구성 가능합니다. 음성 로봇·실시간 대화 애플리케이션 등에 적합합니다.
README
<div align="center"> <div> </div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: 오픈소스 모델로 음성 에이전트 구축하기 [](https://pypi.org/project/speech-to-speech/) [![Python](htt…