speech-to-speech huggingface

Build local voice agents with open-source models

주요 언어
Python
Stars
12,039
Forks
1,475

태그

  • CLI 도구
  • AI 에이전트
  • 음성 AI
  • 실시간
  • 로컬 배포
  • 파이썬

요약

오픈소스 모델만으로 저지연 로컬 음성 에이전트를 구축할 수 있는 모듈형 파이프라인입니다. VAD→STT→LLM→TTS 4단계를 큐로 연결하며 각 구성 요소를 CLI 플래그로 자유롭게 교체할 수 있습니다. OpenAI Realtime 호환 WebSocket API를 제공해 기존 클라이언트를 그대로 연결할 수 있고, LLM은 호스팅 제공자나 로컬 vLLM·llama.cpp 서버에 연결해 완전 로컬 스택도 구성 가능합니다. 음성 로봇·실시간 대화 애플리케이션 등에 적합합니다.

README

<div align="center"> <div>&nbsp;</div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: 오픈소스 모델로 음성 에이전트 구축하기 [![PyPI](https://img.shields.io/pypi/v/speech-to-speech)](https://pypi.org/project/speech-to-speech/) [![Python](htt…

查看完整页面