speech-to-speech huggingface
Build local voice agents with open-source models
- 主要言語
- Python
- Stars
- 12,039
- Forks
- 1,475
タグ
- ライブラリ/SDK
- AIワークフロー
- 音声エージェント
- リアルタイム
- ローカルAI
- セルフホスト
- バックエンド
概要
VAD→STT→LLM→TTSの4段構成を低遅延・完全モジュール化した音声エージェント用Pythonライブラリ。OpenAI Realtime互換のWebSocket APIを公開し、各コンポーネントを自由に差し替えられる。LLMはOpenAI互換プロトコルに対応し、ホスト型プロバイダーからvLLMやllama.cppによる完全ローカル構成まで柔軟に選択可能。ロボットの会話バックエンドとして本番運用されている。
README
<div align="center"> <div> </div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: オープンソースモデルで音声エージェントを構築する [](https://pypi.org/project/speech-to-speech/) [![Python](…