speech-to-speech huggingface
Build local voice agents with open-source models
- Hauptsprache
- Python
- Stars
- 12,039
- Forks
- 1,475
Tags
- Framework
- Sprachagent
- Spracherkennung
- Echtzeit
- Lokale KI
- Multimodal
Zusammenfassung
Dieses Projekt stellt eine vollständig modulare, latenzarme Voice-Agent-Pipeline (VAD → STT → LLM → TTS) bereit, die über eine OpenAI-Realtime-kompatible WebSocket-API angeboten wird. Jede Komponente ist austauschbar und lässt sich mit lokalen Open-Source-Modellen (z. B. Parakeet, Whisper, Qwen3-TT…
README
<div align="center"> <div> </div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: Sprach-Agenten mit Open-Source-Modellen erstellen [](https://pypi.org/project/speec…