speech-to-speech huggingface

Build local voice agents with open-source models

Hauptsprache
Python
Stars
12,039
Forks
1,475

Tags

  • Framework
  • Sprachagent
  • Spracherkennung
  • Echtzeit
  • Lokale KI
  • Multimodal

Zusammenfassung

Dieses Projekt stellt eine vollständig modulare, latenzarme Voice-Agent-Pipeline (VAD → STT → LLM → TTS) bereit, die über eine OpenAI-Realtime-kompatible WebSocket-API angeboten wird. Jede Komponente ist austauschbar und lässt sich mit lokalen Open-Source-Modellen (z. B. Parakeet, Whisper, Qwen3-TT…

README

<div align="center"> <div>&nbsp;</div> <img src="https://raw.githubusercontent.com/huggingface/speech-to-speech/main/logo.png" width="600"/> # Speech To Speech: Sprach-Agenten mit Open-Source-Modellen erstellen [![PyPI](https://img.shields.io/pypi/v/speech-to-speech)](https://pypi.org/project/speec…

查看完整页面