video-vec2wav2-tokenizer k9cli
video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.
- Tipo
- dataset
- Descargas
- 2,314,634
- Me gusta
- 16
- Acceso
- public
- Archivos
- 0
Etiquetas
- Herramienta de código
- reconocimiento de voz
- texto a voz
- dataset de audio
- whisper
- CLI
- transformers
- speech
Resumen
Herramienta de código que transforma carpetas de videos en datasets limpios de entrenamiento para reconocimiento de voz (ASR) y texto a voz (TTS). Extrae audio mono de 16 kHz, transcribe con faster-whisper, segmenta por timestamps y genera metadata.csv, dataset.jsonl y tts_metadata.csv, además de c…
README
# video-vec2wav2-tokenizer Canalización lista para producción (paquete Python `video_vec2wav2_tokenizer`, comando CLI `video2dataset`) que convierte una carpeta de videos en **conjuntos de datos de IA limpios para reconocimiento de voz (ASR) y texto a voz (TTS)**. ``` videos ──► audio (16 kHz mono …