video-vec2wav2-tokenizer k9cli

video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.

Typ
dataset
Downloads
2,314,634
Likes
16
Zugriff
public
Dateien
0

Tags

  • 语音识别
  • 语音合成
  • 文本转语音
  • 音频数据集
  • Python
  • 机器学习
  • 微调
  • Spracherkennung

Zusammenfassung

Dieses Tool verwandelt Videoordner in bereinigte KI-Trainingsdatensätze für Spracherkennung (ASR) und Text-to-Speech (TTS) mittels FFmpeg-Audioextraktion und faster-whisper-Transkription. Es erzeugt segmentierte Audio-Clips samt metadata.csv, dataset.jsonl und tts_metadata.csv und bietet optional M…

README

# video-vec2wav2-tokenizer Produktionsreife Pipeline (Python-Paket `video_vec2wav2_tokenizer`, CLI-Befehl `video2dataset`), die einen Ordner mit Videos in saubere **KI-Trainingsdatensätze für Spracherkennung (ASR) und Text-to-Speech (TTS)** verwandelt. ``` videos ──► audio (16 kHz mono PCM) ──► whi…

查看完整页面 · 查看原文