video-vec2wav2-tokenizer k9cli
video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.
- 类型
- dataset
- 下载量
- 2,314,634
- 点赞
- 16
- 访问
- public
- 文件
- 0
标签
- 音频数据处理
- 语音识别
- 语音合成
- 自动语音识别
- 视频数据集
- 微调
- PyTorch
- 文本生成语音
摘要
这是一个生产级数据处理管道,可将视频文件夹转换为适用于语音识别(ASR)和语音合成(TTS)训练的干净数据集。它依次完成FFmpeg音频提取、faster-whisper转写、按时间戳切分音频片段,并输出metadata.csv、dataset.jsonl等标准格式,同时支持流式特征提取和Wav2Vec2 CTC微调训练。
README
# video-vec2wav2-tokenizer 生产就绪的流水线(Python 包 `video_vec2wav2_tokenizer`,CLI 命令 `video2dataset`),可将视频文件夹转换为干净的**用于语音识别(ASR)和语音合成(TTS)的 AI 训练数据集**。 ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json ``` * **视频处理** …