video-vec2wav2-tokenizer k9cli

video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.

类型
dataset
下载量
2,314,634
点赞
16
访问
public
文件
0

标签

  • 音频数据处理
  • 语音识别
  • 语音合成
  • 自动语音识别
  • 视频数据集
  • 微调
  • PyTorch
  • 文本生成语音

摘要

这是一个生产级数据处理管道,可将视频文件夹转换为适用于语音识别(ASR)和语音合成(TTS)训练的干净数据集。它依次完成FFmpeg音频提取、faster-whisper转写、按时间戳切分音频片段,并输出metadata.csv、dataset.jsonl等标准格式,同时支持流式特征提取和Wav2Vec2 CTC微调训练。

README

# video-vec2wav2-tokenizer 生产就绪的流水线(Python 包 `video_vec2wav2_tokenizer`,CLI 命令 `video2dataset`),可将视频文件夹转换为干净的**用于语音识别(ASR)和语音合成(TTS)的 AI 训练数据集**。 ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json ``` * **视频处理** …

查看完整页面 · 查看原文