video-vec2wav2-tokenizer-3 k9cli
video-vec2wav2-tokenizer-3 Version 3 - continuation shard of the video-to-AI-dataset tokenizer project. Version 2 - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──►… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer-3.
- 種別
- dataset
- ダウンロード
- 305,193
- いいね
- 1
- アクセス
- public
- ファイル
- 0
タグ
- 音声データセット
- 音声認識
- 音声合成
- 動画データセット
- テキストデータセット
- 機械学習
- NLP
概要
本データセットは、動画フォルダを音声認識(ASR)と音声合成(TTS)の学習用クリーンデータセットに変換するパイプラインの継続シャードです。FFmpegで動画から16kHz・モノラル音声を抽出し、faster-whisperによる文字起こしとタイムスタンプ分割でクリップ化し、metadata.csvやtts_metadata.csvなどのマニフェストを生成します。さらにWav2Vec2のCTC学習スクリプトやストリーミング特徴抽出機能も同梱し、音声データセット構築からモデル微調整までを一括支援します。
README
# video-vec2wav2-tokenizer-3 > **Version 3** - continuation shard of the video-to-AI-dataset tokenizer project. > **Version 2** - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package `video_vec2wav2_tokenizer`, CLI command `video2dataset`) that …