video-vec2wav2-tokenizer-3 k9cli

video-vec2wav2-tokenizer-3 Version 3 - continuation shard of the video-to-AI-dataset tokenizer project. Version 2 - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──►… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer-3.

種別
dataset
ダウンロード
305,193
いいね
1
アクセス
public
ファイル
0

タグ

  • 音声データセット
  • 音声認識
  • 音声合成
  • 動画データセット
  • テキストデータセット
  • 機械学習
  • NLP

概要

本データセットは、動画フォルダを音声認識(ASR)と音声合成(TTS)の学習用クリーンデータセットに変換するパイプラインの継続シャードです。FFmpegで動画から16kHz・モノラル音声を抽出し、faster-whisperによる文字起こしとタイムスタンプ分割でクリップ化し、metadata.csvやtts_metadata.csvなどのマニフェストを生成します。さらにWav2Vec2のCTC学習スクリプトやストリーミング特徴抽出機能も同梱し、音声データセット構築からモデル微調整までを一括支援します。

README

# video-vec2wav2-tokenizer-3 > **Version 3** - continuation shard of the video-to-AI-dataset tokenizer project. > **Version 2** - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package `video_vec2wav2_tokenizer`, CLI command `video2dataset`) that …

查看完整页面 · 查看原文