video-vec2wav2-tokenizer k9cli

video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.

유형
dataset
다운로드
2,314,634
좋아요
16
접근
public
파일
0

태그

  • 음성 데이터셋
  • 데이터 필터링
  • 음성 인식
  • 음성 합성
  • 파이프라인
  • 비디오 데이터셋
  • 파인튜닝
  • transformers

요약

영상 폴더를 음성인식(ASR)과 음성합성(TTS)용 깨끗한 AI 훈련 데이터셋으로 변환하는 생산 준비 완료형 파이프라인입니다. FFmpeg로 16kHz 모노 PCM 오디오를 추출하고, faster-whisper로 전사한 뒤 타임스탬프 기준으로 클립을 분할하여 metadata.csv/dataset.jsonl 등 매니페스트를 생성합니다. 스트리밍 방식으로 1TB 이상 대규모 미디어도 처리 가능하며 Wav2Vec2 CTC 파인튜닝 학습 기능까지 포함합니다.

README

# video-vec2wav2-tokenizer 프로덕션 준비 완료 파이프라인(Python 패키지 `video_vec2wav2_tokenizer`, CLI 명령어 `video2dataset`)으로, 비디오 폴더를 음성 인식(ASR) 및 텍스트 음성 변환(TTS)을 위한 깨끗한 **AI 학습 데이터셋**으로 변환합니다. ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.…

查看完整页面 · 查看原文