video-vec2wav2-tokenizer k9cli
video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.
- 유형
- dataset
- 다운로드
- 2,314,634
- 좋아요
- 16
- 접근
- public
- 파일
- 0
태그
- 음성 데이터셋
- 데이터 필터링
- 음성 인식
- 음성 합성
- 파이프라인
- 비디오 데이터셋
- 파인튜닝
- transformers
요약
영상 폴더를 음성인식(ASR)과 음성합성(TTS)용 깨끗한 AI 훈련 데이터셋으로 변환하는 생산 준비 완료형 파이프라인입니다. FFmpeg로 16kHz 모노 PCM 오디오를 추출하고, faster-whisper로 전사한 뒤 타임스탬프 기준으로 클립을 분할하여 metadata.csv/dataset.jsonl 등 매니페스트를 생성합니다. 스트리밍 방식으로 1TB 이상 대규모 미디어도 처리 가능하며 Wav2Vec2 CTC 파인튜닝 학습 기능까지 포함합니다.
README
# video-vec2wav2-tokenizer 프로덕션 준비 완료 파이프라인(Python 패키지 `video_vec2wav2_tokenizer`, CLI 명령어 `video2dataset`)으로, 비디오 폴더를 음성 인식(ASR) 및 텍스트 음성 변환(TTS)을 위한 깨끗한 **AI 학습 데이터셋**으로 변환합니다. ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.…