video-vec2wav2-tokenizer-2 k9cli
video-vec2wav2-tokenizer-2 Version 2 - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing —… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer-2.
- 类型
- dataset
- 下载量
- 582,146
- 点赞
- 4
- 访问
- public
- 文件
- 0
标签
- 音频数据集
- 语音识别
- 语音合成
- 音频数据处理
- 数据处理
- 语音
- transformers
摘要
这是一个把视频文件夹转化为干净语音识别(ASR)与语音合成(TTS)训练数据集的完整流水线工具包。它通过FFmpeg提取16kHz单声道音频,用faster-whisper做语音识别与转写,并按时间戳切割成语音片段,最终生成metadata.csv、dataset.jsonl、tts_metadata.csv等标准数据集格式。支持流式特征提取、Wav2Vec2 CTC微调训练,并能在超大规模音频上保持内存高效运行。
README
# video-vec2wav2-tokenizer-2 > **版本 2** —— 视频转 AI 数据集 tokenizer 项目的延续分片。 生产级流水线(Python 包 `video_vec2wav2_tokenizer`,CLI 命令 `video2dataset`),可将视频文件夹转换为干净的 **用于语音识别(ASR)和文本转语音(TTS)的 AI 训练数据集**。 ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / …