video-vec2wav2-tokenizer-3 k9cli
video-vec2wav2-tokenizer-3 Version 3 - continuation shard of the video-to-AI-dataset tokenizer project. Version 2 - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──►… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer-3.
- 类型
- dataset
- 下载量
- 305,193
- 点赞
- 1
- 访问
- public
- 文件
- 0
标签
- 音频数据集
- 语音识别
- 语音合成
- 音频数据处理
- 数据处理
- 视频数据集
- 微调
- PyTorch
摘要
该数据集/工具提供了一套生产级管道(video2dataset命令),可将视频文件夹转换为干净的语音识别(ASR)和语音合成(TTS)AI训练数据集。核心能力包括视频音频提取、faster-whisper语音识别与时间戳分段、数据集清单生成以及Wav2Vec2 CTC微调训练,支持流式处理和超大规模语料。适用于构建ASR/TTS训练语料,以及下游的语音模型微调训练场景。
README
# video-vec2wav2-tokenizer-3 > **第 3 版** — video-to-AI-dataset tokenizer 项目的延续分片。 > **第 2 版** — video-to-AI-dataset tokenizer 项目的延续分片。 生产就绪的流水线(Python 包 `video_vec2wav2_tokenizer`,命令行命令 `video2dataset`),可将包含视频的文件夹转换为干净的 **用于语音识别(ASR)和文本转语音(TTS)的 AI 训练数据集**。 ``` videos ──► audio (16 kHz mono PCM) ──…