video-vec2wav2-tokenizer-2 k9cli

video-vec2wav2-tokenizer-2 Version 2 - continuation shard of the video-to-AI-dataset tokenizer project. Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing —… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer-2.

类型
dataset
下载量
582,146
点赞
4
访问
public
文件
0

标签

  • 音频数据集
  • 语音识别
  • 语音合成
  • 音频数据处理
  • 数据处理
  • 语音
  • transformers

摘要

这是一个把视频文件夹转化为干净语音识别(ASR)与语音合成(TTS)训练数据集的完整流水线工具包。它通过FFmpeg提取16kHz单声道音频,用faster-whisper做语音识别与转写,并按时间戳切割成语音片段,最终生成metadata.csv、dataset.jsonl、tts_metadata.csv等标准数据集格式。支持流式特征提取、Wav2Vec2 CTC微调训练,并能在超大规模音频上保持内存高效运行。

README

# video-vec2wav2-tokenizer-2 > **版本 2** —— 视频转 AI 数据集 tokenizer 项目的延续分片。 生产级流水线(Python 包 `video_vec2wav2_tokenizer`,CLI 命令 `video2dataset`),可将视频文件夹转换为干净的 **用于语音识别(ASR)和文本转语音(TTS)的 AI 训练数据集**。 ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / …

查看完整页面 · 查看原文