video-vec2wav2-tokenizer k9cli

video-vec2wav2-tokenizer Production-ready pipeline (Python package video_vec2wav2_tokenizer, CLI command video2dataset) that turns a folder of videos into clean AI training datasets for speech recognition (ASR) and text-to-speech (TTS). videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv / report.json Video processing — recursive scan of mp4 / mkv / avi / mov / webm, FFmpeg audio extraction to mono ·… See the full description on the dataset page: https://huggingface.co/datasets/k9cli/video-vec2wav2-tokenizer.

種別
dataset
ダウンロード
2,314,634
いいね
16
アクセス
public
ファイル
0

タグ

  • 音声認識
  • 音声合成
  • データセット
  • 音声処理
  • 動画データベース
  • 音声データセット
  • 事前学習
  • 機械学習

概要

動画フォルダからASR(音声認識)とTTS(音声合成)向けの整ったAI学習データセットを構築する生産向けパイプライン。FFmpegで音声抽出、faster-whisperで文字起こし、タイムスタンプによるクリップ分割、メタデータCSV/JSONL生成、特徴抽出、Wav2Vec2 CTC学習までを一貫して実行する。ストリーミング処理で1TB超の大規模メディアにも対応し、マルチGPU学習や再開機能も備える。

README

# video-vec2wav2-tokenizer 本番稼働対応のパイプライン(Python パッケージ `video_vec2wav2_tokenizer`、CLI コマンド `video2dataset`)で、動画フォルダを音声認識(ASR)および音声合成(TTS)のためのクリーンな **AI トレーニングデータセット** に変換します。 ``` videos ──► audio (16 kHz mono PCM) ──► whisper transcript ──► clips ──► metadata.csv / dataset.jsonl / tts_metadata.csv /…

查看完整页面 · 查看原文