whisper-large-v3 openai
- 種別
- model
- タスク
- automatic-speech-recognition
- フレームワーク
- transformers
- ダウンロード
- 5,075,565
- いいね
- 6,148
- アクセス
- public
- ファイル
- 0
タグ
- 音声認識
- 音声翻訳
- 音声モデル
- 多言語
- transformers
- ゼロショット
- Apache-2.0
概要
OpenAIが開発した最先端の自動音声認識(ASR)および音声翻訳モデルです。100万時間の弱教師あり音声と400万時間の擬似ラベル音声で学習され、100以上の言語に対応し、ゼロショットで多様なデータセットやドメインに汎化できます。large-v2と比較して誤りを10〜20%削減し、音声の文字起こし、翻訳、タイムスタンプ予測が可能です。長い音声や任意の長さの音声を扱えるほか、transformersのpipelineで容易に利用できます。
README
--- language: - en - zh - de - es - ru - ko - fr - ja - pt - tr - pl - ca - nl - ar - sv - it - id - hi - fi - vi - he - uk - el - ms - cs - ro - da - hu - ta - no - th - ur - hr - bg - lt - la - mi - ml - cy - sk - te - fa - lv - bn - sr - az - sl - kn - et - mk - br - eu - is - hy - ne - mn - bs …