whisper-large-v3 openai

種別
model
タスク
automatic-speech-recognition
フレームワーク
transformers
ダウンロード
5,075,565
いいね
6,148
アクセス
public
ファイル
0

タグ

  • 音声認識
  • 音声翻訳
  • 音声モデル
  • 多言語
  • transformers
  • ゼロショット
  • Apache-2.0

概要

OpenAIが開発した最先端の自動音声認識(ASR)および音声翻訳モデルです。100万時間の弱教師あり音声と400万時間の擬似ラベル音声で学習され、100以上の言語に対応し、ゼロショットで多様なデータセットやドメインに汎化できます。large-v2と比較して誤りを10〜20%削減し、音声の文字起こし、翻訳、タイムスタンプ予測が可能です。長い音声や任意の長さの音声を扱えるほか、transformersのpipelineで容易に利用できます。

README

--- language: - en - zh - de - es - ru - ko - fr - ja - pt - tr - pl - ca - nl - ar - sv - it - id - hi - fi - vi - he - uk - el - ms - cs - ro - da - hu - ta - no - th - ur - hr - bg - lt - la - mi - ml - cy - sk - te - fa - lv - bn - sr - az - sl - kn - et - mk - br - eu - is - hy - ne - mn - bs …

查看完整页面 · 查看原文