oasst1 OpenAssistant

OpenAssistant Conversations Dataset (OASST1) Dataset Summary In an effort to democratize research on large-scale alignment, we release OpenAssistant Conversations (OASST1), a human-generated, human-annotated assistant-style conversation corpus consisting of 161,443 messages in 35 different languages, annotated with 461,292 quality ratings, resulting in over 10,000 fully annotated conversation trees. The corpus is a product of a worldwide crowd-sourcing effort… See the full description on the dataset page: https://huggingface.co/datasets/OpenAssistant/oasst1.

種別
dataset
ライセンス
apache-2.0
言語
en
ダウンロード
21,688
いいね
1,559
アクセス
public
ファイル
0

タグ

  • 对话データ
  • 対話データ
  • 多言語コーパス
  • 指令微调整
  • RLHF
  • 强化学习
  • 人間フィードバック
  • 大規模言語モデル

概要

OpenAssistant (OASST1) は、13,500人以上のボランティアがクラウドソーシングで構築した、人間生成・人間注釈付きのアシスタント対話データセットです。35言語で161,443件のメッセージ、461,292件の品質評価、10,000本以上の完全注釈付き会話ツリーを含みます。大規模なアライメント(整列)研究の民主化を目的とし、指示追従型モデルの教師付き微調整(SFT)や報酬モデルの訓練に適しています。

README

--- license: apache-2.0 dataset_info: features: - name: message_id dtype: string - name: parent_id dtype: string - name: user_id dtype: string - name: created_date dtype: string - name: text dtype: string - name: role dtype: string - name: lang dtype: string - name: review_count dtype: int32 - name…

查看完整页面 · 查看原文