Nemotron-RL-Agentic-Terminal-Pivot-v1 nvidia

유형
dataset
라이선스
cc-by-4.0
언어
en
다운로드
445
좋아요
15
접근
public
파일
3

태그

  • 코드 생성
  • 에이전트
  • 대규모 언어 모델
  • 강화학습
  • 강화 학습
  • 텍스트 생성
  • 합성 데이터
  • 데이터셋

요약

NVIDIA가 공개한 텍스트 데이터셋으로, 명령줄(터미널) 사용 LLM 에이전트의 강화학습 훈련용 훈련 샘플을 제공합니다. 각 레코드는 성공한 에이전트 궤적에서 추출한 단일 의사결정 지점으로, 프롬프트·기준 행동·판독기 라우팅 정보를 담습니다. NeMo Gym의 terminus_judge 환경과 연동되어 RLVR 방식의 보상을 산출하며, 슈퍼바이즈드 파인튜닝이나 터미널 에이전트 행동 분석에도 활용 가능합니다. 코드 생성, 도구 사용, 추론 중심의 실제 장기 운영 작업을 다룹니다.

README

--- license: - cc-by-4.0 language: - en task_categories: - text-generation pretty_name: Nemotron-RL-Agentic-Terminal-Pivot-v1 tags: - text - agentic - code - software engineering - tool use - reasoning - reinforcement-learning - synthetic - human - terminal size_categories: - 10K<n<100K --- ## 데이터셋…

查看完整页面 · 查看原文