Nemotron-RL-Agentic-Terminal-Pivot-v1 nvidia
- 유형
- dataset
- 라이선스
- cc-by-4.0
- 언어
- en
- 다운로드
- 445
- 좋아요
- 15
- 접근
- public
- 파일
- 3
태그
- 코드 생성
- 에이전트
- 대규모 언어 모델
- 강화학습
- 강화 학습
- 텍스트 생성
- 합성 데이터
- 데이터셋
요약
NVIDIA가 공개한 텍스트 데이터셋으로, 명령줄(터미널) 사용 LLM 에이전트의 강화학습 훈련용 훈련 샘플을 제공합니다. 각 레코드는 성공한 에이전트 궤적에서 추출한 단일 의사결정 지점으로, 프롬프트·기준 행동·판독기 라우팅 정보를 담습니다. NeMo Gym의 terminus_judge 환경과 연동되어 RLVR 방식의 보상을 산출하며, 슈퍼바이즈드 파인튜닝이나 터미널 에이전트 행동 분석에도 활용 가능합니다. 코드 생성, 도구 사용, 추론 중심의 실제 장기 운영 작업을 다룹니다.
README
--- license: - cc-by-4.0 language: - en task_categories: - text-generation pretty_name: Nemotron-RL-Agentic-Terminal-Pivot-v1 tags: - text - agentic - code - software engineering - tool use - reasoning - reinforcement-learning - synthetic - human - terminal size_categories: - 10K<n<100K --- ## 데이터셋…