harvey-labs harveyai

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

主要语言
Python
Stars
1,096
Forks
197

标签

  • 数据集
  • 框架
  • 研究Agent
  • 微基准测试
  • 工具调用
  • Python
  • 提示词工程

摘要

Harvey LAB(Legal Agent Benchmark)是一个开源基准测试项目,专为评估LLM智能体在真实法律工作场景中的能力而构建。它包含两大核心组件:覆盖24+法律实践领域、共1671个任务的数据集(含指令、文档和评分标准),以及用于运行和评估智能体的执行框架。项目支持从M&A数据室审查等真实法律任务的端到端执行、评分和结果分析,适用于法律AI研究者和开发者对智能体能力的系统性评测与改进。

README

<p align="center"> <img src="docs/assets/lab-hero.png" alt="Harvey LAB" width="100%"> </p> <p align="center"> <strong>法律智能体基准测试(LAB):一个用于评估智能体在真实法律工作中表现的开源基准测试项目。</strong> </p> <p align="center"> <a href="https://github.com/harveyai/harvey-labs/tags"><img alt="Latest version" src="https://img.shiel…

查看完整页面