harvey-labs harveyai

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

주요 언어
Python
Stars
1,096
Forks
197

태그

  • AI 에이전트
  • 벤치마크
  • 데이터셋
  • 프레임워크
  • 파이썬
  • LLM 평가

요약

Harvey LAB은 실제 법률 업무 환경에서 LLM 에이전트의 능력을 평가·개선하기 위한 오픈소스 벤치마크입니다. 에이전트 지시문·문서·평가 기준(rubric)을 담은 1,671개 태스크 데이터셋과 이를 실행·채점하는 실행 하네스(execution harness)로 구성됩니다. M&A 실사 같은 현실적인 법률 과제를 활용해 에이전트 실행, 점수 산출, 리포트 비교까지 파이프라인으로 제공하며, 법률 AI 및 에이전트 연구에 활용할 수 있습니다.

README

<p align="center"> <img src="docs/assets/lab-hero.png" alt="Harvey LAB" width="100%"> </p> <p align="center"> <strong>Legal Agent Benchmark (LAB): 실제 법률 업무에서 에이전트를 평가하는 오픈소스 벤치마크입니다.</strong> </p> <p align="center"> <a href="https://github.com/harveyai/harvey-labs/tags"><img alt="Latest version" sr…

查看完整页面