harvey-labs harveyai

A benchmark built to evaluate and improve agent capabilities for supporting legal work.

主要言語
Python
Stars
1,096
Forks
197

タグ

  • ベンチマーク
  • データセット
  • AIテスト
  • 法律
  • エージェント評価

概要

法律業務を遂行するLLMエージェントの能力を現実的な環境で評価・改善するためのオープンソースのベンチマーク。エージェントへの指示・文書・採点基準(ルーブリック)を含む1,671件のタスクデータセットと、エージェントの実行・評価を行う実行ハーネスで構成される。M&Aデータルームなどの実務シナリオを題材に、エージェントの成果物を自動採点し、レポートや比較ダッシュボードで結果を確認できる。法務AIエージェントの研究・開発者向けの評価基盤である。

README

<p align="center"> <img src="docs/assets/lab-hero.png" alt="Harvey LAB" width="100%"> </p> <p align="center"> <strong>Legal Agent Benchmark (LAB): 実際の法律業務におけるエージェントを評価するためのオープンソースベンチマーク</strong> </p> <p align="center"> <a href="https://github.com/harveyai/harvey-labs/tags"><img alt="Latest version"…

查看完整页面