Agent-Eval logo

Agent-Eval

LLMエージェントの統計的回帰テスト

Artificial Intelligence Developer Tools GitHub Open Source

概要

エージェントの挙動変化を統計的に検証するツール。バージョンA/Bをそれぞれ50回実行し、p値だけでなく分布の変化を示す効果量と95%信頼区間を算出します。

特長

完全自ホスト可能でApache 2.0。SaaS不要。LangGraph、OpenAI Agents SDK、CrewAI、LangChain LCELとネイティブ連携。

アプローチ

Mann-Whitney U検定、ブートストラップCI、Cohen's dを組み合わせ、変化の有意性と実質的な影響を評価。

データ品質

30未満の実行で警告、10未満でINSUFFICIENT_DATA。

将来展望

次のバージョン検討と優先順位の議論を促進。

投票数: 2
← 投稿一覧に戻る