Agent-Eval
ストックにはログインが必要です
LLMエージェントの統計的回帰テスト
Artificial Intelligence
Developer Tools
GitHub
Open Source
概要
エージェントの挙動変化を統計的に検証するツール。バージョンA/Bをそれぞれ50回実行し、p値だけでなく分布の変化を示す効果量と95%信頼区間を算出します。
特長
完全自ホスト可能でApache 2.0。SaaS不要。LangGraph、OpenAI Agents SDK、CrewAI、LangChain LCELとネイティブ連携。
アプローチ
Mann-Whitney U検定、ブートストラップCI、Cohen's dを組み合わせ、変化の有意性と実質的な影響を評価。
データ品質
30未満の実行で警告、10未満でINSUFFICIENT_DATA。
将来展望
次のバージョン検討と優先順位の議論を促進。
投票数: 2