Dependency-free statistical checks for AI eval claims: multiple-comparisons correction, LLM-judge bias tests, and leave-one-out fragility. Run them before you publish.
python benchmark statistics mcp evaluation reproducibility multiple-comparisons ai-agents mlops llm llm-eval llm-evaluation model-context-protocol mcp-server judge-bias eval-integrity
-
Updated
Jul 24, 2026 - Python