Skip to content

feat: add machine-readable benchmark discovery surfaces - #6

Merged
0xnavarro merged 1 commit into
mainfrom
feat/machine-readable-distribution
Sep 24, 2026
Merged

0xnavarro merged 1 commit into
mainfrom
feat/machine-readable-distribution

Conversation

@0xnavarro

Copy link
Copy Markdown
Contributor

Summary

  • add benchmark.json for stable benchmark discovery
  • add leaderboards/v1.json with canonical raw leaderboard plus explicitly separate Reflex harness/policy lanes
  • add repository-hosted “Evaluated on ReflexBench v1” badge
  • add integrator guidance for benchmark aggregators and model labs
  • add tests that lock the machine-readable leaderboard back to committed public claims/receipts

Why

ReflexBench should be ingestible by model labs, benchmark catalogs and evaluation platforms without scraping prose.

QA

  • PYTHONPATH=reflexbench python3 -m unittest tests.test_machine_surfaces -v ✅
  • python3 tools/check_public_release.py . ✅
  • python3 tools/check_claims.py . ✅
  • git diff --check ✅

Raw engine quality, model+harness ablations and same-response policy results remain separate experimental claims.

@0xnavarro
0xnavarro merged commit 0c3535d into main Sep 24, 2026
2 checks passed
@0xnavarro
0xnavarro deleted the feat/machine-readable-distribution branch September 24, 2026 02:09
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant