Skip to content

Phase G: verifier-derived training rewards with kernel-observed divergence penalty - #65

Merged
txmed82 merged 1 commit into
mainfrom
feat/phase-g-divergence-training-rewards
Sep 10, 2026
Merged

Phase G: verifier-derived training rewards with kernel-observed divergence penalty#65
txmed82 merged 1 commit into
mainfrom
feat/phase-g-divergence-training-rewards

Conversation

@txmed82

@txmed82 txmed82 commented Sep 10, 2026

Copy link
Copy Markdown
Contributor

What

  • Wires kernel-observed episode divergence (diverged_observed) into export_verifiers.py:rollout_vector context during training rollouts.
  • Adopts context.get("diverged_observed") in LumenVerifier and wrap.py verifier generator: when engine info lacks a divergence channel, non-finite tags observed across full episode steps correctly mark diverged = True.
  • Evaluates diverged episodes as failed gates and sets the diverged metric to True, driving declarative projection to 0.0 without manual reward shaping.
  • Adds regression unit test in tests/test_eval_run.py covering verifier divergence gate failure under diverged_observed.
  • Updates docs/NEXT_STATUS.md ledger reflecting D5 cloud parity (feat: Phase D5 explicit cohort subgroup validation, head-covered trial bindings, and clustered continuous bootstrap #64, vector-cloud Phase 5: decision rule and contestation #5) and Phase G training reward adoption.

Why

Phase G requires that verifier-derived training rewards reflect authoritative vectors rather than fabricated physics or unobserved convergence. Wiring kernel-observed divergence ensures diverged solver rollouts penalize training rewards directly.

Verify

  • uv run ruff check --fix && uv run ruff format --check && uv run mypy clean.
  • Evaluation test suites green (65 passed).

@txmed82

txmed82 commented Sep 10, 2026

Copy link
Copy Markdown
Contributor Author

@droid review

@factory-droid

factory-droid Bot commented Sep 10, 2026

Copy link
Copy Markdown

Droid finished @txmed82's task —— View job


Security Review

No inline comments. The divergence-observed wiring looks consistent across export_verifiers, wrap verifiers, and the Lumen example, and the added regression test covers the intended behavior.

@factory-droid

factory-droid Bot commented Sep 10, 2026

Copy link
Copy Markdown

Droid finished @txmed82's task —— View job


No inline review comments to add. The changes look consistent with wiring kernel-observed divergence into verifier scoring so diverged rollouts fail gating as intended.

@txmed82
txmed82 merged commit 7c9c9f8 into main Sep 10, 2026
7 checks passed
@txmed82
txmed82 deleted the feat/phase-g-divergence-training-rewards branch September 10, 2026 22:50
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

2 participants