Preregistered AI-safety study of sandbagging model organisms: trigger type sets the sign of cross-capability alignment (task-local locks dismantle it, situational locks amplify it) and cue-sharing sets its size. All five predictions failed, four reversed.
reproducible-research transformers lora model-organisms ai-safety interpretability preregistration peft ai-alignment negative-results llm mechanistic-interpretability gsm8k qwen activation-steering mbpp sandbagging linear-probes capability-elicitation password-locked-models
-
Updated
Sep 5, 2026 - Python