面向数学建模竞赛的证据驱动 Agent Skill:从题面与附件审计,到路线确认、真实运行、结果审计和论文交付,把每个结论绑定回可检查的来源。
它不是自动交卷器,也不把测试切片包装成生产平台。参赛队员必须理解、重写并人工核验最终论文、程序、数据与结论。
数学建模的风险往往不在“能不能写出一个模型名字”,而在于题面和附件没有读透、不同小问的假设互相漂移、代码和论文引用了旧结果,或者一个看似漂亮的数字找不到来源。
这个 Skill 把工作拆成可审计的层:先识别问题与数据,再比较必要的候选路线;路线确认后逐问实现和真实运行;最终结果通过 Run、Evidence、图表 QA、论文 QA 和年度合规审计回到交付物。聊天只保留当前决策所需的信息,深层规则和模板按路线加载。
它适合需要“可解释、可复核、可交接”的建模工作:不是替队伍隐藏假设,而是让假设、决策、运行、结果与论文之间的关系能够被重新检查。
| 阶段 | 主要动作 | 受保护的事实 |
|---|---|---|
| Read / Explore | 读题、附件审计、EDA、baseline | 原始输入与数据形状 |
| Decide / Gate | 比较必要候选,确认模型与关键语义 | Decision Ledger |
| Run / Validate | 按小问实现、验证、执行 Final Run | Run、配置与代码快照 |
| Evidence / Paper | 绑定结果、图表与论文对象 | Evidence、Paper Contract、QA |
题面 + 原始附件
│
▼
Stage 1:题面/数据审计 · EDA · baseline · 候选路线
│
▼
当前问题 Decision Brief → 必要时唯一 Human Gate
│
▼
Stage 2:QUESTION_BY_QUESTION 实现 · Validation · Final Run
│
▼
Evidence → Question Solution → Paper Contract → Planner → Engine → QA
│
▼
当前论文状态与官方提交合规分开判断
Stage 2 只支持 QUESTION_BY_QUESTION。不使用 ONE_PASS、BATCH 或“整题一次性 Final”,跨问题依赖通过已接受的 Decision、Run、Evidence 和当前问题 Handoff 传递。
runtime/ 与 visualization/ 是已登记的 development_only 能力:提供动态任务图、结构化 Agent 结果、Artifact provenance、事件 replay、checkpoint、review/repair 和图表候选评审的本地 MVP。它们保留稳定路线的事实边界,不会自动改写现有比赛工作区。
当前 runtime 的 Q3 纵向切片使用 ScriptedModelGateway 做确定性 replay;OpenAI live call、分布式队列、GUI、完整论文 runtime 和正式提交编排尚未执行或实现。详见 P4_REAL_AGENT_REPORT.md 与 RUNTIME_MVP_REPORT.md。
| 机制 | 它具体做什么 | 入口 |
|---|---|---|
| 比例化证据 | 默认使用当前问题的最小充分证据;只有风险或合理替代路线需要时才扩展到 TRIGGERED / FULL。 |
references/execution-policy.md |
| 唯一 Human Gate | 只有材料模型选择或会改变结论的关键语义存在歧义时才暂停;合法继承上游路线,不重复开门。 | references/model-decision-gate.md |
| Provenance 链 | 把 Decision、Run、Evidence、Question Solution 和论文对象分层保存,避免用聊天记忆或旧输出代替来源。 | references/run-lifecycle.md |
| 来源与引用核验 | 分开记录元数据身份、实际阅读、页面/下载可用性和主张支持;普通查证不强制系统综述,网络核验显式运行。 | references/source-policy.md · tools/source_audit.py |
| Fail-closed 交付 | CURRENT_PAPER_READY 与 OFFICIAL_SUBMISSION_READY 分开;机器通过不能冒充队员人工终审或官方核验。 |
references/final-paper-audit.md |
新安装时,将仓库放进你的 Agent Skills 目录:
# Windows PowerShell
git clone https://github.com/Guivyn/cumcm-modeling-analyst.git `
"$env:USERPROFILE\.codex\skills\cumcm-modeling-analyst"# macOS / Linux
git clone https://github.com/Guivyn/cumcm-modeling-analyst.git \
~/.codex/skills/cumcm-modeling-analyst也可以按所使用的 Agent 的 Skill 安装方式注册本目录。主入口是 SKILL.md,路由和资源生命周期见 manifest.yaml。
在支持 Skills 的 Agent 会话中明确调用它,并先限制在 Stage 1:
使用 $cumcm-modeling-analyst。
当前任务只做 Stage 1:审计题面和附件,输出问题结构、数据质量、跨问依赖、候选路线与缺失信息;不要开始正式求解。
确认路线后,再让 Agent 按当前问题进入实现、Validation、Final Run 和 Evidence。不要把探索性结果、未接受路线或机器 QA 直接写成最终结论。
cumcm-modeling-analyst/
├── SKILL.md # 主控制器与协作边界
├── manifest.yaml # 路由、资源加载与生命周期
├── agents/openai.yaml # Agent 展示信息与默认提示
├── references/ # 按问题阶段加载的深层规则
├── schemas/ # State / Decision / Run / Evidence / Paper 合约
├── tools/ # Gate、运行管理、统计/图表/论文/合规 QA
├── runtime/ # development-only 多 Agent runtime MVP
├── visualization/ # development-only 图表规划与溯源骨架
├── assets/ # 模板、样式、README 展示素材与年度官方快照
├── tests/ # 开发期 smoke / regression tests
└── maintenance/ # 维护审计资料,不进入比赛运行路由
重点入口:
tools/decision_gate.py:候选声明、自然语言确认、继承与 early stop 验证。tools/run_manager.py:Final Run 前置阻断与接受记录。tools/statistical_audit.py:按风险启用的最小充分统计审计。tools/figure_qa.py:A 级主要图与 B 级草稿图 QA。tools/source_audit.py:离线来源账本完整性、元数据匹配、阅读/可用性和主张定位检查;--network才做网络核验。tools/paper_qa.py:Draft / Final 论文内容、渲染和制品 QA。tools/compliance_audit.py:年度规则、论文、支撑材料与官方导出审计。runtime/runtime.py:隔离的 Task / Artifact / Event / Review runtime MVP;默认不替代稳定入口。visualization/planner.py:按已接受结果规划图表候选,并把数据绑定与 Critic 分开。
在 Skill 根目录执行:
python tools/manifest_validate.py --skill-root .
python -m pytest -q
python -m compileall -q tools tests runtime visualization论文构建和渲染所需依赖见 requirements-paper.txt。单个回归测试和真实渲染边界见 tests/README.md。
- 不伪造数据、来源、运行记录、Final 数字、论文制品、人工核验或官方合规状态。
- 题面已有的目标、成本、风险或评分直接使用;人工权重必须标明为场景假设或透明启发式,并在会影响结论时做敏感性分析。
- 公式、图表、论文与结果都要回到真实源文件、接受的 Run 和对应 Evidence;失败 Run 保留,修复建立新 Run 并记录 supersession 关系。
2026.md只是本地年度 Runtime 记录。比赛开始、AI disclosure、论文合规和官方导出前,必须重新核验官网、赛区通知、提交系统及最新来源。runtime/、visualization/与相关架构文档是开发期能力;测试通过不等于真实 LLM 质量、生产并发能力或官方竞赛就绪。
当前最可靠的入口仍是 SKILL.md + manifest.yaml + 现有 tools/ 工具链。若需要查看 runtime 的真实执行边界,先看报告中的 status classification、测试证据和未实现清单。
欢迎通过 Issue 或 Pull Request 提交问题和改进。涉及路由、Schema、工具、模板或行为变化时,请同步检查 maintenance/DEV_MAINTENANCE.md 与对应回归测试,保持运行时和文档一致。
Built for traceable mathematical modeling workflows — keep the evidence attached to the claim.