Skip to content

Repository files navigation

CUMCM Modeling Analyst

CUMCM Modeling Analyst:从题面与附件审计,经路线确认、Final Run 与 Evidence,到论文和合规交付的数学建模工作流

面向数学建模竞赛的证据驱动 Agent Skill:从题面与附件审计,到路线确认、真实运行、结果审计和论文交付,把每个结论绑定回可检查的来源。

它不是自动交卷器,也不把测试切片包装成生产平台。参赛队员必须理解、重写并人工核验最终论文、程序、数据与结论。

Version 5.4.0 Agent Skill Stage 2 is question by question Python tools

它解决什么问题

数学建模的风险往往不在“能不能写出一个模型名字”,而在于题面和附件没有读透、不同小问的假设互相漂移、代码和论文引用了旧结果,或者一个看似漂亮的数字找不到来源。

这个 Skill 把工作拆成可审计的层:先识别问题与数据,再比较必要的候选路线;路线确认后逐问实现和真实运行;最终结果通过 Run、Evidence、图表 QA、论文 QA 和年度合规审计回到交付物。聊天只保留当前决策所需的信息,深层规则和模板按路线加载。

它适合需要“可解释、可复核、可交接”的建模工作:不是替队伍隐藏假设,而是让假设、决策、运行、结果与论文之间的关系能够被重新检查。

先看两层工作流

稳定竞赛路线

阶段 主要动作 受保护的事实
Read / Explore 读题、附件审计、EDA、baseline 原始输入与数据形状
Decide / Gate 比较必要候选,确认模型与关键语义 Decision Ledger
Run / Validate 按小问实现、验证、执行 Final Run Run、配置与代码快照
Evidence / Paper 绑定结果、图表与论文对象 Evidence、Paper Contract、QA
题面 + 原始附件
      │
      ▼
Stage 1:题面/数据审计 · EDA · baseline · 候选路线
      │
      ▼
当前问题 Decision Brief → 必要时唯一 Human Gate
      │
      ▼
Stage 2:QUESTION_BY_QUESTION 实现 · Validation · Final Run
      │
      ▼
Evidence → Question Solution → Paper Contract → Planner → Engine → QA
      │
      ▼
当前论文状态与官方提交合规分开判断

Stage 2 只支持 QUESTION_BY_QUESTION。不使用 ONE_PASS、BATCH 或“整题一次性 Final”,跨问题依赖通过已接受的 Decision、Run、Evidence 和当前问题 Handoff 传递。

隔离的开发期 runtime

runtime/ 与 visualization/ 是已登记的 development_only 能力:提供动态任务图、结构化 Agent 结果、Artifact provenance、事件 replay、checkpoint、review/repair 和图表候选评审的本地 MVP。它们保留稳定路线的事实边界,不会自动改写现有比赛工作区。

当前 runtime 的 Q3 纵向切片使用 ScriptedModelGateway 做确定性 replay;OpenAI live call、分布式队列、GUI、完整论文 runtime 和正式提交编排尚未执行或实现。详见 P4_REAL_AGENT_REPORT.md 与 RUNTIME_MVP_REPORT.md。

核心机制

机制 它具体做什么 入口
比例化证据 默认使用当前问题的最小充分证据;只有风险或合理替代路线需要时才扩展到 TRIGGERED / FULL。 references/execution-policy.md
唯一 Human Gate 只有材料模型选择或会改变结论的关键语义存在歧义时才暂停;合法继承上游路线,不重复开门。 references/model-decision-gate.md
Provenance 链 把 Decision、Run、Evidence、Question Solution 和论文对象分层保存,避免用聊天记忆或旧输出代替来源。 references/run-lifecycle.md
来源与引用核验 分开记录元数据身份、实际阅读、页面/下载可用性和主张支持;普通查证不强制系统综述,网络核验显式运行。 references/source-policy.md · tools/source_audit.py
Fail-closed 交付 CURRENT_PAPER_READY 与 OFFICIAL_SUBMISSION_READY 分开;机器通过不能冒充队员人工终审或官方核验。 references/final-paper-audit.md

5 分钟开始

1. 安装 Skill

新安装时,将仓库放进你的 Agent Skills 目录:

# Windows PowerShell
git clone https://github.com/Guivyn/cumcm-modeling-analyst.git `
  "$env:USERPROFILE\.codex\skills\cumcm-modeling-analyst"
# macOS / Linux
git clone https://github.com/Guivyn/cumcm-modeling-analyst.git \
  ~/.codex/skills/cumcm-modeling-analyst

也可以按所使用的 Agent 的 Skill 安装方式注册本目录。主入口是 SKILL.md,路由和资源生命周期见 manifest.yaml。

2. 从一次安全的首次请求开始

在支持 Skills 的 Agent 会话中明确调用它,并先限制在 Stage 1:

使用 $cumcm-modeling-analyst。
当前任务只做 Stage 1:审计题面和附件,输出问题结构、数据质量、跨问依赖、候选路线与缺失信息;不要开始正式求解。

确认路线后,再让 Agent 按当前问题进入实现、Validation、Final Run 和 Evidence。不要把探索性结果、未接受路线或机器 QA 直接写成最终结论。

目录与入口

cumcm-modeling-analyst/
├── SKILL.md                 # 主控制器与协作边界
├── manifest.yaml            # 路由、资源加载与生命周期
├── agents/openai.yaml       # Agent 展示信息与默认提示
├── references/              # 按问题阶段加载的深层规则
├── schemas/                 # State / Decision / Run / Evidence / Paper 合约
├── tools/                   # Gate、运行管理、统计/图表/论文/合规 QA
├── runtime/                 # development-only 多 Agent runtime MVP
├── visualization/            # development-only 图表规划与溯源骨架
├── assets/                  # 模板、样式、README 展示素材与年度官方快照
├── tests/                   # 开发期 smoke / regression tests
└── maintenance/             # 维护审计资料,不进入比赛运行路由

重点入口:

本地验证

在 Skill 根目录执行:

python tools/manifest_validate.py --skill-root .
python -m pytest -q
python -m compileall -q tools tests runtime visualization

论文构建和渲染所需依赖见 requirements-paper.txt。单个回归测试和真实渲染边界见 tests/README.md。

边界、状态与责任

  • 不伪造数据、来源、运行记录、Final 数字、论文制品、人工核验或官方合规状态。
  • 题面已有的目标、成本、风险或评分直接使用;人工权重必须标明为场景假设或透明启发式,并在会影响结论时做敏感性分析。
  • 公式、图表、论文与结果都要回到真实源文件、接受的 Run 和对应 Evidence;失败 Run 保留,修复建立新 Run 并记录 supersession 关系。
  • 2026.md 只是本地年度 Runtime 记录。比赛开始、AI disclosure、论文合规和官方导出前,必须重新核验官网、赛区通知、提交系统及最新来源。
  • runtime/、visualization/ 与相关架构文档是开发期能力;测试通过不等于真实 LLM 质量、生产并发能力或官方竞赛就绪。

当前最可靠的入口仍是 SKILL.md + manifest.yaml + 现有 tools/ 工具链。若需要查看 runtime 的真实执行边界,先看报告中的 status classification、测试证据和未实现清单。

参与贡献

欢迎通过 Issue 或 Pull Request 提交问题和改进。涉及路由、Schema、工具、模板或行为变化时,请同步检查 maintenance/DEV_MAINTENANCE.md 与对应回归测试,保持运行时和文档一致。

Built for traceable mathematical modeling workflows — keep the evidence attached to the claim.

About

Evidence-first agent skill for mathematical modeling: problem and data audits, model decisions, reproducible runs, provenance, paper QA, and a development-only multi-agent runtime.

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages