简体中文 | English
面向多 Agent 软件修复的治理型、证据优先 SkillOps 平台,构建于 AgentTeams 之上。
AgentLoom 将第三方 Agent Skill 转化为可审查、可授权、可测试、可审计的能力。 参赛场景从生产风格的修复任务开始,以经过独立验证、可回放的证据结束。
当前证据基线(2026-08-16): AgentTeams
v1.1.2使用minimax-cn / MiniMax-M2.5完成了Administrator -> Manager -> Investigator -> Verifier -> 已认证 Higress -> Policy Broker -> 不可变 Docker pytest 沙箱链路,并产生且仅产生一个受治理的SUCCEEDEDToolCall。历史 clean-clone Lite 证据为 339 passed / 0 failed / 3 skipped(可选 Docker 测试),冻结v0.1.0门禁为 375 passed / 3 skipped。当前 public main 的 GitHub Actions 会构建不可变沙箱镜像,门禁为 379 passed / 0 skipped;Task 24 两模式基准为 6 PASSED / 0 NOT_RUN。Skill 目录状态为 2 PUBLISHED / 4 QUARANTINED; 团队原创patch-scope-validatorv1.0.1 的三次治理调用均已严格重开。 Human L2 审批为APPROVED,上游 PR #1141 仍为OPEN。 真人录制、匿名公开播放和正式v0.1.0Release 均已验证。最终八项 P0 提交包已完成审计,SHA-256 为0c5dfeb0ba6665609a14129a76cc1c239aed882a17e930c144aa5d3b88f6c306; 目前只有竞赛页面提交仍是 Human 负责的检查点。
- 赛道:Agent Infra
- 方向:软件研发全流程协同
- 运行时:AgentTeams/HiClaw
v1.1.2 - 当前付费证据 Provider:
minimax-cn / MiniMax-M2.5 - 当前结果:Task 24 三案例两模式矩阵 6/6 完成;Task 17 另行证明一个成功 ToolCall 经过 Higress、Policy Broker 和全新 Docker 沙箱的完整治理链路
- 当前 public main 门禁:启用不可变 Docker 沙箱测试后 379 passed / 0 skipped;
冻结
v0.1.0门禁:375 passed / 3 skipped;clean-clone Lite 证据: 339 passed / 0 failed / 3 skipped;Ruff、strict mypy、pip-audit、语法、 迁移、Diff 和密钥检查通过 - Skill 状态:
code-review-and-quality(上游)和patch-scope-validator(团队原创) 为PUBLISHED,另外四个上游 Skill 为QUARANTINED;三次原创 Skill 调用均可按完整身份闭包重开 - 提交状态:P0 提交包、公开 Demo 和
v0.1.0Release 已完成;竞赛页面提交待完成
当前证据和提交声明索引见初赛提交记录。 最终包的精确文件清单与哈希见公开提交包 manifest, Human 操作步骤见赛事提交操作清单。
flowchart LR
Administrator["Administrator"] --> Manager["AgentTeams Manager"]
Manager --> Investigator["Investigator"]
Investigator -->|"受治理委派"| Verifier["Verifier"]
Verifier --> Higress["已认证 Higress"]
Higress --> Broker["AgentLoom Policy Broker"]
Broker --> Grant["签名且限定作用域的 Grant"]
Broker --> Sandbox["不可变 Docker pytest 沙箱"]
Broker --> Evidence["可回放 ToolCall 证据"]
Human["Human L2 审批者"] --> Broker
Manager 无权调用 Policy Broker,Worker 不持有 Broker 签名密钥。受治理的
ToolCall 必须同时具备已认证 Worker 身份,以及短时有效、绑定 Consumer、参数和
单次使用的 SkillExecutionGrant。Broker 持久化 nonce 消费记录和可回放事件摘要,
再把不可信 pytest 放入全新、禁网、只读挂载工作区的 Docker 沙箱运行。Policy、
身份、沙箱和 Agent 作用域都是运行时控制,不只存在于 Prompt 或文档中。
完整设计见 AgentLoom 架构设计。
前置条件:Python 3.12 和 Git。以下命令不会调用模型或付费 API。
python -m venv .venv
.venv\Scripts\python -m pip install -e ".[dev]"
.venv\Scripts\python -m pytest
.venv\Scripts\ruff check .
.venv\Scripts\mypy src tests无需 LLM 或云额度即可运行任一确定性修复案例:
.venv\Scripts\python -m agentloom.mock_repair `
--case-root .\demo\cases\severity-normalization `
--output-root .\artifacts\demo\severity-normalization将 severity-normalization 替换成 pagination-boundary 即可运行第二个案例。
本地证据控制面板的启动方式为:
.venv\Scripts\agentloom tui清洁 clone 的失败关闭门禁只有一个入口:
scripts/verify-clean-reproduction.ps1。
它创建全新证据、运行确定性 Demo 和全部质量门禁,并输出脱敏 JSON 摘要及 SHA-256。
详见清洁环境复现指南和
五分钟快速开始。
部署、Provider 激活、Policy Broker、Higress 和严格 E2E 的权威说明位于
deploy/agentteams/README.md。Full 模式要求预先安装
锁定版本的 AgentTeams/HiClaw v1.1.2;AgentLoom 不提供单容器独立发行版。
已固化的维护者付费证据只使用 MiniMax。新的 Live 探测可按场景选择 MiniMax 或 StepFun,但必须使用唯一 run ID 并记录准确 Provider/模型。下游管理员也可以用 自己的额度,通过经过验证、使用公共 HTTPS 的 OpenAI-compatible Provider Profile 接入 Provider。无密钥 Profile 只保存 Provider 元数据和环境变量名称,不保存 API Key。Provider 只有通过验证后才会激活,付费连接探测还必须显式开启确认开关。
Provider Profile 验证只证明配置结构正确。配置、连接测试和严格 AgentTeams E2E 是三个独立门禁。“OpenAI-compatible”并不证明任意模型都支持所需的角色消息、 流式输出、工具调用、reasoning 参数、上下文长度或修复行为。厂商私有协议需要单独 实现 Adapter,不能直接视为即插即用。
- 面向 Skill、Tool 和 Verifier 的稳定 Capability、Provider、Consumer 边界, 不同实现复用同一组契约测试
- Agent 身份、Skill 元数据、Evidence、验证、检测、Grant、任务和可回放任务事件的 严格 Pydantic 契约
- HMAC 签名 Grant:绑定有效期、Consumer、审批、参数并防重放;Broker 重启后仍 持久化已消费 nonce 摘要
- 失败关闭的检测流水线和确定性 L1 Skill 检查
- 具有来源锁定、严格 Schema 和发布/隔离状态的 Skill 目录:一个上游 Skill 和一个 团队原创 Skill 已发布,另外四个上游 Skill 隔离
- FastAPI 任务 API、乐观状态迁移、追加式因果事件及可逆 SQLite/Alembic 持久化
- 位于 Higress 身份认证和白名单之后的 Streamable HTTP Policy Broker
- 带请求/结果摘要和本地 Evidence 的受治理 ToolCall 事件
- 运行于锁定镜像中的 pytest Tool Provider:禁网、只读工作区、限制输出和超时, 并验证容器清理
- 锁定版本的 AgentTeams Manager、三个业务 Agent 身份和 Human 资源
- 无密钥 Provider Profile、无模型校验和显式启用的连接探测
- 绑定精确 Matrix event ID 的 Investigator-to-Verifier 受治理委派
- 确定性本地修复案例、隐藏测试、补丁范围约束、回放查看器和 Textual 证据面板
- Human L2 审批证据,以及仍等待维护者审查的上游 PR #1141
humanMembers修复
创建本地数据库,并用至少 32 字节、仅注入进程环境的开发密钥启动验证型 stdio Broker:
.venv\Scripts\alembic upgrade head
$env:AGENTLOOM_POLICY_SIGNING_KEY = "replace-with-a-local-development-secret"
.venv\Scripts\python -m agentloom.policy_mcp旧的宿主机 pytest runner 只允许用于可信本地开发,并同时要求
AGENTLOOM_SANDBOX_BACKEND=local-development 和显式确认
AGENTLOOM_ALLOW_HOST_TEST_EXECUTION=true。它不是容器或网络沙箱,绝不能执行
不可信测试。AgentTeams 启动器使用锁定的 Docker 后端,也不会导出该确认变量。
签名密钥、模型凭据和 Provider 原始密钥都不得写入已提交的 MCP、Worker 或 Provider
Profile 配置。
以下内容仅为审计和复现而保留,不是当前证据基线。Qwen、DeepSeek 因账户 无余额继续禁用。MiniMax 和 StepFun 均已获得订阅调用授权,但每次新运行必须使用 唯一 run ID 并记录准确 Provider/模型;StepFun 证据不得混入只允许 MiniMax 的 Task 24 版本化基准。不得把历史付费链路冒充为新运行。
- 2026-08-04,Qwen
qwen3.7-plus曾完成无人值守修复,并通过独立的可见测试、 主机专属隐藏测试和静态检查。生成补丁 SHA-256 为7d9d571a833eabaedf97eac73dad50f6290bfa332d3ef504882398ba2e6d0833。 严格运行证据仍位于artifacts/agentteams/live-repair-pagination-qwen-unattended-03.json,独立验证证据仍位于artifacts/live-repair/AL-LIVE-PAGINATION-UNATTENDED-20260804-03/verified/artifacts/。 - 更早的 StepFun 四角色回滚和 DeepSeek 消息基线证据仍作为 Human L2 审批记录的 历史输入。脱敏摘要见 L2 审批与上游贡献证据。
- 历史回放入口保留为
scripts/competition-demo.ps1 -Mode replay和scripts/competition-rollback-demo.ps1 -Mode replay。回放无需模型;Live 模式是独立、 必须明确付费并授权的操作。
- 完成竞赛页面提交并保留平台回执。
- 在第二台清洁 Windows/Docker 主机验证 Full bootstrap,并发布兼容性记录。
- 评测四个处于隔离状态的上游 Skill;只有通过 Skill Eval 和来源门禁后才发布。
- 将受治理修复结果接入一个受控的真实 Issue/PR 工作流。
AgentLoom 代码采用 Apache-2.0 许可证。上游运行时、Skill 内容、依赖和设计参考保留 各自许可证及署名要求。详见 THIRD_PARTY.md、 provenance/sources.yaml 和 CHANGELOG.md。
MVP 阶段只使用合成 fixture 和隔离仓库。不要把个人 SSH 目录、生产凭据或无关主机 路径挂载到 Worker 或沙箱。安全问题请私下联系仓库所有者。
