Skip to content
View ZhangYangyi03's full-sized avatar

Block or report ZhangYangyi03

Block user

Prevent this user from interacting with your repositories and sending you notifications. Learn more about blocking users.

You must be logged in to block users.

Content in all repositories owned by your account will be closed.
Maximum 250 characters. Please don’t include any personal information such as legal names or email addresses. Markdown is supported. This note will only be visible to you.
Report abuse

Contact GitHub support about this user’s behavior. Learn more about reporting abuse.

Report abuse
ZhangYangyi03/README.md

Yangyi Zhang · 张洋溢

一个主张,在五个领域各测一遍:一个数字,在它没通过自己的验证之前,不算结果。

LLM agent 的工具调用安全验证 · 芯片 EDA 编排 · 化学动力学约简 · 机器学习评测审计 · 主权债务条款的可验证执行。


主线

项目 它不接受的那个数字
debt-verify 一条债务条款"是否被触发"的结论——点值判定在 84 个可判单元全部有答案,但要求答案在已公布修订记录上仍成立之后,75% 变得无法支持。三值逻辑 (Kleene K3) + 分布式自由 conformal 区间 + P/NP-hard/PSPACE-hard 三分,3-SAT 归约与 z3 对拍 120/120
autoforge 一个工具自己的适应度——独立 validity gate 把 oracle 和 fitness 定义权从被测工具手里收回。真模型干净消融:gate 开则完好率恒 3/3,关掉 4 代内退化到 0/3。已发布 PyPI,1176 项测试
agentic-eda 一个电路的面积——必须先证明与参考网表等价(abc cec 给反例 / yosys equiv 要求 0 unproven)。13 策略 × 11 基准,最优 -30.1% 面积 / -61.2% 深度,全链路到 sky130 版图
evidence-gate 一个模型的 AUC——同一份代码两个公共靶点,EGFR 全门通过,hERG 被驳回(换年代 0.453)。先跑标签置换阴性对照证伪管线,再谈分数
tool-market 一个工具"活着"这件事——双轴正交状态机解耦"能否调用"与"哪个版本生效",append-only 日志 + SHA-256 哈希链

同一套骨架,换一个领域再测一遍

eda-spine 把 qoragent / assertforge / covagent 串成一条链:综合后的门级网表必须仍满足在 RTL 上已证的性质。 kinetics-spine 把这四段 (search / prove / perturb / cover) 指向一个完全不含 EDA 的领域,用守恒量当门——用来回答一个可测量的问题:这四段是 EDA 的形状,还是任何可信搜索的形状。

数据侧

  • unifolm-wla-toolkit — 按宇树 UnifoLM-WLA-1.0 官方规范实现的数据管线:54 维动作 / 60 维状态统一表示、SE(3) 相对位姿、零依赖 URDF 正运动学。不需要 GPU、真机、权重。15 步自检一条命令全过。规范里 7 处未定义的地方写成了给宇树的说明。
  • llm-safety-eval-audits — 三篇在审稿件的全部可重算数据。重算发现:被打分脚本的回退分支在 120 次试验里悄悄触发了 28 次;被当作真值的规则分类器在人工标注上只有 53% 正确,与 LLM 裁判原始一致率 61.6% 但 kappa 仅 0.115。
  • craftagent — 机床工况数据到异常归因,只用 Python 标准库(工厂那台机器上少一个依赖就少一个装不上的理由)。合成数据埋真值,5 项验收全过。

研究向

  • swpl — Skew-Phase Law:Zipf 负载下的数据结构选型,α = 1 处相变,ζ-Trie
  • agent-safety-bench — 多步 agent 安全合规基准,测的是"关键深度"而不是单轮拒答
  • benign-rag-trap — 无害查询如何经由分布外检索路径放大风险

怎么找我

有关于 agent 工具治理、验证流水线、或者机器人数据格式的问题,开 issue 就行——主仓库的 issue 我都会看。 每个项目都写了它不做的那件事(debt-verify 检出的是"结论不被公布记录支持",不是"债务国造假";agentic-eda 会告诉你 11/11 基准仍带它修不了的签核违规)。这条边界是我的,不是免责声明。

Python · verification pipelines · LLM agent systems · EDA orchestration · numerical reproducibility

Popular repositories Loading

  1. unifolm-wla-toolkit unifolm-wla-toolkit Public

    Spec-faithful data pipeline for Unitree UnifoLM-WLA-1.0: 54-D action / 60-D state, SE(3) relative poses, rotation-6D, equal-task-weight statistics, URDF FK for real G1 data, and an ER-Flow token bu…

    Python 2 1

  2. ct30a3401-distributed-systems-assignment2 ct30a3401-distributed-systems-assignment2 Public

    Python

  3. lut-oop-week8-calculator lut-oop-week8-calculator Public

    this is the right version

  4. lut-oop-week10-movie-db lut-oop-week10-movie-db Public

    YangyiZhangCT60A2412 Object-Oriented Programmingweek10

  5. lut-oop-week11 lut-oop-week11 Public

    YangyiZhangCT60A2412 Object-Oriented Programmingweek11

  6. REPS-2025 REPS-2025 Public

    Scala