把短视频评论区变成一张可交互、可追溯的知识图谱。
这个仓库是两样东西:一个 Agent Skill(处理你自己的评论数据),和一份 公开数据集(518 条真实评论构成的 AI 时代关注点图谱,agent 可直接 fetch)。
下面这张图 GitHub 会直接渲染,不用点任何链接:
graph LR
n1("职业选择<br/>43次")
n2("不会用工具<br/>30次")
n3("AI替代人<br/>27次")
n4("读博价值<br/>15次")
n5("生活成本<br/>12次")
n6("学历贬值<br/>11次")
n7("变现难<br/>8次")
n8["留学生"]
n9["职场人"]
n10["转行"]
n11["读书深造"]
n12["老师"]
n13["学AI工具"]
n14["大学生"]
n15["自媒体新人"]
n16["做自媒体"]
n17["变现"]
n18["博士生"]
n8 -->|担心| n5
n9 -->|担心| n1
n10 -->|缓解| n1
n11 -->|缓解| n4
n12 -->|担心| n1
n13 -->|缓解| n2
n14 -->|担心| n6
n15 -->|担心| n7
n16 -->|缓解| n7
n17 -->|缓解| n7
n13 -->|缓解| n6
n14 -->|担心| n3
n18 -->|担心| n3
n18 -->|担心| n4
classDef concern fill:#ffdedb,stroke:#d1534a,color:#5c1a15
classDef persona fill:#dbeafe,stroke:#3b7dd8,color:#12325e
classDef coping fill:#dcfce7,stroke:#3f9e5a,color:#14401f
class n1,n2,n3,n4,n5,n6,n7 concern
class n8,n9,n12,n14,n15,n18 persona
class n10,n11,n13,n16,n17 coping
想看能悬浮、能点开证据的完整版 → 在线交互版
想读数据结论 → data/digest.md
单条评论没有价值,评论之间的关系才有。
你的视频是提问,评论区是几千人对同一个问题的即兴回答。把「谁在关心什么」「什么内容引出了什么讨论」「哪些关注点总是一起出现」「哪些提问从来没被回答过」连成网络,才能看见评论区真正的结构。
| 你是 | 怎么用 |
|---|---|
| 想直接看 | 上面的 mermaid 图,或在线交互版 |
| 想让 agent 读数据 | data/graph.json(结构化)或 data/digest.md(纯文本) |
| 想跑自己的数据 | 把仓库装成 skill,见下 |
读一下 https://raw.githubusercontent.com/XBuilderLAB/cheat-on-audience/main/data/digest.md
或者要完整图谱(含每条边的评论证据):
https://raw.githubusercontent.com/XBuilderLAB/cheat-on-audience/main/data/graph.json
llms.txt 在仓库根目录,列出了所有 agent 可读入口。
git clone https://github.com/XBuilderLAB/cheat-on-audience ~/.claude/skills/cheat-on-audience然后在 Claude Code 里说「分析我的评论区」。
想先看效果不用自己的数据:
python3 scripts/build_graph.py && python3 scripts/render.py && open atlas.html按优先级:
- 你已有的导出文件 — JSON / CSV / 纯文本都行,最低要求是每条评论有正文
- iGrowth 插件采集的数据 — 装了的话查
~/.igrowth/opc-assets/runs/*/video-comments.json - 手动复制 — 从创作者后台复制粘贴
不含爬虫。用官方后台导出、你自己授权的插件,或手动复制。
五类节点:关注点、人群、视频、隐喻、应对策略。
五类边:引出(视频→关注点)、担心(人群→关注点)、被说成(关注点→隐喻)、缓解(应对→关注点)、共现(关注点↔关注点)。
每条边都挂评论原文作为证据。 图谱里任何一个结论都能点回到具体是谁说的哪句话。没有证据的边不建——这是防 LLM 抽取幻觉的唯一办法。
is_sarcasm阴阳怪气 — 「挺好的,以后送外卖路上还能跟 AI 聊人生」字面正向实际负面。不处理这个,整张图会歪is_ask提问 — 内容缺口信号。提问密集但你从没正面回应过的关注点,就是被验证过需求的选题is_win成果汇报 — 正反馈信号,是做案例内容和社会证明的素材库
产出的 atlas.html 是零依赖单文件:
- 双击打开,不需要起服务器
- 可以直接发成 Artifact
- 推 GitHub Pages 就是在线版
不引任何 CDN。 Artifact 的 CSP 会拦截外部请求,弱网也会白屏。力导向布局是手写的,200 行,不需要 d3。
平台后台一般不提供单条评论的时间戳和回复链,所以:
- 时间维度只能用视频发布时间近似,做不了评论级的精确时间轴
- 做不了「情绪升级链」「被安抚链」这类需要回复关系的分析
如果你的数据源恰好有这些字段,schema 可以扩展。
另外:真实评论区里只有约 40% 的评论带信息量,其余是玩梗和打招呼。图谱反映的是那 40%。
cheat-on-audience/
├── SKILL.md # agent 入口,六阶段流程
├── llms.txt # agent 可读资源清单
├── references/schema.md # 抽取规范和词表
├── scripts/
│ ├── build_graph.py # 抽取结果 → graph.json
│ ├── render.py # graph.json → atlas.html
│ └── export.py # → Pages / digest / mermaid / llms.txt
├── templates/viewer.html # 渲染器模板
├── docs/index.html # GitHub Pages 在线版
└── data/
├── graph.json # 图谱数据(agent fetch 这个)
└── digest.md # 纯文本摘要
数据和视图分离:graph.json 本身是可积累的资产,每次新采集增量追加,图谱越长越大。
评论数据来自创作者本人后台,字段只有正文、点赞数、排序来源——不含用户昵称、UID 或任何个人标识。
MIT