Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

3 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

cheat-on-audience

把短视频评论区变成一张可交互、可追溯的知识图谱。

这个仓库是两样东西:一个 Agent Skill(处理你自己的评论数据),和一份 公开数据集(518 条真实评论构成的 AI 时代关注点图谱,agent 可直接 fetch)。

先看结果

下面这张图 GitHub 会直接渲染,不用点任何链接:

graph LR
  n1("职业选择<br/>43次")
  n2("不会用工具<br/>30次")
  n3("AI替代人<br/>27次")
  n4("读博价值<br/>15次")
  n5("生活成本<br/>12次")
  n6("学历贬值<br/>11次")
  n7("变现难<br/>8次")
  n8["留学生"]
  n9["职场人"]
  n10["转行"]
  n11["读书深造"]
  n12["老师"]
  n13["学AI工具"]
  n14["大学生"]
  n15["自媒体新人"]
  n16["做自媒体"]
  n17["变现"]
  n18["博士生"]
  n8 -->|担心| n5
  n9 -->|担心| n1
  n10 -->|缓解| n1
  n11 -->|缓解| n4
  n12 -->|担心| n1
  n13 -->|缓解| n2
  n14 -->|担心| n6
  n15 -->|担心| n7
  n16 -->|缓解| n7
  n17 -->|缓解| n7
  n13 -->|缓解| n6
  n14 -->|担心| n3
  n18 -->|担心| n3
  n18 -->|担心| n4
  classDef concern fill:#ffdedb,stroke:#d1534a,color:#5c1a15
  classDef persona fill:#dbeafe,stroke:#3b7dd8,color:#12325e
  classDef coping fill:#dcfce7,stroke:#3f9e5a,color:#14401f
  class n1,n2,n3,n4,n5,n6,n7 concern
  class n8,n9,n12,n14,n15,n18 persona
  class n10,n11,n13,n16,n17 coping
Loading

想看能悬浮、能点开证据的完整版 → 在线交互版

想读数据结论 → data/digest.md

为什么

单条评论没有价值,评论之间的关系才有。

你的视频是提问,评论区是几千人对同一个问题的即兴回答。把「谁在关心什么」「什么内容引出了什么讨论」「哪些关注点总是一起出现」「哪些提问从来没被回答过」连成网络,才能看见评论区真正的结构。

三种打开方式

你是 怎么用
想直接看 上面的 mermaid 图,或在线交互版
想让 agent 读数据 data/graph.json(结构化)或 data/digest.md(纯文本)
想跑自己的数据 把仓库装成 skill,见下

让 agent 读这份数据

读一下 https://raw.githubusercontent.com/XBuilderLAB/cheat-on-audience/main/data/digest.md

或者要完整图谱(含每条边的评论证据):

https://raw.githubusercontent.com/XBuilderLAB/cheat-on-audience/main/data/graph.json

llms.txt 在仓库根目录,列出了所有 agent 可读入口。

跑自己的数据

git clone https://github.com/XBuilderLAB/cheat-on-audience ~/.claude/skills/cheat-on-audience

然后在 Claude Code 里说「分析我的评论区」。

想先看效果不用自己的数据:

python3 scripts/build_graph.py && python3 scripts/render.py && open atlas.html

数据从哪来

按优先级:

  1. 你已有的导出文件 — JSON / CSV / 纯文本都行,最低要求是每条评论有正文
  2. iGrowth 插件采集的数据 — 装了的话查 ~/.igrowth/opc-assets/runs/*/video-comments.json
  3. 手动复制 — 从创作者后台复制粘贴

不含爬虫。用官方后台导出、你自己授权的插件,或手动复制。

图谱结构

五类节点:关注点、人群、视频、隐喻、应对策略。

五类边:引出(视频→关注点)、担心(人群→关注点)、被说成(关注点→隐喻)、缓解(应对→关注点)、共现(关注点↔关注点)。

每条边都挂评论原文作为证据。 图谱里任何一个结论都能点回到具体是谁说的哪句话。没有证据的边不建——这是防 LLM 抽取幻觉的唯一办法。

三个中文评论区特供信号

  • is_sarcasm 阴阳怪气 — 「挺好的,以后送外卖路上还能跟 AI 聊人生」字面正向实际负面。不处理这个,整张图会歪
  • is_ask 提问 — 内容缺口信号。提问密集但你从没正面回应过的关注点,就是被验证过需求的选题
  • is_win 成果汇报 — 正反馈信号,是做案例内容和社会证明的素材库

渲染

产出的 atlas.html 是零依赖单文件:

  • 双击打开,不需要起服务器
  • 可以直接发成 Artifact
  • 推 GitHub Pages 就是在线版

不引任何 CDN。 Artifact 的 CSP 会拦截外部请求,弱网也会白屏。力导向布局是手写的,200 行,不需要 d3。

已知限制

平台后台一般不提供单条评论的时间戳和回复链,所以:

  • 时间维度只能用视频发布时间近似,做不了评论级的精确时间轴
  • 做不了「情绪升级链」「被安抚链」这类需要回复关系的分析

如果你的数据源恰好有这些字段,schema 可以扩展。

另外:真实评论区里只有约 40% 的评论带信息量,其余是玩梗和打招呼。图谱反映的是那 40%。

结构

cheat-on-audience/
├── SKILL.md              # agent 入口,六阶段流程
├── llms.txt              # agent 可读资源清单
├── references/schema.md  # 抽取规范和词表
├── scripts/
│   ├── build_graph.py    # 抽取结果 → graph.json
│   ├── render.py         # graph.json → atlas.html
│   └── export.py         # → Pages / digest / mermaid / llms.txt
├── templates/viewer.html # 渲染器模板
├── docs/index.html       # GitHub Pages 在线版
└── data/
    ├── graph.json        # 图谱数据(agent fetch 这个)
    └── digest.md         # 纯文本摘要

数据和视图分离:graph.json 本身是可积累的资产,每次新采集增量追加,图谱越长越大。

隐私

评论数据来自创作者本人后台,字段只有正文、点赞数、排序来源——不含用户昵称、UID 或任何个人标识。

License

MIT

About

把短视频评论区变成可追溯的知识图谱:谁在关心什么、哪些提问从没被回答过。自带 518 条真实评论数据集,agent 可直接 fetch。

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages