让 AI 帮你找公众号资料,并留下可追溯的原文链接和结果。
这是一个可安装的 Codex / Agent Skill,也能作为独立 Python CLI 使用。通过微信读书(WeRead)的可见搜索页检索微信公众号文章,在本机 Edge 中提取正常可读的正文,支持断点恢复、离线重筛与 JSON / CSV / Markdown 导出。
帮我检索“公司治理与数字化转型”相关的公众号文章,
排除培训广告,读最相关的 5 篇正文,导出可追溯的文章清单。
| 需求 | 能力 |
|---|---|
| 查微信公众号文章 | 多关键词检索,获取标题、公众号、日期、摘要及 mp.weixin.qq.com 原文链接 |
| 读正文、做研究 | 提取可见文字、图片链接和文内链接,逐篇保存 Markdown |
| 精确筛选 | 按日期、公众号、包含/排除关键词筛选;相关性或时间排序 |
| 中断后继续 | 检查点恢复、失败关键词重试、已读正文复用、保留抓取上限 |
| 换条件重筛 | 完整已观察候选池 + 离线 rank,不重复联网 |
| 后续分析 | 带状态的 JSON、Excel 可读 CSV、结果摘要和错误诊断 |
适合文献线索收集、行业研究、政策资料整理和公众号文章归档。结果会区分已读正文、未读取、图片文章、已删除、客户端限制及风控,不把失败伪装成“没有结果”。
在 Windows PowerShell 中,将仓库克隆到技能目录;需要已安装 Git 和 uv。
git clone https://github.com/jayhigh425/wechat-article-search-skill.git `
"$env:USERPROFILE\.codex\skills\wechat-weread-official"目录已经存在时,不要覆盖其中的本地改动。安装后,在识别到该 skill 的 Codex 会话里直接使用:
使用 $wechat-weread-official 检索公司治理相关公众号文章,
保留原文链接,获取最相关的 5 篇可见正文。
技能入口是 SKILL.md。其它支持 SKILL.md 的代理可按其技能安装方式使用;本仓库未逐一验证这些客户端。
**运行环境:Windows 10/11、Microsoft Edge、uv。**脚本声明 Python 3.11+ 和固定依赖,uv run 自动解析环境。检索需要微信读书登录态,首次运行会显示/保存二维码,扫码后继续;直接抓取文章链接不需要先登录微信读书。
git clone https://github.com/jayhigh425/wechat-article-search-skill.git
cd wechat-article-search-skill
# 检查环境,不访问网站
uv run .\scripts\wechat_official.py doctor
# 搜索并获取最相关的 5 篇可见正文
uv run .\scripts\wechat_official.py collect `
--query-file .\examples\search-config.json `
--fulltext-limit 5 --run-dir .\outputs\research
# 同一任务断点恢复;原正文上限会保留
uv run .\scripts\wechat_official.py collect `
--run-dir .\outputs\research --resume
# 不联网,按时间重新筛选已观察候选
uv run .\scripts\wechat_official.py rank `
--input .\outputs\research --sort newest --target 10 `
--run-dir .\outputs\reranked下面是模拟数据,用于展示文件结构和状态,不代表真实公众号文章。
outputs/research/
├── candidates.json # 全部已观察候选,保留过滤未通过和超出 target 的条目
├── results.json # 筛选后的结构化结果与正文状态
├── results.csv # UTF-8 CSV,可用 Excel 打开
├── summary.md # 文章清单 + 各关键词覆盖/过滤/停止原因
├── checkpoint.jsonl # 中断恢复日志
├── articles/ # 正文 Markdown 或纯图片链接清单
└── diagnostics/ # 仅失败时生成的页面截图
- 原文 URL 用于访问,规范化文章身份用于去重,兼容带参短链接。
- 先执行各关键词,再应用全局目标数量;保留完整已观察候选池。
- 等待延迟链接/正文,支持带
#rd的原文链接;避免“页面已显示却报超时”。 - 逐关键词记录错误和过滤原因,便于判断是查询、条件、登录还是页面问题。
- 断点续采可修复截断的日志尾部,已完成内容不重复抓取;风控时停止后续请求。
检索策略见 研究检索说明。
本地验证通过 34 项单元/流程回归测试和 1 套 Edge 浏览器模拟网页测试。还进行了两个关键词的小规模真实检索:6 条候选、保留 3 条、成功读取 1 篇可见正文(3440 字符、7 张图片)。这些是验证样本,不是速度或覆盖率承诺。GitHub Actions 运行本地模拟测试,不访问真实微信账号。
微信读书索引不保证覆盖全部公众号或历史文章。关键词筛选基于标题、摘要和公众号名称;全文分析需要先读取正文。图片文章标记为 image_only,不自动 OCR;已删除、客户端限制及风控状态会保留,不绕过访问限制。暂未验证 macOS/Linux 的浏览器运行路径。
如果它帮你减少了资料收集时间,欢迎 Star,或分享你的使用场景。页面结构变化、日期解析和恢复问题,请通过 Issue 模板 提交最小可复现信息;贡献方式见 CONTRIBUTING.md。
项目以 MIT 协议开源。采集文章仍归原作者所有。