72e5edfbd49ec3cee30b21bd59364001fff0f5ef
钉钉群聊飞书文档收集与知识图谱系统
从钉钉群聊「dc战略问题研究院」和「创新组」中自动收集飞书链接、文件附件,读取内容并整理为结构化知识图谱和 Obsidian 知识库。
项目背景
公司战略研究团队每天在钉钉群中分享飞书文档(研究报告、竞品分析、日报等),本项目自动化完成:
- 采集:通过悟空(dws CLI)拉取群聊消息,提取飞书链接和文件附件
- 下载:下载 HTML/MD/XLSX 等文件附件
- 解析:读取文档内容,提取关键信息
- 结构化:构建知识图谱(JSON)和 Obsidian 知识库
- 汇总:生成主题汇总报告
目录结构
├── scripts/ ← 核心脚本
│ ├── fetch_all.py ← 全量消息拉取
│ ├── extract_links.py ← 链接提取
│ ├── build_graph.py ← 知识图谱构建
│ ├── write_obsidian.py ← Obsidian 库生成
│ ├── write_report.py ← 汇总报告生成
│ ├── gen_visual.py ← 可视化生成
│ └── daily_feishu_collector.py ← 每日定时采集
├── data/
│ └── links/ ← 提取的链接和内容
├── output/
│ ├── reports/ ← 汇总报告
│ ├── knowledge-graph/ ← 知识图谱(JSON+HTML)
│ ├── obsidian-vault/ ← Obsidian 知识库(可直接打开)
│ └── downloaded-files/ ← 下载的原始文件
└── .gitignore
快速开始
环境要求
- Python 3.10+
- dws CLI(钉钉官方开源工具,可从 GitHub 自动下载)
快速安装
# 自动从 GitHub 下载 dws CLI(约 5MB)
python scripts/setup_dws.py
# 首次使用需认证(钉钉扫码登录)
tools/dws auth
使用方式
# 1. 全量拉取两个群的消息
python scripts/fetch_all.py
# 2. 提取所有链接和文件
python scripts/extract_links.py
# 3. 构建知识图谱
python scripts/build_graph.py
# 4. 生成 Obsidian 知识库
python scripts/write_obsidian.py
# 5. 生成汇总报告
python scripts/write_report.py
# 6. 查看结果
# 知识图谱:output/knowledge-graph/knowledge_graph.html
# Obsidian:用 Obsidian 打开 output/obsidian-vault/ 目录
每日定时采集
# 注册 Windows 定时任务(每天18:00执行)
python scripts/daily_feishu_collector.py
配置说明
dws 路径自动查找顺序:
- 环境变量
DWS_PATH - 项目
tools/dws.exe(由setup_dws.py下载) - 悟空内置路径(向后兼容)
- 系统 PATH
核心发现
《我的花园世界》研究
一句话结论:不要学"种花题材",要学"已验证底座 + 放大能力"的立项路径。
知识图谱概览
- 28位活跃人员:跨两个群
- 190个飞书文档链接:4个飞书空间
- 18个文件附件:HTML/MD/XLSX/PPT/PDF/ZIP
- 7大核心主题:花园世界研究、云湖项目、Agent工具、战略思维、AI落地、创新组研发、战略组日报
- 300+条关系
数据来源
| 群组 | 消息数 | 时间范围 | 飞书链接 |
|---|---|---|---|
| dc战略问题研究院 | 291条 | 2026-05-08 ~ 06-02 | 96个 |
| 创新组 | 86条 | 2026-05-01 ~ 06-02 | 94个 |
技术栈
- dws CLI:钉钉消息拉取、文件下载(GitHub 开源,可从 GitHub 自动下载,无需安装悟空)
- Python:数据处理、知识图谱构建
- BeautifulSoup:HTML 解析
- Obsidian:知识库管理
Description
Languages
HTML
77.4%
Python
22.6%