19a747a5565d99fbaa8bee2f5531da19ace4a006
- 分析 147 篇下载的飞书文档 - 生成全面分析报告(feishu_docs_comprehensive_analysis.md) - 生成主题深度分析(feishu_docs_topic_analysis.md) - 生成关键发现摘要(key_findings.json) - 创建 Obsidian 知识库条目(飞书文档知识库.md) - 更新 MOC 索引 分析结果: - 花园世界研究:22 篇文档 - AI与Agent应用:109 篇文档 - 工作流优化:62 篇文档 - 竞品分析:59 篇文档 - 商业化策略:48 篇文档 - 产品策略:56 篇文档 - 技术实现:103 篇文档 - 美术资产:100 篇文档
钉钉群聊飞书文档收集与知识图谱系统
从钉钉群聊「dc战略问题研究院」和「创新组」中自动收集飞书链接、文件附件,读取内容并整理为结构化知识图谱和 Obsidian 知识库。
项目背景
公司战略研究团队每天在钉钉群中分享飞书文档(研究报告、竞品分析、日报等),本项目自动化完成:
- 采集:通过悟空(dws CLI)拉取群聊消息,提取飞书链接和文件附件
- 下载:下载 HTML/MD/XLSX 等文件附件
- 解析:读取文档内容,提取关键信息
- 结构化:构建知识图谱(JSON)和 Obsidian 知识库
- 汇总:生成主题汇总报告
目录结构
├── scripts/ ← 核心脚本
│ ├── fetch_all.py ← 全量消息拉取
│ ├── extract_links.py ← 链接提取
│ ├── build_graph.py ← 知识图谱构建
│ ├── write_obsidian.py ← Obsidian 库生成
│ ├── write_report.py ← 汇总报告生成
│ ├── gen_visual.py ← 可视化生成
│ └── daily_feishu_collector.py ← 每日定时采集
├── data/
│ └── links/ ← 提取的链接和内容
├── output/
│ ├── reports/ ← 汇总报告
│ ├── knowledge-graph/ ← 知识图谱(JSON+HTML)
│ ├── obsidian-vault/ ← Obsidian 知识库(可直接打开)
│ └── downloaded-files/ ← 下载的原始文件
└── .gitignore
快速开始
环境要求
- Python 3.10+
- 悟空 CLI(dws)已认证登录
使用方式
# 1. 全量拉取两个群的消息
python scripts/fetch_all.py
# 2. 提取所有链接和文件
python scripts/extract_links.py
# 3. 构建知识图谱
python scripts/build_graph.py
# 4. 生成 Obsidian 知识库
python scripts/write_obsidian.py
# 5. 生成汇总报告
python scripts/write_report.py
# 6. 查看结果
# 知识图谱:output/knowledge-graph/knowledge_graph.html
# Obsidian:用 Obsidian 打开 output/obsidian-vault/ 目录
每日定时采集
# 注册 Windows 定时任务(每天18:00执行)
python scripts/daily_feishu_collector.py
核心发现
《我的花园世界》研究
一句话结论:不要学"种花题材",要学"已验证底座 + 放大能力"的立项路径。
知识图谱概览
- 28位活跃人员:跨两个群
- 190个飞书文档链接:4个飞书空间
- 18个文件附件:HTML/MD/XLSX/PPT/PDF/ZIP
- 7大核心主题:花园世界研究、云湖项目、Agent工具、战略思维、AI落地、创新组研发、战略组日报
- 300+条关系
数据来源
| 群组 | 消息数 | 时间范围 | 飞书链接 |
|---|---|---|---|
| dc战略问题研究院 | 291条 | 2026-05-08 ~ 06-02 | 96个 |
| 创新组 | 86条 | 2026-05-01 ~ 06-02 | 94个 |
技术栈
- 悟空 CLI(dws):钉钉消息拉取、文件下载
- Python:数据处理、知识图谱构建
- BeautifulSoup:HTML 解析
- Obsidian:知识库管理
Description
Languages
HTML
77.4%
Python
22.6%