# 钉钉群聊飞书文档收集与知识图谱系统 从钉钉群聊「dc战略问题研究院」和「创新组」中自动收集飞书链接、文件附件,读取内容并整理为结构化知识图谱和 Obsidian 知识库。 ## 项目背景 公司战略研究团队每天在钉钉群中分享飞书文档(研究报告、竞品分析、日报等),本项目自动化完成: 1. **采集**:通过悟空(dws CLI)拉取群聊消息,提取飞书链接和文件附件 2. **下载**:下载 HTML/MD/XLSX 等文件附件 3. **解析**:读取文档内容,提取关键信息 4. **结构化**:构建知识图谱(JSON)和 Obsidian 知识库 5. **汇总**:生成主题汇总报告 ## 目录结构 ``` ├── scripts/ ← 核心脚本 │ ├── fetch_all.py ← 全量消息拉取 │ ├── extract_links.py ← 链接提取 │ ├── build_graph.py ← 知识图谱构建 │ ├── write_obsidian.py ← Obsidian 库生成 │ ├── write_report.py ← 汇总报告生成 │ ├── gen_visual.py ← 可视化生成 │ └── daily_feishu_collector.py ← 每日定时采集 ├── data/ │ └── links/ ← 提取的链接和内容 ├── output/ │ ├── reports/ ← 汇总报告 │ ├── knowledge-graph/ ← 知识图谱(JSON+HTML) │ ├── obsidian-vault/ ← Obsidian 知识库(可直接打开) │ └── downloaded-files/ ← 下载的原始文件 └── .gitignore ``` ## 快速开始 ### 环境要求 - Python 3.10+ - 悟空 CLI(dws)已认证登录 ### 使用方式 ```bash # 1. 全量拉取两个群的消息 python scripts/fetch_all.py # 2. 提取所有链接和文件 python scripts/extract_links.py # 3. 构建知识图谱 python scripts/build_graph.py # 4. 生成 Obsidian 知识库 python scripts/write_obsidian.py # 5. 生成汇总报告 python scripts/write_report.py # 6. 查看结果 # 知识图谱:output/knowledge-graph/knowledge_graph.html # Obsidian:用 Obsidian 打开 output/obsidian-vault/ 目录 ``` ### 每日定时采集 ```bash # 注册 Windows 定时任务(每天18:00执行) python scripts/daily_feishu_collector.py ``` ## 核心发现 ### 《我的花园世界》研究 详见 [output/reports/花园世界全量汇总.md](output/reports/花园世界全量汇总.md) **一句话结论**:不要学"种花题材",要学"已验证底座 + 放大能力"的立项路径。 ### 知识图谱概览 - **28位活跃人员**:跨两个群 - **190个飞书文档链接**:4个飞书空间 - **18个文件附件**:HTML/MD/XLSX/PPT/PDF/ZIP - **7大核心主题**:花园世界研究、云湖项目、Agent工具、战略思维、AI落地、创新组研发、战略组日报 - **300+条关系** ## 数据来源 | 群组 | 消息数 | 时间范围 | 飞书链接 | |------|--------|----------|----------| | dc战略问题研究院 | 291条 | 2026-05-08 ~ 06-02 | 96个 | | 创新组 | 86条 | 2026-05-01 ~ 06-02 | 94个 | ## 技术栈 - **悟空 CLI(dws)**:钉钉消息拉取、文件下载 - **Python**:数据处理、知识图谱构建 - **BeautifulSoup**:HTML 解析 - **Obsidian**:知识库管理