# 境外数据采集技能使用指南

## 已安装组件

### 核心技能文件
- `SKILL.md` - 技能定义与规范说明
- `USAGE.md` - 本使用指南

### 工具脚本（7个采集模块）
1. `news_collector.py` - 公开新闻采集器
2. `reports_collector.py` - 智库报告采集器
3. `journals_collector.py` - 学术期刊采集器
4. `patents_collector.py` - 专利信息采集器
5. `social_collector.py` - 社交媒体采集器
6. `verify.py` - 多源交叉验证工具
7. `passport.py` - 数据护照生成器

### 权限状态
✅ 所有脚本已设置为可执行

---

## 标准工作流程

### 场景1：采集公开新闻

**长官指令示例**：
```
采集以下公开信息：
- 地区：美国
- 类型：新闻报道
- 来源：主流媒体（CNN, Reuters, AP等）
- 关键词：AI policy, China
- 时间：最近7天
```

**执行步骤**：
1. 使用 `web_search` 进行初步搜索（支持DuckDuckGo）
2. 使用 `web_fetch` 获取具体新闻页面内容
3. 调用 `news_collector.py` 进行结构化处理
4. 调用 `passport.py` 生成数据护照

5. 向长官交付结构化结果 + 数据护照

---

### 场景2：采集智库报告

**长官指令示例**：
```
采集以下智库报告：
- 地区：美国
- 智库：布鲁金斯学会、兰德公司、CSIS
- 主题：AI技术发展、安全政策
- 时间：最近1年
```

**执行步骤**：
1. 构建基于智库域名的搜索查询
2. 使用 `web_search` + `web_fetch` 获取报告内容
3. 调用 `reports_collector.py` 提取元数据
4. 生成数据护照
5. 交付报告元数据 + 摘要

---

### 场景3：采集学术期刊

**长官指令示例**：
```
采集以下学术期刊文章：
- 领域：技术安全、政策研究
- 关键词：AI governance, cybersecurity policy
- 年份：2023-2025
```

**执行步骤**：
1. 使用 `journals_collector.py` 定义领域和期刊范围
2. 构建开放获取期刊的搜索查询
3. 调用 `web_fetch` 获取文章内容
4. 提取元数据（标题、作者、DOI、摘要）
5. 交付结构化结果

---

### 场景4：采集专利信息

**长官指令示例**：
```
采集以下专利信息：
- 技术：AI芯片、量子计算
- 权人：指定公司（可选）
- 国家：US, CN, JP
- 年份：2020-2025
```

**执行步骤**：
1. 使用 `patents_collector.py` 构建专利数据库查询
2. 优先使用 Google Patents（聚合源）
3. 提取专利元数据（专利号、标题、摘要、权人）
4. 交付专利信息

---

### 场景5：采集社交媒体公开动态

**长官指令示例**：
```
采集以下社交媒体内容：
- 平台：Twitter/X, Reddit, YouTube
- 账号/话题：指定公开账号或话题标签
- 关键词：相关政策话题
- 时间：最近1周
```

**执行步骤**：
1. 使用 `social_collector.py` 选择平台
2. 通过搜索引擎间接获取公开内容（合规优先）
3. 提取帖文元数据（作者、内容、时间、互动指标）
4. 交付社交媒体数据

---

### 场景6：多源交叉验证

**长官指令示例**：
```
验证以下信息的真实性：
[提供多条待验证的新闻/报告片段]
```

**执行步骤**：
1. 将信息整理为JSON格式
2. 调用 `verify.py` 进行交叉验证
3. 返回一致性评分、可信度排序
4. 对低可信度条目标注警告

---

### 场景7：专项情报采集（多步骤综合）

**长官指令示例**：
```
针对"某地区X"进行专项情报采集：
1. 近期主要政策动向（新闻 + 政府公开文件）
2. 关键智库相关研究（智库报告）
3. 学术界观点（期刊文献）
4. 技术发展态势（专利数据）
5. 社交媒体舆论动态（公开帖文）
6. 多源交叉验证
```

**执行步骤**：
1. 分步执行各领域采集
2. 汇总所有数据
3. 运行交叉验证
4. 生成综合数据护照
5. 提交综合报告

---

## 合规性保证

所有采集均通过以下合法途径：
- ✅ 公开网站的可访问页面（web_fetch）
- ✅ 公开搜索（DuckDuckGo via web_search）
- ✅ 公开API（如适用）
- ✅ 搜索引擎间接访问（社交媒体等受限平台）

**绝不触碰**：
- ❌ 需要认证的私有数据
- ❌ 国家秘密
- ❌ 未授权的内网信息
- ❌ 违反目标地区法律法规的采集行为

---

## 数据输出格式

每条交付数据包含：

```json
{
  "data": {
    // 结构化采集内容
    "title": "标题",
    "content": "正文/摘要",
    "source": "来源",
    "url": "原始URL",
    "timestamp": "发布时间",
    "region": "地区"
  },
  "passport": {
    "passport_id": "PP-20260327-abc123",
    "issuance_time": "2026-03-27T12:00:00",
    "compliance": {
      "level": "public_only",
      "data_type": "structured_records",
      "access_method": "public_web_scraping",
      "robots_txt_respected": true
    },
    "audit_chain": {
      "collection_start": "...",
      "sources_accessed": [...],
      "total_access_attempts": 10
    },
    "quality": {
      "completeness": 0.85,
      "format_validity": true,
      "overall_score": 0.88
    },
    "warnings": []
  }
}
```

---

## 快速参考

### 数据类型 vs 工具映射

| 数据类型 | 使用工具 | 主要来源 |
|---------|---------|---------|
| 新闻 | news_collector.py | 国际主流媒体、地区新闻网站 |
| 智库报告 | reports_collector.py | 布鲁金斯、兰德、CSIS、CFR等 |
| 期刊文献 | journals_collector.py | 开放获取期刊（SAGE、Wiley、IEEE等） |
| 专利 | patents_collector.py | Google Patents、USPTO、WIPO、EPO |
| 社交媒体 | social_collector.py | Twitter/X、Reddit、YouTube（公开内容） |
| 交叉验证 | verify.py | 多源信息比对 |
| 数据护照 | passport.py | 所有采集类型 |

### 合规等级

- `public_only`：仅限公开信息采集（默认）
- `standard`：标准合规模式
- `strict`：严格合规模式

### 内置网络工具

| 工具 | 用途 | 输入 | 输出 |
|------|------|------|------|
| web_search | 公开搜索 | 关键词、地区 | 搜索结果列表 |
| web_fetch | 页面抓取 | URL | 提取的内容(markdown/text) |

---

## 可用的公开来源

### 智库数据库
- 美国：Brookings, RAND, CSIS, CFR, AEI, Heritage
- 欧洲：Bruegel, Chatham House, SIPRI, Carnegie Europe
- 亚洲：RIETI, Stanford CISAC, NTI

### 学术平台
- arXiv（预印本）
- SSRN（社会科学）
- ResearchGate（公开部分）
- JSTOR（开放获取部分）

### 专利数据库
- Google Patents（聚合源，优先使用）
- USPTO（美国）
- WIPO PAT（SCOPE）（国际）
- EPO Espacenet（欧洲）

### 社交媒体
- 通过搜索引擎间接访问（合规优先）
- Reddit（公开内容）
- YouTube（公开视频元数据）

---

**技能版本**：2.0
**最后更新**：2026-03-27 12:00
**准备就绪，等待长官指令** 🌐
