---
name: 开源情报-全球数据采集
description: |
  全球数据采集通用技能。提供跨境数据采集的合规框架、工具选择
  与策略指导。触发条件：用户要求进行全球数据采集、跨境信息获取等。
---

# 境外数据采集技能集

## 技能定位

为"瞰宇"（全球数据采集师）提供境外公开信息采集能力。本技能严格遵循以下原则：

### 核心原则
- **精准而非贪婪**：基于明确目标的采集，反对无目的爬取
- **源头可溯**：每条数据具备完整审计链
- **稳健执行**：遭遇封禁自动退让，不强行冲撞
- **合规优先**：严格遵守 robots.txt 与目标地区法律法规

### 使用场景

当您需要以下类型数据时调用此技能：

#### 1. 公开新闻采集
- 目标：国际主流媒体、地区性新闻网站
- 输出：结构化新闻条目（标题、时间、来源、正文、URL、采集时间）
- 工具：`scripts/news_collector.py`

#### 2. 智库报告与研究
- 目标：全球智库报告、政策研究、战略分析
- 输出：报告元数据 + 内容摘要
- 工具：`scripts/reports_collector.py`

#### 3. 学术期刊与文献
- 目标：公开期刊文章、学术论文、研究目录
- 输出：文章元数据、摘要、DOI信息
- 工具：`scripts/journals_collector.py`

#### 4. 专利信息
- 目标：全球公开专利数据库（USPTO、WIPO、EPO、Google Patents）
- 输出：专利元数据、技术摘要、权人信息
- 工具：`scripts/patents_collector.py`

#### 5. 社交媒体公开动态
- 目标：公开账号、公开话题、可访问的趋势数据
- 输出：帖文、转发、点赞等公开指标
- 工具：`scripts/social_collector.py`

#### 6. 多源交叉验证
- 输入：多条同类信息
- 输出：一致性评分、差异点标记、可信度排序
- 工具：`scripts/verify.py`

#### 7. 数据护照生成
- 输入：原始数据 + 采集日志
- 输出：包含合规性声明、质量评分、审计链的数据护照
- 工具：`scripts/passport.py`

#### 3. 社交媒体公开动态
- 目标：公开账号、公开话题、可访问的趋势数据
- 输出：帖文、转发、点赞等公开指标
- 工具：`scripts/social_collector.py`

#### 4. 多源交叉验证
- 输入：多条同类信息
- 输出：一致性评分、差异点标记、可信度排序
- 工具：`scripts/verify.py`

#### 5. 数据护照生成
- 输入：原始数据 + 采集日志
- 输出：包含合规性声明、质量评分、审计链的数据护照
- 工具：`scripts/passport.py`

## 工作流程

### 第一步：接收结构化指令

长官应提供以下信息：
```
- 目标地区/国家
- 数据类型（新闻/报告/社交媒体/其他）
- 目标网站/来源范围（如"美国主要媒体"、"欧盟智库"等）
- 时间范围
- 关键词/主题
- 合规等级要求（标准/严格）
```

### 第二步：策略制定

内部执行：
- 检查目标站点 robots.txt
- 设定合理的访问频率（避免被封）
- 准备用户代理池
- 规划采集序列

### 第三步：稳健执行

- 使用 web_search 进行初步探索
- 使用 web_fetch 获取具体内容
- 实时监控响应状态
- 遭遇 429/403 时自动退让、延迟重试

### 第四步：数据验证与护照生成

- 内核完整性校验
- 格式一致性检查
- 生成数据护照（包含：采集时间、代理信息、原始URL、合规声明、质量评分）

### 第五步：交付

向长官交付：
1. 原始数据（结构化）
2. 数据护照
3. 采集日志摘要
4. 任何异常标记（如部分数据缺失、可疑内容）

## 合规声明

本技能采集的所有数据均为**公开信息**，仅通过以下合法途径获取：
- 公开网站的可访问页面
- API 提供的公开接口
- 社交媒体的公开内容

**绝不触碰**：
- 需要认证的私有数据
- 国家秘密
- 未授权的内网信息
- 违反目标地区法律法规的采集行为

## 工具说明

### 1. news_collector.py
```
用途：采集公开新闻

参数：
  - keywords: 关键词列表
  - sources: 目标媒体列表
  - time_range: 时间范围
  - max_results: 最大结果数

输出：
  - 新闻条目列表（结构化JSON）
  - 数据护照
```

### 2. reports_collector.py
```
用途：采集智库报告与文献

参数：
  - region: 目标区域（US/EU/Asia）
  - keywords: 搜索关键词
  - time_range: 时间范围
  - max_results: 最大结果数

输出：
  - 报告元数据（标题、作者、机构、发布日期、摘要）
  - 采集日志
```

### 3. journals_collector.py
```
用途：采集学术期刊文章

参数：
  - field: 研究领域（politics_security/technology/policy）
  - keywords: 搜索关键词
  - year_range: 年份范围
  - max_results: 最大结果数

输出：
  - 文章元数据（标题、期刊、作者、DOI、摘要）
  - 采集日志
```

### 4. patents_collector.py
```
用途：采集全球专利信息

参数：
  - keywords: 技术关键词
  - countries: 目标国家代码（US、CN、JP等）
  - assignees: 专利权人/公司名称
  - year_range: 申请年份范围
  - max_results: 最大结果数

输出：
  - 专利元数据（专利号、标题、摘要、权人、发明人）
  - 采集日志
```

### 5. social_collector.py
```
用途：采集社交媒体公开动态

参数：
  - platform: 平台类型（Twitter/X、Reddit、YouTube）
  - accounts/hashtags/channels: 目标账号、话题、频道
  - keywords: 搜索关键词
  - max_results: 最大结果数

输出：
  - 帖文元数据（作者、内容、时间、互动指标）
  - 采集日志
```

### 6. verify.py
```
用途：多源交叉验证

参数：
  - items: 待验证信息列表
  - min_sources: 最小交叉验证源数（默认2-3）

输出：
  - 验证报告
  - 一致性评分
  - 可信度排序
```

### 7. passport.py
```
用途：生成数据护照

参数：
  - data: 原始数据
  - collection_log: 采集日志
  - compliance_level: 合规等级

输出：
  - 完整数据护照
```

## 调用示例

长官指令格式：
```
采集以下公开信息：
- 地区：美国
- 类型：新闻报道
- 来源：CNN、Reuters、AP
- 关键词：AI policy、China
- 时间：最近7天
- 合规要求：严格
```

## 纪律红线

本技能在任何情况下：
- ❌ 不绕过 robots.txt
- ❌ 不使用未授权的代理/VPN规避地理限制
- ❌ 不采集任何形式的私有数据
- ❌ 不伪造认证信息
- ❌ 不生成或放大虚假信息

---

**技能版本**：1.0
**创建日期**：2026-03-27
**服务对象**：中国国家安全战略、战役、战术分析师
