iboard/scripts/scraper/README.md
Cheney 79341bb8cc
All checks were successful
Docker Build and Push / build-image (push) Successful in 3m16s
save
2026-08-03 18:09:08 +08:00

63 lines
1.6 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 数据爬取脚本
本目录包含用于从各种数据源爬取经济数据的脚本。
## 目录结构
- `sow-inventory-scraper.js` - 爬取能繁母猪数量数据
- `template-scraper.js` - 通用爬取脚本模板
## 依赖
- axios - 用于发送HTTP请求
- cheerio - 用于解析HTML内容
- csv-parser - 用于解析CSV格式数据
## 安装依赖
```bash
npm install
```
## 使用方法
1. **修改脚本配置**
- 打开相应的爬取脚本
- 修改数据源URL和数据提取逻辑
2. **运行爬取脚本**
```bash
node scripts/scraper/sow-inventory-scraper.js
```
## 注意事项
1. **数据来源合规性**:确保爬取的数据来源符合相关法律法规
2. **爬虫礼仪**:设置合理的请求间隔,避免对目标网站造成压力
3. **数据验证**:爬取后对数据进行验证,确保数据准确性
4. **错误处理**:脚本包含基本的错误处理,但可能需要根据实际情况进行调整
## 扩展指南
1. **添加新的爬取脚本**
- 复制 `template-scraper.js` 模板
- 修改数据源URL和数据提取逻辑
- 更新数据库存储逻辑
2. **修改数据提取逻辑**
- 使用Cheerio选择器提取HTML中的数据
- 对于CSV数据使用csv-parser解析
- 对于JSON数据直接处理响应数据
3. **数据存储**
- 脚本会自动将数据存储到数据库
- 会检查数据是否已存在,存在则更新,不存在则创建
## 示例
爬取浙江省能繁母猪数量数据:
```bash
node scripts/scraper/sow-inventory-scraper.js
```