All checks were successful
Docker Build and Push / build-image (push) Successful in 3m16s
63 lines
1.6 KiB
Markdown
63 lines
1.6 KiB
Markdown
# 数据爬取脚本
|
||
|
||
本目录包含用于从各种数据源爬取经济数据的脚本。
|
||
|
||
## 目录结构
|
||
|
||
- `sow-inventory-scraper.js` - 爬取能繁母猪数量数据
|
||
- `template-scraper.js` - 通用爬取脚本模板
|
||
|
||
## 依赖
|
||
|
||
- axios - 用于发送HTTP请求
|
||
- cheerio - 用于解析HTML内容
|
||
- csv-parser - 用于解析CSV格式数据
|
||
|
||
## 安装依赖
|
||
|
||
```bash
|
||
npm install
|
||
```
|
||
|
||
## 使用方法
|
||
|
||
1. **修改脚本配置**:
|
||
- 打开相应的爬取脚本
|
||
- 修改数据源URL和数据提取逻辑
|
||
|
||
2. **运行爬取脚本**:
|
||
```bash
|
||
node scripts/scraper/sow-inventory-scraper.js
|
||
```
|
||
|
||
## 注意事项
|
||
|
||
1. **数据来源合规性**:确保爬取的数据来源符合相关法律法规
|
||
2. **爬虫礼仪**:设置合理的请求间隔,避免对目标网站造成压力
|
||
3. **数据验证**:爬取后对数据进行验证,确保数据准确性
|
||
4. **错误处理**:脚本包含基本的错误处理,但可能需要根据实际情况进行调整
|
||
|
||
## 扩展指南
|
||
|
||
1. **添加新的爬取脚本**:
|
||
- 复制 `template-scraper.js` 模板
|
||
- 修改数据源URL和数据提取逻辑
|
||
- 更新数据库存储逻辑
|
||
|
||
2. **修改数据提取逻辑**:
|
||
- 使用Cheerio选择器提取HTML中的数据
|
||
- 对于CSV数据,使用csv-parser解析
|
||
- 对于JSON数据,直接处理响应数据
|
||
|
||
3. **数据存储**:
|
||
- 脚本会自动将数据存储到数据库
|
||
- 会检查数据是否已存在,存在则更新,不存在则创建
|
||
|
||
## 示例
|
||
|
||
爬取浙江省能繁母猪数量数据:
|
||
|
||
```bash
|
||
node scripts/scraper/sow-inventory-scraper.js
|
||
```
|