|
All checks were successful
Docker Build and Push / build-image (push) Successful in 4m44s
|
||
|---|---|---|
| .. | ||
| code.md | ||
| README.md | ||
| sh300.scraper.js | ||
| sow-inventory-scraper.js | ||
| template-scraper.js | ||
| usd-cny-rate.scraper.js | ||
数据爬取脚本
本目录包含用于从各种数据源爬取经济数据的脚本。
目录结构
sow-inventory-scraper.js- 爬取能繁母猪数量数据template-scraper.js- 通用爬取脚本模板
依赖
- axios - 用于发送HTTP请求
- cheerio - 用于解析HTML内容
- csv-parser - 用于解析CSV格式数据
安装依赖
npm install
使用方法
-
修改脚本配置:
- 打开相应的爬取脚本
- 修改数据源URL和数据提取逻辑
-
运行爬取脚本:
node scripts/scraper/sow-inventory-scraper.js
注意事项
- 数据来源合规性:确保爬取的数据来源符合相关法律法规
- 爬虫礼仪:设置合理的请求间隔,避免对目标网站造成压力
- 数据验证:爬取后对数据进行验证,确保数据准确性
- 错误处理:脚本包含基本的错误处理,但可能需要根据实际情况进行调整
扩展指南
-
添加新的爬取脚本:
- 复制
template-scraper.js模板 - 修改数据源URL和数据提取逻辑
- 更新数据库存储逻辑
- 复制
-
修改数据提取逻辑:
- 使用Cheerio选择器提取HTML中的数据
- 对于CSV数据,使用csv-parser解析
- 对于JSON数据,直接处理响应数据
-
数据存储:
- 脚本会自动将数据存储到数据库
- 会检查数据是否已存在,存在则更新,不存在则创建
示例
爬取浙江省能繁母猪数量数据:
node scripts/scraper/sow-inventory-scraper.js