iboard/scripts/scraper
2026-04-26 11:41:39 +08:00
..
code.md 第一个爬虫,但是感觉是不能用的。 2026-04-17 20:37:44 +08:00
README.md 增加数据库 2026-04-09 22:07:23 +08:00
sh300.scraper.js 对比图完成 2026-04-26 11:41:39 +08:00
sow-inventory-scraper.js 添加汇率数据 2026-04-25 19:22:57 +08:00
template-scraper.js 增加数据库 2026-04-09 22:07:23 +08:00
usd-cny-rate.scraper.js 对比图完成 2026-04-26 11:41:39 +08:00

数据爬取脚本

本目录包含用于从各种数据源爬取经济数据的脚本。

目录结构

  • sow-inventory-scraper.js - 爬取能繁母猪数量数据
  • template-scraper.js - 通用爬取脚本模板

依赖

  • axios - 用于发送HTTP请求
  • cheerio - 用于解析HTML内容
  • csv-parser - 用于解析CSV格式数据

安装依赖

npm install

使用方法

  1. 修改脚本配置

    • 打开相应的爬取脚本
    • 修改数据源URL和数据提取逻辑
  2. 运行爬取脚本

    node scripts/scraper/sow-inventory-scraper.js
    

注意事项

  1. 数据来源合规性:确保爬取的数据来源符合相关法律法规
  2. 爬虫礼仪:设置合理的请求间隔,避免对目标网站造成压力
  3. 数据验证:爬取后对数据进行验证,确保数据准确性
  4. 错误处理:脚本包含基本的错误处理,但可能需要根据实际情况进行调整

扩展指南

  1. 添加新的爬取脚本

    • 复制 template-scraper.js 模板
    • 修改数据源URL和数据提取逻辑
    • 更新数据库存储逻辑
  2. 修改数据提取逻辑

    • 使用Cheerio选择器提取HTML中的数据
    • 对于CSV数据使用csv-parser解析
    • 对于JSON数据直接处理响应数据
  3. 数据存储

    • 脚本会自动将数据存储到数据库
    • 会检查数据是否已存在,存在则更新,不存在则创建

示例

爬取浙江省能繁母猪数量数据:

node scripts/scraper/sow-inventory-scraper.js