# 数据爬取脚本 本目录包含用于从各种数据源爬取经济数据的脚本。 ## 目录结构 - `sow-inventory-scraper.js` - 爬取能繁母猪数量数据 - `template-scraper.js` - 通用爬取脚本模板 ## 依赖 - axios - 用于发送HTTP请求 - cheerio - 用于解析HTML内容 - csv-parser - 用于解析CSV格式数据 ## 安装依赖 ```bash npm install ``` ## 使用方法 1. **修改脚本配置**: - 打开相应的爬取脚本 - 修改数据源URL和数据提取逻辑 2. **运行爬取脚本**: ```bash node scripts/scraper/sow-inventory-scraper.js ``` ## 注意事项 1. **数据来源合规性**:确保爬取的数据来源符合相关法律法规 2. **爬虫礼仪**:设置合理的请求间隔,避免对目标网站造成压力 3. **数据验证**:爬取后对数据进行验证,确保数据准确性 4. **错误处理**:脚本包含基本的错误处理,但可能需要根据实际情况进行调整 ## 扩展指南 1. **添加新的爬取脚本**: - 复制 `template-scraper.js` 模板 - 修改数据源URL和数据提取逻辑 - 更新数据库存储逻辑 2. **修改数据提取逻辑**: - 使用Cheerio选择器提取HTML中的数据 - 对于CSV数据,使用csv-parser解析 - 对于JSON数据,直接处理响应数据 3. **数据存储**: - 脚本会自动将数据存储到数据库 - 会检查数据是否已存在,存在则更新,不存在则创建 ## 示例 爬取浙江省能繁母猪数量数据: ```bash node scripts/scraper/sow-inventory-scraper.js ```