采集场景 在维基百科网页面 https://zh.wikipedia.org/wiki循环输入多个关键词,采集搜索后展示的多个名词解释的详细数据。       采集字段 岛屿、位置、坐标、群岛、面积 、最高海拔、最高点、人口等字段。   采集结果 采集结果可导出为Excel,CSV,HTML,数据库等多种格式。导出为Excel示例:       教程说明 本篇制作时间:2022/2/28    八爪鱼版本:V8.5.1.21611   采集步骤  步骤一、打开网页 步骤二、批量输入多个关键词并搜索 步骤三、提取检索…

2023年9月5日 0条评论 84点热度 0人点赞 365crawadmin 阅读全文

云采集日志主要有两个方面的应用:

2023年9月5日 0条评论 48点热度 0人点赞 365crawadmin 阅读全文

采集场景 B站有非常多的分类(动画、音乐、舞蹈等),每个分类下都会很多热门标签。本教程采集热门分类下的视频列表数据。 标签示例网址: https://www.bilibili.com/v/douga/mad/?spm_id_from=333.5.b_7375626e6176.2#/4672 https://www.bilibili.com/v/music/cover/?spm_id_from=333.5.b_6d757369635f636f766572.23#/312357    采集字段 标签、视频时长、标题、视…

2023年9月5日 0条评论 37点热度 0人点赞 365crawadmin 阅读全文

采集场景 在淘宝首页(https://s.taobao.com/)输入关键词搜索,采集搜索后得到的商品列表页数据。示例中关键词为【耐克】,可根据需求进行更换,同时支持自动批量输入多个关键词。   采集字段 采集字段包括关键字文本值,产品标题,店铺名称,产品价格,付款人数,商品链接,店铺名,品牌,发货地等。     鼠标放到图片上,右键,选择【在新标签页中打开图片】可查看高清大图 下文其他图片同理   采集结果 采集结果可导出为Excel,CSV,HTML,数据库等多种格式。导出为Excel示例:   教程说明 本篇…

2023年9月5日 0条评论 75点热度 0人点赞 365crawadmin 阅读全文

一、定时本地采集是什么?   支持对执行本地采集的任务设置定时启动,大幅提高本地采集性能。   二、如何设置定时本地采集   1、在任务编辑页面设置【定时本地采集】 打开目标任务编辑页面,点击【采集】,再点击【定时本地采集】,会弹出一个【定时本地采集】设置的弹窗。 支持多种定时方式:【只采集一次】【选择星期】【每月采集】【间隔时间采集】。请根据需求,选择定时方式。 设置完成后,点击【保存并启动】即可。     2、在任务列表页面设置【定时本地采集】 找到目标任务,点击【更多操作】的   按钮,选择【本地采集】-【设…

2023年9月5日 0条评论 45点热度 0人点赞 365crawadmin 阅读全文

有些网站可能我们用系统做好的规则在采集的时候可能明明已经采集最后一页了,就是不停止,一直在最后一页循环采集,这种情况其实是由于Xpath定位不对导致的,我们需要通过修改Xpath来解决这个翻页问题。   在出现这个问题的时候,我们可以直接在流程里面找到问题所在,下面的规则是直接按照新手入门的步骤做的(列表循环-翻页循环): 此教程引用的示例网址:http://www.gzebpubservice.cn/dlzbgg/index_590.htm            如上图中,浏览器中要采集的数据已经在最后一页了,可…

2023年9月5日 0条评论 31点热度 0人点赞 365crawadmin 阅读全文

1、正则表达式简介 正则表达式是对字符串(包括普通字符(例如,a 到 z 之间的字母)和特殊字符(称为“元字符”))操作的一种逻辑公式,就是用事先定义好的一些特定字符、及这些特定字符的组合,组成一个【规则字符串】,这个【规则字符串】用来表达对字符串的一种过滤逻辑。正则表达式是一种文本模式,该模式描述在搜索文本时要匹配的一个或多个字符串。   2、正则的用途 字符串匹配(字符匹配) 字符串查找 字符串替换   3、常用元字符及描述 \d 匹配一个数字字符。等价于[0-9] \D 匹配一个非数字字符。等价于[^0-9]…

2023年9月5日 0条评论 55点热度 0人点赞 365crawadmin 阅读全文

我们通过创建【循环列表】去采集多个列表或详情页的数据。创建【循环列表】的方式在 新手入门系列课程 中有详细讲过。   一般情况下,通过以上方法创建的【循环列表】不会出错,能够精准采集到我们想要的全部数据。但有时候也会遇到一些问题:比如滚动后加载出100个列表,为什么只采集到20个?有一些列表并不是我们需要的,如何将其排除掉? 页面本来有30条列表,为什么却只能采集到10条?   这时候,就需要手动修改XPath去精准定位列表。   以下通过实例进行说明。   实例网址:https://www.made-in-chi…

2023年9月5日 0条评论 49点热度 0人点赞 365crawadmin 阅读全文

采集场景 空天院遥感数据服务系统页面 http://eds.ceode.ac.cn/nuds/freedataquery设置查询条件,采集查询展示的卫星数据。             采集字段 数据标识 、卫星和传感器、 成像时间 、链接等字段。       采集结果 采集结果可导出为Excel,CSV,HTML,数据库等多种格式。导出为Excel示例:           教程说明 本篇制作时间:2022/2/27    八爪鱼版本:V8.5.1.21611   采集步骤  步骤一、打开网页 步骤二、设置筛选条件…

2023年9月5日 0条评论 51点热度 0人点赞 365crawadmin 阅读全文

通过前几课的学习,我们已经学会了采集一页数据:列表、表格、点击链接进入详情的数据。   在实际使用过程中,经常是需要翻页来采集更多的数据。对于需要翻页的网站,我们该如何操作呢?   本课将讲解常见的网页翻页类型,以及用八爪鱼实现翻页的方法。   一、点击 【下一页】按钮翻页   点击页面上的 【下一页】按钮翻页,是最常见的翻页方式。这个网站就是如此:http://www.ggzy.gov.cn/information/info/news/news.shtml     鼠标放到图片上,右键,选择【在新标签页中打开图片…

2023年9月5日 0条评论 54点热度 0人点赞 365crawadmin 阅读全文
1234513