数据去重功能是指在任务采集过程中,将当前采集到的数据和该任务中已保存的所有数据进行对比,如果数据重复,则按照设置条件进行处理。 在编辑任务界面,点击右下角“开始采集”按钮,在弹出的设置框中,点击“数据去重”选项可以切换到数据去重设置界面。 1、去重条件 1)所有字段都重复 勾选“所有字段都重复”这个去重条件,意味着两行数据必须完全相同,软件才会执行去重。只要两行数据中有任意一个字段不相同,该数据都不会被判定为重复数据。 需要注意的是,很多网页内容中存在时间或阅读数这一类会变化的内容,包含此类内容时,数据往往看上去大…

2023年9月5日 0条评论 34点热度 0人点赞 365crawadmin 阅读全文

如果需要设置采集范围,可以点击页面上的采集范围按钮直接设置采集范围。 1、设置起始页和结束页 起始页默认为当前页,结束页默认为最后一页。需要注意的是如果选择自定义设置,当前页为第一页。 2、设置跳过项 在采集中可以跳过每页前多少条或者后多少条。 3、设置停止采集 正常的采集任务会根据上述范围从开始页采集到结束页,此处的停止采集是在采集过程中满足设置条件时提前停止采集。停止采集条件设置和数据筛选条件的设置相同,请参考如何设置数据筛选。

2023年9月5日 0条评论 30点热度 0人点赞 365crawadmin 阅读全文

智能模式不支持在页面中直接点击等操作,如果需要进行在页面进行点击操作,请使用预执行操作功能。 具体操作步骤如下: 1、点击预执行操作按钮 2、根据操作提示或者拖动组件预执行操作 预执行操作窗口其实是一个简化版的流程图模式,在这个窗口中可以按照流程图的方式进行页面操作。 更多详情内容,请参考以下教程: 流程图模式教程

2023年9月5日 0条评论 23点热度 0人点赞 365crawadmin 阅读全文

在新建流程图模式任务之后,软件会打开任务编辑界面,本教程为大家介绍如何在流程图模式的任务编辑页面进行任务设置。 1、刷新网页 如果遇到网页加载不出来的情况,可以点击刷新按钮刷新网页。 2、修改任务网址 用户可以在下图的两个位置对网址进行编辑,超过200个请直接修改本地文件。 注意:如果是从本地文件中导入的网址,这里的修改不会影响本地文件。 更多详情内容,请参考以下教程: 如何修改网址 3、预登录功能 遇到需要登录的网页,可以点击此位置使用预登录功能。 更多详情内容,请参考以下教程: 如何采集需要登录才能查看的网页 …

2023年9月5日 0条评论 64点热度 0人点赞 365crawadmin 阅读全文

在新建智能模式任务之后,软件会打开任务编辑界面,本教程为大家介绍如何在智能模式的任务编辑页面进行任务设置。 1、刷新网页 如果遇到网页加载不出来的情况,可以点击刷新按钮刷新网页,软件会刷新当前网页并重新进行智能识别。 2、修改任务网址 这里可以对网址进行编辑,超过200个请直接修改本地文件。 注意:如果是从本地文件中导入的网址,这里的修改不会影响本地文件。 更多详情内容,请参考以下教程: 如何修改网址 3、预登录功能 遇到需要登录的网页,可以点击此位置使用预登录功能 更多详情内容,请参考以下教程: 如何采集需要登录…

2023年9月5日 0条评论 49点热度 0人点赞 365crawadmin 阅读全文

在智能模式中,后羿采集器会自动识别分页,分页类型通常包括以下几种: (1)分页按钮 (2)滚动加载 (3)瀑布流分页(滚动加载)+ 分页按钮 (4)不启用分页 但是偶尔也会发生识别结果错误的情况,原因通常包括以下几种: (1)网页加载速度过慢,软件自动识别结束之后才出现分页按钮 (2)页面中存在多个分页按钮,软件最终只会选择其中的一个 (3)在滚动加载和分页按钮同时存在的情况中,软件自动滚动多次之后分页按钮仍未出现。 (4)当前页面中的分页按钮软件暂时未兼容 “分页设置”的设置菜单如下图所示。 针对不同的分页类型,…

2023年9月5日 0条评论 22点热度 0人点赞 365crawadmin 阅读全文

在编辑任务的过程中,大家有时候会遇到各种情况导致页面内容无法显示,或者会遇到验证码提示,本教程主要为大家介绍如何处理这些情况并进行采集。 1、网页中提示验证码操作 (1)手动输入验证码 输入网址之后直接弹出的验证码,此时软件会提示验证码需要输入,如下图所示: 大家可以按照软件提示进行手动输入验证码操作。 如果软件未给出提示,我们可以直接点击手动输入验证码按钮,如下图所示: 然后在弹出的窗口中进行输入验证码操作,完成后点击右下角完成按钮。   (2)重启猫,注意不是路由器 重启猫可以切换您的IP,请注意不是…

2023年9月5日 0条评论 36点热度 0人点赞 365crawadmin 阅读全文

在如何设置数据筛选和如何设置采集范围两篇教程中,我们分别介绍了数据筛选条件和采集停止条件的设置步骤,可以看出这两个条件使用的是同样的设置方式。 这里我们以 A 或者 (B 并且 C 并且 D)或者 E 为例给大家解释如何设置。 以数据筛选为例(请忽略字段,条件和值的设置),设置结果如下图所示: 在设置条件时,存在“组间关系”和“组内关系”两种设置,这是为了让大家能够设置条件运算的优先级。 其中“组间关系”都是“或者”,“组内关系”都是“并且”,组内的优先运算,然后再是组之间的运算。 因此,如果需要添加“或者”条件,…

2023年9月5日 0条评论 50点热度 0人点赞 365crawadmin 阅读全文

终端标识可以理解为您当前电脑中所安装的后羿采集器软件的身份证号码,默认生成的终端标识由您的“电脑名称+随机数”构成,您也可以在设置中心进行修改。 终端标识主要用于同一个账号在多台电脑上登录的场景,当您的账号在多台电脑上登录时,如果您同时登录的电脑数量超过了套餐限制(后羿采集器的账号可以在任意一台电脑上登录,但是同时登录的电脑数量存在限制,具体可以参考官网价格页面的介绍),软件会显示出所有正在登录中的终端标识,并提示您需要断开其中一个正在登录中的终端,然后才能进行登录操作。 终端标识和账号存在关联,因此同一个账号在不…

2023年9月5日 0条评论 33点热度 0人点赞 365crawadmin 阅读全文

1、连接问题总结 (1)宝塔控制面板 使用此管理工具时需要注意mysql数据库访问权限设置,和远程访问端口的开放。 (2) localhost、192.168.xxx.xxx 使用此类主机地址需要注意是本机需要开启MySQL服务 (3)不确定报错详请 可使用navicat先确定具体报错详情 2、字段映射问题总结 (1)字段类型 仅支持数据表中字符串和整型字段的映射(如果需要映射日期字段,需要将数据表中对应字段改成字符串类型) (2)字段长度 需要注意字段长度是否可以满足本地采集的数据长度 3、导出中的错误日志总结:…

2023年9月5日 0条评论 38点热度 0人点赞 365crawadmin 阅读全文
1101112131446