织梦采集分页内容怎么抓取
长篇文章常被目标站拆分成多页展示,采集时若只抓第一页会内容缺失。织梦采集模块支持分页采集,通过配置分页规则可把多页正文合并为一篇完整文档。本文详解分页采集的配置方法。
一、分页采集的难点
- 分页链接识别:不同站点分页结构差异大,“下一页”位置不固定。
- 正文区域定位:每页正文都在同一容器,需稳定匹配。
- 内容合并:多页正文需按顺序拼接,不能错乱。
- 分页符处理:合并后是否保留分页符,影响阅读体验。
二、分页规则配置
1. 开启分页采集
在采集节点编辑页“文章页规则”区域,找到“分页内容采集”选项,设为“开启”。
分页内容采集:开启
2. 配置分页匹配规则
分页规则使用 {dede:match} 与 {dede:pagelistreg} 两组标签。先框定分页导航区域,再正则匹配每一页链接:
{dede:match}...<div class="pagination">[内容]</div>...{/dede:match}
{dede:pagelistreg}<a href="[内容]">[内容]</a>{/dede:pagelistreg}
分页导航的匹配锚点要选紧邻页码列表的容器,确保正则能抓到全部页码链接。
3. “下一页”模式
部分站点只有“下一页”按钮而无完整页码列表,此时匹配“下一页”链接即可,织梦会循环抓取直到没有下一页:
{dede:match}<a class="next" href="[内容]">下一页</a>{/dede:match}
三、正文区域匹配
1. 统一正文容器
分页采集要求每页正文都在相同的 HTML 容器内。配置正文匹配规则与单页采集一致:
{dede:match}<div class="article-content">[内容]</div>{/dede:match}
织梦会自动对每个分页应用该规则,抓取各页正文。
2. 去除每页重复内容
分页文章每页可能重复出现标题、广告、推荐位,需在过滤规则中剔除,避免合并后内容重复:
{dede:trim_replace}<div class="ad">[\s\S]*?</div>{/dede:trim_replace}
四、内容合并方式
1. 直接拼接
默认将各页正文按顺序拼接为一段长文本。适合无分页展示需求的站点。
2. 保留分页符
若希望前台仍分页展示,可在分页之间插入织梦分页符