织梦采集分页内容怎么抓取

织梦CMS采集分页正文合并

长篇文章常被目标站拆分成多页展示,采集时若只抓第一页会内容缺失。织梦采集模块支持分页采集,通过配置分页规则可把多页正文合并为一篇完整文档。本文详解分页采集的配置方法。

一、分页采集的难点

二、分页规则配置

1. 开启分页采集

在采集节点编辑页“文章页规则”区域,找到“分页内容采集”选项,设为“开启”。

分页内容采集:开启

2. 配置分页匹配规则

分页规则使用 {dede:match}{dede:pagelistreg} 两组标签。先框定分页导航区域,再正则匹配每一页链接:

{dede:match}...<div class="pagination">[内容]</div>...{/dede:match}
{dede:pagelistreg}<a href="[内容]">[内容]</a>{/dede:pagelistreg}
分页导航的匹配锚点要选紧邻页码列表的容器,确保正则能抓到全部页码链接。

3. “下一页”模式

部分站点只有“下一页”按钮而无完整页码列表,此时匹配“下一页”链接即可,织梦会循环抓取直到没有下一页:

{dede:match}<a class="next" href="[内容]">下一页</a>{/dede:match}

三、正文区域匹配

1. 统一正文容器

分页采集要求每页正文都在相同的 HTML 容器内。配置正文匹配规则与单页采集一致:

{dede:match}<div class="article-content">[内容]</div>{/dede:match}

织梦会自动对每个分页应用该规则,抓取各页正文。

2. 去除每页重复内容

分页文章每页可能重复出现标题、广告、推荐位,需在过滤规则中剔除,避免合并后内容重复:

{dede:trim_replace}<div class="ad">[\s\S]*?</div>{/dede:trim_replace}

四、内容合并方式

1. 直接拼接

默认将各页正文按顺序拼接为一段长文本。适合无分页展示需求的站点。

2. 保留分页符

若希望前台仍分页展示,可在分页之间插入织梦分页符