一、前置准备
确保你已经完成以下3项基础准备,缺一项会直接卡壳:
- 已安装并正常运行的迅睿CMS:推荐使用稳定的4.6.x或5.1.x版本,可直接从官方镜像站 https://mirrors.xunruicms.com/ 下载对应压缩包
- 至少1个已创建的内容模型:后台「内容」→「内容模型」,可以直接复制默认的「文章模型」修改使用
- 已登录的后台账号(需有内容管理+模型管理权限):普通管理员或超级管理员均可
二、核心操作流程
1. 找到「手动采集」入口
登录迅睿CMS后台,点击左侧菜单栏「内容」→「采集」→「手动采集」,进入手动采集配置页。
2. 创建手动采集任务
点击页面右上角「添加任务」,弹出任务创建表单,按以下要求逐行填写:
- 任务名称:必填,比如“科技文章手动采集任务”
- 关联模型:必填,点击下拉框选择前置准备中创建的内容模型
- 关联分类:必填,点击「浏览」选择内容要发布到的分类,可多选但建议初期选1个测试
- 关联用户:必填,选当前登录账号或指定发布者账号
- 任务状态:默认「启用」即可
- 保存后返回列表:保持勾选
填写完成后点击「提交」,任务创建成功会自动跳回任务列表页,找到刚创建的任务,点击操作栏的「规则」进入采集规则配置(这是最关键的一步)。
3. 配置目标网页的采集规则
假设我们要采集的目标网页是某科技博客的单篇文章:https://example.com/tech/20240512-12345.html,先在浏览器打开这个页面,右键→查看网页源代码(或按F12打开开发者工具切换到「Elements」面板)。
第一步:测试目标网页可访问性
在规则配置页顶部的「测试URL」输入框中粘贴完整的目标单篇文章URL,点击右侧「测试」按钮。
- 如果显示“测试成功!”且下方出现目标网页的源代码片段,直接进入下一步
- 如果显示“无法访问”,检查URL是否正确、目标网站是否禁止抓取(可以尝试在「高级设置」→「请求头」添加User-Agent,比如:
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/124.0.0.0 Safari/537.36,再次测试)
第二步:配置基础字段采集规则
基础字段指内容模型自带的「标题」「摘要」「内容」「封面」等字段(不同模型可能有差异,以下以默认文章模型为例)。
规则配置采用XPath语法(最简单的抓取语法,不用深入学习,直接用浏览器开发者工具复制即可),操作步骤如下:
3.2.1 配置「标题」字段
- 回到浏览器开发者工具的「Elements」面板,点击左上角的箭头图标(或按Ctrl+Shift+C)
- 用鼠标点击目标网页的文章标题文字,开发者工具会自动定位到标题对应的HTML标签(比如:
这是测试文章标题
)
- 在定位到的标签上右键→Copy→Copy XPath,把复制的内容粘贴到规则配置页「标题」字段的「规则」输入框
- 点击「测试」按钮,右侧预览区如果显示正确的标题文字,说明规则配置成功
3.2.2 配置「摘要」字段
操作同「标题」字段,定位到目标网页的摘要文字对应的标签,复制XPath即可。如果目标网页没有摘要,可以留空,或者后续手动补。
3.2.3 配置「内容」字段
- 用箭头图标定位到正文的容器标签(通常是包含所有正文文字、图片的大标签,比如:
...
)
- 复制XPath粘贴到「内容」字段的「规则」输入框
- 勾选「内容」字段下方的「过滤HTML标签外的空格和换行」(可选,但推荐勾选,避免采集到的正文排版杂乱)
- 如果要过滤正文内的广告、版权声明等无关内容,可以在「替换规则」输入框中添加正则表达式(新手可暂时跳过)
- 点击「测试」按钮,右侧预览区如果显示完整且无多余内容的正文,说明规则配置成功
3.2.4 配置「封面」字段
- 用箭头图标定位到封面图片对应的
标签,复制该标签的XPath
- 在「封面」字段的「规则」输入框中粘贴XPath
- 在「封面」字段的「属性」输入框中填写:
src(因为图片地址通常放在src属性里)
- 点击「测试」按钮,右侧预览区如果显示完整的图片地址,说明规则配置成功
第三步:保存规则

所有基础字段配置完成后,点击页面底部的「提交」按钮,保存规则。
4. 执行手动采集
回到「手动采集」任务列表页,点击刚创建任务的操作栏的「采集」,弹出采集执行窗口:
- 输入URL:可以输入1个或多个目标单篇文章URL,多个URL用换行分隔(最多支持100个)
- 选择发布状态:推荐先选「待审核」,测试没问题后再选「已发布」
填写完成后点击「开始采集」按钮,等待几秒钟,采集完成后会显示“成功X条,失败Y条”的提示。
5. 查看采集结果
点击左侧菜单栏「内容」→「内容管理」,在顶部筛选栏选择「关联分类」「关联模型」「发布状态(待审核/已发布)」,即可找到刚采集到的文章。点击「编辑」可以查看或修改内容,确认无误后点击「发布」即可正式上线。
三、常见卡壳问题及解决方案
1. 测试URL显示“无法访问”
除了添加User-Agent外,还可以尝试:
- 检查目标网站是否需要登录:手动采集暂不支持登录后才能访问的内容
- 在「高级设置」→「请求超时」中把时间从默认的30秒改成60秒
- 检查服务器的防火墙是否禁止访问目标网站
2. 采集到的内容为空或不完整
- 重新用开发者工具定位标签,确保复制的XPath是完整且唯一的(不要定位到多个重复标签)
- 检查「内容」字段是否勾选了多余的过滤选项
- 如果目标网站的正文是动态加载的(滚动后才显示),手动采集暂不支持,需要用自动采集(带JS渲染功能)
3. 采集到的图片无法显示
- 检查图片地址是否是相对路径:如果是,在「高级设置」→「图片替换规则」中把相对路径转换成绝对路径(比如:查找
/uploads/,替换成https://example.com/uploads/)
- 检查目标网站是否禁止图片外链:如果是,需要开启「自动下载图片到本地」功能(后台「内容」→「采集」→「采集设置」→「基础设置」,勾选「采集时自动下载远程图片到本地」)
四、进阶优化(可选但实用)
1. 批量替换内容中的关键词
在规则配置页的「全局替换规则」中添加正则表达式,比如把所有的“测试”替换成“实战”:
查找:测试
替换:实战
点击「添加」按钮,再保存规则即可。
2. 自动设置文章发布时间
如果目标网页有明确的发布时间,操作同「标题」字段,定位到发布时间对应的标签,复制XPath,粘贴到「发布时间」字段的「规则」输入框,勾选「自动转换为时间戳」即可。