用火车头采集器获取当前采集网址的正则表达式

蒲松林
发布时间:
2013年12月28日
所在分类:
优化
评论数:
暂无

用火车头采集器获取当前采集网址的正则表达式

要能采集网址的火车头,必须是7版以上的,以下的版本无法办到。

首先创建一个标签为本文网址,勾选后面的“从网址中采集”。
选择下面的“正则提取”,点击通配符“(?<content>?)”,这样在窗口中就显示为(?<content>[\s\S]*?)
我们再在它前加一个与字符串开始的地方匹配的符号^,又在它后面加一个与字符串结束的地方匹配的符号$,这样就变成了^(?<content>[\s\S]*?)$。如图:

火车头采集器正则表达式

 

我们来解释下意思

 

发表评论