搜索引擎怎样判断文章或网页的原始出处？

2012-08-08/0次

复制内容网页有的时候会影响网页排名。比如说原本是你写的文章，本来应该排名很好，但是其他人抄袭或转载你的文章，而且搜索引擎不幸的判断那篇被抄袭或转载的网页是原始出处的话，你应有的排名就会被那个网页夺走。

那么搜索引擎怎样才能从多个网页中挑出哪一个是原始出处呢？可能有以下几个考虑：

1）网页PR值。网页PR值越高，被认为是原始版本的可能性就越大。

2）网页第一次被收录的时间。网页被搜索引擎收录的时候越早，相比后发现的相同内容的网页来说，被当作原始出处的可能性就越大。

3）域名注册时间。越老的域名上面的网页被当成原始出处的可能性也越大。

4）网站的权威度。这就有点说不清了，可能包含前面3个因素，还有很多其他因素。

但到目前为止，无论以哪一个因素为主，或怎样组合这些因素，都不可能完全正确从多个网页中挑出原始出处。

比如说我这个博客就很新，域名也很新，文章被收录的时间有的时候也不一定是最早的，就权威地位和被信任度来说，也肯定比不上很多中文网站。但我的博客新，我的域名新，并不意味着我的内容就不是原始出处，实际上我的所有博客都是原创。

我最近也发现了很多网站都转载，有的时候是抄袭我的博客内容，很多网站的规模，历史，PR值都比我的网站要高的多。

在检测文章原始出处方面，Google做的比较好，基本上能够正确判断，百度做的就比较差。从我的文章在不同的地方出现的情况看，百度似乎认为域名比较老的就是原创。

这个问题不是网站管理员自己可以解决的，只有依靠搜索引擎算法的改进。