中国站长之家  
首页 | 收录查询 | Alexa排名查询 | 域名查询 | Whois查询 | IP地址查询 | PR查询 | 搜狗评级查询 | 站长工具 | 网站优化 | 天气预报 | 汇率查询
 4当前位置:站长之家 - 网站优化 - SEO优化技术 - 谷歌(Google)优化推广
Google工程师详述Google的搜索结果排列算法
发布时间:2006-12-25 11:26:00    浏览次数:1704
本文作者马特-卡兹(Matt Cutts)是Google公司品质管理部门的软件工程师。他的工作主要是给好的网站评定等级,并负责开发阻止虚假或垃圾网站出现在Google搜索结果上的技术。

  图书馆管理员们提出最多的问题之一是:“对于什么样的结果应该位于搜索列表的最上方,Google是如何选择的?”现在品质工程师马特-卡兹介绍了快速入门的知识,解释了Google是如何在网上爬行和索引,以及如何评定搜索结果等级的。马特也向学校图书馆管理员提出建议,告诉他们如何辅导学生。

  爬行和索引

  在你浏览包含了Google搜索结果的网页之前,要发生很多事情。首先是在万维网数以十亿计的网页上爬行和索引,这个工作是由Googlebot完成的,它负责与全球的网络服务器连接以收集文件。爬行不是真的在网上漫游,而是访问网络服务器返回到一个特定的网页上,接着扫描该网页建立超链接并为每一个网页编上号码。爬行可收集大量的文件,但这些文件还不能直接用于搜索。

  如果没有索引,在你想查询如“civil war”(南北战争)等内容时,Google的服务器将不得不在你每次搜索时阅读每一份文件的内容。因此第二个步骤是要建立一个索引,这样就需要“转换”爬行所获得的数据。为了不必在每一份文件上扫描每一个单词,就需要在数据上做些文章,以便显示包含了特定单词的所有文件。例如,假设单词“civil”在编号为3、8、22、56、68和92的文件上出现过,而单词“war”出现编号为2、8、15、22、68和77的文件上。

  一旦建立了索引,就开始对文件进行等级评定并确定它们的相关性。假如某个人上Google搜索并输入“civil war”,为呈现和评价搜索结果需要做两件事:一是查找包含了用户提问的网页;二是按照相关性排定匹配网页的位置。Google已经开发出一个有趣的技术可加速第一步骤的过程:不是将所有索引存储在一台电脑上,而是使用数百台电脑做这种工作。由于任务被分配到很多电脑上,使得查询答案更为迅速。

  为更加形象地描述这个过程,可以设想下一本30页厚书的索引。如果一个人在索引中查找数页的信息,那么每一次搜索都至少需要花几秒钟的时间;但如果你将索引的每一页分给不同的人去查找呢?三十个人分别查找索引的不同部分,要比一个人独自查找快的多。同样,Google也是将数据分配到各台电脑上以便可以更快地查找文件。

  如何查找包含了用户提问的网页?让我们返回到上面举的“civil war”例子。单词“civil”在编号为3、8、22、56、68和92的文件上,单词“war”在编号为2、8、15、22、68和77的文件上,我们可以在网页上显示文件并寻找包含两个单词的文件(从下表中可以看出是8、22和68号文件)。

  单词civil 3 8 22 56 68 92

  单词war 2 8 15 22 68 77

  两个单词都出现 8 22 68

  包含了一个单词的文件列表被称为“文件标识列表”,查找包含两个单词的文件被称为“文件标识列表的交集”。

  评定搜索结果

  有了包含用户提问的网页后,就该按照相关性评定网页了。Google使用了很多技术,其中PageRank算法是最有名的。PageRank评定的是两种事情:从网站到某一网页有多少个链接,提供链接的网站的排名。使用PageRank,来自CNN和纽约时报网站的链接的价值,是很多不太有名网站的两倍。

  除了PageRank外Google还使用了很多其他技术,例如一份文件所包含的“civil”和“war”两个单词靠的很近,就比只使用了“war”单词的包含“Revolutionary War”(独立战争)的文件相关性要大的多。另外在题目中出现了“civil war”的网页,它的相关性就比题目为“19th Century American Clothing”(19世纪的美国服装)要重要的多。同样如果“civil war”在网页上出现了数次,比出现一次的网页要相关的多。

  Google的目的是要找到知名度和相关性都大的网页。如果两个网页出现匹配提问的信息数量几乎一样,我们常常会选择更有名网站的链接。但如果其他方面表明一个网页更为相关,也会选择更少链接或更低排名的网页。例如,一个网页全篇都是讲“南北战争”的内容,会比只是略微提到“南北战争”的网页更为有用,即使这个网页是出现不太有名的网站上。一旦我们有了文件的列表和分值,就会选择最高分值、最匹配的文件。

  Google从包含了提问单词的每一份文件中提取几句话作为摘要显示,接着将排好的URLs和摘要显示在搜索结果上。正如你所知道的运行一个搜索器需要大量的计算资源。每一次搜索需要500台以上的电脑一起工作,搜索的时间还不到半秒钟。


上一篇:Google推出火星地图 用户可自己探索火星
下一篇:Google购网络字处理软件商 欲建“网络Office”

返回栏目:谷歌(Google)优化推广
 
【声明】:
  以上文章或资料除注明为 中国站长之家 自创或编辑整理外,均为各方收集或网友推荐所得。以上内容以共享、参考、研究为目的,不存在任何商业目的。
  未注明作者或出处的文章,并非不尊重作者及出处网站,而是有些资料来源不规范。如果您发现有涉及版权等问题请及时联系我们,本站确认后将立即更正或予以删除。
站长工具
  收录查询
  Alexa排名查询
  PageRank查询
  Sogou Rank查询
  HTTP状态查询
  HTML/JS互转工具
  JS/VBS加密/解密
  Escape加密/解密
  MD5加密
  Unicode编码转换
  中文简繁互转
  汉字转换拼音
  CSS在线编辑器
  查看网页源代码
  HTML颜色代码
  网站优化资讯
  网站历史页面查询
 
实用查询工具
  IP地址查询
  IP WHOIS查询
  天气预报查询
  汇率查询 黄金 白银
  学历查询
  身份证号码查询
  机票价格查询
  酒店预订
  列车时刻表查询
  手机号码归属地查询
  QQ强制聊天
  火星文转换器
  电子成语词典
  邮编区号查询
  车牌查询
  快递查询
  免费在线翻译
  万年历
 
域名注册查询
  域名注册查询
  WHOIS查询
  中文域名转码
  国家或地区域名

  CN域名到期时间列表
  今天CN域名删除列表
  明天CN域名删除列表
  后天CN域名删除列表

  国际域名到期时间列表
  今天国际域名删除列表
  明天国际域名删除列表
  后天国际域名删除列表
Alexa排名统计 收录查询统计 帮助中心 免责声明与隐私 广告服务 联系我们 网站地图 友情链接 用户中心
©2005-2017 - 中国站长之家 - 酷帝网站目录 - 菜鸟汇率网 - Design by Hanren - 沪ICP备05003862号
设为首页 添加收藏 我要统计