武汉世纪互联科技有限公司为您免费提供武汉网站优化公司武汉专业网络推广武汉网站营销等相关信息发布和行业资讯,敬请关注!
联系我们
咨询热线
13995609075
全国售后热线:
13995609075
邮箱:4733180@qq.com
地址:洪山区卓刀泉路108号凯乐桂园S-1栋单元10层1室
您的当前位置:首页 > 常见问答 > 详细内容

武汉网络营销市场搜索引擎原理详解

来源:http://www.whxsjhl.com/news/57.html   发布时间:2016-09-05

武汉网络营销市场搜索引擎原理详解

搜索引擎,通常指的是收集了因特网上几千万到几十亿个网页并对网页中的每一个词(即关键词)进行索引,建立索

引数据库的全文搜索引擎。当用户查找某个关键词的时候,所有在页面内容中包含了该关键词的网页都将作为搜索结

果被搜出来。在经过复杂的算法进行排序后,这些结果将按照与搜索关键词的相关度高低,依次排列。根据自己的优

化程度,获得相应的名次。
  原理概述
  在搜索引擎的后台,有一些用于搜集网页信息的程序。所收集的信息一般是能表明网站内容(包括网页本身、网

页的URL地址、构成网页的代码以及进出网页的连接)的关键词或者短语。接着将这些信息的索引存放到数据库中。

  搜索引擎原理详解

  搜索引擎的系统架构和运行方式吸收了信息检索系统设计中许多有价值的经验,也针对万维网数据和用户的特点

进行了许多修改,如右图所示的搜索引擎系统架构。其核心的文档处理和查询处理过程与传统信息检索系统的运行原

理基本类似,但其所处理的数据对象即万维网数据的繁杂特性决定了搜索引擎系统必须进行系统结构的调整,以适应

处理数据和用户查询的需要。
  工作原理
搜索引擎原理

  爬行和抓取
  搜索引擎派出一个能够在网上发现新网页并抓文件的程序,这个程序通常称之为蜘蛛(Spider)。搜索引擎从已

知的数据库出发,就像正常用户的浏览器一样访问这些网页并抓取文件。搜索引擎通过这些爬虫去爬互联网上的外链

,从这个网站爬到另一个网站,去跟踪网页中的链接,访问更多的网页,这个过程就叫爬行。这些新的网址会被存入

数据库等待搜索。所以跟踪网页链接是搜索引擎蜘蛛(Spider)发现新网址的基本的方法,所以反向链接成为搜索

引擎优化的基本因素之一。搜索引擎抓取的页面文件与用户浏览器得到的完全一样,抓取的文件存入数据库。
  建立索引
  蜘蛛抓取的页面文件分解、分析,并以巨大表格的形式存入数据库,这个过程即是索引(index).在索引数据库中

,网页文字内容,关键词出现的位置、字体、颜色、加粗、斜体等相关信息都有相应记录。
  搜索词处理
  用户在搜索引擎界面输入关键词,单击“搜索”按钮后,搜索引擎程序即对搜索词进行处理,如中文特有的分词

处理,去除停止词,判断是否需要启动整合搜索,判断是否有拼写错误或错别字等情况。搜索词的处理必须十分快速。
  排序
  对搜索词处理后,搜索引擎程序便开始工作,从索引数据库中找出所有包含搜索词的网页,并且根据排名算法计

算出哪些网页应该排在前面,然后按照一定格式返回到“搜索”页面。
  再好的搜索引擎也无法与人相比,这就是为什么网站要进行搜索引擎优化。没有SEO的帮助,搜索引擎常常并不

能正确的返回相关、权威、有用的信息。
  数据结构
  搜索引擎的核心数据结构为倒排文件(也称倒排索引),倒排索引是指用记录的非主属性值(也叫副键)来查找记

录而组织的文件叫倒排文件,即次索引。倒排文件中包括了所有副键值,并列出了与之有关的所有记录主键值,主要

用于复杂查询。 与传统的SQL查询不同,在搜索引擎收集完数据的预处理阶段,搜索引擎往往需要一种高效的数据结

构来对外提供检索服务。而现行有效的数据结构就是“倒排文件”。倒排文件简单一点可以定义为“用文档的关键

词作为索引,文档作为索引目标的一种结构(类似于普通书籍中,索引是关键词,书的页面是索引目标)。
  全文搜索引擎
  在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集

功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对

一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。
  另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你

的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于搜索引擎索引规则发生了很

大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前好的办法是多获得一些外部链接,让搜

索引擎有更多机会找到你并自动将你的网站收录。
  当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特

殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名

等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。
  来源:SEO自学网

武汉网络营销市场搜索引擎原理详解

 

相关产品