第一个爬虫

第一个爬虫入门_爬虫

怎样扒网页呢?

其实就是根据URL来获取它的网页信息,虽然我们在浏览器中看到的是一幅幅优美的画面,但是其实是由浏览器解释才呈现出来的,实质它是一段HTML代码,加 JS、CSS。如果把网页比作一个人,那么HTML便是他的骨架,JS便是他的肌肉,CSS便是它的衣服。所以最重要的部分是存在于HTML

  • HTML 70%
  • JS 20%
  • CSS 10%

第一个爬虫入门_CSS_02

爬取页面,代码如下:

from urllib.request import urlopen


def reptile():

    # 请求地址
    url = 'https://www.baidu.com/'
    # 发送请求
    resp = urlopen(url)
    # 打印响应数据
    print(resp.read().decode())


if __name__ == '__main__':
    reptile()

第一个爬虫入门_HTML_03