第一个爬虫
怎样扒网页呢?
其实就是根据URL来获取它的网页信息,虽然我们在浏览器中看到的是一幅幅优美的画面,但是其实是由浏览器解释才呈现出来的,实质它是一段HTML代码,加 JS、CSS。如果把网页比作一个人,那么HTML便是他的骨架,JS便是他的肌肉,CSS便是它的衣服。所以最重要的部分是存在于HTML
- HTML 70%
- JS 20%
- CSS 10%
爬取页面,代码如下:
from urllib.request import urlopen
def reptile():
# 请求地址
url = 'https://www.baidu.com/'
# 发送请求
resp = urlopen(url)
# 打印响应数据
print(resp.read().decode())
if __name__ == '__main__':
reptile()