2019-06-26—正则

作者: ElfACCC | 来源:发表于2019-06-26 18:30 被阅读0次

2019-06-26—正则
没有星星的夜
卖萌的ScalersTalk第四轮新概念朗读持续力训练Day22
Docker修炼之旅（二）—— 利用Dockerfile文件加d
不焦虑
木的土纪，第2日
2019-6-26晨间日记
Mr. L 的ScalersTalk第四轮《新概念》朗读持续力训
vue computed与watch实战
docker-compose部署微服务发生资源抢占的问题解决

\ 做为转意，即通常在"\"后面的字符不按原来意义解释，如/b/匹配字符"b"，当b前面加了反斜杆后/\b/，转意为匹配一个单词的边界。 
-或- 
对正则表达式功能字符的还原，如"*"匹配它前面元字符0次或多次，/a*/将匹配a,aa,aaa，加了"\"后，/a\*/将只匹配"a*"。 

^ 匹配一个输入或一行的开头，/^a/匹配"an A"，而不匹配"An a" 
$ 匹配一个输入或一行的结尾，/a$/匹配"An a"，而不匹配"an A" 
* 匹配前面元字符0次或多次，/ba*/将匹配b,ba,baa,baaa 
+ 匹配前面元字符1次或多次，/ba*/将匹配ba,baa,baaa 
? 匹配前面元字符0次或1次，/ba*/将匹配b,ba 
(x) 匹配x保存x在名为$1...$9的变量中 
x|y 匹配x或y 
{n} 精确匹配n次 
{n,} 匹配n次以上 
{n,m} 匹配n-m次 
[xyz] 字符集(character set)，匹配这个集合中的任一一个字符(或元字符) 
[^xyz] 不匹配这个集合中的任何一个字符 
[\b] 匹配一个退格符 
\b 匹配一个单词的边界 
\B 匹配一个单词的非边界 
\cX 这儿，X是一个控制符，/\cM/匹配Ctrl-M 
\d 匹配一个字数字符，/\d/ = /[0-9]/ 
\D 匹配一个非字数字符，/\D/ = /[^0-9]/ 
\n 匹配一个换行符 
\r 匹配一个回车符 
\s 匹配一个空白字符，包括\n,\r,\f,\t,\v等 
\S 匹配一个非空白字符，等于/[^\n\f\r\t\v]/ 
\t 匹配一个制表符 
\v 匹配一个重直制表符 
\w 匹配一个可以组成单词的字符(alphanumeric，这是我的意译，含数字)，包括下划线，如[\w]匹配"$5.98"中的5，等于[a-zA-Z0-9] 
\W 匹配一个不可以组成单词的字符，如[\W]匹配"$5.98"中的$，等于[^a-zA-Z0-9]。

image.png

加了问号就是非贪婪模式，匹配最少的，+是匹配至少1个

？是有一个或者没有
groups用法

image.png
sub,split,compile

image.png

匹配20.50

image.png

古诗文网爬取

image.png

完整代码

import requests
import re


def parse_page(url):
    headers = {
        'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36'
        }
    response = requests.get(url,headers)
    text = response.text
    titles = re.findall(r'<div\sclass="cont">.*?<b>(.*?)</b>',text,re.DOTALL)
    dynasties = re.findall(r'<p\sclass="source">.*?<a.*?>(.*?)</a>',text,re.DOTALL)
    authors = re.findall(r'<p\sclass="source">.*?<a.*?>.*?</a>.*?<a.*?>(.*?)</a>',text,re.DOTALL)
    content_tags = re.findall(r'<div\sclass="contson".*?>(.*?)</div>',text,re.DOTALL)
    contents = []
    for content_tag in content_tags:
        x = re.sub(r'<.*?>','',content_tag)
        contents.append(x.strip())
    poems = []
    for value in zip(titles,dynasties,authors,contents):
        title,dynastiy,author,content = value
        poem = {
            'title' : title,
            'dynastiy' : dynastiy,
            'author' : author,
            'content' : content
        }
        poems.append(poem)
    print(poems)
    print("="*30)


def main():
    for x in range(1,3):
        url = 'https://www.gushiwen.org/default_%s.aspx' %x
        parse_page(url)

if __name__ == "__main__":
    main()