正则表达式的介绍

正则表达式（或 RE）是一种小型的、高度专业化的编程语言，（在Python中）它内嵌在Python中，并通过 re 模块实现。正则表达式模式被编译成一系列的字节码，然后由用 C 编写的匹配引擎执行。

正则表达式是对字符串（包括普通字符（例如，a 到 z 之间的字母）和特殊字符（称为“元字符”））操作的一种逻辑公式，就是用事先定义好的一些特定字符、及这些特定字符的组合，组成一个“规则字符串”，这个“规则字符串”用来表达对字符串的一种过滤逻辑。正则表达式是一种文本模式，模式描述在搜索文本时要匹配的一个或多个字符串。

正则的元字符

**元字符（11个） . ^ $ * + ? {} [] | () \**

1. .(通配符) 只能带替任意一个字符（不能匹配换行符）
2. ^ 从字符串的开始匹配
3. $ 从字符串的结尾匹配 
4. * 重复前面的字符匹配 [0,+oo]  0到多次
5. + 重复前面的字符匹配 [1,+oo]  1到多次
6. ？ 匹配0到1次 [0,1]
7. {} 匹配任意次数 自定义 
* 等价于{0，正无穷}   +等价于{1，+oo}   ?等价于{0，1} 推荐使用前面的匹配符

8.[] 字符集 [ab] 表示a或b  [a-z] 表示范围  取消元字符的特殊功能（除 \ ^ -） ^放在[]里：取反

9.\ 
反斜杠后边跟元字符去除特殊功能
反斜杠后边跟普通字符实现特殊功能
\d 匹配任何十进制数 相当于类[0-9] 
\D 匹配任何非数字字符 相当于类 [^0-9]
\s 匹配任何空白字符 相当于 [ \t\n\r\f\v]
\S 匹配任何非空白字符 相当于  [^ \t\n\r\f\v]
\w 匹配任何字母数字字符 相当于类 [a-zA-Z0-9]
\W 匹配任何非字母数字字符 相当于类 [^a-zA-Z0-9]
\b 匹配一个特殊字符边界 也就是指单词和空格间的位置

10. () 分组
11. | 或

re模块的一些函数

re.findall() 全部查找，找到第一个继续查找 返回一个列表
re.search('ab','dafaddfaab') （第一个匹配成功停止匹配）返回一个对象，查找不到返回一个None
re.search('ab','dafaddfaab').group()（第一个匹配成功停止匹配）返回一个对象结果,如果查找不到会抛异常

re.match(): 只在字符串开始匹配
re.split(): 分割字符串
示例：
re.split('s','fgasdfa')  # ['fga','dfa']
re.split('[s,f]','fgasdfa')  # ['', 'ga', 'd', 'a']  先按照s分割再按照f分割


re.sub('k..k','l..l','dafakaikaidfa')  # 替换 第一个参数是匹配 第二个参数是要将匹配替换成什么 第三个参数是原始字符串
re.compile()：匹配规则编译好，可以多次调用

obj = re.compile('\.com')
ret = obj.findall('gfd.comfga')
print(ret)

元字符之. ^ $ * + ? { }

import re
 
ret=re.findall('a..in','helloalvin')
print(ret)#['alvin']
 
 
ret=re.findall('^a...n','alvinhelloawwwn')
print(ret)#['alvin']
 
 
ret=re.findall('a...n$','alvinhelloawwwn')
print(ret)#['awwwn']
 
 
ret=re.findall('a...n$','alvinhelloawwwn')
print(ret)#['awwwn']
 
 
ret=re.findall('abc*','abcccc')#贪婪匹配[0,+oo]  
print(ret)#['abcccc']
 
ret=re.findall('abc+','abccc')#[1,+oo]
print(ret)#['abccc']
 
ret=re.findall('abc?','abccc')#[0,1]
print(ret)#['abc']
 
 
ret=re.findall('abc{1,4}','abccc')
print(ret)#['abccc'] 贪婪匹配

注意：前面的*,+,?等都是贪婪匹配，也就是尽可能匹配，后面加?号使其变成惰性匹配

ret=re.findall('abc*?','abcccccc')
print(ret)#['ab']

元字符之字符集［］：

#--------------------------------------------字符集[]
ret=re.findall('a[bc]d','acd')
print(ret)#['acd']
 
ret=re.findall('[a-z]','acd')
print(ret)#['a', 'c', 'd']
 
ret=re.findall('[.*+]','a.cd+')
print(ret)#['.', '+']
 
#在字符集里有功能的符号: - ^ \
 
ret=re.findall('[1-9]','45dha3')
print(ret)#['4', '5', '3']
 
ret=re.findall('[^ab]','45bdha3')
print(ret)#['4', '5', 'd', 'h', '3']
 
ret=re.findall('[\d]','45bdha3')
print(ret)#['4', '5', '3']

findall() 和（）分组使用的时候，查找的结果是分组的结果，当在分组前面添加?:后表示取消分组的优先级，查找为findall结果

ret = re.findall('www.(\w+).com','www.baidu.com')
print(ret) # ['baidu']
ret = re.findall('www.(?:\w+).com','www.baidu.com')
print(ret) # ['www.baidu.com']

元字符之转义符\

ret=re.findall('I\b','I am LIST')
print(ret)#[]
ret=re.findall(r'I\b','I am LIST')
print(ret)#['I']

\和\\的特殊情况

#-----------------------------eg1:
import re
ret=re.findall('c\l','abc\le')
print(ret)#[]
ret=re.findall('c\\l','abc\le')
print(ret)#[]
ret=re.findall('c\\\\l','abc\le')
print(ret)#['c\\l']
ret=re.findall(r'c\\l','abc\le')
print(ret)#['c\\l']
 
#-----------------------------eg2:
#之所以选择\b是因为\b在ASCII表中是有意义的
m = re.findall('\bblow', 'blow')
print(m)
m = re.findall(r'\bblow', 'blow')
print(m)

元字符之分组()

m = re.findall(r'(ad)+', 'add')
print(m)
 
ret=re.search('(?P<id>\d{2})/(?P<name>\w{3})','23/com')
print(ret.group())#23/com
print(ret.group('id'))#23

元字符之｜

ret=re.search('(ab)|\d','rabhdg8sd')
print(ret.group())#ab

原文来自http://www.cnblogs.com/yuanchenqi/articles/5732581.html

python之re模块使用

正则表达式的介绍

正则的元字符

**元字符（11个） . ^ $ * + ? {} [] | () \**

re模块的一些函数

findall() 和（）分组使用的时候，查找的结果是分组的结果，当在分组前面添加?:后表示取消分组的优先级，查找为findall结果

猜你喜欢