Python全栈之路正则函数

作者:熬夜泡枸杞 时间:2022-03-19 05:03:51 

目录
  • 1. 反向引用_命名分组

  • 2. 正则函数

    • 小提示:

  • 总结

    1. 反向引用_命名分组


    # ### 反向引用
    import re
    strvar = "<div>明天又要休息了</div>"
    obj = re.search("<(.*?)>(.*?)<(.*?)>",strvar)
    print(obj)
    # 获取匹配到的内容
    res1 = obj.group()
    print(res1)
    # 获取分组里的内容
    res2 = obj.groups()
    print(res2)
    # 反向引用的语法 \1把第一个括号里面匹配到的内容在引用一次
    obj = re.search(r"<(.*?)>(.*?)</\1>",strvar)
    print(obj)
    print(obj.group())
    print(obj.groups())
    strvar = " z3d4pzd a1b2cab "
    obj = re.search(r"(.*?)\d(.*?)\d(.*?)\1\2",strvar)
    print(obj)
    print(obj.group())
    print(obj.groups())
    # ### 命名分组
    """
    3) (?P<组名>正则表达式) 给这个组起一个名字
    4) (?P=组名) 引用之前组的名字,把该组名匹配到的内容放到当前位置
    """
    # 写法一
    strvar = " z3d4pzd a1b2cab "
    obj = re.search(r"(?P<tag1>.*?)\d(?P<tag2>.*?)\d(?P<tag3>.*?)\1\2",strvar)
    print(obj)
    print(obj.group())
    # 写法二
    strvar = " z3d4pzd a1b2cab "
    obj = re.search(r"(?P<tag1>.*?)\d(?P<tag2>.*?)\d(?P<tag3>.*?)(?P=tag1)(?P=tag2)",strvar)
    print(obj)
    print(obj.group())

    2. 正则函数


    # ### 正则函数
    import re
    # search   通过正则匹配出第一个对象返回,通过group取出对象中的值
    strvar = "3+4 6*4"
    obj = re.search(r"(\d+[+*]\d+)",strvar)
    print(obj)
    # 获取匹配到的内容
    print(obj.group())
    # 获取分组当中的内容 (返回元组)
    print(obj.groups())
    # match    验证用户输入内容 (了解)
    """search在正则表达式的前面加上^ 等价于 match ,其他用法上一模一样"""
    strvar = "a17366668888"
    strvar = "17366668888"
    # obj = re.search(r"^\d+",strvar)
    # obj = re.match(r"\d+",strvar)
    # print(obj.group())
    print(obj)
    # split    切割
    strvar = "alex|wusir_xboyww@risky"
    lst = re.split("[|_@]",strvar)
    print(lst)
    strvar = "alex2341273894wusir234234xboyww11111risky"
    lst = re.split("\d+",strvar)
    print(lst)
    # sub      替换
    strvar = "alex|wusir_xboyww@risky"
    """
    strvar = strvar.replace("|","&")
    strvar = strvar.replace("_","&")
    strvar = strvar.replace("@","&")
    print(strvar)
    """
    # sub(正则,替换的字符,原字符串[,替换的次数])
    res = re.sub("[|_@]","&",strvar)
    res = re.sub("[|_@]","&",strvar,1)
    print(res)
    # subn     替换  (用法上与sub相同,只是返回值不同)
    res = re.subn("[|_@]","&",strvar)
    res = re.subn("[|_@]","&",strvar,2)
    print(res)
    # res = re.sub("[|_@]","&",strvar)
    # ('alex&wusir&xboyww@risky', 2)
    # finditer 匹配字符串中相应内容,返回迭代器
    """返回的是迭代器,迭代器中包含了对象 对象.group来获取匹配到的值"""
    from collections import Iterator, Iterable
    strvar = "sdf23647fdgdfg()*()*23423423"
    it = re.finditer("\d+",strvar)
    print(isinstance(it,Iterator))
    for obj in it:
    print(obj.group())
    # compile  指定一个统一的匹配规则
    """
    正常情况下,正则表达式编译一次,执行一次
    为了避免反复编译,节省时间空间,可以使用compile统一规则
    编译一次,终身受益
    """
    strvar = "asdfs234sdf234"
    pattern = re.compile("\d+")
    print("<===>")
    obj = pattern.search(strvar)
    print(obj.group())
    lst = pattern.findall(strvar)
    print(lst)
    # 修饰符
    # re.I 使匹配对大小写不敏感
    strvar = "<h1>大标题</H1>"
    pattern = re.compile("<h1>(.*?)</h1>" , flags=re.I)
    obj = pattern.search(strvar)
    print(obj.group())
    # re.M 使每一行都能够单独匹配(多行匹配),影响 ^ 和 $
    """单行独立匹配,而不是整体匹配"""
    strvar = """
    <p>111</p>
    <a>222</a>
    <strong>333</strong>
    """
    pattern = re.compile("^<.*?>(?:.*?)<.*?>$" , flags=re.M)
    lst = pattern.findall(strvar)
    print(lst)
    # re.S 使 . 匹配包括换行在内的所有字符
    strvar = """
    give
    sdfsdfmefive
    """
    # 多个修饰符一起使用通过|拼接
    pattern = re.compile(".*?mefive" , flags = re.S|re.I|re.M )
    obj = pattern.search(strvar)
    print(obj.group())

    小提示:


    爬虫爬数据的时候用finditer,数据太大,用迭代器存
    strvar = """
    <p>111</p>
    <a>222</a>
    <strong>333</strong>
    """
    pattern = re.compile("^<.*?>(?:.*?)<.*?>$")
    lst = pattern.findall(strvar)
    print(lst) # 这里的结果为[] 因为.不匹配换行符,所以不会返回结果
    pattern = re.compile("^<.*?>(?:.*?)<.*?>$",flags=re.M) 这里就是
    一行的一行的匹配了
    不会用for i in找思路
    不会用.*?找思路

    总结

    本篇文章就到这里了,希望能够给你带来帮助,也希望您能够多多关注脚本之家的更多内容!

    来源:https://blog.csdn.net/weixin_46818279/article/details/121315758

    标签:Python,正则,函数
    0
    投稿

    猜你喜欢

  • 用CSS定义 li 样式

    2007-09-28 20:56:00
  • 用python爬虫爬取CSDN博主信息

    2023-06-13 08:11:10
  • 对Keras中predict()方法和predict_classes()方法的区别说明

    2022-11-05 09:13:32
  • 详解Python中的四种队列

    2021-05-10 01:48:04
  • W3C 发布 XMLHttpRequest 工作草图

    2008-04-28 13:00:00
  • mssql server 数据库附加不上解决办法分享

    2011-09-30 11:55:20
  • python 将对象设置为可迭代的两种实现方法

    2023-08-24 18:01:39
  • 如何使用Django默认的Auth权限管理系统

    2022-11-29 04:09:40
  • Python趣味挑战之教你用pygame画进度条

    2022-08-13 15:02:49
  • Python代码实现删除一个list里面重复元素的方法

    2022-06-02 15:31:02
  • 用python自动生成日历

    2022-08-28 14:28:58
  • js实现带积分弹球小游戏

    2024-04-10 16:19:15
  • python操作csv格式文件之csv.DictReader()方法

    2021-03-04 18:10:04
  • Python Django view 两种return的实现方式

    2022-05-03 16:07:04
  • css样式命名规则

    2008-04-30 12:31:00
  • python中数组和列表的简单实例

    2021-04-15 20:04:42
  • Python实现邮件的批量发送的示例代码

    2023-08-09 07:47:57
  • python playwrigh框架入门安装使用

    2023-05-07 23:18:51
  • 在自动化中用python实现键盘操作的方法详解

    2021-02-04 00:23:48
  • 页面无刷新调用数据(IFRAME+js)

    2009-06-01 11:29:00
  • asp之家 网络编程 m.aspxhome.com