pandas中使用excel的模糊匹配通配符,真香

liftword2周前 (06-18)技术文章3

前言

在 pandas 中,实现如下的模糊匹配统计,要怎么做?

简单:

因为在 pandas 中可以把筛选和统计两种逻辑分开编写,所以代码清晰好用。 问题在于pandas 中要实现模糊匹配,只能使用正则表达式或某种具体的函数。

在 excel 中有一类可以模糊匹配的统计函数,比如 sumifs countifs 等,它们可以使用通配符实现模糊匹配统计。之前的 excel 公式:

  • 问号 ? 表示1个任意的字符,星号 * 表示任意个数(0、1、或n)的字符
  • 对比来看,这可以直接在字符串中表达出 pandas 中的 startswith , endswith , contains

这种直接在字符串中表达模糊匹配规则,真香!难道在 pandas 中无法做到?


正则表达式的特殊字符

要在字符串中表达匹配规则,用正则表达式是最好的选择。其实思路挺简单,不就是直接把表达字符串中的符合替换成正则表达式相对于的符号吗?如下:

  • 行3:正则表达式中的点 . ,表示任意一个字符
  • 行4:在表达式前后添加开始 ^ 和结束 $ 标志

问题在于,用户输入的表达字符串里面可能包含了正则表达式的其他符号:

  • 这里我希望表达的是,搜索内容中有加号 + ,但因为 加号在正则表达式中有1或多个字符的意思 ,导致结果仍然匹配成功(内容中根本没有加号)

在 python 的正则表达式库中,为此有专门的函数,可以把所有在正则表达式中有特殊意义的符号,转义成匹配内容:

  • 处理后的结果中,加号 + 前面添加了反斜杠,正则表达式中反斜杠可以把特殊含义符号转义成普通内容

正确步骤

现在我们已经把整个问题拆分成2个小问题(并有解决方法):

  1. excel 的通配符在正则表达式中的对应表达
  2. 排除正常正则表达式中的特殊符号

只要设计好这两个步骤的执行顺序,应该就可以顺利解决问题。

定义函数:

  • 函数只做一件事情,把匹配字符串转成符合要求的表达式字符串
  • 行4: 首先用 re.escape 转成普通内容,然后针对星号和问号做替换

定义一个测试函数:

  • 行3: re.match 返回有结果,就是匹配到

写一些简单的测试:

没有报错,证明没问题。

应用到 pandas 的 series.str.match 函数即可:

不过,每次都这样子调用很啰嗦。可以封装到一个函数里面:

现在可以使用:

不要忘记一键三连。你的点赞、收藏、关注,是我创作的动力。

相关文章

如何使用正则表达式和 Python 匹配不以模式开头的字符串

需要在 Python 中使用正则表达式来匹配不以给定模式开头的字符串吗?如果是这样,你可以使用下面的语法来查找所有的字符串,除了那些不以https 开始的字符串。r"^(?!https).*&...

Python 中 字符串处理的高效方法,不允许你还不知道

以下是 Python 中 字符串处理的高效方法,涵盖常用操作、性能优化技巧和实际应用场景,帮助您写出更简洁、更快速的代码:一、基础高效操作1.字符串拼接:优先用join()代替+原因:join() 预...

浅学python | 使用正则表达式对象处理字符串

分享兴趣,传播快乐,增长见闻,留下美好!亲爱的您,这里是LearningYard学苑。欢迎大家继续访问学苑内容,今天小编为大家带来有关Python的知识。Share interest, spread...

Python爬虫中正则表达式的用法,只讲如何应用,不讲原理

Python爬虫:正则的用法(非原理)。大家好,这节课给大家讲正则的实际用法,不讲原理,通俗易懂的讲如何用正则抓取内容。·导入re库,这里是需要从html这段字符串中提取出中间的那几个文字。实例一个对...

Python中使用正则表达式

正则表达式(Regular Expression,简称Regex)是一种强大的文本处理工具,它使用一种特定的模式(Pattern)来描述要搜索的文本字符串的集合。Python通过内置的re模块提供了对...

Python学不会来打我(8)字符串string类型深度解析

2025年全球开发者调查显示,90%的Python项目涉及字符串处理,而高效使用字符串可提升代码效率40%。本文系统拆解字符串核心操作,涵盖文本处理、数据清洗、模板生成等八大场景,助你掌握字符串编程精...