分享几个令人相见恨晚的Pandas函数

liftword17小时前技术文章1

作者:俊欣

来源:关于数据分析与可视化

又是新的一周,今天小编给大家来分享几个好用到爆的Pandas函数,或许不那么为人所知,但是相信会给大家在数据分析与挖掘的过程中起到不小的帮助。

创建数据集

首先我们先来创建一个数据集,代码如下

import numpy as np
import pandas as pd
df = pd.DataFrame({
   "date": pd.date_range(start="2021-11-20", periods=100, freq="D"),
   "class": ["A","B","C","D"] * 25,
   "amount": np.random.randint(10, 100, size=100)
})
df.head()

output

To_period

当我们在处理日期数据时,有时候需要提取出月份的数据,有时候我们需要的是季度的数据,这里就可以通过to_period()方法来实现了,代码如下

df["year"] = df["date"].dt.to_period("Y")
df["month"] = df["date"].dt.to_period("M")
df["day"] = df["date"].dt.to_period("D")
df["quarter"] = df["date"].dt.to_period("Q")
df.head()

output

在此基础之上,我们可以进一步对数据进行分析,例如

df["month"].value_counts()

output

我们想要筛选出“2021-12”该时段的数据,代码如下

df[df['month'] == "2021-12"].head()

output

生成假数据

我们在建模、训练模型的时候,需要用到大量的数据集,然鹅很多时候我们会遇到数据量不够的情况,小编之前写过一篇相关的教程,使用Python中的faker模块或者通过一些深度学习的模型来生成假数据

【原创好文】当机器学习遇到数据量不够时,这几个Python技巧为你化解难题

pandas模块中也有一些相关的方法来帮助我们解决数据量不够的问题,代码如下

pd.util.testing.makeDataFrame()

output

默认生成的假数据是30行4列的,当然我们也可以指定生成数据的行数和列数,代码如下

pd.util.testing.makeCustomDataframe(nrows=1000, ncols=5)

output

要是我们希望创建的数据集当中存在的缺失值,调用的则是makeMissingDataframe()方法

pd.util.testing.makeMissingDataframe()

output

要是我们希望创建的数据集包含了整型、浮点型以及时间日期等其他类型的数据,调用的是makeMixedDataFrame()方法

pd.util.testing.makeMixedDataFrame()

output

将数据集导出至压缩包中

众多周知,我们可以轻松地将数据集导出至csv文件、json格式的文件等等,但是有时候我们想要节省存储的资源,例如在文件的传送过程当中,想将其导出至压缩包当中,代码如下

df = pd.util.testing.makeCustomDataframe(nrows=1000, ncols=5)
df.shape

output

(1000, 5)

我们先将其存储成csv格式的文件,看一下文件的大小,结果大概是占到了45KB的存储,代码如下

import os
os.path.getsize("sample.csv")/1024

output

44

要是最后导出至压缩包当中呢,我们看一下文件的大小有多少?代码如下

df.to_csv('sample.csv.gz', compression='gzip')
os.path.getsize('sample.csv.gz')/1024

output

14

结果只占到了13KB的空间大小,大概是前者的三分之一吧,当然pandas还能够直接读取压缩包变成DataFrame数据集,代码如下

df = pd.read_csv('sample.csv.gz', compression='gzip', index_col=0)
df.head()

output

一行代码让Pandas提速

很多时候我们想要通过pandas中的apply()方法将自定义函数或者是一些内部自带的函数应用到DataFrame每一行的数据当中,如果行数非常多的话,处理起来会非常地耗时间,这里使用的是swifter可以自动使apply()方法的运行速度达到最快,并且只需要一行代码即可,例如

import swifter
 
df.swifter.apply(lambda x: x.max() - x.mean())

当然使用前,我们需要先前下载该模块,使用pip命令

pip install swifter

相关文章

使用python把csv汇总成excel(python怎么将csv文件中的列存入列表)

最近领导安排让我每周定时把grafana导出的csv文件进行统计汇总工作,需要处理的csv文件还是蛮多的,况且还要每周重复汇总处理。干脆写个脚本,每周执行一遍脚本,既方便还不会出错。一、需求分析1....

python爬虫25 | 爬取的数据怎么保存?CSV了解一下

大家好我是小帅b是一个练习时长两年半的练习生喜欢唱!跳!rap!篮球!敲代码!装逼!不好意思我又走错片场了接下来的几篇文章小帅b将告诉你如何将你爬取到的数据保存下来有文本文件、redis、数据库(My...

将MySQL查询结果输出为CSV格式的方法

技术背景在数据库管理和数据分析中,我们常常需要将MySQL查询结果以CSV格式输出,方便在其他工具(如Excel、Python数据分析库)中进行进一步处理。然而,由于CSV格式有其特定的规范,如字段分...

Django 如何使用视图动态输出 CSV 以及 PDF

Django 如何使用视图动态输出 CSV 以及 PDF这一篇我们需要用到 python 的 csv 和 reportLab 库,通过django视图来定义输出我们需要的 csv 或者 pdf 文件。...

Python版的迷你程序——json文件转换为csv

浅话C语言是过去几十年软件和硬件两个阵营之间,签署的最坚实的契约。硬件为C语言的语义提供了最能发挥其性能的基础构件,而软件虽然搞了很多的圆环套圆环般的层次,但最终都以C语言作为最后的沉淀收尾。----...

Python CSV文件的读写和处理(csv python 读取)

一、介绍CSV文件的概念和结构CSV(Comma-Separated Values,逗号分隔值)是一种常见的文本文件格式,用于存储表格数据。CSV 文件以纯文本形式存储数据,使用逗号作为字段之间的分隔...