本节我们将简要介绍使用pandas预处理原始数据,并将原始数据转换为张量格式的步骤。

首先,创建一个数据集。

其中,import os 导入了 Python 的操作系统接口模块,用于处理文件和目录操作。

os.path.join('..', 'data') 拼接路径,生成 "../data",data文件生成在当前目录的上一级目录下,如图所示。写入的内容是一个包含三列信息的 CSV 格式数据,同时包含一些缺省值(NA)。

接下来,对生成的文件进行读取。

接下来,处理缺失值,注意的是Alley的值是非数值,所以不会有计算mean方法。

结果是:

对于Alley列,使用pd.get_dummies() 是 pandas 中用于将类别型变量转换为哑变量的函数,也称为独热编码(One-Hot Encoding。dummy_na=True 表示将缺失值(NaN)也作为一个独立的类别进行编码。原有的 "Alley" 列被转换为两个新列:"Alley_Pave" 和 "Alley_nan"。这种编码方式可以将类别型数据转换为机器学习算法能够处理的数值型数据,同时保留了缺失值的信息。

独热编码后结果为:

接下来,将数据转化为张量形式。默认类型为float。这里要先将pandas的dataframe类型转为numpy类型,然后再转化为tensor类型。

总结:pandas软件包是Python中常用的数据分析工具中,pandas可以与张量兼容。

用pandas处理缺失的数据时,我们可根据情况选择用插值法和删除法。

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐