首页 > temp > python入门教程 >
-
pandas里的缺失值(理解与相关方法)
由于数据库或数据集中存在大量缺失数据和空值,这时在pandas中经常用NAN代替。
pandas用标签方法表示缺失值:
一:浮点数据类型的NaN值
二:python的None对象
其中,None是一个python对象,所以不能作为任何Numpy/pandas数组类型的缺失值,只能用于'object'数组类型(即由python对象构成的数组)
1 in:np.array([1,None,3,4]) 2 out:array([1,None,3,4],dtype=object)
而NaN属于数值类型的缺失值,是一种按照IEEE浮点数标准设计,在任何系统中都兼容的特殊浮点数。
1 in:vals1=np.array([1,np.nan,3,4]) 2 vals1.dtype 3 out:dtype('float64')
并且在数组运算中,NaN可看作是一个数据类病毒,可以把与它接触过的数据同化,例如:
1+np.nan与1*np.nan结果均为nan,这是需要注意的。
但在实际运算中,NaN这一特性并不能让我们得到满意的结果,如下实例可看:
1 in:vals2=np.array([1,np.nan,3,4]) 2 vals2.sum(),vals2.min(),vals2.max() 3 out:(nan,nan,nan)
特殊的累计函数,可以忽略缺失值的影响
1 in:vals3=np.array([1,np.nan,3,4]) 2 np.nansum(vals3),np.nanmin(vals3),np.nanmax(vals3) 3 out:(8.0,1.0,4.0)
注意:这里结果是浮点类型 dtype='float64'
NaN与None:
在pandas中它们两个是可以等价交换的
pd.Series([1,np.nan,2,None])
out:
0 1.0
1 NaN
2 2.0
3 NaN
dtype:float64
注意:其中np.nan是强制转换成浮点数缺失值NaN,pandas会将没有标签值的数据类型自动转换为NA
转换规则如下:
类型 | 缺失值转换规则 | NA标签值 |
floating浮点型 | 无变化 | np.nan |
object对象类型 | 无变化 | np.nan或None |
integer整数类型 | 强制转换成float64 | np.nan |
Boolean布尔类型 | 强制转换成object | np.nan或None |
关于pandas发现、剔除、替换数据结构中的缺失值
isnull(),notnull()#返回布尔类型,创建一个布尔类型的数组,isnull():若是缺失值,则返回true,否则false,而在notnull中则相反
dropna():不传参数时,默认删除所有含缺失值的行,若传入axis=1或axis='columns',则它会删除所有包含缺失值的列
以上会把一些非缺失值一并剔除,为避免这个情况发生,可通过设置how和thresh参数满足
例如:
df.dropna(axis=1,how='all')则是删除全部为缺失值的列
df.dropna(axis='rows',thresh=2)则删除的行中非缺失值至少为2个,thresh用于设置行或列中非缺失值的最小数量
fillna()用于填充缺失值,将其换成有效数值
(可返回填充了缺失值的数组副本)
在Series中
df.fillna(0) 用0来替换缺失值
1 in:df=pd.Series([1,2,np.nan,4,5]) 2 df.fillna(0) 3 out: 4 0 1.0 5 1 2.0 6 2 0.0 7 3 4.0 8 4 5.0 9 dtype:float64
df.fillna(method='ffill') 从前往后填充
1 in:df=pd.Series([1,2,np.nan,4,5]) 2 df.fillna(method='ffill') 3 out: 4 0 1.0 5 1 2.0 6 2 2.0 7 3 4.0 8 4 5.0 9 dtype:float64
df.fillna(method='bfill') 从后往前填充
1 in:df=pd.Series([1,2,np.nan,4,5]) 2 df.fillna(method='bfill') 3 out: 4 0 1.0 5 1 2.0 6 2 4.0 7 3 4.0 8 4 5.0 9 dtype:float64
在DataFrame中
df.fillna(method='ffill',axis=1)与series用法类似,但需表明行或列
1 in:df=pd.DataFrame([[1,2,np.nan],[3,6,7],[4,np.nan,np.nan]],columns=['a','b','c']) 2 df.fillna(method='ffill',axis=0) 3 out: 4 a b c 5 0 1.0 2.0 2.0 6 1 3.0 6.0 7.0 7 2 4.0 4.0 4.0 8 dtype:float64
出处:https://www.cnblogs.com/TiAmo-bai/p/16817272.html