做数据清洗的朋友应该都遇到过这样的场景:拿到一份数据,跑起来全是NaN,顺手敲一行fillna(0)或者fillna("unknown"),以为万事大吉。结果呢?后面建模的时候,数值列莫名其妙变成了字符串,分类列里凭空多出来一个本该不存在的“0”类别,整个数据分析流程直接卡住。这事并不稀奇——fillna看似简单,但踩坑的人从来不少。

先提个醒:fillna的第一个教训,就是绝对不能一刀切。直接用fillna(0)去填所有列,数值列可能还没太大问题,一旦碰到时间列或分类列,那麻烦就大了。时间列填进去一个整数,Pandas会强制把它转成object,后续所有时间计算全废;分类列填0,可能被模型当成一个有效类别,但业务上这个0压根不存在。所以动手填充前,第一件事是搞清楚每列的dtype和业务含义。

数值列的处理相对简单:均值和中位数是首选。异常值偏多的时候,中位数更稳。写法上就是fillna(df["col"].mean())或者fillna(df["col"].median())。时间列得特殊照顾——不能用数字或字符串去填,必须用pd.NaT,或者一个合理的默认时间点,比如fillna(pd.Timestamp("1970-01-01"))。分类列的玩法不一样,填"Missing"比填None更可控,但关键是提前把列转成category类型,确保新值能被系统识别为合法类别,否则填进去也会被忽略。

如何使用Python实现数据清洗中的缺失值填充_基于Pandas的fillna策略

fillna 填什么值?先看缺失类型再选策略

直接用 fillna(0)fillna("unknown") 很危险——数值型列填字符串会强制转为 object 类型,后续计算全报错;分类列填 0 可能被误当有效类别。必须先确认 dtype 和业务含义。

按列差异调用 fillna:避免整表一刀切

df.fillna({"A": 0, "B": "N/A", "C": df["C"].mode()[0]}) 是最常用也最安全的方式。整表统一填一个值(如 df.fillna(0))会污染非数值列,且无法处理众数为空(所有值唯一)的情况。

用 method 参数做时序/结构化填充:ffill 和 bfill 的边界问题

method="ffill" 不是万能的——它只沿指定轴向前传播最后一个有效值,遇到开头连续缺失就完全无效。实际中常需组合使用或加限制。

fillna 后必须验证:dtype 和非空计数是否符合预期

填完不检查等于没填。尤其要注意 object 列混入 floatint 后,isna() 仍返回 True,但 sum() 会直接报错。

最后说一个容易被忽视的点:fillna不是万能的,它不会改变缺失模式带来的分布偏移。比如用中位数去填充大量缺失的收入字段,建模时模型会误以为中位数就是真实的高频值,结果自然不准。真正严谨的清洗,往往需要配合插值、建模预测填充,或者明确标记“已填充”的列供下游感知。数据清洗不是填个值就完事,后续的验证和审计同样不可少。

本文转载于:https://www.php.cn/faq/2462482.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。