做数据清洗的朋友应该都遇到过这样的场景:拿到一份数据,跑起来全是NaN,顺手敲一行fillna(0)或者fillna("unknown"),以为万事大吉。结果呢?后面建模的时候,数值列莫名其妙变成了字符串,分类列里凭空多出来一个本该不存在的“0”类别,整个数据分析流程直接卡住。这事并不稀奇——fillna看似简单,但踩坑的人从来不少。
先提个醒:fillna的第一个教训,就是绝对不能一刀切。直接用fillna(0)去填所有列,数值列可能还没太大问题,一旦碰到时间列或分类列,那麻烦就大了。时间列填进去一个整数,Pandas会强制把它转成object,后续所有时间计算全废;分类列填0,可能被模型当成一个有效类别,但业务上这个0压根不存在。所以动手填充前,第一件事是搞清楚每列的dtype和业务含义。
数值列的处理相对简单:均值和中位数是首选。异常值偏多的时候,中位数更稳。写法上就是fillna(df["col"].mean())或者fillna(df["col"].median())。时间列得特殊照顾——不能用数字或字符串去填,必须用pd.NaT,或者一个合理的默认时间点,比如fillna(pd.Timestamp("1970-01-01"))。分类列的玩法不一样,填"Missing"比填None更可控,但关键是提前把列转成category类型,确保新值能被系统识别为合法类别,否则填进去也会被忽略。

fillna 填什么值?先看缺失类型再选策略
直接用 fillna(0) 或 fillna("unknown") 很危险——数值型列填字符串会强制转为 object 类型,后续计算全报错;分类列填 0 可能被误当有效类别。必须先确认 dtype 和业务含义。
- 数值列(
float64):优先考虑fillna(df["col"].mean())、fillna(df["col"].median()),异常值多时用中位数更稳 - 时间列(
datetime64):不能填数字或字符串,得用pd.NaT或合理默认时间,比如fillna(pd.Timestamp("1970-01-01")) - 分类列(
object或category):填"Missing"比None更可控,且要提前用df["col"] = df["col"].astype("category")确保新值能被识别为合法类别
按列差异调用 fillna:避免整表一刀切
用 df.fillna({"A": 0, "B": "N/A", "C": df["C"].mode()[0]}) 是最常用也最安全的方式。整表统一填一个值(如 df.fillna(0))会污染非数值列,且无法处理众数为空(所有值唯一)的情况。
mode()返回Series,必须取[0];若列全空,mode()返回空Series,直接取[0]报IndexError,得加判断:df["col"].mode().iloc[0] if not df["col"].mode().empty else "Unknown"- 对时间列单独处理:先用
pd.to_datetime(df["time"], errors="coerce")转成datetime64,再填pd.NaT或前向填充fillna(method="ffill") - 别在原地改:始终写
df_clean = df.fillna(...),而不是df.fillna(..., inplace=True),后者在链式操作中容易出不可复现的 bug
用 method 参数做时序/结构化填充:ffill 和 bfill 的边界问题
method="ffill" 不是万能的——它只沿指定轴向前传播最后一个有效值,遇到开头连续缺失就完全无效。实际中常需组合使用或加限制。
- 限制填充长度:
fillna(method="ffill", limit=3)防止一个有效值撑起后面几十行 - 按组填充更合理:比如用户行为日志,应先
groupby("user_id")再apply(lambda x: x.fillna(method="ffill")),否则用户 A 的数据会污染用户 B 的字段 bfill在末尾缺失多时有用,但和ffill一样不校验逻辑合理性——比如“注册时间”列用bfill填了未来日期,程序不会报错,但业务上绝对错误
fillna 后必须验证:dtype 和非空计数是否符合预期
填完不检查等于没填。尤其要注意 object 列混入 float 或 int 后,isna() 仍返回 True,但 sum() 会直接报错。
- 快速核对:
df_clean.dtypes看有没有意外变成object;df_clean.isna().sum()确认目标列确实为 0 - 数值列验证:填均值后用
df_clean["num_col"].describe()看min/max是否仍在合理区间,避免因原始数据有极端异常值导致均值失真 - 写进清洗函数里:每次
fillna后加一句assert df_clean[col].notna().all(), f"{col} still has NaN after fill",CI 流程里就能立刻暴露问题
最后说一个容易被忽视的点:fillna不是万能的,它不会改变缺失模式带来的分布偏移。比如用中位数去填充大量缺失的收入字段,建模时模型会误以为中位数就是真实的高频值,结果自然不准。真正严谨的清洗,往往需要配合插值、建模预测填充,或者明确标记“已填充”的列供下游感知。数据清洗不是填个值就完事,后续的验证和审计同样不可少。