登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  python教程

Python csv.DictReader处理缺失列与额外列的办法

来源:17golang原创

时间:2026-09-20 15:58:01 105浏览 收藏

CSV 导入最容易被忽略的不是分隔符,而是每一行的列数不一致。Python 的 csv.DictReader 可以把额外字段收集到 restkey 对应的列表,也可以用 restval 为缺失字段填充占位值。实用做法是:先给这两个参数明确命名,再在进入业务模型前分别检查“缺列”和“多列”,不要把默认的 None 当成完整的校验策略。

要点速览
  • restkey 处理字段名之外的额外值,值本身仍是列表。
  • restval 只填充缺失列;空字符串是存在但为空,不能混为一谈。
  • 导入层先保留异常信息,再决定跳过、补值、告警或拒绝整行。

先把缺失列和额外列分成两种异常

假设表头是 name,email,department。某行只有两个值时,department 会得到 restval;某行有四个值时,多出来的值会放在 restkey 指定的键下。两类异常的业务含义不同:缺失列通常需要补值或阻断必填校验,额外列则可能意味着上游新增字段、分隔符错误,或者数据行被错误拼接。

用Python标准库自带的csv模块就能处理缺失列和额外列的场景,不需要额外安装第三方依赖,只要配置好DictReader的restkey、restval两个参数,再搭配行级过滤逻辑,就能覆盖绝大多数不规则CSV的读取需求。
Python csv.DictReader 将表头字段、缺失值和额外值分流到字典的结构说明图
图1:Python csv.DictReader 的字段对齐与异常列分流说明图,不是运行截图。
很多人刚接触csv.DictReader的时候,碰到CSV文件某行比表头少几个字段、或者某行多出来多余字段的情况,直接跑代码就会丢数据、或者报意料之外的错误,下面先给大家一段可以直接复制跑通的最小可用写法,普通场景直接套就能用。

最小配方:给 restkey 和 restval 可识别的语义

下面的写法保留每行的原始结构信息。restval 使用独立对象作为内部标记,避免和合法字符串混淆;输出前再把它转换成业务需要的缺省值。

import csv

MISSING = object()

with open("contacts.csv", newline="", encoding="utf-8-sig") as file:
    # 用明确的键名保存多出来的字段,避免默认的 None 键难以排查。
    reader = csv.DictReader(
        file,
        restkey="__extra__",
        restval=MISSING,
    )

    for line_no, row in enumerate(reader, start=2):
        # 额外列保留为列表,先记录再决定是否拒绝这一行。
        extra = row.pop("__extra__", [])
        missing = [
            name for name in reader.fieldnames or []
            if row.get(name) is MISSING
        ]

        if missing or extra:
            # 结构异常不应静默进入后续的类型转换和入库逻辑。
            print({"line": line_no, "missing": missing, "extra": extra})
            continue

        # 空字符串表示字段存在但没有内容,按业务规则单独处理。
        if not row["email"].strip():
            print({"line": line_no, "error": "email is empty"})
            continue

        print(row)
接下来看两个核心参数的边界规则,搞懂之后就能精准控制不同异常场景的输出结果。

这里用 pop 取出额外值,是因为后续模型只接受白名单字段。行号从 2 开始只是针对“第一行是表头”的常见文件;如果通过 fieldnames 显式传入字段名,第一行也会作为数据行读取,行号应相应调整。

把参数放进导入边界,而不是业务模型

DictReader 负责对齐字段,业务代码负责判断是否可接受。建议在导入边界留下三类结果:规范行、可修复行、不可接受行。可修复行可以把缺失的非必填字段转换为空值或默认值;不可接受行则保存行号、缺失字段和额外值,交给错误文件或告警流程。

输入情况DictReader 结果建议处理
字段数相同普通键值对继续做类型与必填校验
字段不足缺失键值为 restval区分缺失与空字符串
字段过多restkey 对应列表记录原值,不直接静默丢弃
Python CSV 导入边界将结构异常、必填校验和业务模型分层的说明图
图2:从 DictReader 到业务模型的字段白名单与校验边界说明图,不是运行截图。
实际写生产代码的时候还要注意几个常见的兼容坑,不然线上碰到特殊格式的CSV很容易出bug:

常见坑:默认值、空值与表头方式

第一,restval=None 只说明列不存在,不代表原文件明确写了空值。第二,restkey=None 会让额外字段落到一个不直观的键上,日志和序列化都不容易读。第三,文件打开时应使用 newline="",并根据来源选择编码;Excel 导出的 UTF-8 文件常见 utf-8-sig

如果表头不可信,可以显式传入 fieldnames,这时第一行不会被当成表头而会进入数据;如果表头就是协议的一部分,则让 DictReader 自动读取首行更自然。两种方式不要混用,否则容易把表头当成一条业务记录。

把上面的参数配置、异常校验、兼容逻辑整合到一起,就能得到一个健壮的不规则CSV读取逻辑,完整覆盖表头和行字段数不匹配的所有常见情况:

相关问题

额外列可以直接忽略吗?

只有在协议明确允许扩展字段时才建议忽略;更稳妥的是先记录额外值,确认来源升级后再调整白名单。

如何判断字段缺失还是字段为空?

用独立的 restval 标记判断列是否存在,再对实际字符串做 strip(),不要只写 if not row[name]

为什么要给 CSV 文件设置 newline?

官方文档建议读写 CSV 时使用 newline="",这样由 CSV 模块处理换行,避免带引号的多行字段被错误拆分。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>