登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  python教程

Python csv.DictReader 遇到重复列名时怎么保存数据

来源:17golang原创

时间:2026-09-08 19:59:52 371浏览 收藏

CSV 导入最容易被忽略的一类脏数据,就是首行出现两个同名列。例如表头是 name,score,score,但业务上两个分数分别代表平时成绩和考试成绩。直接使用 csv.DictReader 时,两个值不会自动变成列表,后一个 score 会覆盖前一个。要保存完整数据,先判断业务语义:需要保留列的原始位置,就用 csv.reader 按下标收集;只需要继续以字典取值,就先把表头改成唯一名称。

要点速览
  • DictReader 的键来自 fieldnames,普通字典不能同时保存两个同名键。
  • 审计、对账等场景应保留同名列的值列表;固定业务字段则适合生成稳定后缀。
  • restkeyrestval 只能处理列数不齐,不能解决重复表头本身。

先看默认行为:重复键会被后面的值覆盖

处理带有重复列名的CSV文件时,Python标准库自带的csv.DictReader默认只会保留重复列最后一个字段的值,前面同名列的内容会被直接覆盖掉,想要完整留存所有同名列的数据,可以通过修改fieldnames的生成逻辑,自动给重复的列名加有序后缀做区分,也可以重写DictReader的字段映射规则,把同名列对应的多个值直接存入列表结构里。
处理重复列名的CSV无需引入第三方依赖,只用标准库的原生能力就能覆盖绝大多数场景,改完的逻辑可以兼容正常无重复列的普通CSV文件,不会产生额外的适配成本。

DictReader 没有提供“重复表头自动聚合”开关。未传入 fieldnames 时,它把第一行作为字段名;每条数据按字段名和值配对后形成一个 dict。因此相同的 score 只能留下一个键,读取结果看起来正常,却已经少了一列。

import csv
from io import StringIO

csv_text = "name,score,score\nAlice,80,92\n"
reader = csv.DictReader(StringIO(csv_text))

# 先查看表头,再观察同名键的覆盖结果
print(reader.fieldnames)
print(next(reader))

这个例子中,fieldnames 仍会显示两个 score,但记录是字典,最终只能通过一个 score 访问。问题不在 CSV 解析器把列读少了,而在列名被用作字典键后发生了覆盖。

用 csv.reader 保留重复列名的每个值

如果两个同名列都重要,建议先用 csv.reader 读取原始列序,再建立“表头到下标列表”的映射。这样既保留列的顺序,也能把 score 变成 ["80", "92"]。对于对账、追溯和数据清洗,这种结构比擅自命名更稳妥。

Python csv.reader 将重复表头映射到多个列下标并保留全部行值的静态关系图
图1:从原始 CSV 表头、列下标到重复字段值列表的关系,重点看同名 score 如何保留两个位置。
import csv
from io import StringIO

csv_text = "name,score,score\nAlice,80,92\n"
rows = csv.reader(StringIO(csv_text))
headers = next(rows)

# 为每个表头记录所有出现位置,不让重复键互相覆盖
positions = {}
for index, header in enumerate(headers):
    positions.setdefault(header, []).append(index)

for values in rows:
    record = {
        header: [values[i] if i 

输出里的 score 是值列表。若业务还需要区分“第一个 score”和“第二个 score”,可以继续使用下标,或把映射保存为元数据,不要在导入阶段凭猜测改写含义。

预处理表头再交给 DictReader

如果下游代码习惯写 row["score_2"],可以在创建 DictReader 前规范化表头。传入自定义 fieldnames 后,原始表头行会被当作普通数据行,所以要先用 csv.reader 消费它,再交给 DictReader

Python CSV 表头规范化后由唯一字段名交给 csv.DictReader 的静态关系图
图2:表头规范化、唯一 fieldnames、DictReader 与业务记录之间的静态关系,适合需要稳定字典键的导入代码。
import csv
from io import StringIO

def unique_headers(headers):
    seen = {}
    result = []
    for raw in headers:
        name = raw.strip() or "unnamed"
        seen[name] = seen.get(name, 0) + 1
        # 第一次保留原名,后续出现使用可预测的序号后缀
        result.append(name if seen[name] == 1 else f"{name}_{seen[name]}")
    return result

csv_text = "name,score,score\nAlice,80,92\n"
stream = StringIO(csv_text)
raw_headers = next(csv.reader(stream))
fieldnames = unique_headers(raw_headers)
reader = csv.DictReader(stream, fieldnames=fieldnames,
                        restkey="_extra", restval="")

for row in reader:
    print(row["score"], row["score_2"])

这个方案的关键不是简单加后缀,而是保证规则稳定:同一份数据每次都得到相同字段名,并把空表头变成可识别的 unnamed。如果字段名来自外部文件,后续还应把最终 fieldnames 记录到导入日志。

列数不齐时,再用 restkey 和 restval 做边界处理

重复表头与列数不齐是两种问题。DictReaderrestkey 会接住一行里多出来的值,restval 会填补字段名多于数据值的缺口。它们不能让两个同名键共存,因此不能替代表头规范化或按下标保存。

输入情况建议检查保存策略
同名列都有业务含义记录每个列下标csv.reader + 值列表
下游依赖字典键规范化后表头是否稳定fieldnames + 唯一后缀
多余或缺失列_extra 与缺省值记录异常并决定拒绝或修复

生产导入前可以先检查空表头、重复字段和每行列数;发现不符合契约时,把文件标为待处理比静默吞掉数据更安全。打开文件时记得使用 newline="",必要时显式指定 encoding,避免换行和编码问题掩盖真正的列结构问题。

常见问题

重复列名能不能直接让 DictReader 返回列表?

不能直接配置。要返回列表,先用 csv.reader 按列位置聚合,或者自行生成唯一的 fieldnames 后再读取。

只修改 fieldnames 就够了吗?

不够。传入 fieldnames 时首行不会自动丢弃,会作为第一条数据返回,所以必须先消费原始表头。

后缀应该用数字还是原始业务名?

没有统一答案。若文件来源稳定,可以映射为 score_writtenscore_exam;无法判断语义时使用 score_2 并保留原始表头,避免编造业务含义。

选择原则可以压缩成一句话:要数据完整性就保留列位置,要兼容字典代码就先生成唯一键;无论哪种方式,都要把重复表头当成输入契约的一部分显式处理。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>