Go 怎么逐行读取大 CSV 文件并记录错误行
来源:17golang原创
时间:2026-09-05 11:11:18 171浏览 收藏
Go 读取大 CSV 文件时,核心不是把文件拆成很多字符串,而是让 encoding/csv.Reader 按记录流式消费:每次调用 Read() 只拿当前记录,遇到坏数据就把行号和列号写入错误日志,然后决定跳过还是停止。这样既不会像 ReadAll() 一样把全部内容放进内存,也不会因为一条脏记录丢掉整批数据。
固定列的导入任务建议使用Read循环并保留默认的字段数检查;错误处理用errors.As取出*csv.ParseError,记录StartLine、Line和Column。只有明确接受不规范 CSV 时,才考虑LazyQuotes。
先把大文件变成一条条记录
csv.NewReader 接受任意 io.Reader,文件可以直接传入,也可以外面包一层缓冲读取器。真正的循环要单独处理 io.EOF,它代表没有下一条记录,不是失败。
package main
import (
"encoding/csv"
"errors"
"fmt"
"io"
"os"
)
func readCSV(path string) error {
f, err := os.Open(path)
if err != nil {
return err
}
defer f.Close()
r := csv.NewReader(f)
// 默认值 0:第一条记录决定后续期望的列数。
for {
record, err := r.Read()
if err == io.EOF {
return nil
}
if err != nil {
var pe *csv.ParseError
if errors.As(err, &pe) {
fmt.Printf("CSV 解析错误:开始行=%d,错误行=%d,列=%d,原因=%v\n",
pe.StartLine, pe.Line, pe.Column, pe.Err)
continue
}
return err
}
if err := consume(record); err != nil {
return err
}
}
}
func consume(record []string) error {
fmt.Println(record[0])
return nil
}
这个循环的内存特点是“当前记录大小”而不是“整个文件大小”。但 Read 返回的切片是否可复用,取决于 ReuseRecord 配置;默认情况下每次返回新的数据,若为了减少分配开启复用,就不能把 record 直接保存到循环外。

列数规则决定“错误行”的含义
FieldsPerRecord 有三种典型选择。保持默认的 0 时,第一条记录读完后会把列数固定下来,后续少列或多列都会返回 ErrFieldCount。设置为正数可以跳过表头后明确规定列数;设置为负数则完全不检查列数,适合字段确实不稳定的日志型 CSV,但业务字段校验要由自己的代码完成。
| 场景 | 建议 | 原因 |
|---|---|---|
| 有固定表头的导入 | 读表头后设为正数 | 列数错误尽早暴露 |
| 每行字段可变 | 设为 -1 | 让 Reader 只负责解析,不误判列数 |
| 不确定供应方格式 | 保留 0 并记录坏行 | 第一条记录作为基本契约 |
如果分隔符不是逗号,可以在第一次 Read 前设置 r.Comma = ';'。空白是否属于字段、注释行是否跳过,也分别受 CSV 的字段和 Comment 配置影响,不能用字符串切割简单替代。
用 ParseError 记录真实发生位置
错误处理最容易犯的错是手动维护一个“第几条记录”计数器,然后把它当成文件行号。CSV 的引号字段允许包含换行,因此一条记录可能跨越多行。ParseError.StartLine 是记录开始行,Line 是错误发生行,Column 是从 1 开始的字节列号;记录这些字段,排查时才能回到原始文件的正确位置。
func logParseError(err error) {
var pe *csv.ParseError
if !errors.As(err, &pe) {
fmt.Printf("CSV 非解析错误:%v\n", err)
return
}
switch {
case errors.Is(pe.Err, csv.ErrFieldCount):
fmt.Printf("列数不符:记录起始行=%d,检查行=%d\n", pe.StartLine, pe.Line)
default:
fmt.Printf("格式错误:行=%d,字节列=%d,原因=%v\n", pe.Line, pe.Column, pe.Err)
}
}
列数错误和引号错误的处理策略通常不同:前者可以把原始记录放入隔离文件,后者可能连完整记录都无法得到。不要把一个错误统一包装成“第 N 条失败”,否则多行字段会让错误定位产生偏差。

需要缓存记录时处理 ReuseRecord
对大文件来说,ReuseRecord 可以降低循环中创建切片的次数,但它改变了所有权语义:
r.ReuseRecord = true
for {
record, err := r.Read()
if err == io.EOF {
break
}
if err != nil {
// 这里按前面的 ParseError 规则处理
continue
}
// 要异步发送或放入队列,必须复制一份。
saved := append([]string(nil), record...)
enqueue(saved)
}
如果记录只在当前循环中同步消费,可以复用;如果会交给 goroutine、批量缓存或下一层异步处理,就复制字段切片。另一方面,InputOffset() 返回当前输入位置:它表示最近一次成功读取的记录末尾、下一条记录开头,可用于日志和恢复点,但不要把它误当成字符位置。
什么时候不要打开 LazyQuotes
LazyQuotes 会放宽未加引号字段中的引号规则,也允许带引号字段出现非成对引号。它适合“先尽可能读取,再由清洗规则修复”的场景,不适合财务、订单等必须保证字段边界的导入。严格导入应保留默认值,遇到解析错误就把原文件位置、供应方文件名和错误原因写入隔离日志;宽松导入也要单独标注,避免下游误以为数据已经通过格式校验。
最后检查三个边界:关闭文件的错误是否需要上报;consume 失败时是否应停止;以及错误行是否需要原文留存。这样,CSV 读取器只负责可靠解析,业务校验和重试策略留在更清晰的上层。
常见问题
大 CSV 能不能直接用 ReadAll? 小文件可以,几十万行以上通常应使用 Read 循环,避免把全部记录同时留在内存。
为什么错误行号和我计数的记录号不一致? 引号字段可以跨行,ParseError 报的是文件行位置;记录计数只能说明第几条逻辑记录。
列数不固定是不是必须开启 LazyQuotes? 不是。列数由 FieldsPerRecord 控制,错误引号由 LazyQuotes 控制,两者是不同问题。
-
860 收藏
-
843 收藏
-
826 收藏
-
809 收藏
-
792 收藏
-
254 收藏
-
423 收藏
-
339 收藏
-
142 收藏
-
462 收藏
-
189 收藏
-
409 收藏
-
151 收藏
-
314 收藏
-
445 收藏
-
311 收藏
-
314 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习