登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go 怎么逐行读取大 CSV 文件并记录错误行

来源:17golang原创

时间:2026-09-05 11:11:18 171浏览 收藏

Go 读取大 CSV 文件时,核心不是把文件拆成很多字符串,而是让 encoding/csv.Reader 按记录流式消费:每次调用 Read() 只拿当前记录,遇到坏数据就把行号和列号写入错误日志,然后决定跳过还是停止。这样既不会像 ReadAll() 一样把全部内容放进内存,也不会因为一条脏记录丢掉整批数据。

固定列的导入任务建议使用 Read 循环并保留默认的字段数检查;错误处理用 errors.As 取出 *csv.ParseError,记录 StartLineLineColumn。只有明确接受不规范 CSV 时,才考虑 LazyQuotes

先把大文件变成一条条记录

csv.NewReader 接受任意 io.Reader,文件可以直接传入,也可以外面包一层缓冲读取器。真正的循环要单独处理 io.EOF,它代表没有下一条记录,不是失败。

package main

import (
    "encoding/csv"
    "errors"
    "fmt"
    "io"
    "os"
)

func readCSV(path string) error {
    f, err := os.Open(path)
    if err != nil {
        return err
    }
    defer f.Close()

    r := csv.NewReader(f)
    // 默认值 0:第一条记录决定后续期望的列数。
    for {
        record, err := r.Read()
        if err == io.EOF {
            return nil
        }
        if err != nil {
            var pe *csv.ParseError
            if errors.As(err, &pe) {
                fmt.Printf("CSV 解析错误:开始行=%d,错误行=%d,列=%d,原因=%v\n",
                    pe.StartLine, pe.Line, pe.Column, pe.Err)
                continue
            }
            return err
        }

        if err := consume(record); err != nil {
            return err
        }
    }
}

func consume(record []string) error {
    fmt.Println(record[0])
    return nil
}

这个循环的内存特点是“当前记录大小”而不是“整个文件大小”。但 Read 返回的切片是否可复用,取决于 ReuseRecord 配置;默认情况下每次返回新的数据,若为了减少分配开启复用,就不能把 record 直接保存到循环外。

Go encoding/csv 读取器、文件流、记录和消费函数的静态关系框图
图 1:外层文件流进入 csv.Reader,再形成当前记录并交给消费函数;这里看的是组件关系,不是运行截图。

列数规则决定“错误行”的含义

FieldsPerRecord 有三种典型选择。保持默认的 0 时,第一条记录读完后会把列数固定下来,后续少列或多列都会返回 ErrFieldCount。设置为正数可以跳过表头后明确规定列数;设置为负数则完全不检查列数,适合字段确实不稳定的日志型 CSV,但业务字段校验要由自己的代码完成。

场景建议原因
有固定表头的导入读表头后设为正数列数错误尽早暴露
每行字段可变设为 -1让 Reader 只负责解析,不误判列数
不确定供应方格式保留 0 并记录坏行第一条记录作为基本契约

如果分隔符不是逗号,可以在第一次 Read 前设置 r.Comma = ';'。空白是否属于字段、注释行是否跳过,也分别受 CSV 的字段和 Comment 配置影响,不能用字符串切割简单替代。

用 ParseError 记录真实发生位置

错误处理最容易犯的错是手动维护一个“第几条记录”计数器,然后把它当成文件行号。CSV 的引号字段允许包含换行,因此一条记录可能跨越多行。ParseError.StartLine 是记录开始行,Line 是错误发生行,Column 是从 1 开始的字节列号;记录这些字段,排查时才能回到原始文件的正确位置。

func logParseError(err error) {
    var pe *csv.ParseError
    if !errors.As(err, &pe) {
        fmt.Printf("CSV 非解析错误:%v\n", err)
        return
    }
    switch {
    case errors.Is(pe.Err, csv.ErrFieldCount):
        fmt.Printf("列数不符:记录起始行=%d,检查行=%d\n", pe.StartLine, pe.Line)
    default:
        fmt.Printf("格式错误:行=%d,字节列=%d,原因=%v\n", pe.Line, pe.Column, pe.Err)
    }
}

列数错误和引号错误的处理策略通常不同:前者可以把原始记录放入隔离文件,后者可能连完整记录都无法得到。不要把一个错误统一包装成“第 N 条失败”,否则多行字段会让错误定位产生偏差。

CSV 记录边界、ParseError 行列信息和错误隔离记录的静态关系框图
图 2:正常记录与错误记录共享同一个 Reader,但错误分支保留 StartLine、Line、Column 和错误原因,便于隔离处理。

需要缓存记录时处理 ReuseRecord

对大文件来说,ReuseRecord 可以降低循环中创建切片的次数,但它改变了所有权语义:

r.ReuseRecord = true
for {
    record, err := r.Read()
    if err == io.EOF {
        break
    }
    if err != nil {
        // 这里按前面的 ParseError 规则处理
        continue
    }

    // 要异步发送或放入队列,必须复制一份。
    saved := append([]string(nil), record...)
    enqueue(saved)
}

如果记录只在当前循环中同步消费,可以复用;如果会交给 goroutine、批量缓存或下一层异步处理,就复制字段切片。另一方面,InputOffset() 返回当前输入位置:它表示最近一次成功读取的记录末尾、下一条记录开头,可用于日志和恢复点,但不要把它误当成字符位置。

什么时候不要打开 LazyQuotes

LazyQuotes 会放宽未加引号字段中的引号规则,也允许带引号字段出现非成对引号。它适合“先尽可能读取,再由清洗规则修复”的场景,不适合财务、订单等必须保证字段边界的导入。严格导入应保留默认值,遇到解析错误就把原文件位置、供应方文件名和错误原因写入隔离日志;宽松导入也要单独标注,避免下游误以为数据已经通过格式校验。

最后检查三个边界:关闭文件的错误是否需要上报;consume 失败时是否应停止;以及错误行是否需要原文留存。这样,CSV 读取器只负责可靠解析,业务校验和重试策略留在更清晰的上层。

常见问题

大 CSV 能不能直接用 ReadAll? 小文件可以,几十万行以上通常应使用 Read 循环,避免把全部记录同时留在内存。

为什么错误行号和我计数的记录号不一致? 引号字段可以跨行,ParseError 报的是文件行位置;记录计数只能说明第几条逻辑记录。

列数不固定是不是必须开启 LazyQuotes? 不是。列数由 FieldsPerRecord 控制,错误引号由 LazyQuotes 控制,两者是不同问题。

参考:Go encoding/csv 标准库文档

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>