登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go 读取 CSV 时怎么保留字段中的换行和逗号

来源:17golang原创

时间:2026-09-07 00:23:37 157浏览 收藏

如果 CSV 的备注列里出现了逗号或换行,strings.Split 会很快把一条记录拆错。Go 的正确做法是交给 encoding/csv.Reader 读取:被双引号包住的字段可以包含逗号和换行,返回的字符串会保留这些内容。关键是不要先按物理行切割,也不要为了“读出来”随意打开 LazyQuotes

要点速览
  • 带逗号或换行的字段必须在 CSV 中使用双引号包裹,csv.Reader 会按逻辑记录解析。
  • 字段数量固定时保留默认检查;列数可变时显式设置 FieldsPerRecord = -1,再由业务层校验。
  • 遇到坏数据先看 *csv.ParseError 的行号和错误类型,只有明确兼容目标时才考虑 LazyQuotes

不要先按行切开 CSV

下面这条记录只有两列,但第二列的内容本身含有逗号和换行:

id,note
42,"仓库 A, 夜班
需要复核入库单"

这里的换行属于 note 字段,不是下一条记录的开始。按行读取再调用 strings.Split(line, ","),会同时遇到两个问题:第二行被拆成半条记录,逗号又把一列误判成两列。CSV 的“行”必须交给能识别引号状态的解析器判断。

用 encoding/csv 保留逗号和换行

encoding/csv 的 Reader 会把双引号字段中的逗号和换行还原到同一个字符串中,外层循环只接收完整的逻辑记录:

package main

import (
	"encoding/csv"
	"errors"
	"fmt"
	"io"
	"strings"
)

func main() {
	input := "id,note\n42,\"仓库 A, 夜班\n需要复核入库单\"\n"
	r := csv.NewReader(strings.NewReader(input))
	// 允许示例中的列数由业务层检查,不让 Reader 用首行锁死列数。
	r.FieldsPerRecord = -1

	for {
		// Read 按 CSV 逻辑记录返回,而不是按物理换行返回。
		record, err := r.Read()
		if errors.Is(err, io.EOF) {
			break
		}
		if err != nil {
			var parseErr *csv.ParseError
			// ParseError 包含行号和具体原因,适合记录到导入错误表。
			if errors.As(err, &parseErr) {
				fmt.Printf("第 %d 行解析失败:%v\n", parseErr.Line, parseErr.Err)
				return
			}
			return fmt.Println("读取 CSV 失败:", err)
		}

		// 这一层拿到的 note 仍包含逗号和换行,再交给业务校验。
		fmt.Printf("字段数=%d,记录=%q\n", len(record), record)
	}
}

这段代码中,record[1] 会是包含逗号和换行的完整备注。实际文件读取时,把 strings.NewReader 换成 os.Open 返回的文件即可;不要在进入 Reader 之前把文件内容切成行。

Go encoding/csv Reader、带引号字段与逻辑记录边界的静态关系图
图1:查看 Reader、引号字段和逻辑记录之间的静态关系,理解逗号与换行为什么仍属于同一字段。

字段数量和格式错误要分开处理

默认情况下,FieldsPerRecord 为 0,Reader 会用第一条记录的字段数作为后续记录的要求。对于导入模板固定的业务,这是很有价值的保护:列数突然变化时,程序不会把错位数据继续写入数据库。

如果 CSV 本来就允许不同记录有不同列数,可以设置为 -1,但要在业务层明确最小列数和可选列。不要把“列数不固定”和“格式错误”混为一谈:

现象优先检查处理建议
列数和首行不同FieldsPerRecord固定模板保留默认检查;动态模板自行校验
引号未闭合csv.ParseError回到原文件定位缺少的双引号
非引号字段出现裸双引号ErrBareQuote修正导出方,不要先用 LazyQuotes 掩盖问题
字段中有逗号或换行是否被双引号包裹使用 Reader,不要用字符串切分

LazyQuotes 适合兼容某些并不严格遵守 CSV 引号规则的历史文件,但它会降低输入约束。生产导入更稳妥的顺序是:记录解析行号和原始文件标识,修复上游导出格式,确认仍需兼容后再单独放宽,并为这类文件增加回归样本。

Go CSV 字段数量检查、ParseError 与业务校验边界静态关系图
图2:字段数量检查、ParseError 和业务校验各自负责不同边界,排错时先判断错误属于哪一层。

读完再映射,别让字段内容在业务层丢失

读取成功不代表数据就能直接入库。建议先检查表头,再把每条记录映射为结构体;备注列保留原字符串,必填列则单独做空值和格式校验。这样即使备注里有换行,校验逻辑也不会因为数组错位而误判。

如果文件很大,继续使用 Read 循环即可,避免一次性 ReadAll 把全部记录放进内存。若后续保存 record 的切片,还要注意是否开启了 ReuseRecord:开启后下一次读取可能复用底层数组,长期保存前应复制需要的数据。

常见问题

CSV 字段里有逗号,为什么还会被拆开?

通常是导出文件没有用双引号包住该字段,或程序先用 Split 拆分了文本。合法 CSV 应让逗号留在双引号字段内,并交给 csv.Reader 解析。

字段里的换行会让 Read 多返回一条记录吗?

不会,只要换行处于成对双引号内部。Reader 会把它作为字段内容保留;未闭合引号则会返回解析错误。

什么时候设置 LazyQuotes?

只有在必须兼容已存在的非严格 CSV,且已经评估误读风险时才设置。新系统应优先修复生成 CSV 的上游程序。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>