登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go bufio.Scanner 怎么编写保留分隔符的 SplitFunc

来源:17golang原创

时间:2026-09-26 23:26:32 121浏览 收藏

要让 bufio.Scanner 保留分隔符,关键是 SplitFunc 找到分隔符后,把 token 截到分隔符末尾,同时把 advance 设为相同长度。假设分隔符是 ||,输入 alpha||beta||tail 应依次返回 alpha||、beta|| 和 tail。

SplitFunc 的三个返回值各有职责:advance 告诉 Scanner 消费多少字节,token 决定交给调用方什么内容,err 决定是否终止。保留分隔符只改变 token 的切片终点,不能忘记同步推进 advance。

先看 SplitFunc 的返回契约

SplitFunc 接收当前缓冲区 data 和 atEOF。当完整分隔符还没到达时,应返回 0, nil, nil,让 Scanner 继续读取更多字节;找到分隔符时返回一个完整 token;到达 EOF 后若还有剩余数据,则把残片作为最后一个 token 返回。

bufio SplitFunc 中 data、分隔符、advance、token 和 atEOF 的静态关系
图1:看返回契约:data 中出现完整分隔符后,token 截到分隔符末尾,advance 消费相同范围;没有完整分隔符时等待更多数据。这是静态结构说明图。
条件advancetoken含义
找到完整分隔符分隔符末尾位置data 到分隔符末尾返回并保留分隔符
未找到且未 EOF0nil请求更多数据
未找到但已 EOF,有残片len(data)data返回最后一段
已 EOF 且无数据0nil扫描结束

实现一个保留分隔符的 SplitFunc

下面的闭包先复制分隔符,避免调用方随后修改原切片。bytes.Index 返回分隔符起点,加入分隔符长度后就是 token 与 advance 的共同终点。

package split

import (
    "bufio"
    "bytes"
)

func SplitAfter(delim []byte) bufio.SplitFunc {
    if len(delim) == 0 {
        panic("SplitAfter: 分隔符不能为空")
    }
    // 复制配置,避免外部修改 delim 影响扫描行为。
    sep := append([]byte(nil), delim...)

    return func(data []byte, atEOF bool) (advance int, token []byte, err error) {
        if i := bytes.Index(data, sep); i >= 0 {
            end := i + len(sep)
            // token 与 advance 都到分隔符末尾,因此分隔符会被保留且只消费一次。
            return end, data[:end], nil
        }

        if atEOF && len(data) > 0 {
            // 文件末尾没有分隔符时,仍返回最后一段残留数据。
            return len(data), data, nil
        }

        // 分隔符可能跨越两次读取,先不消费任何字节,等待缓冲区补全。
        return 0, nil, nil
    }
}

不要在“未找到分隔符”时返回 len(data), nil, nil,那会提前丢掉可能属于下一个完整 token 的数据,也会破坏跨缓冲区分隔符。例如一个缓冲区末尾是 |,下一次读取开头也是 |,只有保留原数据才能识别完整 ||。

把 SplitFunc 交给 Scanner

package main

import (
    "bufio"
    "fmt"
    "strings"

    "example/split"
)

func main() {
    input := strings.NewReader("alpha||beta||tail")
    scanner := bufio.NewScanner(input)
    scanner.Split(split.SplitAfter([]byte("||")))

    for scanner.Scan() {
        // Text 会复制当前 token,适合在下一次 Scan 后继续使用。
        fmt.Printf("%q\n", scanner.Text())
    }
    if err := scanner.Err(); err != nil {
        // 扫描错误必须单独处理,Scan 返回 false 不只代表 EOF。
        panic(err)
    }
}

如果使用 scanner.Bytes(),返回切片可能在下一次 Scan 后被覆盖;需要缓存 token 时应复制。超长记录还要在首次扫描前配合 scanner.Buffer 设置合理上限,否则自定义切分正确也可能因 token 太长而停止。

跨缓冲区和连续分隔符怎么处理

保留分隔符的 SplitFunc 对跨缓冲区、连续分隔符和 EOF 残片的处理关系
图2:看三种边界:跨缓冲区分隔符必须等待补全,连续分隔符会生成只含分隔符的 token,EOF 残片则按最后一个 token 返回。这是静态关系说明图。
  • 分隔符跨缓冲区:未找到完整序列时返回 0, nil, nil,Scanner 会补充数据后再调用。
  • 连续分隔符:输入 a||||b 会得到 a||、||、b;这是“保留分隔符”的自然结果。
  • 分隔符在结尾:输入 a|| 只返回 a||,不会额外产生空 token。
  • EOF 残片:输入 a||b 最后返回 b,避免丢失未以分隔符结束的数据。

如果业务不希望连续分隔符产生独立 token,可在调用层过滤仅等于分隔符的 token,或明确修改 SplitFunc;不要在没有定义好空记录语义时悄悄丢弃它。

常见问题

为什么 token 保留了分隔符,但下一次扫描又重复看到它?通常是 advance 只推进到分隔符起点。advance 必须与 token 终点一致,包含完整分隔符长度。

能否保留分隔符但只返回分隔符前内容?这两个目标冲突。若调用方需要分别处理正文和分隔符,可以返回完整 token 后再拆分,或设计结构化解析器而不是 Scanner。

分隔符很长会有问题吗?逻辑仍然成立,但 bytes.Index 会反复扫描当前缓冲区。对复杂、可转义或嵌套语法,应使用专门解析器,不要把 SplitFunc 变成完整语法分析器。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>