登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go bufio.Scanner 自定义 SplitFunc 怎么识别带前缀的日志记录

来源:17golang原创

时间:2026-09-09 06:00:53 129浏览 收藏

bufio.Scanner 读取带前缀的日志时,关键不是把每次 Read 读到的字节直接当成一条记录,而是让自定义 SplitFunc 同时回答两个问题:一条记录在哪里结束,以及这条记录是否符合 [source] 前缀格式。完整记录尚未到达时返回 (0, nil, nil),遇到换行时推进分隔符,文件末尾没有换行也要在 atEOF 时交付最后一条记录。

要点速览
  • SplitFuncdata 是尚未消费的字节,不能假设一次就拿到完整日志。
  • 返回的 advance 要越过换行符;不完整数据返回零推进,格式错误直接返回错误。
  • 默认 token 上限约为 64 KiB,长日志要在第一次 Scan 前调用 Buffer

SplitFunc 先负责切记录,再负责识别前缀

下面的输入把日志来源放在方括号中,记录之间用换行分隔。SplitFunc 只处理边界和格式,不在里面做业务解析;这样来源名、正文和后续路由仍可由普通 Go 函数完成。

输入字节流经过 Scanner 缓冲区和 SplitFunc 后形成带前缀的日志记录 token 的静态关系图
图1:看清 Scanner 缓冲区、SplitFunc 与日志记录 token 的边界关系。
package main

import (
    "bufio"
    "bytes"
    "errors"
    "fmt"
    "strings"
)

var errMissingPrefix = errors.New("日志缺少 [source] 前缀")

// splitPrefixedLog 以换行切出一条记录,并校验 [source] 头部。
func splitPrefixedLog(data []byte, atEOF bool) (advance int, token []byte, err error) {
    newline := bytes.IndexByte(data, '\n')
    if newline = len(record) || record[closeBracket+1] != ' ' {
        return 0, nil, errMissingPrefix
    }

    advance = newline + 1
    if newline == len(data) {
        // EOF 尾记录没有分隔符,不能再越过一个不存在的字节。
        advance = 0
    }
    return advance, record, nil
}

func main() {
    input := "[api] user=42 action=login\n[worker] job=sync status=ok\n[api] user=7 action=logout"
    scanner := bufio.NewScanner(strings.NewReader(input))
    scanner.Split(splitPrefixedLog)
    scanner.Buffer(make([]byte, 0, 1024), 1024*1024)

    for scanner.Scan() {
        record := scanner.Text()
        end := strings.IndexByte(record, ']')
        source := record[1:end]
        body := strings.TrimSpace(record[end+1:])
        fmt.Printf("source=%s body=%s\n", source, body)
    }
    if err := scanner.Err(); err != nil {
        fmt.Printf("scan log: %v\n", err)
    }
}

这个函数把 data 看作“尚未消费的窗口”。找不到换行且还没到 EOF 时,零推进告诉 Scanner 继续填充;找到换行后,advance 必须包含换行字节,否则下一次扫描会再次看到同一个分隔符。前缀校验只确认结构,真正的键值解析放在 Scan 循环中更容易测试。

返回值的三个位置决定 Scanner 会不会继续读

SplitFunc 的返回值是 advancetokenerr。可以按下面的判断记忆:没有完整记录时是 0, nil, nil;有记录时推进到下一条;格式损坏时返回错误。若返回负数推进,或推进超过当前数据长度,Scanner 会把它视为扫描错误。

场景返回方式含义
半条日志0, nil, nil保留当前窗口,等待更多字节
换行记录换行位置+1, record, nil交付 token 并越过分隔符
格式错误0, nil, err停止扫描,由 scanner.Err() 暴露
EOF 尾记录0, record, nil交付没有换行的最后一条

示例中特意把“找不到前缀”和“还没有读完”分开:前者是输入格式问题,后者只是读取时机。若把前者也返回成零 token,坏日志可能一直等待;若把后者当成错误,则跨读取块的正常记录会被误截断。

atEOF 和 Buffer 决定最后一条记录能否安全交付

完整日志、EOF 尾记录和 Buffer 最大容量三个边界的静态关系图
图2:对照正常换行、EOF 尾记录和 Buffer 容量三个边界,判断扫描结束后的错误来源。

atEOF 为真并不代表一定有 token;它表示底层 Reader 已经没有更多数据。此时仍有字节,就应交付最后一条无换行记录;只剩空字节时返回空 token,让扫描自然结束。另一方面,Scanner 默认 token 大小有限,日志正文可能包含堆栈、JSON 或长 SQL,应该在第一次 Scan 前配置上限:

scanner := bufio.NewScanner(reader)
// 预留 64 KiB 初始空间,允许单条日志最多占用 1 MiB。
scanner.Buffer(make([]byte, 64*1024), 1024*1024)
scanner.Split(splitPrefixedLog)

for scanner.Scan() {
    // scanner.Text() 在这里交给业务解析或写入结构化日志。
}
if err := scanner.Err(); err != nil {
    // token 超长、底层读取失败或 SplitFunc 格式错误都从这里判断。
    return fmt.Errorf("读取日志失败: %w", err)
}

Buffer 不是“自动解决所有长日志”的开关:它只是规定 Scanner 可使用的最大缓冲空间。超过这个值仍会得到 token too long;如果日志可能远超合理上限,或需要更细的恢复和连续扫描控制,应改用 bufio.Reader 自己管理分片。

扫描结束后要把记录错误和输入错误分开

循环里的 Scan 返回 false 只说明没有下一条 token,它可能是正常 EOF,也可能是 SplitFunc 或底层 Reader 出错。因此必须在循环后调用 scanner.Err()。示例里的格式错误会保留来源和记录边界,调用方可以记录坏行、丢弃当前文件,或者转入人工修复;不要只看最后一条成功输出就认为整个文件有效。

  • 前缀名称为空或缺少右方括号:在 SplitFunc 中返回格式错误。
  • 最后一条没有换行:atEOF 分支返回剩余字节。
  • 记录超过允许长度:调大 Buffer 前先评估内存上限,否则使用 bufio.Reader

常见问题

为什么 SplitFunc 找不到换行时不能直接返回当前 data?

因为当前 data 可能只是底层 Reader 的一部分。直接返回会把一条日志拆成多个 token;正确做法是返回 0, nil, nil,让 Scanner 继续读取。

为什么最后一条日志没有换行也能被读到?

当 Reader 到达 EOF 时,Scanner 会再次调用 SplitFunc 并把 atEOF 设为真。函数需要把仍然存在的非空 data 作为最后一个 token 返回。

Scanner 适合处理无限增长的日志流吗?

它适合边界明确、单条记录有合理上限的流式文本。若需要恢复超长记录、保留更多读取控制,使用 bufio.Reader 会更合适。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>