登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go问答

Go 问答:encoding/json.Decoder.InputOffset 怎么定位坏 JSON 的字节位置

来源:17golang原创

时间:2026-08-28 01:38:06 429浏览 收藏

接口收到一段看起来像 JSON 的请求体,日志只留下了“invalid character”却没有指出该看哪一段时,encoding/json.Decoder.InputOffset 可以先回答一个很实用的问题:解码器目前已经读到输入的哪个字节。它适合和 SyntaxError、原始字节及上下文截取一起用,而不是单独把返回值当成错误字符的行号。

InputOffset() 返回的是解码器读到的输入偏移,偏移按字节计算;要定位坏 JSON,先记录它,再从原始请求体按字节截取前后文,最后结合错误类型判断是截断、分隔符错误还是字段类型不匹配。

实践要点

  • InputOffset 是字节偏移,不是字符位置或行号。
  • SyntaxError.Offset 与解码器当前读入位置用途不同,不能混为一谈。
  • 流式请求要保留受控大小的原始字节上下文,避免日志泄露完整敏感载荷。

先把 Decoder 的位置和错误位置分开

Decoderio.Reader 持续读取,调用 Decode 时可能预读一部分数据。因此 InputOffset 表示解码器已经读到的输入边界;它是排查现场的“读到哪”,不保证等于错误字符本身的精确位置。

如果错误来自语法解析,错误值通常可以断言为 *json.SyntaxError,其中的 Offset 更接近语法错误的字节位置。两者一起记录,才能看出解码器是否已经跨过了错误附近。

Go Decoder 调用 Decode 后通过 InputOffset 记录字节边界并结合 SyntaxError 判断 JSON 语法错误

用一段可复现的坏 JSON 观察偏移

先准备一个带换行的请求体。这里故意把 role 的字符串少写一个结束引号,让错误不依赖网络环境就能复现。

package main

import (
    "bytes"
    "encoding/json"
    "errors"
    "fmt"
    "io"
)

type Request struct {
    ID   int    `json:"id"`
    Role string `json:"role"`
}

func main() {
    raw := []byte("{\n  \"id\": 7,\n  \"role\": \"admin\n}\n")
    dec := json.NewDecoder(bytes.NewReader(raw))

    var req Request
    err := dec.Decode(&req)
    fmt.Printf("err=%v input_offset=%d\n", err, dec.InputOffset())

    var syn *json.SyntaxError
    if errors.As(err, &syn) {
        fmt.Printf("syntax_offset=%d\n", syn.Offset)
    }
}

上面的完整程序还需要导入 errors。运行时重点不是死记某个数字,而是同时保存 input_offsetsyntax_offset,再用同一份 raw JSON 做上下文核对。生产日志里建议只输出脱敏后的片段。

把字节偏移换成可读上下文

偏移是从输入开始计算的字节数,也就是图中的 byte offset。可以把它限制在原文长度内,截取前后各一小段,再从片段中寻找换行,得到可读的 line context。不要先把原文转换成字符串后按 rune 下标切片,否则遇到中文等多字节 UTF-8 内容时,字符位置和字节偏移会错位。

func contextAt(raw []byte, offset int64) []byte {
    if offset  int64(len(raw)) {
        offset = int64(len(raw))
    }
    start := offset - 24
    if start  int64(len(raw)) {
        end = int64(len(raw))
    }
    return raw[start:end]
}
InputOffset 将 JSON 输入转换为 byte offset,再从 raw JSON 截取 line context

如果要给人看的行号,可以在这段字节上下文上统计换行数;如果要做机器诊断,保留原始字节偏移更可靠。长请求体还应设置上限,不能为了定位错误把整个上传内容写进日志。

Decode 循环里最容易漏掉的检查

一个请求体可能包含多个连续 JSON 值。循环调用 Decode 时,成功解码后要继续判断下一个值;遇到 io.EOF 才是正常结束,其他错误都要连同当前 InputOffset 记录。

for {
    var req Request
    err := dec.Decode(&req)
    if errors.Is(err, io.EOF) {
        break
    }
    if err != nil {
        fmt.Printf("decode failed at byte %d: %v\n", dec.InputOffset(), err)
        break
    }
    fmt.Printf("accepted id=%d\n", req.ID)
}

别把“已经读到输入末尾”误判成“业务对象完整”。字段缺失、类型不匹配和多余数据是不同问题,分别看结构体结果、错误类型以及下一次 Decode 的结果。

常见问题:InputOffset 什么时候不够用

它能直接返回行号吗?

不能。它返回字节偏移;行号需要依据原始字节中的换行自行计算。

为什么 InputOffset 和 SyntaxError.Offset 不一样?

前者描述解码器的输入边界,后者描述语法错误的位置,且流式解码可能发生预读。两者应一起记录,不要用一个覆盖另一个。

原始 JSON 应该全部写入日志吗?

不建议。只保留脱敏后的前后文、偏移、错误类型和请求关联标识;密码、令牌和个人信息不要进入诊断日志。

收尾:定位问题靠三份证据

遇到坏 JSON 时,最小可复查证据是错误值、InputOffset 和受控的原始字节上下文。语法错误再结合 SyntaxError.Offset,流式多值再检查下一次 Decode 是否返回 io.EOF。这样既能定位字节范围,也不会把解码器的预读位置误当成唯一答案。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>