登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go unicode/utf8 怎么判断字符串是否含有非法 UTF-8

来源:17golang原创

时间:2026-09-07 20:27:28 195浏览 收藏

Go 的 string 本质上保存的是字节序列,并不会在赋值时自动保证内容一定是合法 UTF-8。要判断整段字符串,直接使用 utf8.ValidString(s);它返回 false 就说明至少有一段字节不能按合法 UTF-8 解码。若还要记录坏数据的位置,再用 utf8.DecodeRuneInString 扫描,遇到 RuneError 且宽度为 1 时,就是非法字节起点。

要点速览
  • len(s) 只统计字节数,不能证明字符串是合法 UTF-8。
  • ValidString 适合整段拦截,解码扫描适合定位偏移。
  • 合法的 U+FFFD 也会得到 RuneError,必须同时判断 size == 1

为什么 string 里会藏着非法 UTF-8

Go 允许把任意字节转换成字符串,例如 string([]byte{0xff, 0xfe})。这段值可以保存、拼接和传递,但它不是合法的 UTF-8 文本。中文字符通常占多个字节,所以 len(s) 得到的是字节长度;把它转换成 []rune 或用 range 遍历时,非法序列会被解码成替换字符,原始问题可能因此被掩盖。

因此要先确定目标:只拦截无效输入,就做整段校验;需要返回错误位置,就做按字节偏移的扫描;允许继续处理,则在明确策略后替换。不要用“能不能正常打印”作为判断依据。

整段校验优先用 utf8.ValidString

unicode/utf8 提供了与输入类型对应的两个函数:utf8.Valid([]byte)utf8.ValidString(string)。接口参数是字符串时,后者表达更直接,也不会为了检查而先复制成字节切片。

package main

import (
    "fmt"
    "unicode/utf8"
)

func main() {
    // 模拟一个包含非法起始字节的外部输入。
    input := string([]byte{'G', 'o', ' ', 0xff, '!'})

    // 只回答“整段是否为合法 UTF-8”。
    fmt.Println(utf8.ValidString(input)) // false
}

这个判断只说明“存在或不存在非法 UTF-8”,并不会告诉你具体是哪一个字节。它适合 HTTP 入参、消息字段、写入 JSON 前的快速门禁。空字符串没有非法字节,因此会返回 true

Go unicode utf8 字节边界中 string、ValidString、DecodeRuneInString 与 RuneError 的静态关系
图1:string 的原始字节经过 ValidString 做整段判断,需要定位时再交给 DecodeRuneInString;RuneError 与字节宽度共同表达非法边界。

需要定位时,别只看 RuneError

逐段调用 DecodeRuneInString 时,非法编码会返回 (utf8.RuneError, 1)。这里的 1 很关键:合法的 Unicode 替换字符 U+FFFD 本身是有效 UTF-8,解码宽度通常是 3,不能把所有 RuneError 都当成坏数据。

package main

import (
    "fmt"
    "unicode/utf8"
)

func firstInvalidOffset(s string) (int, bool) {
    // offset 始终是原字符串的字节偏移,不是 rune 序号。
    for offset := 0; offset 

函数返回的偏移可以写进日志或错误响应,方便上游按原始字节排查。扫描时必须保证每轮都按 size 前进;非法输入的宽度为 1,所以不会卡在同一个位置。

需求推荐 API结果含义
整段拦截utf8.ValidString只得到合法或非法
找到坏字节DecodeRuneInString得到字节偏移与异常宽度
继续流转strings.ToValidUTF8按连续非法序列替换

替换和清洗要保留可追溯性

当业务允许清洗时,可以使用 strings.ToValidUTF8(s, replacement)。它会把每一段连续的非法 UTF-8 序列替换成指定字符串;传入空字符串则表示删除这些非法序列。

package main

import (
    "fmt"
    "strings"
    "unicode/utf8"
)

func cleanText(raw []byte) (string, bool) {
    // 先保留是否发生清洗,避免业务误以为原文未被修改。
    valid := utf8.Valid(raw)
    cleaned := strings.ToValidUTF8(string(raw), "�")
    return cleaned, !valid
}

func main() {
    cleaned, changed := cleanText([]byte{'A', 0xff, 'B'})
    fmt.Printf("%q changed=%v\n", cleaned, changed)
}

日志、搜索索引等容错场景可以替换;签名校验、协议解析、财务或审计原文则更适合保留原始字节并拒绝请求。替换字符只是展示策略,不是修复原始编码,最好同时记录 changed 或原始数据的位置。

Go UTF-8 清洗中原始字节、有效性判断、替换策略和业务输出的静态关系
图2:清洗策略把原始字节、Valid 判断、ToValidUTF8 替换和业务输出分开,保留是否发生修改这一判断结果。

常见问题

range 遍历没有报错,是否说明 UTF-8 合法?

不是。range 会把非法序列解码成 RuneError 并继续遍历;要做严格校验,先调用 utf8.ValidString

utf8.ValidString 和 utf8.Valid 有什么区别?

判断规则相同,区别只在输入类型。已有 stringValidString,已有 []byteValid,不必为了调用 API 来回转换。

发现非法 UTF-8 后应该删除还是替换?

取决于数据责任:展示和索引通常替换,协议和审计数据通常拒绝并保留原始字节。无论哪种策略,都应让调用方知道发生过清洗。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>