Go unicode/utf8 怎么判断字符串是否含有非法 UTF-8
来源:17golang原创
时间:2026-09-07 20:27:28 195浏览 收藏
Go 的 string 本质上保存的是字节序列,并不会在赋值时自动保证内容一定是合法 UTF-8。要判断整段字符串,直接使用 utf8.ValidString(s);它返回 false 就说明至少有一段字节不能按合法 UTF-8 解码。若还要记录坏数据的位置,再用 utf8.DecodeRuneInString 扫描,遇到 RuneError 且宽度为 1 时,就是非法字节起点。
len(s)只统计字节数,不能证明字符串是合法 UTF-8。ValidString适合整段拦截,解码扫描适合定位偏移。- 合法的 U+FFFD 也会得到
RuneError,必须同时判断size == 1。
为什么 string 里会藏着非法 UTF-8
Go 允许把任意字节转换成字符串,例如 string([]byte{0xff, 0xfe})。这段值可以保存、拼接和传递,但它不是合法的 UTF-8 文本。中文字符通常占多个字节,所以 len(s) 得到的是字节长度;把它转换成 []rune 或用 range 遍历时,非法序列会被解码成替换字符,原始问题可能因此被掩盖。
因此要先确定目标:只拦截无效输入,就做整段校验;需要返回错误位置,就做按字节偏移的扫描;允许继续处理,则在明确策略后替换。不要用“能不能正常打印”作为判断依据。
整段校验优先用 utf8.ValidString
unicode/utf8 提供了与输入类型对应的两个函数:utf8.Valid([]byte) 和 utf8.ValidString(string)。接口参数是字符串时,后者表达更直接,也不会为了检查而先复制成字节切片。
package main
import (
"fmt"
"unicode/utf8"
)
func main() {
// 模拟一个包含非法起始字节的外部输入。
input := string([]byte{'G', 'o', ' ', 0xff, '!'})
// 只回答“整段是否为合法 UTF-8”。
fmt.Println(utf8.ValidString(input)) // false
}
这个判断只说明“存在或不存在非法 UTF-8”,并不会告诉你具体是哪一个字节。它适合 HTTP 入参、消息字段、写入 JSON 前的快速门禁。空字符串没有非法字节,因此会返回 true。

需要定位时,别只看 RuneError
逐段调用 DecodeRuneInString 时,非法编码会返回 (utf8.RuneError, 1)。这里的 1 很关键:合法的 Unicode 替换字符 U+FFFD 本身是有效 UTF-8,解码宽度通常是 3,不能把所有 RuneError 都当成坏数据。
package main
import (
"fmt"
"unicode/utf8"
)
func firstInvalidOffset(s string) (int, bool) {
// offset 始终是原字符串的字节偏移,不是 rune 序号。
for offset := 0; offset
函数返回的偏移可以写进日志或错误响应,方便上游按原始字节排查。扫描时必须保证每轮都按 size 前进;非法输入的宽度为 1,所以不会卡在同一个位置。
| 需求 | 推荐 API | 结果含义 |
|---|---|---|
| 整段拦截 | utf8.ValidString | 只得到合法或非法 |
| 找到坏字节 | DecodeRuneInString | 得到字节偏移与异常宽度 |
| 继续流转 | strings.ToValidUTF8 | 按连续非法序列替换 |
替换和清洗要保留可追溯性
当业务允许清洗时,可以使用 strings.ToValidUTF8(s, replacement)。它会把每一段连续的非法 UTF-8 序列替换成指定字符串;传入空字符串则表示删除这些非法序列。
package main
import (
"fmt"
"strings"
"unicode/utf8"
)
func cleanText(raw []byte) (string, bool) {
// 先保留是否发生清洗,避免业务误以为原文未被修改。
valid := utf8.Valid(raw)
cleaned := strings.ToValidUTF8(string(raw), "�")
return cleaned, !valid
}
func main() {
cleaned, changed := cleanText([]byte{'A', 0xff, 'B'})
fmt.Printf("%q changed=%v\n", cleaned, changed)
}
日志、搜索索引等容错场景可以替换;签名校验、协议解析、财务或审计原文则更适合保留原始字节并拒绝请求。替换字符只是展示策略,不是修复原始编码,最好同时记录 changed 或原始数据的位置。

常见问题
range 遍历没有报错,是否说明 UTF-8 合法?
不是。range 会把非法序列解码成 RuneError 并继续遍历;要做严格校验,先调用 utf8.ValidString。
utf8.ValidString 和 utf8.Valid 有什么区别?
判断规则相同,区别只在输入类型。已有 string 用 ValidString,已有 []byte 用 Valid,不必为了调用 API 来回转换。
发现非法 UTF-8 后应该删除还是替换?
取决于数据责任:展示和索引通常替换,协议和审计数据通常拒绝并保留原始字节。无论哪种策略,都应让调用方知道发生过清洗。
-
449 收藏
-
256 收藏
-
413 收藏
-
113 收藏
-
433 收藏
-
475 收藏
-
430 收藏
-
469 收藏
-
375 收藏
-
268 收藏
-
327 收藏
-
326 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习