Go 中文字符串怎么按字符截取而不产生乱码
来源:17golang原创
时间:2026-09-06 00:05:43 240浏览 收藏
在 Go 里,中文字符串截取乱码,通常不是编码“突然变了”,而是把字符当成了字节。string[i:j] 的下标按 UTF-8 字节偏移计算,中文一个字符往往占 3 个字节,边界落在中间就会留下不完整编码。需要按字符截取时,先转成 []rune;如果只想遍历或计数,则使用 range 和 utf8.RuneCountInString。
len(s)得到字节数,[]rune(s)的长度才是 Unicode code point 数。- 展示标题、摘要时可用
string([]rune(s)[:n]),并先处理负数和超长 n。 - “一个 rune”不一定等于一个用户感知字符;表情符号和组合字符要另做 grapheme cluster 分段。
为什么按字节截取会把中文切坏
Go 的字符串是只读字节序列,源码和网络文本通常以 UTF-8 表示。ASCII 字符占 1 个字节,而常见中文通常占 3 个字节,所以这段代码按下标取前 4 个字节时,可能正好截断第二个中文字符:
package main
import "fmt"
func main() {
text := "Go语言"
// 下标表示字节偏移,不表示第几个中文字符。
broken := text[:4]
fmt.Printf("%q\\n", broken)
}
这里的 4 不是“取 4 个字符”,而是“取前 4 个 UTF-8 字节”。判断长度时要把两个概念分开:
| 写法 | 单位 | 适合场景 |
|---|---|---|
len(text) | 字节 | 协议长度、缓冲区容量 |
utf8.RuneCountInString(text) | rune 数 | 统计 Unicode code point |
len([]rune(text)) | rune 数 | 需要按字符索引或切片 |

用 []rune 按字符截取
最直接的写法是把字符串转换为 rune 切片,再按切片下标截取。转换会把 UTF-8 字节解码成 Unicode code point,因此切片边界不会落在一个完整 rune 的中间。
package main
import "fmt"
// TakeRunes 返回前 n 个 rune;n 小于 0 时按空字符串处理。
func TakeRunes(text string, n int) string {
if n len(runes) {
n = len(runes)
}
return string(runes[:n])
}
func main() {
// 截取单位是 rune,不会切断“语言”中的某个 UTF-8 编码。
fmt.Println(TakeRunes("Go语言", 4))
}
边界处理有两个重点:n 直接返回空串,避免负数切片触发 panic;n > len(runes) 收敛到实际长度,避免越界。代价是需要一份 rune 切片,长文本或高频调用时会产生额外内存和解码成本。
如果只是从头读取前 n 个 rune,不需要随机访问,可以用 range 在一次遍历中记录字节边界:
// PrefixRunes 在原字符串上找到第 n 个 rune 的字节结束位置。
func PrefixRunes(text string, n int) string {
if n
![Go []rune 转换、range 遍历与安全字符串前缀截取的静态结构图](/uploads/20260906/1788624342-d1a181a5cd-057926996f-go-rune-slice-map.webp)
混合文本与非法 UTF-8 该怎么处理
range 遍历字符串时,每次给出一个字节位置和解码后的 rune;对非法或不完整的 UTF-8 编码,解码结果会使用 utf8.RuneError,并按一个字节向前推进。utf8.RuneCountInString 也会把错误或短编码按一个 rune 计数。
如果数据来自文件、HTTP 请求或消息队列,先决定是否接受替换字符。需要拒绝脏数据时,可以显式检查:
import "unicode/utf8"
// ValidText 只接受完整的 UTF-8 字符串。
func ValidText(text string) bool {
return utf8.ValidString(text)
}
这一步只能说明编码序列是否合法,不能判断文本是否适合界面显示。比如一个 emoji 可能由多个 code point 组成,带组合音标的字母也可能由多个 code point 组成。若需求是“用户看到的一个字符”,要使用支持 Unicode grapheme cluster 的分段方案,而不是简单把 rune 数当作视觉字符数。
按字符和按字节的选型检查
不要为了“避免乱码”把所有字符串都转成 []rune。展示文本、标题和摘要通常按 rune 截取;协议字段、文件切片和容量限制通常按字节,但必须在协议允许的位置截断,并不能随意从 UTF-8 中间切开。
| 需求 | 推荐做法 | 注意点 |
|---|---|---|
| 按字符取前缀 | []rune 或 range | 处理 n 的边界 |
| 统计 Unicode code point | utf8.RuneCountInString | 非法 UTF-8 会按错误 rune 计数 |
| 检查输入编码 | utf8.ValidString | 决定拒绝还是替换错误数据 |
| 限制网络字段字节数 | 按字节,但只在合法 UTF-8 边界截断 | 不要把字节限制误当字符限制 |
常见问题
Go 中 rune 和字符是同一个概念吗?
rune 是 Go 对 Unicode code point 的别名;它比字节更接近“字符”,但不一定等于用户眼中的一个完整可见字符。
为什么 len("中") 不是 1?
len 返回 UTF-8 字节数,中文通常占 3 个字节;需要 rune 数时使用 utf8.RuneCountInString。
只截取英文时还需要转 rune 吗?
如果输入已经明确限定为 ASCII,按字节截取和按字符截取结果一致;一旦输入可能包含中文、emoji 或其他 Unicode 文本,就应明确使用 rune 语义。
相关 API 可在 Go 官方的 unicode/utf8 文档中继续查阅,重点关注 RuneCountInString、ValidString 和解码函数的返回语义。
-
860 收藏
-
843 收藏
-
826 收藏
-
809 收藏
-
792 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 立即学习 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 立即学习 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 立即学习 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 立即学习 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 立即学习 485次学习