登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  Golang >  Go教程

Go 中文字符串怎么按字符截取而不产生乱码

来源:17golang原创

时间:2026-09-06 00:05:43 240浏览 收藏

在 Go 里,中文字符串截取乱码,通常不是编码“突然变了”,而是把字符当成了字节。string[i:j] 的下标按 UTF-8 字节偏移计算,中文一个字符往往占 3 个字节,边界落在中间就会留下不完整编码。需要按字符截取时,先转成 []rune;如果只想遍历或计数,则使用 rangeutf8.RuneCountInString

要点速览
  • len(s) 得到字节数,[]rune(s) 的长度才是 Unicode code point 数。
  • 展示标题、摘要时可用 string([]rune(s)[:n]),并先处理负数和超长 n。
  • “一个 rune”不一定等于一个用户感知字符;表情符号和组合字符要另做 grapheme cluster 分段。

为什么按字节截取会把中文切坏

Go 的字符串是只读字节序列,源码和网络文本通常以 UTF-8 表示。ASCII 字符占 1 个字节,而常见中文通常占 3 个字节,所以这段代码按下标取前 4 个字节时,可能正好截断第二个中文字符:

package main

import "fmt"

func main() {
	text := "Go语言"
	// 下标表示字节偏移,不表示第几个中文字符。
	broken := text[:4]
	fmt.Printf("%q\\n", broken)
}

这里的 4 不是“取 4 个字符”,而是“取前 4 个 UTF-8 字节”。判断长度时要把两个概念分开:

写法单位适合场景
len(text)字节协议长度、缓冲区容量
utf8.RuneCountInString(text)rune 数统计 Unicode code point
len([]rune(text))rune 数需要按字符索引或切片
Go string、UTF-8 字节、rune 与中文字符边界的静态关系图
图1:观察 string 的字节边界与 rune 边界,理解为什么中文不能直接按字节下标截取。

用 []rune 按字符截取

最直接的写法是把字符串转换为 rune 切片,再按切片下标截取。转换会把 UTF-8 字节解码成 Unicode code point,因此切片边界不会落在一个完整 rune 的中间。

package main

import "fmt"

// TakeRunes 返回前 n 个 rune;n 小于 0 时按空字符串处理。
func TakeRunes(text string, n int) string {
	if n  len(runes) {
		n = len(runes)
	}
	return string(runes[:n])
}

func main() {
	// 截取单位是 rune,不会切断“语言”中的某个 UTF-8 编码。
	fmt.Println(TakeRunes("Go语言", 4))
}

边界处理有两个重点:n 直接返回空串,避免负数切片触发 panic;n > len(runes) 收敛到实际长度,避免越界。代价是需要一份 rune 切片,长文本或高频调用时会产生额外内存和解码成本。

如果只是从头读取前 n 个 rune,不需要随机访问,可以用 range 在一次遍历中记录字节边界:

// PrefixRunes 在原字符串上找到第 n 个 rune 的字节结束位置。
func PrefixRunes(text string, n int) string {
	if n 
Go []rune 转换、range 遍历与安全字符串前缀截取的静态结构图
图2:对比 []rune 的字符索引与 range 找到的字节边界,选择适合展示文本的截取方式。

混合文本与非法 UTF-8 该怎么处理

range 遍历字符串时,每次给出一个字节位置和解码后的 rune;对非法或不完整的 UTF-8 编码,解码结果会使用 utf8.RuneError,并按一个字节向前推进。utf8.RuneCountInString 也会把错误或短编码按一个 rune 计数。

如果数据来自文件、HTTP 请求或消息队列,先决定是否接受替换字符。需要拒绝脏数据时,可以显式检查:

import "unicode/utf8"

// ValidText 只接受完整的 UTF-8 字符串。
func ValidText(text string) bool {
	return utf8.ValidString(text)
}

这一步只能说明编码序列是否合法,不能判断文本是否适合界面显示。比如一个 emoji 可能由多个 code point 组成,带组合音标的字母也可能由多个 code point 组成。若需求是“用户看到的一个字符”,要使用支持 Unicode grapheme cluster 的分段方案,而不是简单把 rune 数当作视觉字符数。

按字符和按字节的选型检查

不要为了“避免乱码”把所有字符串都转成 []rune。展示文本、标题和摘要通常按 rune 截取;协议字段、文件切片和容量限制通常按字节,但必须在协议允许的位置截断,并不能随意从 UTF-8 中间切开。

需求推荐做法注意点
按字符取前缀[]runerange处理 n 的边界
统计 Unicode code pointutf8.RuneCountInString非法 UTF-8 会按错误 rune 计数
检查输入编码utf8.ValidString决定拒绝还是替换错误数据
限制网络字段字节数按字节,但只在合法 UTF-8 边界截断不要把字节限制误当字符限制

常见问题

Go 中 rune 和字符是同一个概念吗?

rune 是 Go 对 Unicode code point 的别名;它比字节更接近“字符”,但不一定等于用户眼中的一个完整可见字符。

为什么 len("中") 不是 1?

len 返回 UTF-8 字节数,中文通常占 3 个字节;需要 rune 数时使用 utf8.RuneCountInString

只截取英文时还需要转 rune 吗?

如果输入已经明确限定为 ASCII,按字节截取和按字符截取结果一致;一旦输入可能包含中文、emoji 或其他 Unicode 文本,就应明确使用 rune 语义。

相关 API 可在 Go 官方的 unicode/utf8 文档中继续查阅,重点关注 RuneCountInStringValidString 和解码函数的返回语义。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>