登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  php教程

PHP mbstring 截取多字节文本避免乱码

来源:17golang原创

时间:2026-10-10 19:08:43 434浏览 收藏

PHP 处理中文、日文或 emoji 时,直接使用 substr() 可能把一个 UTF-8 字符从中间切开,结果出现乱码或替代字符。稳定的做法是先确认文本编码,再用 mb_substr($text, $start, $length, 'UTF-8') 按字符位置截取,并用 mb_strlen() 做长度判断。

官方文档:https://www.php.net/manual/zh/book.mbstring.php

只要业务边界是“取前 N 个字符”,就使用 mbstring 的字符级函数;只有在明确处理原始字节或协议数据时,才考虑字节级函数。

PHP 截取中文不乱码的最小写法

UTF-8 中一个中文字符通常由多个字节组成,而 substr() 的偏移量和长度是按字节工作的。mbstring 提供面向多字节字符串的函数,mb_substr() 则按照字符数执行截取,所以更适合文章摘要、昵称、接口提示语等面向用户的文本。

如果运行环境没有加载 mbstring,会出现“Call to undefined function mb_substr()”。Linux 包管理器、Windows 扩展配置和 PHP-FPM 使用的配置文件可能不同,排查时要确认实际运行的 SAPI,而不是只看命令行的 php.ini。

PHP substr 按字节与 mb_substr 按字符保留中文边界的说明图
图1:字符边界说明图,展示 substr 与 mb_substr 的处理层级差异。

start、length 和 encoding 的边界要先约定

mb_substr() 的 start 从 0 开始计数,length 表示最多取多少个字符;省略 length 或传入 null 时,会一直取到字符串末尾。start 可以是负数,表示从字符串尾部倒数定位,这对取文件名后缀前的尾部摘要很方便。

参数作用实践建议
string待截取文本进入函数前统一为 UTF-8
start字符起点,支持负数展示摘要通常从 0 开始
length最大字符数接口字段建议显式传入
encoding字符编码项目代码优先显式写 UTF-8

不要把 mb_substr() 的“字符安全”理解成“语义安全”。它不会自动识别一个组合 emoji、复杂 grapheme cluster 或 HTML 标签。富文本截断应先转为纯文本,涉及用户可见字素时再考虑更专门的分段策略。

按场景选择长度函数和截取边界

列表摘要通常需要“最多 N 个字符”,用 mb_strlen() 判断后再拼接省略号;终端或固定宽度卡片则可能关心中文占两列、英文占一列的显示宽度,这时应考虑 mb_strimwidth(),不能只用字符数代替视觉宽度。

三者的职责可以这样记:mb_strlen() 回答“有多少个字符”,mb_substr() 回答“取哪一段字符”,mb_strimwidth() 回答“在指定显示宽度内保留什么”。数据库字段长度、接口校验长度和前端视觉宽度也应分别定义。

PHP mb_strlen mb_substr mb_strimwidth 区分字符数和显示宽度的结构图
图2:长度与展示边界结构图,区分字符数量和界面显示宽度。

混合文本的检查清单

  • 输入来源明确是 UTF-8,并在函数中显式传入 'UTF-8'。
  • 需要用户可见字符时不用 substr() 直接裁剪中文。
  • 空字符串、start 超出范围、length 为 0 或负数都写入测试用例。
  • 摘要长度与数据库字段限制分开计算,省略号是否占配额要先约定。
  • 界面固定宽度场景用显示宽度函数验证,而不是凭字符数猜测。

最小验证集应包含纯中文、纯英文、中英文混合、emoji、空字符串和尾部截取。这样既能发现乱码,也能提前暴露“字符数量正确但界面仍然溢出”的另一类问题。

常见问题

mb_substr() 省略编码参数可以吗?

可以省略,PHP 会使用内部字符编码;但在多环境部署中显式传入 UTF-8 更容易读懂,也能减少配置差异造成的结果变化。

为什么 mb_strlen() 和 strlen() 得到的数字不同?

strlen() 面向字节,mb_strlen() 在指定编码下按字符统计。中文、emoji 等多字节内容中,两者不同是正常现象。

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>