登录
推荐 文章 Go 技术 课程 下载 专题 AI
首页 >  文章 >  php教程

PHP mb_substr 截断中文时如何避免半个字符

来源:17golang原创

时间:2026-09-08 22:12:34 277浏览 收藏

中文标题被截成半个字符,通常不是数据库把内容弄坏了,而是把 UTF-8 字符串交给了按字节工作的函数。处理中文摘要、昵称或列表标题时,直接用 mb_substr(),并显式传入 UTF-8,就能按字符位置截取;长度判断则配套使用 mb_strlen(),不要用 strlen() 代替。

安全写法是 mb_substr($text, 0, $limit, 'UTF-8')。同时确认 mbstring 已加载、输入确实是 UTF-8,并把省略号是否占长度的规则先定下来。

先分清 substr、strlen 与 mb_substr

UTF-8 的一个中文字符通常由多个字节组成。substr()strlen() 面向字节工作,长度为 5 并不等于“前 5 个中文字符”;截在中间时,输出可能出现替换字符。PHP 手册把 mb_substr() 定义为按字符数执行的多字节安全截取,起始位置从 0 计数。

这里的关键不是把数字从 5 改大,而是换成字符语义的函数。存储层仍然要保证连接、表和页面的编码一致,否则输入在截取前就已经不是预期文本。

substr 的字节边界与 mb_substr 的字符边界关系图
字节长度和字符长度是两套计数边界,mb_substr 在字符边界上工作。

显式指定 UTF-8 截取中文

最小可复用写法如下。第四个参数不要省略:省略时 PHP 会使用 mbstring 的内部编码,部署环境如果配置不同,同一段代码可能得到不同结果。

这个函数把“正文最多几个字符”和“是否额外显示省略号”分开了。若产品要求总长度包括省略号,可以先把上限减 1,再截取正文;不要把多字节字符串交给 substr() 做补救。

检查 mbstring 扩展和内部编码

如果出现 Call to undefined function mb_substr(),先安装或启用 mbstring,不是修改参数名。函数可用后,仍建议在项目入口确认内部编码,尤其是 CLI、FPM 和队列消费者由不同配置启动时。

mb_internal_encoding() 是默认值的读写接口,但它不会自动把任意来源的数据转换成 UTF-8。文件、HTTP 请求或旧接口的编码不确定时,先完成明确的转码和校验,再做截取。

处理长度、后缀与边界

接口摘要最容易漏掉三个边界:空字符串、限制值小于等于 0,以及文本刚好等于限制值。前面的函数在这三处都给出了稳定返回值。还要提前决定 emoji、组合字符和展示宽度是否属于本题范围;mb_substr() 解决的是多字节字符计数,不等于完整的用户感知字素切分或终端显示宽度计算。

如果只想从末尾去掉固定字符,可以使用负的 startlength,但这会改变问题语义。普通列表摘要从开头保留内容时,正数 start=0 更容易读,也更便于测试。

PHP 文本处理中的输入编码、字符长度和展示后缀关系图
输入编码、字符计数与省略号策略属于不同边界,分别处理才能避免长度误判。

用字符数而不是字节数验收

不需要运行复杂项目,准备纯中文、英文加中文、空字符串和刚好达到上限的样例即可。验收关注两件事:结果没有乱码,字符数符合业务约定。

如果测试结果仍然异常,排查顺序应是:输入编码、mbstring 是否启用、调用处是否显式传入编码、最后才看业务的后缀规则。这样能把“半个字符”和“长度定义不一致”分开处理。

几个容易混淆的问题

为什么 mb_substr 还是显示乱码? 它只能保证按字符边界截取,不能修复已经损坏或不是 UTF-8 的输入。

能不能全局设置一次内部编码? 可以设置,但跨 CLI、FPM、队列和测试环境时不够稳;关键调用显式传 UTF-8 更清楚。

strlen 什么时候仍然有用? 计算协议、文件或二进制数据的字节数时仍应使用它;展示文本长度才使用 mb_strlen

声明:本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
相关阅读
更多>
最新阅读
更多>
课程推荐
更多>