人工智能技术文章
-
模型服务出现限流、超时或参数错误时,AI 网关不能把所有失败都交给重试。本文从统一请求契约出发,拆分可降级、可重试和必须直返的错误,并用幂等键保护跨模型切换后的结果一致性。347 收藏 -
评测分数异常好,未必代表模型真的可靠。训练集、验证集和测试集之间的重复样本、未来字段和错误的预处理顺序,都会造成数据泄漏。本文以带时间的客服工单分类为例,给出切分、去重、特征时间点和最终验收的检查方法。115 收藏 -
AI 应用调用搜索、数据库或业务接口时,超时不只是返回一条错误消息。本文用 Go context 把截止时间、取消信号、工具结果和用户状态串成一条可验收的链路,说明何时停止、如何记录以及怎样避免重复执行。310 收藏 -
模型没有返回答案时,不能只看空字符串或 HTTP 状态码。本文把提示被拦截、候选被安全过滤、正常截断和服务异常分开,给出统一状态判断、用户提示与回归验收的方法。140 收藏 -
RAG 应用最难排查的错误之一,是模型把相似检索片段直接改写成确定答案。本文从引用绑定、证据片段和拒答边界入手,给出一套可落地的输出验收方法。201 收藏 -
大模型流式接口出现重复片段,通常不是模型把同一句话生成了两次,而是客户端把重试、重放或累计快照重复拼接。本文用可观测指标拆开增量事件、断线续传和去重边界。213 收藏 -
RAG 知识库答非所问,通常不是模型单独失灵,而是切分、召回过滤和重排之间没有形成可验证的证据链。本文用一组可复现的检查方法定位问题,并给出适合上线前评测的调整顺序。243 收藏 -
Responses API 的 tool_choice 不只是 auto 和 required 两个开关。本文用一个订单查询工具说明如何强制调用、指定具体工具,并用响应项和业务回退做可复查验收。484 收藏 -
多模态 RAG 能检索到图片,却在回答里漏掉关键上下文,通常不是模型单点失效,而是 OCR、图文切片、向量检索和引用回链之间有一段断了。本文按证据顺序定位并修复这类问题。197 收藏 -
RAG 明明已经写入知识库,回答却像没有检索到内容?从查询改写、文本分块、相似度阈值和召回日志四个位置建立一条可验证的排查路径。350 收藏 -
图片输入的成本不只由文件大小决定,还受模型细节档位、有效分辨率和长图切分方式影响。本文用一套可复核的输入策略,判断何时用低细节、何时保留高分辨率,以及长图如何切成可验收的局部图片。152 收藏 -
多租户 AI 知识库最危险的故障不是检索变慢,而是把 A 租户的片段、缓存或引用带给 B 租户。本文从检索权限、缓存键、引用回显和审计证据四条线,拆解一套可验证的隔离方案。369 收藏 -
多模态接口的图片费用不只取决于文件大小,真正影响预算的是输入分辨率、detail 级别、图片数量和重试策略。本文用一个可复用的请求预算表,说明什么时候使用 low、high 或 auto,并给出上线前的核对方法。165 收藏 -
MCP 客户端拿到 resources/read 的空结果时,问题通常不在模型,而在 URI 没有按原值传递、内容类型判断错误或把资源列表缓存成了永久数据。本文按一次可复现的排查顺序,拆开 URI、contents、文本与二进制资源,以及缓存失效边界。104 收藏 -
接入多个大模型后,真正难处理的不是把请求转发出去,而是主模型超时、限流或返回异常时如何在有限时间内切换备用模型。本文用一个可落地的网关流程说明超时预算、降级条件和结果标记应该怎样设计。102 收藏