人工智能技术文章
-
客服回复提示词改了两句话,结果结构化字段合格率下降,才发现线上没有记录每条回答来自哪个版本。本文用样本对照、灰度比例、输出门禁和请求标识建立可回退的提示词发布流程。419 收藏 -
多轮对话变长后,简单截掉旧消息很容易让模型丢失用户约束。本文从上下文压缩的边界出发,拆解摘要漂移、关键事实遗漏和回放验收,用可重复的测试样例判断压缩是否真的可用。418 收藏 -
Prompt 变化不能只靠复制文本和人工回忆。本文用模板、变量、模型配置、输入集和输出指标五类记录,搭建可重放、可比较、可回滚的版本流程。412 收藏 -
向量库里明明有数据,检索却返回空结果,常见根因不是数据库坏了,而是 embedding 维度、归一化方式和查询链路没有对齐。本文用一个最小 Go 实验把排查顺序固定下来。410 收藏 -
向量检索通常应先执行租户、权限、状态和时间等硬过滤,再做向量或混合召回与 rerank,最后应用阈值、去重和多样性检查,本文给出可落地的判断顺序。409 收藏 -
MCP 2026-07-28 将协议核心改成无会话请求,并用 MRTR 承接工具调用中的用户补充输入。本文从旧版会话依赖、请求路由、input_required 重试和灰度验收四个方面拆解迁移边界。407 收藏 -
AI 网关同时承载多路流式回答时,连接复用、异步回调和日志采集很容易把不同请求的片段混到一起。本文用 request_id 贯穿入口、上游连接、事件转发和落盘日志,再配合状态机与断言,把串线问题变成可以复现、定位和验收的工程流程。407 收藏 -
视觉语言模型接入 OCR 时,结果漂移往往不是模型突然失忆,而是裁切坐标、原图尺寸和结构化字段没有对齐。本文用一条可复核的数据路径拆开问题,并给出校验与回退做法。406 收藏 -
图像问答不稳定,常常不是模型不会看,而是说明文字和视觉证据没有分层。本文给出冲突分类、证据优先级、结构化输入和人工复核的实用提示设计。404 收藏 -
从文档结构、token预算、重叠窗口和稳定元数据四个方面,说明RAG切块与引用定位的配置方法、排查顺序和常见误区。404 收藏 -
用 Ollama Modelfile 固化 SYSTEM 系统提示和 num_ctx 上下文长度,说明 ollama create、ollama show、ollama ps 的配合方式,以及服务环境和客户端覆盖配置的排查思路。403 收藏 -
用 PEFT 的 merge_and_unload 合并 LoRA adapter,固定 tokenizer、输入和生成参数,再通过 token 与 logits 对比判断合并前后是否一致。399 收藏 -
按 decoder-only 生成、训练、encoder-only 和 encoder-decoder 任务拆解 Tokenizer 左右填充选择,并说明 attention_mask、pad_token 与标签屏蔽。399 收藏 -
同一个模型请求失败,并不代表应该立刻换到下一个模型。本文按超时、限流、服务异常和内容拒答拆开处理,给出路由状态、重试边界、降级策略与可验收的实现路径。398 收藏 -
说明 Gemini API 隐式缓存的启用范围、最低输入 token 门槛、公共前缀组织方式,以及如何用 usage.total_cached_tokens 核对命中。398 收藏