人工智能技术文章
-
同一个模型换了提示词却突然复读、接不上回答,问题常常不在采样参数,而在 Transformers 的 chat template。本文用 apply_chat_template 对比 add_generation_prompt、重复 special tokens 和 continue_final_message 的边界,再用 token 数量与首个生成片段完成验收。243 收藏 -
RAG 知识库答非所问,通常不是模型单独失灵,而是切分、召回过滤和重排之间没有形成可验证的证据链。本文用一组可复现的检查方法定位问题,并给出适合上线前评测的调整顺序。243 收藏 -
AI 流式接口不能只靠某个文本片段判断结束。本文用事件序列拆解增量内容、完成事件、失败状态与断线续接,给出客户端状态机、重复片段处理和验收清单。239 收藏 -
Gemini 3 的 function calling 在手动维护多轮历史时,不能丢掉 thought_signature。本文用一个最小工具调用链说明官方 SDK、REST 手写历史和错误降级的处理边界。238 收藏 -
RAG 文档切片的 overlap 过大,会让相邻片段重复进入上下文,增加索引和推理成本。本文给出重叠比例、配置调整和验证指标。238 收藏 -
RAG 可以先用双编码器或 BM25 召回候选,再让 CrossEncoder 对查询和候选片段逐对打分,按分数取最终 Top-K。本文给出可运行的 Python 写法,并说明候选规模、分数和延迟边界。237 收藏 -
长文档切分不应只看字符数。本文用标题、段落、代码块和 token 预算建立语义分块,为每块保存章节元数据,再通过 Embedding 建索引并在召回时补回邻近上下文。234 收藏 -
OCR 结果进入 RAG 前不要只保留拼接文本。本文用统一文本块保存 source_id、页码、版面多边形和字符范围,并说明切块、向量召回与回答引用如何保持同一条证据链。233 收藏 -
接入远程工具时,真正需要验收的是工具白名单、调用暂停、审批结果与工具输出的关联链路。本文用只读查询场景拆开发现、确认、拒绝和故障恢复的边界。232 收藏 -
AI 流式回答在移动网络或代理切换时可能中途断开。本文用 SSE 的事件 ID、重连窗口和客户端游标,拆解如何续接未完成内容、避免重复片段,并给出可验收的状态与日志设计。231 收藏 -
AI 接口遇到 504 不能简单重复提交。本文用 OpenAI 的 X-Client-Request-Id 和 Gemini API 的指数退避建议,拆解请求标识、可重试错误、结果去重与人工复核的完整工作流。229 收藏 -
超长视频不能只靠一次请求和一段摘要解决。本文以长视频检索为例,拆解分段抽帧、时间轴索引、候选片段复核和证据回溯的工程流程,并给出可验收的结果格式。229 收藏 -
更换 Embedding 模型后,旧向量与新向量的维度可能不一致,直接覆盖索引会让写入、查询和回滚同时失控。本文以双索引迁移为主线,拆解维度核对、查询路由、后台回填和回滚验收。229 收藏 -
Embedding 模型切换后,向量维度、距离度量和索引构建参数可能同时变化,旧索引不能靠改字段继续复用。本文用 pgvector 的 vector(1536)、vector(3072) 与 HNSW 示例,给出双写迁移、验收和可回滚方案。222 收藏 -
大模型流式响应偶尔重复半句,通常不是模型把同一句生成了两遍,而是客户端重复消费增量块、混淆事件边界或把结束事件再次当成正文。本文从流式传输、UTF-8 解码和结束标记三个边界拆开排查方法。222 收藏