人工智能技术文章
-
RAG 知识库把长文档切成片段后,最容易丢掉的是标题层级。本文用一个产品手册场景说明如何把章节路径随片段保存,让检索结果保留上下文,减少同名字段和跨章节误答。182 收藏 -
AI 流式回答显示到一半、刷新后状态混乱,通常不是模型少返回了一句,而是增量缓冲、结束事件和可恢复状态没有分开处理。本文用一个浏览器流式阅读器示例拆开这条链路。298 收藏 -
流式调用工具时,参数 JSON 会被拆成多个增量事件,不能把每个片段直接解析。本文用 buffer、JSON.parse 和状态恢复拆开半包边界,给出失败重试与重复调用的防线。197 收藏 -
向量检索的分数阈值不能照抄一个固定数字。本文以 Go 的候选分层流程为例,说明如何先理解距离方向,再用 score_threshold、候选数量和低相关兜底共同控制 RAG 答案质量。172 收藏 -
向量检索返回相似度高的片段,不等于答案一定可靠。本文用一个轻量 Python 示例,把 query_points、score_threshold、source_id 和引用片段串成可验收的检索链,并处理空召回与低分结果。297 收藏 -
RAG 应用把检索结果直接拼进提示词,常会遇到重复段落挤占上下文、引用指向不稳定和答案被相似文档带偏的问题。本文用一条可回放的数据流说明候选文档如何去重、截断并组成引用上下文。146 收藏 -
RAG 检索命中并不等于答案可靠。本文从文档切块边界、条件与例外的证据链、引用片段校验三个角度,说明如何定位答案被带偏的原因并建立可复查的回归检查。385 收藏 -
RAG 检索命中文档却只能生成很短的答案,往往不是模型突然变笨,而是切片边界、重叠窗口和引用片段没有对齐。本文用一个内部知识库场景说明如何逐层调优,并保留可验证的证据。286 收藏 -
Anthropic Prompt Caching 的关键不在于盲目加 cache_control,而在于把断点放在稳定前缀末尾,再从 cache_creation_input_tokens 和 cache_read_input_tokens 核对是否真正命中。本文用 Python Messages API 示例说明断点、20 个区块回看窗口、TTL 与成本判断。176 收藏 -
多模态请求总超时通常不是单一网络问题:图片尺寸、编码体积、视觉分辨率和重试策略会共同放大耗时。本文用一条可观测链路拆解预处理、请求超时、重试边界和最终降级。164 收藏 -
科技周边 · 人工智能 | 1星期前 | websocket · 人工智能 · gemini · 实时语音 · Gemini Live API session resumption SessionResumptionUpdate GoAway
Gemini Live API 的 WebSocket 连接会周期性结束,单纯重连会丢掉上下文。本文用 session resumption 保存最新恢复句柄,再结合 GoAway.timeLeft、generationComplete 和上下文压缩处理重连时机与数据边界。436 收藏 -
更换 Embedding 模型后,旧向量与新向量的维度可能不一致,直接覆盖索引会让写入、查询和回滚同时失控。本文以双索引迁移为主线,拆解维度核对、查询路由、后台回填和回滚验收。229 收藏 -
科技周边 · 人工智能 | 1星期前 | 人工智能 · api设计 · Google AI · Gemini API · Context Caching · Gemini API Context Caching cachedContent 长提示词 generateContent
Gemini API 的 Context Caching 适合反复使用同一份长上下文的场景。本文用 cachedContents.create 创建缓存,再把 cache.name 绑定到 generateContent,讲清缓存内容、动态问题和 TTL 的边界。257 收藏 -
大模型返回的 JSON 偶尔缺字段、枚举值漂移或混入解释文字时,不能只继续堆提示词。本文按输出稳定性、供应商能力和业务风险比较提示词约束、结构化输出与服务端校验,给出可落地的组合选择和验收门槛。431 收藏 -
向量库里明明有数据,检索却返回空结果,常见根因不是数据库坏了,而是 embedding 维度、归一化方式和查询链路没有对齐。本文用一个最小 Go 实验把排查顺序固定下来。410 收藏