人工智能技术文章
-
LLM 输出 JSON 不稳定时,不能只靠提示词要求“返回 JSON”。本文用一个工单分类小项目拆解解析、JSON Schema 校验、错误分类和有限重试,并说明为什么业务失败不该混入格式重试。480 收藏 -
OCR 识别表格不能只保留文字,还要保存每个片段的坐标框,再通过行聚类、列排序和跨度判断重建二维结构。本文给出一套可落地的处理流程。147 收藏 -
Reranker 分数不是通用的相关性刻度。本文从分数归一化、候选集标注、分层阈值和 top-k 兜底四个方面,说明如何减少相关答案被过滤的问题。477 收藏 -
更换 embedding 模型时,先读取新旧模型的真实向量维度,再用模型版本、维度和距离度量建立双索引迁移边界,最后通过小批量回填验证后切换查询路由。498 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
向量索引不能只看查询速度。本文以 Redis 的 FLAT、HNSW 和 SVS-VAMANA 为例,拆开比较召回率、内存、写入维护与重建代价,并给出一套可复查的选型压测方法。485 收藏 -
图像问答不稳定,常常不是模型不会看,而是说明文字和视觉证据没有分层。本文给出冲突分类、证据优先级、结构化输入和人工复核的实用提示设计。404 收藏 -
Responses API 同时声明多个函数工具时,可用 tool_choice 的 allowed_tools 将当前轮次限制到指定子集,再用 auto、required 或 none 表达调用策略。本文给出参数结构、选择边界和服务端安全检查。463 收藏 -
结构化输出校验失败时,不要只记录 ValidationError。本文把原始响应保存、拒答与截断判断、JSON 解析、Schema 校验和业务校验拆开,给出一套可脱敏、可重放、可定位的应用层处理方式。324 收藏 -
多智能体系统出错时,单看模型调用或 HTTP 状态往往找不到根因。本文从一次用户任务出发,拆解 agent 委派、交接、工具调用和记忆读写的追踪边界,给出可回放的链路设计与检查清单。474 收藏 -
AI 推理延迟不能只看一个平均数:本文用 TTFT、TPOT/ITL 和端到端耗时拆开聊天、Agent、代码生成与批处理的观测口径,并给出排队、检索、prefill、decode 的定位方法。387 收藏 -
Embedding 文本切块不要只按固定字符数截断;应先保留主体、条件、动作、结果和例外,再用结构边界、适量 overlap 与可追溯元数据保护事实完整性。314 收藏 -
AI Agent 的短期上下文负责当前线程,长期存储负责跨会话复用。本文从边界、数据类型、写入检索和权限保留四个方面给出一套可落地的记忆设计方法。155 收藏 -
向量搜索选余弦距离还是内积,取决于 embedding 模型是否归一化,以及向量长度是否承载业务信息。本文用公式、Python 示例和选择表说明两者边界,并提醒区分相似度与数据库距离。260 收藏 -
RAG 检索结果太多时,不要只提高 top_k 再把无关片段塞给模型。本文用租户、文档类型、状态和更新时间说明如何先做元数据过滤,再做向量或混合检索,并根据过滤选择性调整召回策略。437 收藏