人工智能技术文章
-
RAG 检索结果不要直接按 top_k 全量送入模型。本文用文档身份、规范化文本和语义多样性三层策略去重,再按系统指令、问题、证据与回答余量分配上下文预算,给出可迁移的 Python 实现与参数调优指标。357 收藏 -
vLLM Prefix Caching 适合重复长前缀、长文档和多轮会话,但收益集中在 prefill。本文从前缀稳定性、开启配置、测量方法、缓存容量和多租户隔离几个方面判断是否值得使用。356 收藏 -
RAG overlap 过高时,不要只看切片数量;应结合 chunk size 的相对比例、召回候选的公共文本和最终上下文长度判断,再用固定问题集对照调参。355 收藏 -
RAG 应用不要只返回一串链接。本文用 source_id、答案段落和引用集合建立可校验的对齐关系,并给出无证据、多来源冲突与前端展示的处理方式。354 收藏 -
RAG 明明已经写入知识库,回答却像没有检索到内容?从查询改写、文本分块、相似度阈值和召回日志四个位置建立一条可验证的排查路径。350 收藏 -
大模型流式响应偶尔停在半句时,不能只把已收到的字符串直接展示。本文用增量 JSON 缓冲、finish_reason 和重连状态拆开定位,并给出可复查的收口方案。348 收藏 -
模型服务出现限流、超时或参数错误时,AI 网关不能把所有失败都交给重试。本文从统一请求契约出发,拆分可降级、可重试和必须直返的错误,并用幂等键保护跨模型切换后的结果一致性。347 收藏 -
科技周边 · 人工智能 | 1个月前 | 人工智能 · gemini · 结构化输出 · 接口测试 · 结构化输出 JSON Schema Gemini 3 Function Calling 工具调用验收
Gemini 3 的工具调用和结构化输出解决的是两个不同阶段的问题:前者负责取得外部结果,后者约束最终回答。本文用订单查询场景拆开两段协议,给出 schema、工具结果、拒答和失败分支的验收方法。346 收藏 -
模型返回枚举值错误时,先区分 schema 不匹配、拒答和输出不完整,再用 JSON Schema 的 enum 约束允许值,并保存脱敏原始响应。本文给出结构化输出的约束、解析、重试和监控做法。345 收藏 -
用 JSONL 固定安全过滤回归样本的字段、动作和原因码,再按阶段定位误放行、误拦截与边界样本漂移。345 收藏 -
MCP elicitation/create 允许服务器在工具调用过程中向用户请求结构化补充信息。本文用一个配置向导场景拆解能力声明、JSON Schema、accept/decline/cancel 响应,以及为什么 API 密钥和支付信息不能放进表单模式。340 收藏 -
AI 流式输出最难防的不是一句脏话,而是外部内容诱导模型越权调用工具。本文用一个可落地的请求链说明权限隔离、增量输出过滤、审计字段和失败回收如何配合。338 收藏 -
Hugging Face Datasets 的 streaming 模式会返回 IterableDataset,按迭代按需读取远程或本地分片。本文给出变换、缓冲区打乱、多 worker、训练轮次和检查点恢复的生产写法。337 收藏 -
知识库删除原文时,不能只删业务数据库记录,还要依据稳定的 doc_id 清理 Qdrant 中的全部 points。本文说明 payload 设计、按过滤器删除、wait/ordering 选择,以及如何避免并发重建任务把旧向量重新写回。335 收藏 -
订单咨询一多,最难受的不是模型答得不通顺,而是下游拿到的字段时有时无。用 JSON Schema 约束输出、在服务端再做一次校验,并给拒答和缺字段留出口,能把自然语言解析变成可观察、可验收的业务步骤。333 收藏