人工智能技术文章
-
多轮对话一旦超过模型上下文窗口,常见表现不是单纯报错,还包括旧约束丢失、工具参数变长和响应质量波动。本文用一个可复现的 token 预算实验,拆解消息裁剪、摘要保留与最近轮次保护的组合策略。361 收藏 -
MCP 中 Resource 负责按 URI 提供可读取的上下文,Tool 负责按名称和参数执行能力。本文从发现消息、调用边界、权限审计和错误分层说明两者的实现方法。359 收藏 -
OpenAI Responses API 的推理项不是普通文本,手动管理多轮上下文时要保留完整 reasoning item。本文拆解 reasoning.encrypted_content、include 参数和函数调用续接的验收边界,避免第二轮请求丢上下文。357 收藏 -
AI Agent 的超时不能只设一个总秒数。把模型等待、工具调用和整条任务预算分开,才能区分慢在哪里、及时停止无效工作,并在重试与回退时保留可核对的状态。357 收藏 -
围绕 AI 提示词缓存的稳定前缀组织请求,说明固定指令、工具 schema 与动态问题的排列方法,并用 cached_tokens、cache_write_tokens 和版本化回滚定位缓存失效。357 收藏 -
vLLM Prefix Caching 适合重复长前缀、长文档和多轮会话,但收益集中在 prefill。本文从前缀稳定性、开启配置、测量方法、缓存容量和多租户隔离几个方面判断是否值得使用。356 收藏 -
RAG overlap 过高时,不要只看切片数量;应结合 chunk size 的相对比例、召回候选的公共文本和最终上下文长度判断,再用固定问题集对照调参。355 收藏 -
RAG 明明已经写入知识库,回答却像没有检索到内容?从查询改写、文本分块、相似度阈值和召回日志四个位置建立一条可验证的排查路径。350 收藏 -
大模型流式响应偶尔停在半句时,不能只把已收到的字符串直接展示。本文用增量 JSON 缓冲、finish_reason 和重连状态拆开定位,并给出可复查的收口方案。348 收藏 -
模型服务出现限流、超时或参数错误时,AI 网关不能把所有失败都交给重试。本文从统一请求契约出发,拆分可降级、可重试和必须直返的错误,并用幂等键保护跨模型切换后的结果一致性。347 收藏 -
科技周边 · 人工智能 | 3星期前 | 人工智能 · gemini · function calling · 结构化输出 · 接口测试 · 结构化输出 JSON Schema Gemini 3 Function Calling 工具调用验收
Gemini 3 的工具调用和结构化输出解决的是两个不同阶段的问题:前者负责取得外部结果,后者约束最终回答。本文用订单查询场景拆开两段协议,给出 schema、工具结果、拒答和失败分支的验收方法。346 收藏 -
模型返回枚举值错误时,先区分 schema 不匹配、拒答和输出不完整,再用 JSON Schema 的 enum 约束允许值,并保存脱敏原始响应。本文给出结构化输出的约束、解析、重试和监控做法。345 收藏 -
用 JSONL 固定安全过滤回归样本的字段、动作和原因码,再按阶段定位误放行、误拦截与边界样本漂移。345 收藏 -
AI 流式输出最难防的不是一句脏话,而是外部内容诱导模型越权调用工具。本文用一个可落地的请求链说明权限隔离、增量输出过滤、审计字段和失败回收如何配合。338 收藏 -
知识库删除原文时,不能只删业务数据库记录,还要依据稳定的 doc_id 清理 Qdrant 中的全部 points。本文说明 payload 设计、按过滤器删除、wait/ordering 选择,以及如何避免并发重建任务把旧向量重新写回。335 收藏