人工智能技术文章
-
Structured Outputs 严格模式要求字段全部写入 required。本文用 required 加 null 类型表达可选语义,并说明嵌套对象、额外属性、拒答和不完整响应的兼容边界。281 收藏 -
同一套 Claude API 请求看起来没有改,缓存却一直 miss,常见原因不是缓存没打开,而是断点之前混入了动态内容。本文用静态前缀、工具定义和 usage 字段梳理一套最小核对方法。280 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
AI 流式输出中途断开时,不要等完整响应才落库。应以请求唯一标识和片段序号保存增量快照,区分 partial、completed、interrupted 状态,并在重连时用幂等键避免重复拼接。278 收藏 -
多轮对话压缩不能只追求文本变短。本文用任务目标、已确认决策、硬约束、未完成动作、待确认问题和证据引用六类字段设计提示模板,并说明如何组合状态摘要与最近原文,减少上下文丢失和任务返工。278 收藏 -
RAG 文档切片太大或重叠过高,都会让召回上下文变长并拖慢回答。本文按 chunk size、overlap、top_k 和上下文预算拆开排查,用固定问题集找到兼顾证据完整性与延迟的参数组合。277 收藏 -
讲清 OpenAI Responses API 中 output_text 便捷文本与 output 完整输出项的区别,覆盖展示、结构化处理、工具调用、标注和流式读取等常见场景。277 收藏 -
量化校准数据不是随便凑一批样本。本文对比不同量化路径的校准要求,给出样本配置清单、输入契约检查法和精度回归排查步骤。276 收藏 -
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
用 Responses API 的 strict JSON Schema 约束工具参数,再通过 function_call_output 回传可解析结果,并说明如何单独约束最终 JSON 回复。274 收藏 -
本地大模型聊天效果差时,先检查 chat template 是否正确渲染 messages、assistant 回复起点和特殊 token,本文给出一套可回滚的排查清单。273 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
模型返回 JSON 时,缺字段不等于所有异常都能用默认值修复。本文用解析、归一化、验证三层设计兜底策略,区分可选字段、必填字段、类型错误和无法恢复的响应,并给出 Python 示例。272 收藏 -
MCP 工具返回长列表时,分页协议会直接影响 Agent 是否拿到完整且不重复的结果。本文从游标失效、排序稳定性和增量验收三个问题出发,给出可落地的返回字段与测试方法。269 收藏 -
知识库切片重叠率会同时影响边界语义、重复召回、索引成本和上下文长度。本文用 LangChain 与 Hugging Face 的切分思路说明参数起点、评测方法和不同语料的边界处理。268 收藏