人工智能技术文章
-
Diffusers 单个 LoRA 融合后可先 unfuse_lora 恢复基础权重,再卸载适配器;多 LoRA 或已保存重载的融合模型应重新加载原始基础模型。291 收藏 -
RAG 不应该把向量召回的所有片段直接塞进上下文。本文用 reranker 重排候选片段,再用 token 预算、单片段上限和来源去重装配最终上下文,给出可观测的参数与 Python 示例。281 收藏 -
Structured Outputs 严格模式要求字段全部写入 required。本文用 required 加 null 类型表达可选语义,并说明嵌套对象、额外属性、拒答和不完整响应的兼容边界。281 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
AI 流式输出中途断开时,不要等完整响应才落库。应以请求唯一标识和片段序号保存增量快照,区分 partial、completed、interrupted 状态,并在重连时用幂等键避免重复拼接。278 收藏 -
多轮对话压缩不能只追求文本变短。本文用任务目标、已确认决策、硬约束、未完成动作、待确认问题和证据引用六类字段设计提示模板,并说明如何组合状态摘要与最近原文,减少上下文丢失和任务返工。278 收藏 -
讲清 OpenAI Responses API 中 output_text 便捷文本与 output 完整输出项的区别,覆盖展示、结构化处理、工具调用、标注和流式读取等常见场景。277 收藏 -
量化校准数据不是随便凑一批样本。本文对比不同量化路径的校准要求,给出样本配置清单、输入契约检查法和精度回归排查步骤。276 收藏 -
用 Responses API 的 strict JSON Schema 约束工具参数,再通过 function_call_output 回传可解析结果,并说明如何单独约束最终 JSON 回复。274 收藏 -
模型返回 JSON 时,缺字段不等于所有异常都能用默认值修复。本文用解析、归一化、验证三层设计兜底策略,区分可选字段、必填字段、类型错误和无法恢复的响应,并给出 Python 示例。272 收藏 -
知识库切片重叠率会同时影响边界语义、重复召回、索引成本和上下文长度。本文用 LangChain 与 Hugging Face 的切分思路说明参数起点、评测方法和不同语料的边界处理。268 收藏 -
在同一个基础模型上预加载多个 PEFT LoRA 适配器,使用唯一名称和 set_adapter 按任务切换,并说明 delete_adapter、unload 与 hotswap 的生命周期边界。268 收藏 -
GradScaler 会在反缩放后的梯度含 inf 或 NaN 时跳过对应优化器的 step。本文说明单优化器、多优化器、scale 回退与学习率调度器的判断边界。268 收藏 -
AI Embedding 批量请求变慢时,先把客户端准备、网络往返、服务端排队和模型计算拆开记录,再用固定文本与批次对照区分瓶颈;同时核对输出维度和向量库 schema,避免把维度不一致误判成网络问题。264 收藏 -
以 Hugging Face 风格工具调用为例,说明 JSON Schema、tool_calls 参数形状与 Pydantic/业务规则校验的排查方法。264 收藏