人工智能技术文章
-
RAG 检索结果太多时,不要只提高 top_k 再把无关片段塞给模型。本文用租户、文档类型、状态和更新时间说明如何先做元数据过滤,再做向量或混合检索,并根据过滤选择性调整召回策略。437 收藏 -
Hugging Face Responses API 可以在同一个 input 数组中组合 input_text 与 input_image。本文用 Python 和 OpenAI SDK 说明请求结构,并按令牌权限、模型路由、图片 URL 和输出字段拆解常见失败原因。392 收藏 -
讲清 OpenAI Responses API 中 output_text 便捷文本与 output 完整输出项的区别,覆盖展示、结构化处理、工具调用、标注和流式读取等常见场景。277 收藏 -
用 Responses API 的 strict JSON Schema 约束工具参数,再通过 function_call_output 回传可解析结果,并说明如何单独约束最终 JSON 回复。274 收藏 -
GPT-6 Astra API 限量开放期间,应用应区分访问资格、参数错误与 429/5xx 临时故障,再按能力档案选择备用模型,并记录实际模型与降级原因。192 收藏 -
模型能接收更长输入,不代表它会更稳定地使用检索结果。本文从位置效应、候选重复和长文噪声解释原因,并给出混合召回、重排、去重与 token 预算的收敛做法。386 收藏 -
AI 流式输出中途断开时,不要等完整响应才落库。应以请求唯一标识和片段序号保存增量快照,区分 partial、completed、interrupted 状态,并在重连时用幂等键避免重复拼接。278 收藏 -
LoRA 微调效果不只取决于 rank 和学习率,训练样本的角色、模板、结束标记与推理入口也必须保持一致。本文用 messages 示例说明如何固定这份格式契约。426 收藏 -
AI 评测集不要只放标准答案。把应答、应拒答和边界样本分开,记录 expected_action、拒答理由、人工标注和安全替代建议,再分别计算准确率、漏拒答率与拒答帮助度。385 收藏 -
Prompt 缓存命中率下降时,先比较最终渲染前缀而不是源模板。本文用 cached_tokens、prefix hash、模型设置和动态字段边界给出一套可复查的排查方法。487 收藏 -
模型输出 JSON 偶尔带有 Markdown 围栏时,先判断拒答和截断状态,再只清理首尾围栏,最后用 encoding/json 解码并执行字段级业务校验。398 收藏 -
多模态模型的图片成本不只取决于文件大小,还取决于处理器如何把像素切成视觉 token。本文以 Hugging Face Transformers 的 processor 为参照,说明服务端怎样读取 min_pixels、max_pixels,按像素预算等比例缩放,再决定压缩、裁剪和监控字段。259 收藏 -
Embedding 模型更换后,旧文档向量与新查询向量可能不在同一个向量空间;即使维度相同,语义方向、归一化和提示词约定也可能不同。本文给出双写、全量回填、离线验收、别名切换和回滚方案。259 收藏 -
本地大模型量化后变慢,不一定是量化本身造成的。本文用显存峰值、首 token 延迟、生成 token/s 和上下文长度的对照实验,区分权重显存压力与 KV Cache 上下文瓶颈,并比较 4/8 bit、缓存卸载和量化缓存的选择。433 收藏 -
AI Agent 工具调用失败时,不要无条件重放模型请求。本文用统一错误信封、错误码分层、原始 call_id 回传和有限重试预算,让模型只重试可修复问题,并避免副作用重复执行。307 收藏