人工智能技术文章
-
同一批文档、相近的问题,向量检索却可能召回不同结果。本文从查询向量归一化、元数据过滤和评测样本三个边界入手,给出一个能复现波动、定位原因并验证修复的最小流程。311 收藏 -
RAG 处理 PDF、Excel 或 Markdown 表格时,固定长度切片容易丢失表头和来源。本文用行级知识块、metadata 和检索组合保留表格关系。311 收藏 -
AI 应用调用搜索、数据库或业务接口时,超时不只是返回一条错误消息。本文用 Go context 把截止时间、取消信号、工具结果和用户状态串成一条可验收的链路,说明何时停止、如何记录以及怎样避免重复执行。310 收藏 -
Hugging Face Inference Providers 可以让同一套客户端接入多个推理服务。本文从 provider=auto 的默认路由开始,说明何时固定具体 provider、如何设计 fallback、如何记录实际路由和响应字段,避免模型可用但结果格式悄悄变化。309 收藏 -
RAG 系统检索到了相关资料却仍然答非所问,通常不是模型单点失误。本文用一个可复现的小实验,依次检查召回内容、切片边界、排序分数和上下文拼接,最后给出可回归的验证方法。309 收藏 -
RAG 的 chunk overlap 不是越大越好。本文从标题层级切片、token 上限和检索命中三个可测边界出发,给出一套可复现的初始参数、验证方法和调整顺序。309 收藏 -
本地视觉模型服务最容易被忽略的问题,不是单次推理慢,而是上传任务无限排队。本文用 Python asyncio.Queue(maxsize=2) 建立背压,让生产者在队列满时等待,并用 inference_mode、task_done 和显存检查验证流水线是否真的稳定。308 收藏 -
AI Agent 工具调用失败时,不要无条件重放模型请求。本文用统一错误信封、错误码分层、原始 call_id 回传和有限重试预算,让模型只重试可修复问题,并避免副作用重复执行。307 收藏 -
MCP 2026-07-28 无状态改造移除了协议层会话,但业务状态仍需显式保存。文章用 basket_id、Mcp-Method、ttlMs、cacheScope 与 Trace Context 梳理迁移边界。305 收藏 -
用 LiteLLM Proxy 把多家模型收敛到统一入口,再通过虚拟 Key 做模型白名单、团队预算和速率限制,让客户端不用感知供应商差异。299 收藏 -
Responses API 的多轮工具调用关键在于保留 function_call 的 call_id,用 function_call_output 回传业务结果,并在后续请求中正确续接响应状态。本文用 Python 拆解完整循环、异常处理和状态保存取舍。299 收藏 -
AI 流式回答显示到一半、刷新后状态混乱,通常不是模型少返回了一句,而是增量缓冲、结束事件和可恢复状态没有分开处理。本文用一个浏览器流式阅读器示例拆开这条链路。298 收藏 -
AI Agent 在工具调用中容易遇到参数漂移:字段名变化、旧版本参数残留和失败后无法复现。本文用版本快照、字段校验与失败回放搭出一条可验收的处理链。297 收藏 -
向量检索返回相似度高的片段,不等于答案一定可靠。本文用一个轻量 Python 示例,把 query_points、score_threshold、source_id 和引用片段串成可验收的检索链,并处理空召回与低分结果。297 收藏 -
用 DataCollatorWithPadding 让 Transformers 按 batch 内最长文本动态补齐,并配合 attention_mask、截断和长度分桶减少无效推理计算。297 收藏