人工智能技术文章
-
从一个知识库问答召回率下降的现场出发,拆解查询与文档向量任务类型、topK基线和Recall@K验证方法,帮助定位RAG检索问题到底在编码、切块还是排序。251 收藏 -
科技周边 · 人工智能 | 2星期前 | 异步任务 · 人工智能 · openai · 工程实践 · Batch API · OpenAI Batch API 部分结果 cancelling cancelled output_file_id error_file_id
OpenAI Batch API 取消请求后不会瞬间变成最终状态。本文用 cancelling、cancelled、output_file_id、error_file_id 和 request_counts 拆开取消收口流程,说明如何保留部分成功结果、核对失败行,并避免把取消误判成整批回滚。250 收藏 -
RAG 的关键词检索和向量检索出现重复结果时,应按文档 ID 去重、按切片 ID 保留证据,并用 RRF 处理两路分数尺度不同的问题。244 收藏 -
PDF 表格在 RAG 中不能只靠正文抽取。本文用摄取、元素表示和检索核对三层方法,说明如何保留表格结构、图片与页码元数据。244 收藏 -
把 MCP tools/call 接进 Go 服务后,真正难处理的不是发出 JSON-RPC 请求,而是超时、取消、重试和审计如何共同收口。本文用一个可运行的调用包装器,把总预算、单次调用、重试边界和结果记录拆开。243 收藏 -
同一个模型换了提示词却突然复读、接不上回答,问题常常不在采样参数,而在 Transformers 的 chat template。本文用 apply_chat_template 对比 add_generation_prompt、重复 special tokens 和 continue_final_message 的边界,再用 token 数量与首个生成片段完成验收。243 收藏 -
RAG 知识库答非所问,通常不是模型单独失灵,而是切分、召回过滤和重排之间没有形成可验证的证据链。本文用一组可复现的检查方法定位问题,并给出适合上线前评测的调整顺序。243 收藏 -
MCP 长任务如果只有最终结果,客户端很难判断服务是否卡住。本文用一个批量索引工具拆解 progressToken 的关联规则、notifications/progress 的递增约束、未知 total 的处理,以及完成、超时、取消时如何收口。241 收藏 -
AI 流式接口不能只靠某个文本片段判断结束。本文用事件序列拆解增量内容、完成事件、失败状态与断线续接,给出客户端状态机、重复片段处理和验收清单。239 收藏 -
Gemini 3 的 function calling 在手动维护多轮历史时,不能丢掉 thought_signature。本文用一个最小工具调用链说明官方 SDK、REST 手写历史和错误降级的处理边界。238 收藏 -
RAG 可以先用双编码器或 BM25 召回候选,再让 CrossEncoder 对查询和候选片段逐对打分,按分数取最终 Top-K。本文给出可运行的 Python 写法,并说明候选规模、分数和延迟边界。237 收藏 -
科技周边 · 人工智能 | 1个月前 | go · Context · 流式处理 · 人工智能 · openai api · sse · 重试 · OpenAI Go context 流式输出 SSE Responses API 断线重试
Go 服务接入 OpenAI Responses API 的流式输出时,真正难的是事件边界、重复片段、断线重试和请求取消。本文用官方 openai-go SDK 拆解 SSE 事件,给出增量文本拼接、单次重试边界和 context 超时处理的最小流程。236 收藏 -
本文说明 WebGPU 在浏览器端 AI 推理中的适用边界:如何检测支持情况,如何写最小可用示例,如何在不可用时降级到服务端或 Web Worker,并给出性能和安全检查点。234 收藏 -
OCR 结果进入 RAG 前不要只保留拼接文本。本文用统一文本块保存 source_id、页码、版面多边形和字符范围,并说明切块、向量召回与回答引用如何保持同一条证据链。233 收藏 -
接入远程工具时,真正需要验收的是工具白名单、调用暂停、审批结果与工具输出的关联链路。本文用只读查询场景拆开发现、确认、拒绝和故障恢复的边界。232 收藏