人工智能技术文章
-
多模态模型读图前,缩放与裁切会改变细节、图块、token和坐标关系。本文用任务分类、等比缩放、裁切偏移与对照实验说明如何在识别效果和成本之间取舍。247 收藏 -
多模态请求的图片细节等级会改变视觉输入 token,但成本不能只看 low 或 high。本文比较 low、high、original、auto 的适用场景,并给出请求写法、成本拆分和质量复核方法。246 收藏 -
RAG 的关键词检索和向量检索出现重复结果时,应按文档 ID 去重、按切片 ID 保留证据,并用 RRF 处理两路分数尺度不同的问题。244 收藏 -
PDF 表格在 RAG 中不能只靠正文抽取。本文用摄取、元素表示和检索核对三层方法,说明如何保留表格结构、图片与页码元数据。244 收藏 -
把 MCP tools/call 接进 Go 服务后,真正难处理的不是发出 JSON-RPC 请求,而是超时、取消、重试和审计如何共同收口。本文用一个可运行的调用包装器,把总预算、单次调用、重试边界和结果记录拆开。243 收藏 -
同一个模型换了提示词却突然复读、接不上回答,问题常常不在采样参数,而在 Transformers 的 chat template。本文用 apply_chat_template 对比 add_generation_prompt、重复 special tokens 和 continue_final_message 的边界,再用 token 数量与首个生成片段完成验收。243 收藏 -
RAG 知识库答非所问,通常不是模型单独失灵,而是切分、召回过滤和重排之间没有形成可验证的证据链。本文用一组可复现的检查方法定位问题,并给出适合上线前评测的调整顺序。243 收藏 -
MCP 长任务如果只有最终结果,客户端很难判断服务是否卡住。本文用一个批量索引工具拆解 progressToken 的关联规则、notifications/progress 的递增约束、未知 total 的处理,以及完成、超时、取消时如何收口。241 收藏 -
AI 流式接口不能只靠某个文本片段判断结束。本文用事件序列拆解增量内容、完成事件、失败状态与断线续接,给出客户端状态机、重复片段处理和验收清单。239 收藏 -
Gemini 3 的 function calling 在手动维护多轮历史时,不能丢掉 thought_signature。本文用一个最小工具调用链说明官方 SDK、REST 手写历史和错误降级的处理边界。238 收藏 -
RAG 文档切片的 overlap 过大,会让相邻片段重复进入上下文,增加索引和推理成本。本文给出重叠比例、配置调整和验证指标。238 收藏 -
RAG 可以先用双编码器或 BM25 召回候选,再让 CrossEncoder 对查询和候选片段逐对打分,按分数取最终 Top-K。本文给出可运行的 Python 写法,并说明候选规模、分数和延迟边界。237 收藏 -
科技周边 · 人工智能 | 2个月前 | go · Context · 流式处理 · 人工智能 · sse · 重试 · OpenAI Go context 流式输出 SSE Responses API 断线重试
Go 服务接入 OpenAI Responses API 的流式输出时,真正难的是事件边界、重复片段、断线重试和请求取消。本文用官方 openai-go SDK 拆解 SSE 事件,给出增量文本拼接、单次重试边界和 context 超时处理的最小流程。236 收藏 -
AI Agent 的工具调用失败可能是拒绝、超时或结果未知。本文给出失败分类、稳定幂等键、结果复用、指数退避与人工接管的完整设计,避免重复副作用。236 收藏 -
长文档切分不应只看字符数。本文用标题、段落、代码块和 token 预算建立语义分块,为每块保存章节元数据,再通过 Embedding 建索引并在召回时补回邻近上下文。234 收藏