人工智能技术文章
-
批量推理入口如果直接为每个请求创建 goroutine,短时间内就会把下游模型服务和本地内存一起推高。本文用 Go 的 channel 信号量限制并发,配合 context 取消、结果回收和失败清理,给出一条可以验收的控制路径。331 收藏 -
大模型评测中的长答案偏好,往往和位置偏差、格式线索混在一起。本文用成对盲评、交换答案位置和重复试验拆开这几个因素,并给出可复核的 Python 验收流程。329 收藏 -
多轮对话越聊越长时,直接截掉旧消息会丢失用户约束,完全保留又会推高延迟和成本。本文给出摘要触发点、最近消息窗口和关键事实保留的组合方案,并用可回放的检查方式判断压缩后对话是否仍然可靠。328 收藏 -
Go 服务接入 Responses API 的流式输出后,最难排查的不是连接建立,而是中途断流、客户端取消和重试重复。本文用事件序列、Context 和请求日志拆开问题,给出可回滚的排查与修复方案。326 收藏 -
RAG 应用不能把最高相似度直接当成答案可信度。本文用可复现的分层规则,把 query_embedding、similarity_score、上下文预算和引用保留串成一条检索到回答的质量控制链。325 收藏 -
结构化输出校验失败时,不要只记录 ValidationError。本文把原始响应保存、拒答与截断判断、JSON 解析、Schema 校验和业务校验拆开,给出一套可脱敏、可重放、可定位的应用层处理方式。324 收藏 -
流式 AI 接口返回的是连续事件而不是一段完整文本。本文用浏览器 ReadableStream 拆解 delta、done、缓冲区与断线续传的边界,给出可落地的拼接方案。323 收藏 -
用 MySQL JSON_TABLE 将订单 JSON 中的商品与批次嵌套数组展开成可查询的行,解释 NESTED PATH 的路径继承、行扩展、空数组补 NULL,以及 ON EMPTY 与 ON ERROR 的边界。322 收藏 -
Gemini API 的 URL Context 能读取公开网页,但应用不能只看模型有没有输出。本文用 Go 检查 url_context_result、引用标注、输入 token 与失败回退,建立一条可验收的网页上下文链路。320 收藏 -
RAG 遇到订单号、设备编号、产品型号等精确词时,单纯向量检索可能把关键文档排到后面。本文用关键词检索加向量检索的混合召回,再用 RRF 或可解释权重合并结果。320 收藏 -
多模态批处理完成后,输入行与输出行可能顺序不同,失败请求也可能单独落在错误文件。本文用 custom_id 建立稳定主键,再按 JSONL 逐行解析、分离成功与失败,并给出可重跑而不重复记账的对账流程。319 收藏 -
科技周边 · 人工智能 | 5天前 | 人工智能 · ai agent · json schema · 工程实践 · 函数调用 · 参数校验 AI Agent JSON Schema 工具调用 tool use
AI Agent 调用工具时经常漏传必填字段,问题通常不在提示词,而在工具契约没有收紧。本文用 JSON Schema 拆分必填、类型、额外字段和失败回传,给出可落地的校验与重试边界。316 收藏 -
Embedding 文本切块不要只按固定字符数截断;应先保留主体、条件、动作、结果和例外,再用结构边界、适量 overlap 与可追溯元数据保护事实完整性。314 收藏 -
Embedding 模型升级或调整 dimensions 后,旧向量、查询向量和数据库索引可能不再兼容。本文用维度契约、双写灰度和检索验收三步,说明如何安全迁移并避免静默召回下降。313 收藏 -
OpenAI Responses API 进入后台模式后,response.completed 会通过 Webhook 通知服务端。本文用 Python 说明如何保留原始请求体、调用官方 SDK 验证签名、处理时间窗口与重复事件,避免把未验证的回调直接当成任务完成信号。312 收藏