人工智能技术文章
-
大模型接口出现 429 时,连续立刻再发往往只会让队列更长。本文按运行手册的节奏说明如何保留响应线索,区分请求数量、令牌总量与并发积压三类原因,再用限并发、缩短上下文和带抖动的退避把线上对话从拥塞中拉回来。432 收藏 -
科技周边 · 人工智能 | 3天前 | 人工智能 · api设计 · gemini · AI Agent Gemini Interactions API previous_interaction_id store=false 多轮状态
梳理 Gemini Interactions API 多轮状态的真实继承范围,说明 previous_interaction_id、交互级配置与 store=false 的取舍边界。432 收藏 -
大模型返回的 JSON 偶尔缺字段、枚举值漂移或混入解释文字时,不能只继续堆提示词。本文按输出稳定性、供应商能力和业务风险比较提示词约束、结构化输出与服务端校验,给出可落地的组合选择和验收门槛。431 收藏 -
多模态模型处理跨页 PDF 表格时,字段错位往往来自分页、表头和行号没有对齐。本文把 PDF 页面切片、表头继承、行号复核和低置信度回收串成一条可操作的排查链,给出结构化结果验收方法。430 收藏 -
科技周边 · 人工智能 | 2星期前 | openai · Responses API · AI应用开发 · OpenAI Responses API 上下文压缩 compaction conversation state
长对话和工具循环会不断消耗上下文。本文用 Go 拆解 Responses API 的 /responses/compact、type=compaction 项和续接请求,说明什么时候压缩、哪些状态不能丢,以及如何做回归检查。428 收藏 -
从 RAG 应用答非所问的现场出发,逐步检查文档切块、Embedding、向量召回、混合检索和上下文拼接,给出一套可复查的排查路径。427 收藏 -
科技周边 · 人工智能 | 2个月前 | 人工智能 · GenAI · opentelemetry · 可观测性 · AI工程 · 人工智能 链路追踪 GenAI OpenTelemetry AI可观测性 LLM网关 Token统计
围绕 AI 调用规模化后的日志散乱、模型字段不统一、token 成本不可见和隐私采集风险,讲解如何用 OpenTelemetry GenAI 字段建设统一观测架构。427 收藏 -
Hugging Face 的 hf_fs MCP 把仓库、存储、文档和论文入口收进一个接口。本文解释它解决的上下文问题、如何划定权限边界,以及接入前应该核对哪些事实和回退路径。427 收藏 -
Gemini API 的 URL Context 能读取公开网页,但应用不能只看模型有没有输出。本文用 Go 检查 url_context_result、引用标注、输入 token 与失败回退,建立一条可验收的网页上下文链路。426 收藏 -
MCP Tasks 把耗时工具调用变成可查询的任务,但取消不是简单发一个通知。本文按能力协商、任务状态、tasks/cancel 请求和客户端收口拆开可取消流程,说明如何处理竞态与终态边界。426 收藏 -
科技周边 · 人工智能 | 1个月前 | 前端 · 人工智能 · 用户体验 · 可访问性 · 流式输出 · AI对话 AbortController AbortSignal 流式输出 aria-live 停止生成
AI 对话的停止按钮不只是调用 abort()。要让用户、键盘操作和辅助技术都获得一致反馈,需要为每次请求新建 AbortController,正确收尾读取循环,并把生成、停止、失败状态放进合适的实时状态区域。425 收藏 -
把整张长图直接交给视觉模型,常见结果是文字区域太小、成本偏高且难以复核。本文用 OCR 返回的 boundingPoly 先定位目标区域,再把归一化坐标映射为像素矩形,最后用二次识别确认裁剪没有偏移。425 收藏 -
本文用知识库问答跑偏的真实工程场景,拆解 RAG 从问题改写、向量检索、重排过滤、分数阈值到引用检查的完整流程,帮助你把“模型乱答”改成可排查、可复查、可拒答的系统。419 收藏 -
客服回复提示词改了两句话,结果结构化字段合格率下降,才发现线上没有记录每条回答来自哪个版本。本文用样本对照、灰度比例、输出门禁和请求标识建立可回退的提示词发布流程。419 收藏 -
多轮对话变长后,简单截掉旧消息很容易让模型丢失用户约束。本文从上下文压缩的边界出发,拆解摘要漂移、关键事实遗漏和回放验收,用可重复的测试样例判断压缩是否真的可用。418 收藏