人工智能技术文章
-
MCP 服务端不能看到客户端声明了 elicitation 就直接发送任意模式。本文按初始化能力、form 与 url 分支、请求结果和失败回退,说明如何核对客户端支持范围并守住敏感信息边界。221 收藏 -
多模态模型处理长截图或复杂表格时,整图输入常把小字号和列关系一起压缩掉。本文用区域裁剪、坐标记录和字段映射三步,搭建一套可复核的表格识别流程,避免只看最终文本猜错位置。221 收藏 -
批量推理输入长度差异大时,固定 batch 会产生大量 padding。本文用 Hugging Face Transformers、PyTorch DataLoader 和 token 长度分桶说明配置方式,并给出显存、吞吐和结果顺序的排查清单。221 收藏 -
用 Moderations API 的 flagged、categories 和 category_scores 区分规则命中与业务误报,再把审核结果分成放行、人工复核和拒绝三条路径。218 收藏 -
Model Hardware Standard 把可编程设备的状态、操作和安全限制整理为代理可理解的驱动层。本文从 MHS 研究预览与官方站点出发,拆解接入前应保留的权限、确认和人工复核边界。216 收藏 -
AI 问答评测不稳定,通常不是模型分数本身的问题,而是提示、检索配置和数据集同时在变化。本文给出一套可重复的 RAG 评测拆分、数据字段和回归清单。215 收藏 -
工具调用参数校验失败时,不要直接重放可能产生副作用的工具。本文拆解 strict Schema、应用侧业务校验、tool_call_id 错误反馈、幂等键和有限重试的分工。215 收藏 -
大模型流式接口出现重复片段,通常不是模型把同一句话生成了两次,而是客户端把重试、重放或累计快照重复拼接。本文用可观测指标拆开增量事件、断线续传和去重边界。213 收藏 -
大模型接口返回 JSON 时,偶尔会带上 Markdown 代码围栏、解释文字或截断内容。本文从真实响应现场出发,给出 Go 解析、边界判断、重试与结构化响应约束的组合方案。213 收藏 -
重复把长文档或系统提示词发送给 Gemini API 时,可以用显式 Context Caching 保存公共上下文,再通过 cachedContents、TTL 和 usage.total_cached_tokens 验证缓存是否真的生效。209 收藏 -
关键词检索和向量检索各自找到了内容,合并后却出现重复段落、来源顺序混乱或引用丢失,问题往往出在结果融合阶段。本文用可运行的 Python 示例拆开去重、分组、来源优先级与引用回填,让多路 RAG 的合并结果可解释、可回归。208 收藏 -
RAG 检索结果过多时,不要只调小 top_k。本文拆分候选去重、重排、上下文压缩与预算装箱,给出可落地的选择规则、Python 示例和四项排查指标。207 收藏 -
AI Agent 调用外部工具超时后,不要把异常当空结果或无条件重试。通过 schema、参数校验、幂等键、未知状态和恢复队列,设计可判断、可追踪、可继续处理的结果。203 收藏 -
Embedding 模型一换,向量维度可能跟着变化,批量写入时轻则报错,重则让新旧数据混在同一索引里。本文用维度契约、批量预检、双索引切换和回滚清单,把模型升级变成可验收的入库流程。202 收藏 -
接入远程 MCP 服务器时,不要把工具发现当成授权。本文从工具 allowlist、来源校验、OAuth 受众绑定和审计记录四个边界,整理一套可复核的权限收口方法。202 收藏