人工智能技术文章
-
OCR 识别表格不能只保留文字,还要保存每个片段的坐标框,再通过行聚类、列排序和跨度判断重建二维结构。本文给出一套可落地的处理流程。147 收藏 -
embedding 归一化不是简单打开一个开关:先统一 query 与 document 的向量契约,再检查池化、attention_mask 和相似度度量。本文给出两种配置方式和一套可复用的排查清单。147 收藏 -
RAG 应用把检索结果直接拼进提示词,常会遇到重复段落挤占上下文、引用指向不稳定和答案被相似文档带偏的问题。本文用一条可回放的数据流说明候选文档如何去重、截断并组成引用上下文。146 收藏 -
Responses API 一次返回多个 function_call 时,不要只处理第一项;保留完整 response.output,按每个 call_id 执行工具并逐条回传 function_call_output,才能避免结果串线。146 收藏 -
在一次请求的流式窗口发生中断时,重发与否是关键风险点。本文给出以请求 ID、幂等键、状态回放与回退策略构成的恢复闭环。145 收藏 -
OCR 表格跨页合并不能简单拼接文本。本文从页级表格、重复表头、列位归一化和跨页断行四个边界入手,给出可落地的合并伪代码与结果检查清单。145 收藏 -
向量检索召回很多无关片段,通常不是单一模型失效,而是候选范围、相似度阈值和最终排序没有分层。本文用一个文档问答场景拆开召回噪声的定位路径,说明元数据过滤、score_threshold、候选集放大和重排的使用边界。141 收藏 -
RAG 应用回答看似流畅却总带错文档,通常不是模型突然失常,而是切分、召回和证据核对没有连成一条可追踪链路。本文用一个知识库排障场景,拆解如何定位错召回并验证修复效果。141 收藏 -
模型没有返回答案时,不能只看空字符串或 HTTP 状态码。本文把提示被拦截、候选被安全过滤、正常截断和服务异常分开,给出统一状态判断、用户提示与回归验收的方法。140 收藏 -
围绕 GLM-5.3-Flash 的图文输入场景,拆开消息、抽取字段与校验层,给出一套不把模型输出直接当事实的结构化抽取边界。140 收藏 -
AI Agent 执行长任务时,真正难的是中途失败后从哪里继续。本文围绕 checkpoint、恢复点和幂等回放,拆解状态保存、重启恢复、重复执行与回归验收的工程边界。132 收藏 -
PDF 图表检索失败时,先区分抽取、模态 embedding、向量集合和视觉重排四层。本文用固定回归样本和配置检查,定位图表到底在哪一层丢失。132 收藏 -
视觉模型遇到 20MB 以上图片时,真正棘手的是尺寸预算、上传方式和重试边界同时变化。本文从请求前预缩放、分块上传到失败回收,拆解一条可验证的图片输入链路,并说明什么时候应该拒绝重试。124 收藏 -
量化模型精度下降时,不要只看一个总分。本文用固定输入、配对预测和分桶误差,区分评测条件不一致、长输入敏感与校准集覆盖不足,并给出可复用的对照脚本。124 收藏 -
远程 HTTP MCP 的 OAuth 授权不能只把 Bearer token 透传过去。客户端要以 MCP 服务器的 canonical URI 作为 resource,同时放入授权请求和令牌请求;服务端还要校验 token 是否确实签发给自己。本文用一个最小实现拆开这条受众绑定链路,并说明 401、403 与跨服务器误用的边界。123 收藏