人工智能技术文章
-
AI 推理延迟不能只看一个平均数:本文用 TTFT、TPOT/ITL 和端到端耗时拆开聊天、Agent、代码生成与批处理的观测口径,并给出排队、检索、prefill、decode 的定位方法。387 收藏 -
视觉表格识别前,先统一 xyxy 坐标、比例扩边和边界裁剪,再交给 Hugging Face image processor 做 resize、归一化等预处理。本文给出可复用代码和排查清单。387 收藏 -
从批次边界、吞吐控制、错误分流和幂等写入四个层面,说明 Embedding 批量生成如何稳定处理长文本、429、超时和进程重启。387 收藏 -
模型能接收更长输入,不代表它会更稳定地使用检索结果。本文从位置效应、候选重复和长文噪声解释原因,并给出混合召回、重排、去重与 token 预算的收敛做法。386 收藏 -
AI 评测集不要只放标准答案。把应答、应拒答和边界样本分开,记录 expected_action、拒答理由、人工标注和安全替代建议,再分别计算准确率、漏拒答率与拒答帮助度。385 收藏 -
OCR 通常先返回文本、坐标和置信度,不会直接给出可用的二维表。通过统一坐标、按垂直重叠聚类行、按横坐标排序并推断列锚点,可以重建表格关系,同时保留低置信度单元格供复核。385 收藏 -
余弦相似度异常,先别急着改阈值。本文用一段最小 Python 配方检查 Embedding 的维度、L2 范数、归一化、点积和向量库距离配置,帮助定位分数漂移的真正环节。383 收藏 -
Agent 工具返回的文件路径不能直接信任。本文用工作区根目录、Path.resolve 和 relative_to 组成边界检查,处理绝对路径、目录穿越、符号链接与读写权限分离。381 收藏 -
Tool calling 接入业务工具时,先用 JSON Schema 和应用层校验拦截模型参数问题,再把订单不存在、无权限等领域失败转换为稳定的工具结果。本文给出错误分层、Python 示例和重试边界。380 收藏 -
ONNX Runtime 动态量化中的 nodes_to_exclude 应按节点名称精确控制。本文给出节点清单、全量量化基线、差异定位、逐组复测和配置冻结的方法。377 收藏 -
Sentence Transformers 的 L2 归一化不会改变余弦方向,但会改变原始点积和部分距离。本文用对照实验说明何时开启 normalize_embeddings。372 收藏 -
AI 生成代码最容易失控的地方不是语法,而是修改范围。本文用单元测试、修改预算和 git diff 双重门禁,拆解如何让一次生成式改动保持可验收、可回退。366 收藏 -
LLM输出能解析不代表字段完整。本文从JSON Schema最小契约、响应状态归一化、字段缺失有限重试和上线观测四个方面,给出结构化输出的处理方案。364 收藏 -
MLflow Model Alias 可以把生产代码从固定模型版本号解耦出来。本文用 champion 别名串起模型注册、加载、发布切换和回滚边界,说明 Alias URI 的写法以及不能忽略的版本验证与审计记录。360 收藏 -
MCP 中 Resource 负责按 URI 提供可读取的上下文,Tool 负责按名称和参数执行能力。本文从发现消息、调用边界、权限审计和错误分层说明两者的实现方法。359 收藏