人工智能技术文章
-
本地大模型推理中,KV cache 容量和 batch size 共享显存预算。本文从输入长度、并发、TTFT、TPOT 与长尾延迟出发,给出可落地的配置起点、压测矩阵和超限回退策略。251 收藏 -
围绕 AI 提示词缓存的稳定前缀组织请求,说明固定指令、工具 schema 与动态问题的排列方法,并用 cached_tokens、cache_write_tokens 和版本化回滚定位缓存失效。357 收藏 -
分类评测集不均衡时,macro 与 micro 不是谁更高级的问题,而是按类别平均还是按样本汇总。本文用统一口径、混淆矩阵和复核清单解释两者差异。473 收藏 -
Agent 工具返回的文件路径不能直接信任。本文用工作区根目录、Path.resolve 和 relative_to 组成边界检查,处理绝对路径、目录穿越、符号链接与读写权限分离。381 收藏 -
流式 AI 输出不应在最后一段文字到达时直接入库。本文用 finish_reason、状态机和幂等键说明何时保存正式结果,何时保留 partial 草稿或等待工具调用。195 收藏 -
LoRA 合并只处理 adapter 权重,不会自动替你保存正确的 tokenizer。本文用一套可复用的核对脚本检查词表、特殊 token、长度配置和嵌入尺寸,避免合并模型上线后出现输入映射不一致。162 收藏 -
多模态请求的图片细节等级会改变视觉输入 token,但成本不能只看 low 或 high。本文比较 low、high、original、auto 的适用场景,并给出请求写法、成本拆分和质量复核方法。246 收藏 -
OCR 表格跨页合并不能简单拼接文本。本文从页级表格、重复表头、列位归一化和跨页断行四个边界入手,给出可落地的合并伪代码与结果检查清单。145 收藏 -
向量检索通常应先执行租户、权限、状态和时间等硬过滤,再做向量或混合召回与 rerank,最后应用阈值、去重和多样性检查,本文给出可落地的判断顺序。409 收藏 -
RAG 文档切片的 overlap 过大,会让相邻片段重复进入上下文,增加索引和推理成本。本文给出重叠比例、配置调整和验证指标。238 收藏 -
Responses API 的结构化输出不会自动校验工具返回值。本文用统一错误信封、function_call_output 和严格 JSON Schema 保留错误码、消息与可重试标记,并说明为什么还要保存原始工具结果。111 收藏 -
介绍视觉模型读取表格图片时的区域化证据链:用稳定 region_id 组织裁剪图和字段范围,结合多图输入与 JSON Schema 保存可回溯的字段证据,并处理成本、空值和跨页边界。312 收藏 -
RAG 中不要让模型猜来源。给每个检索片段保留稳定 chunk_id,让模型返回可校验的 citations,再由应用层回填标题、页码和原文位置。111 收藏 -
vLLM Prefix Caching 适合重复长前缀、长文档和多轮会话,但收益集中在 prefill。本文从前缀稳定性、开启配置、测量方法、缓存容量和多租户隔离几个方面判断是否值得使用。356 收藏 -
用 Ollama Modelfile 固化 SYSTEM 系统提示和 num_ctx 上下文长度,说明 ollama create、ollama show、ollama ps 的配合方式,以及服务环境和客户端覆盖配置的排查思路。403 收藏