人工智能技术文章
-
围绕 MCP Tasks 的任务句柄、状态轮询、输入等待、终态取数和断线恢复,整理一套不依赖具体厂商编排的客户端处理边界。260 收藏 -
向量搜索选余弦距离还是内积,取决于 embedding 模型是否归一化,以及向量长度是否承载业务信息。本文用公式、Python 示例和选择表说明两者边界,并提醒区分相似度与数据库距离。260 收藏 -
RAG 问答里反复出现相同段落,通常不是模型突然变笨,而是切块重叠、相邻片段、候选数量和证据合并共同造成的。本文用一组可复现的检索样例分层排查重复来源,再说明 MMR、多样性阈值和最终去重应该放在哪一层。259 收藏 -
Embedding 模型更换后,旧文档向量与新查询向量可能不在同一个向量空间;即使维度相同,语义方向、归一化和提示词约定也可能不同。本文给出双写、全量回填、离线验收、别名切换和回滚方案。259 收藏 -
多模态模型的图片成本不只取决于文件大小,还取决于处理器如何把像素切成视觉 token。本文以 Hugging Face Transformers 的 processor 为参照,说明服务端怎样读取 min_pixels、max_pixels,按像素预算等比例缩放,再决定压缩、裁剪和监控字段。259 收藏 -
本地量化模型显存不足时,先拆分权重、KV cache 和计算缓冲区,再按真实输入选择上下文长度。本文给出 2048、4096、8192 的起点判断,以及上下文、KV 缓存精度、批大小和量化档位的调节顺序。258 收藏 -
Gemini API 的 Context Caching 适合反复使用同一份长上下文的场景。本文用 cachedContents.create 创建缓存,再把 cache.name 绑定到 generateContent,讲清缓存内容、动态问题和 TTL 的边界。257 收藏 -
大模型返回的工具参数只是建议,不是业务事实。本文用 Go 做一个小型工具调用网关,演示如何校验参数、限制动作范围、用请求键去重,并在失败后安全重试。255 收藏 -
排查大模型多轮工具调用中的上下文丢失,梳理 tool_call_id、并行结果配对和消息回放验收。252 收藏 -
从一个知识库问答召回率下降的现场出发,拆解查询与文档向量任务类型、topK基线和Recall@K验证方法,帮助定位RAG检索问题到底在编码、切块还是排序。251 收藏 -
本地大模型推理中,KV cache 容量和 batch size 共享显存预算。本文从输入长度、并发、TTFT、TPOT 与长尾延迟出发,给出可落地的配置起点、压测矩阵和超限回退策略。251 收藏 -
科技周边 · 人工智能 | 2星期前 | 异步任务 · 人工智能 · openai · 工程实践 · OpenAI Batch API 部分结果 cancelling cancelled output_file_id error_file_id
OpenAI Batch API 取消请求后不会瞬间变成最终状态。本文用 cancelling、cancelled、output_file_id、error_file_id 和 request_counts 拆开取消收口流程,说明如何保留部分成功结果、核对失败行,并避免把取消误判成整批回滚。250 收藏 -
多模态请求的图片细节等级会改变视觉输入 token,但成本不能只看 low 或 high。本文比较 low、high、original、auto 的适用场景,并给出请求写法、成本拆分和质量复核方法。246 收藏 -
RAG 的关键词检索和向量检索出现重复结果时,应按文档 ID 去重、按切片 ID 保留证据,并用 RRF 处理两路分数尺度不同的问题。244 收藏 -
PDF 表格在 RAG 中不能只靠正文抽取。本文用摄取、元素表示和检索核对三层方法,说明如何保留表格结构、图片与页码元数据。244 收藏