人工智能技术文章
-
AI Embedding 批量请求变慢时,先把客户端准备、网络往返、服务端排队和模型计算拆开记录,再用固定文本与批次对照区分瓶颈;同时核对输出维度和向量库 schema,避免把维度不一致误判成网络问题。264 收藏 -
以 Hugging Face 风格工具调用为例,说明 JSON Schema、tool_calls 参数形状与 Pydantic/业务规则校验的排查方法。264 收藏 -
向量检索的 top_k 越大不一定让 RAG 答案更好。本文用一个可运行的 Python 小实验说明如何按 source_id 分组、保留上下文多样性,再把有限的候选片段交给生成模型。261 收藏 -
通过最小化工具参数、固定工作区根目录、规范化路径和区分读写审批,限制 AI Agent 越权访问文件,并用结构化拒绝结果和日志保留可追踪性。261 收藏 -
多模型推理服务常见的问题不是请求发不出去,而是任务一拥而上把显存和上游连接同时压满。本文用 Python asyncio.Semaphore 限制并发入口,配合 TaskGroup、超时和结果核对,给出一套可验证的推理任务调度写法。260 收藏 -
科技周边 · 人工智能 | 1星期前 | 异步任务 · mcp · 协议扩展 · MCP Tasks io.modelcontextprotocol/tasks tasks/get tasks/update
围绕 MCP Tasks 的任务句柄、状态轮询、输入等待、终态取数和断线恢复,整理一套不依赖具体厂商编排的客户端处理边界。260 收藏 -
向量搜索选余弦距离还是内积,取决于 embedding 模型是否归一化,以及向量长度是否承载业务信息。本文用公式、Python 示例和选择表说明两者边界,并提醒区分相似度与数据库距离。260 收藏 -
RAG 问答里反复出现相同段落,通常不是模型突然变笨,而是切块重叠、相邻片段、候选数量和证据合并共同造成的。本文用一组可复现的检索样例分层排查重复来源,再说明 MMR、多样性阈值和最终去重应该放在哪一层。259 收藏 -
Embedding 模型更换后,旧文档向量与新查询向量可能不在同一个向量空间;即使维度相同,语义方向、归一化和提示词约定也可能不同。本文给出双写、全量回填、离线验收、别名切换和回滚方案。259 收藏 -
多模态模型的图片成本不只取决于文件大小,还取决于处理器如何把像素切成视觉 token。本文以 Hugging Face Transformers 的 processor 为参照,说明服务端怎样读取 min_pixels、max_pixels,按像素预算等比例缩放,再决定压缩、裁剪和监控字段。259 收藏 -
本地量化模型显存不足时,先拆分权重、KV cache 和计算缓冲区,再按真实输入选择上下文长度。本文给出 2048、4096、8192 的起点判断,以及上下文、KV 缓存精度、批大小和量化档位的调节顺序。258 收藏 -
科技周边 · 人工智能 | 2星期前 | 人工智能 · api设计 · Google AI · Gemini API · Context Caching · Gemini API Context Caching cachedContent 长提示词 generateContent
Gemini API 的 Context Caching 适合反复使用同一份长上下文的场景。本文用 cachedContents.create 创建缓存,再把 cache.name 绑定到 generateContent,讲清缓存内容、动态问题和 TTL 的边界。257 收藏 -
大模型返回的工具参数只是建议,不是业务事实。本文用 Go 做一个小型工具调用网关,演示如何校验参数、限制动作范围、用请求键去重,并在失败后安全重试。255 收藏 -
Go 服务把模型的流式输出转发给浏览器时,客户端刷新或断网会让上游请求继续消耗连接和配额。本文用 Request.Context、HTTP 流读取和取消信号复盘这个故障,并给出可验证的清理与回滚方案。254 收藏 -
排查大模型多轮工具调用中的上下文丢失,梳理 tool_call_id、并行结果配对和消息回放验收。252 收藏