人工智能技术文章
-
AI 能调用工具不等于可以直接相信工具参数。本文用服务端重算权限、字段白名单、资源归属校验和拒绝用例,搭一套可验收的参数越权防线。178 收藏 -
RAG 系统不要只把文本片段交给模型。本文用 Go 设计带 source_id、标题和定位信息的检索结果接口,让生成答案可以回溯来源、处理空召回,并在调用失败时保留可验证的错误边界。178 收藏 -
科技周边 · 人工智能 | 16小时前 | API · 人工智能 · agent · gemini · 工程实践 · agent 工具调用 Interactions API Gemini 3.7 Flash 任务验收
围绕 Gemini 3.7 Flash 的托管 Agent 任务,拆解多步执行、工具结果、sandbox 边界与最终状态验收,并给出 Go 侧可复用的状态检查代码。176 收藏 -
Anthropic Prompt Caching 的关键不在于盲目加 cache_control,而在于把断点放在稳定前缀末尾,再从 cache_creation_input_tokens 和 cache_read_input_tokens 核对是否真正命中。本文用 Python Messages API 示例说明断点、20 个区块回看窗口、TTL 与成本判断。176 收藏 -
AI 接口遇到 504 不能简单重复提交。本文用 OpenAI 的 X-Client-Request-Id 和 Gemini API 的指数退避建议,拆解请求标识、可重试错误、结果去重与人工复核的完整工作流。171 收藏 -
RAG 知识库的切片不是越短越好。本文用一份带标题和代码块的技术文档说明切片长度、重叠窗口与语义边界如何共同影响召回证据,并给出可复现的调参流程、检查指标和常见误区。170 收藏 -
多模态接口的图片费用不只取决于文件大小,真正影响预算的是输入分辨率、detail 级别、图片数量和重试策略。本文用一个可复用的请求预算表,说明什么时候使用 low、high 或 auto,并给出上线前的核对方法。165 收藏 -
多模态请求总超时通常不是单一网络问题:图片尺寸、编码体积、视觉分辨率和重试策略会共同放大耗时。本文用一条可观测链路拆解预处理、请求超时、重试边界和最终降级。164 收藏 -
RAG 系统如果只保存一段孤立文本,回答命中后很难解释它来自文档哪里。本文用 Go 设计带标题路径、页码和片段编号的 Chunk,演示切片、检索上下文和引用回链如何连成一条可复查的数据路径。163 收藏 -
AI 应用上线后,成本失控通常不是因为某一次请求特别贵,而是输入上下文、输出长度和重试叠加后没有预算边界。本文用一个请求预算器拆解 token 估算、费用计算、阈值判断和超额降级,并给出可验收的 Go 示例。162 收藏 -
多模态接口处理图片时,分辨率越高不一定越划算。本文用图片尺寸、切片数量和 media_resolution 拆开 token 与延迟的关系,并给出调用前估算、缩放和结果复核方法。161 收藏 -
图片输入的成本不只由文件大小决定,还受模型细节档位、有效分辨率和长图切分方式影响。本文用一套可复核的输入策略,判断何时用低细节、何时保留高分辨率,以及长图如何切成可验收的局部图片。152 收藏 -
RAG 应用里,回答看似有引用却指错段落,往往不是模型单独出错,而是切块编号、索引元数据和原文版本没有保持同一条链路。本文用文档快照、chunk_id 和回答后验校验,搭一套可定位、可回归的引用验收方法。148 收藏 -
RAG 应用把检索结果直接拼进提示词,常会遇到重复段落挤占上下文、引用指向不稳定和答案被相似文档带偏的问题。本文用一条可回放的数据流说明候选文档如何去重、截断并组成引用上下文。146 收藏 -
在一次请求的流式窗口发生中断时,重发与否是关键风险点。本文给出以请求 ID、幂等键、状态回放与回退策略构成的恢复闭环。145 收藏