人工智能技术文章
-
多租户 AI 知识库最危险的故障不是检索变慢,而是把 A 租户的片段、缓存或引用带给 B 租户。本文从检索权限、缓存键、引用回显和审计证据四条线,拆解一套可验证的隔离方案。369 收藏 -
科技周边 · 人工智能 | 2个月前 | API · go · 人工智能 · 工程实践 · 工具调用 · Go Anthropic Messages API tool_use tool_result Claude工具调用
Go 服务接入 Anthropic Messages API 的工具调用时,模型返回 tool_use 只是请求执行工具,不是最终答案。本文用天气查询工具拆解 stop_reason、tool_use_id、tool_result 的往返消息格式,并给出防止无限循环和错误回传的实现边界。368 收藏 -
Gemini Interactions API 的 2026 schema 迁移不只是把 outputs 改成 steps,还涉及 response_format、函数调用、工具事件、无状态历史和 SSE 监听。本文按 REST 与 SDK 两条路径给出兼容改法和验收清单。367 收藏 -
AI 生成代码最容易失控的地方不是语法,而是修改范围。本文用单元测试、修改预算和 git diff 双重门禁,拆解如何让一次生成式改动保持可验收、可回退。366 收藏 -
LLM输出能解析不代表字段完整。本文从JSON Schema最小契约、响应状态归一化、字段缺失有限重试和上线观测四个方面,给出结构化输出的处理方案。364 收藏 -
用 Claude Prompt Caching 降低长上下文请求的延迟和成本时,要把静态前缀、动态尾部、TTL 与 usage 里的 cache read/write 分开验收。363 收藏 -
AI 接口返回结构化结果时,空对象不一定代表没有数据。本文用 finish_reason、拒答字段和 JSON Schema 校验拆开拒答、截断、合法空结果三种状态,并给出可落地的用户提示策略。363 收藏 -
多轮对话一旦超过模型上下文窗口,常见表现不是单纯报错,还包括旧约束丢失、工具参数变长和响应质量波动。本文用一个可复现的 token 预算实验,拆解消息裁剪、摘要保留与最近轮次保护的组合策略。361 收藏 -
MLflow Model Alias 可以把生产代码从固定模型版本号解耦出来。本文用 champion 别名串起模型注册、加载、发布切换和回滚边界,说明 Alias URI 的写法以及不能忽略的版本验证与审计记录。360 收藏 -
MCP 中 Resource 负责按 URI 提供可读取的上下文,Tool 负责按名称和参数执行能力。本文从发现消息、调用边界、权限审计和错误分层说明两者的实现方法。359 收藏 -
讲清 Transformers 使用 bitsandbytes 进行 8-bit/4-bit 量化时,如何用 llm_int8_skip_modules 保留指定模块,并区分跳过量化、dtype 与 CPU float32 offload。359 收藏 -
本文说明 Accelerate 如何用 device_map=auto 将大模型按显存分配到多块 GPU,并讲清 max_memory、不可拆分层、CPU 与磁盘回退以及多卡推理的性能边界。358 收藏 -
OpenAI Responses API 的推理项不是普通文本,手动管理多轮上下文时要保留完整 reasoning item。本文拆解 reasoning.encrypted_content、include 参数和函数调用续接的验收边界,避免第二轮请求丢上下文。357 收藏 -
AI Agent 的超时不能只设一个总秒数。把模型等待、工具调用和整条任务预算分开,才能区分慢在哪里、及时停止无效工作,并在重试与回退时保留可核对的状态。357 收藏 -
围绕 AI 提示词缓存的稳定前缀组织请求,说明固定指令、工具 schema 与动态问题的排列方法,并用 cached_tokens、cache_write_tokens 和版本化回滚定位缓存失效。357 收藏