-
Gemini 3.5 Flash 已建议用 thinking_level 替代 thinking_budget。本文用同一组请求对比 minimal、low、medium、high,说明迁移写法、选档边界与回归检查。
-
重复把长文档或系统提示词发送给 Gemini API 时,可以用显式 Context Caching 保存公共上下文,再通过 cachedContents、TTL 和 usage.total_cached_tokens 验证缓存是否真的生效。
-
Anthropic Claude Messages API 的 citations 能把回答片段关联回 PDF、纯文本或自定义文档块。本文从 document block、citations.enabled、引用位置和 streaming 的 citations_delta 四个层面核对返回结果,避免只让模型口头声称有来源。
-
Gemini Developer API 的零数据留存不是只设置一个 store=false:Interactions、File API、显式缓存、隐式缓存和 Live API 的保留边界不同。本文用一张核对表和最小请求示例说明如何逐项关闭或清理状态。
-
Hugging Face Inference Providers 可以让同一套客户端接入多个推理服务。本文从 provider=auto 的默认路由开始,说明何时固定具体 provider、如何设计 fallback、如何记录实际路由和响应字段,避免模型可用但结果格式悄悄变化。
-
Gemini 3 的 function calling 在手动维护多轮历史时,不能丢掉 thought_signature。本文用一个最小工具调用链说明官方 SDK、REST 手写历史和错误降级的处理边界。
-
Transformers 的 generate 默认只返回生成序列,不会直接给出每个 token 的分数。本文用 return_dict_in_generate、output_scores 和 compute_transition_scores 还原逐 token 对数概率,并说明 decoder-only 输入长度、beam search 和 length_penalty 的验收边界。
-
接入远程工具时,真正需要验收的是工具白名单、调用暂停、审批结果与工具输出的关联链路。本文用只读查询场景拆开发现、确认、拒绝和故障恢复的边界。
-
同一个模型换了提示词却突然复读、接不上回答,问题常常不在采样参数,而在 Transformers 的 chat template。本文用 apply_chat_template 对比 add_generation_prompt、重复 special tokens 和 continue_final_message 的边界,再用 token 数量与首个生成片段完成验收。
-
OpenAI Responses API 的推理项不是普通文本,手动管理多轮上下文时要保留完整 reasoning item。本文拆解 reasoning.encrypted_content、include 参数和函数调用续接的验收边界,避免第二轮请求丢上下文。
-
RAG 系统把 Markdown 表格按换行或固定字符数切开后,检索结果常常只剩半行字段,模型看似答对却无法说明数据关系。本文用 Markdown AST 识别表格边界、保留表头与行上下文,再用可验收的切片结果接入向量索引。
-
MCP 2026-07-28 规范把 Roots、Sampling、Logging 标记为弃用,但旧接口至少保留过渡期。本文用 sampling/createMessage 的调用链说明变更原因,区分仍可运行与不宜新建的代码,并给出直连模型 API、工具参数和回归验收的迁移清单。
-
MCP 2026-07-28 强化了 OAuth 授权边界,登录失败时不能只盯着 redirect_uri。本文从授权响应中的 iss、Client ID Metadata Document(CIMD)和授权服务器绑定关系入手,给出一套可复现的排查与迁移清单。
-
MCP 2026-07-28 已将 Roots 标为弃用,但兼容期内 roots/list 仍可能出现在旧客户端。本文用工作区读取场景说明如何核验 roots 能力、拒绝越界路径,并把新设计迁移到工具参数、资源 URI 或服务端配置。
-
Gemini Interactions API 迁移真正容易漏的是验收:steps 顺序、函数调用、服务端工具、无状态历史、response_format 和 SSE 事件都要分别断言。本文给出 REST 与 SDK 迁移后的 6 类检查。