人工智能技术文章
-
科技周边 · 人工智能 | 1星期前 | 人工智能 · openai · 工程实践 · 流式输出 · Responses API · SSE 断线重连 Responses API AI流式输出 事件游标
AI 流式输出断线后不要直接重发请求。本文以 OpenAI Responses API 的 SSE 事件为例,说明如何保存 response_id、sequence_number 和已展示片段,重连后消除重复内容,并用最终状态完成一次可审计的收尾。377 收藏 -
一个 AI 应用把危险请求挡住是安全表现,把正常请求误判为风险则是业务失败。本文用一组可回放的测试样本拆分安全拒答、过度拒答、正常通过和非安全业务错误,说明如何设计标签、计算指标并在上线前复核。377 收藏 -
Gemini File Search 支持图片检索后,引用记录不能只保存回答文本。本文拆开 media_id、page_number 与 file_citation 的职责,给出一套可复查的多模态引用记录方法。377 收藏 -
Gemini Interactions API 迁移真正容易漏的是验收:steps 顺序、函数调用、服务端工具、无状态历史、response_format 和 SSE 事件都要分别断言。本文给出 REST 与 SDK 迁移后的 6 类检查。376 收藏 -
科技周边 · 人工智能 | 2星期前 | 人工智能 · transformers · Hugging Face · 文本生成 · 模型评估 · Hugging Face Transformers generate output_scores compute_transition_scores 长度惩罚 生成概率
Transformers 的 generate 默认只返回生成序列,不会直接给出每个 token 的分数。本文用 return_dict_in_generate、output_scores 和 compute_transition_scores 还原逐 token 对数概率,并说明 decoder-only 输入长度、beam search 和 length_penalty 的验收边界。374 收藏 -
Gemini Developer API 的零数据留存不是只设置一个 store=false:Interactions、File API、显式缓存、隐式缓存和 Live API 的保留边界不同。本文用一张核对表和最小请求示例说明如何逐项关闭或清理状态。374 收藏 -
多租户 AI 知识库最危险的故障不是检索变慢,而是把 A 租户的片段、缓存或引用带给 B 租户。本文从检索权限、缓存键、引用回显和审计证据四条线,拆解一套可验证的隔离方案。369 收藏 -
科技周边 · 人工智能 | 1个月前 | API · go · 人工智能 · 工程实践 · 工具调用 · Go Anthropic Messages API tool_use tool_result Claude工具调用
Go 服务接入 Anthropic Messages API 的工具调用时,模型返回 tool_use 只是请求执行工具,不是最终答案。本文用天气查询工具拆解 stop_reason、tool_use_id、tool_result 的往返消息格式,并给出防止无限循环和错误回传的实现边界。368 收藏 -
Gemini Interactions API 的 2026 schema 迁移不只是把 outputs 改成 steps,还涉及 response_format、函数调用、工具事件、无状态历史和 SSE 监听。本文按 REST 与 SDK 两条路径给出兼容改法和验收清单。367 收藏 -
用 Claude Prompt Caching 降低长上下文请求的延迟和成本时,要把静态前缀、动态尾部、TTL 与 usage 里的 cache read/write 分开验收。363 收藏 -
AI 接口返回结构化结果时,空对象不一定代表没有数据。本文用 finish_reason、拒答字段和 JSON Schema 校验拆开拒答、截断、合法空结果三种状态,并给出可落地的用户提示策略。363 收藏 -
多轮对话一旦超过模型上下文窗口,常见表现不是单纯报错,还包括旧约束丢失、工具参数变长和响应质量波动。本文用一个可复现的 token 预算实验,拆解消息裁剪、摘要保留与最近轮次保护的组合策略。361 收藏 -
OpenAI Responses API 的推理项不是普通文本,手动管理多轮上下文时要保留完整 reasoning item。本文拆解 reasoning.encrypted_content、include 参数和函数调用续接的验收边界,避免第二轮请求丢上下文。357 收藏 -
AI Agent 的超时不能只设一个总秒数。把模型等待、工具调用和整条任务预算分开,才能区分慢在哪里、及时停止无效工作,并在重试与回退时保留可核对的状态。357 收藏 -
RAG 明明已经写入知识库,回答却像没有检索到内容?从查询改写、文本分块、相似度阈值和召回日志四个位置建立一条可验证的排查路径。350 收藏