人工智能技术文章
-
长上下文应用不应把全部聊天记录直接拼进请求。本文用近期消息、滚动摘要和按需检索三层结构,配合 token 预算、去重与计数,减少无关历史进入模型上下文。296 收藏 -
OpenAI 提示词模板的变量主要负责替换输入,默认值、类型和必填校验应放在应用侧包装函数中。本文用 TypeScript 建立一层可复用契约。296 收藏 -
Anthropic Claude Messages API 的 citations 能把回答片段关联回 PDF、纯文本或自定义文档块。本文从 document block、citations.enabled、引用位置和 streaming 的 citations_delta 四个层面核对返回结果,避免只让模型口头声称有来源。295 收藏 -
从 messages、tool_calls 到 response.items,拆清 Open Responses 面向代理循环的输入输出对象变化,给出兼容层和最小验证方法。293 收藏 -
RAG 评测不要只看一个总分。本文用固定 JSONL 样本,把检索上下文覆盖率与最终答案正确率拆开统计,并用指标组合定位检索、生成和数据集问题。293 收藏 -
合同中的金额、日期和付款条件经常藏在跨页表格里。本文以多模态模型抽取合同表格为例,拆解版面切片、字段约束、来源定位和人工复核,给出一套可回放的验收流程。289 收藏 -
同一个 AI 应用切换模型后,答案长度、语气和结构可能一起变化。本文用能力矩阵、版本化提示词和固定验收样本拆开这类漂移,给出路由决策、差异记录与灰度检查方法。288 收藏 -
RAG 检索命中文档却只能生成很短的答案,往往不是模型突然变笨,而是切片边界、重叠窗口和引用片段没有对齐。本文用一个内部知识库场景说明如何逐层调优,并保留可验证的证据。286 收藏 -
Transformers 文本超过模型输入上限时,不要只开启 truncation 丢掉后半段。本文用 max_length、stride 和 return_overflowing_tokens 按 token 生成重叠窗口,并说明批量输入如何保留原文映射。286 收藏 -
大模型以流式方式返回 JSON 时,任意一个分片都可能停在字符串或对象中间。本文用 Go 写一个增量缓冲器,以括号配对判断候选完整度,最后再用标准 JSON 解析和业务字段校验收口。284 收藏 -
用 Hugging Face Transformers 拆解大模型批量输入中的 padding 与 attention_mask,说明不等长文本、超长截断、左侧补齐和模型调用的配置边界。282 收藏 -
RAG 不应该把向量召回的所有片段直接塞进上下文。本文用 reranker 重排候选片段,再用 token 预算、单片段上限和来源去重装配最终上下文,给出可观测的参数与 Python 示例。281 收藏 -
Structured Outputs 严格模式要求字段全部写入 required。本文用 required 加 null 类型表达可选语义,并说明嵌套对象、额外属性、拒答和不完整响应的兼容边界。281 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
AI 流式输出中途断开时,不要等完整响应才落库。应以请求唯一标识和片段序号保存增量快照,区分 partial、completed、interrupted 状态,并在重连时用幂等键避免重复拼接。278 收藏