人工智能技术文章
-
用 Hugging Face Transformers 拆解大模型批量输入中的 padding 与 attention_mask,说明不等长文本、超长截断、左侧补齐和模型调用的配置边界。282 收藏 -
RAG 不应该把向量召回的所有片段直接塞进上下文。本文用 reranker 重排候选片段,再用 token 预算、单片段上限和来源去重装配最终上下文,给出可观测的参数与 Python 示例。281 收藏 -
同一套 Claude API 请求看起来没有改,缓存却一直 miss,常见原因不是缓存没打开,而是断点之前混入了动态内容。本文用静态前缀、工具定义和 usage 字段梳理一套最小核对方法。280 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
AI 流式输出中途断开时,不要等完整响应才落库。应以请求唯一标识和片段序号保存增量快照,区分 partial、completed、interrupted 状态,并在重连时用幂等键避免重复拼接。278 收藏 -
RAG 文档切片太大或重叠过高,都会让召回上下文变长并拖慢回答。本文按 chunk size、overlap、top_k 和上下文预算拆开排查,用固定问题集找到兼顾证据完整性与延迟的参数组合。277 收藏 -
讲清 OpenAI Responses API 中 output_text 便捷文本与 output 完整输出项的区别,覆盖展示、结构化处理、工具调用、标注和流式读取等常见场景。277 收藏 -
科技周边 · 人工智能 | 9小时前 | 人工智能 · 模型量化 · 校准数据 · ONNX Runtime · GPTQ · 推理优化 · 量化校准数据 模型量化配置 代表性校准集 ONNX静态量化 GPTQ校准数据 AI模型精度排查
量化校准数据不是随便凑一批样本。本文对比不同量化路径的校准要求,给出样本配置清单、输入契约检查法和精度回归排查步骤。276 收藏 -
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
科技周边 · 人工智能 | 4天前 | openai · function calling · 结构化输出 · Responses API · OpenAI JSON Schema 工具调用 Responses API Structured Outputs
用 Responses API 的 strict JSON Schema 约束工具参数,再通过 function_call_output 回传可解析结果,并说明如何单独约束最终 JSON 回复。274 收藏 -
本地大模型聊天效果差时,先检查 chat template 是否正确渲染 messages、assistant 回复起点和特殊 token,本文给出一套可回滚的排查清单。273 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
MCP 工具返回长列表时,分页协议会直接影响 Agent 是否拿到完整且不重复的结果。本文从游标失效、排序稳定性和增量验收三个问题出发,给出可落地的返回字段与测试方法。269 收藏 -
科技周边 · 人工智能 | 3星期前 | oauth · 人工智能 · mcp · ai agent · OAuth MCP redirect_uri iss CIMD Client ID Metadata Documents
MCP 2026-07-28 强化了 OAuth 授权边界,登录失败时不能只盯着 redirect_uri。本文从授权响应中的 iss、Client ID Metadata Document(CIMD)和授权服务器绑定关系入手,给出一套可复现的排查与迁移清单。267 收藏 -
多模态模型接收图片时,文件大小并不是唯一门槛。先检查格式、宽高、总像素和编码后的体积,再按剩余预算决定压缩、拒绝或重试,才能减少请求失败和重复上传。267 收藏