人工智能技术文章
-
RAG 文档切片太大或重叠过高,都会让召回上下文变长并拖慢回答。本文按 chunk size、overlap、top_k 和上下文预算拆开排查,用固定问题集找到兼顾证据完整性与延迟的参数组合。277 收藏 -
讲清 OpenAI Responses API 中 output_text 便捷文本与 output 完整输出项的区别,覆盖展示、结构化处理、工具调用、标注和流式读取等常见场景。277 收藏 -
量化校准数据不是随便凑一批样本。本文对比不同量化路径的校准要求,给出样本配置清单、输入契约检查法和精度回归排查步骤。276 收藏 -
批量推理服务把长任务和短任务混在一个先进先出队列里时,小请求会被大任务拖住。本文用 Go 的 heap.Interface、优先级字段和 worker 调度,拆出一条可验证的隔离路径,并说明公平性与取消边界。274 收藏 -
用 Responses API 的 strict JSON Schema 约束工具参数,再通过 function_call_output 回传可解析结果,并说明如何单独约束最终 JSON 回复。274 收藏 -
本地大模型聊天效果差时,先检查 chat template 是否正确渲染 messages、assistant 回复起点和特殊 token,本文给出一套可回滚的排查清单。273 收藏 -
AI 代理调用搜索、数据库或文件工具时,完整结果直接塞进上下文会挤压后续推理空间。本文用 Go 演示摘要与原始响应分离、引用句柄回取和失败状态核对。272 收藏 -
模型返回 JSON 时,缺字段不等于所有异常都能用默认值修复。本文用解析、归一化、验证三层设计兜底策略,区分可选字段、必填字段、类型错误和无法恢复的响应,并给出 Python 示例。272 收藏 -
MCP 工具返回长列表时,分页协议会直接影响 Agent 是否拿到完整且不重复的结果。本文从游标失效、排序稳定性和增量验收三个问题出发,给出可落地的返回字段与测试方法。269 收藏 -
多模态模型接收图片时,文件大小并不是唯一门槛。先检查格式、宽高、总像素和编码后的体积,再按剩余预算决定压缩、拒绝或重试,才能减少请求失败和重复上传。267 收藏 -
AI Embedding 批量请求变慢时,先把客户端准备、网络往返、服务端排队和模型计算拆开记录,再用固定文本与批次对照区分瓶颈;同时核对输出维度和向量库 schema,避免把维度不一致误判成网络问题。264 收藏 -
以 Hugging Face 风格工具调用为例,说明 JSON Schema、tool_calls 参数形状与 Pydantic/业务规则校验的排查方法。264 收藏 -
向量检索的 top_k 越大不一定让 RAG 答案更好。本文用一个可运行的 Python 小实验说明如何按 source_id 分组、保留上下文多样性,再把有限的候选片段交给生成模型。261 收藏 -
通过最小化工具参数、固定工作区根目录、规范化路径和区分读写审批,限制 AI Agent 越权访问文件,并用结构化拒绝结果和日志保留可追踪性。261 收藏 -
多模型推理服务常见的问题不是请求发不出去,而是任务一拥而上把显存和上游连接同时压满。本文用 Python asyncio.Semaphore 限制并发入口,配合 TaskGroup、超时和结果核对,给出一套可验证的推理任务调度写法。260 收藏