人工智能技术文章
-
用 Python 把大模型返回的 JSON 经过解析、字段校验和有限重试,避免把半截或缺字段的数据直接写入业务流程。501 收藏 -
本地大模型反复输出同一句话时,从采样开关、temperature、top_p、repetition_penalty、no_repeat_ngram_size 和长度边界逐项调整,并给出 Transformers 示例。501 收藏 -
向量库维度不一致通常源于 embedding 模型输出、批量请求和集合 schema 没有对齐。本文给出从 expected/actual 到模型配置、命名向量和迁移方案的检查清单。498 收藏 -
更换 embedding 模型时,先读取新旧模型的真实向量维度,再用模型版本、维度和距离度量建立双索引迁移边界,最后通过小批量回填验证后切换查询路由。498 收藏 -
从评测样本、提示词模板和模型输出三层排查评测集污染,给出变量隔离、快照留存与回归验收方法。496 收藏 -
RAG 不是召回越多越好。本文从 retrieve、rerank、budget、prompt 四个真实环节拆解上下文被截断的原因,并给出可验证的预算分配与降级方案。495 收藏 -
Prompt 缓存命中率下降时,先比较最终渲染前缀而不是源模板。本文用 cached_tokens、prefix hash、模型设置和动态字段边界给出一套可复查的排查方法。487 收藏 -
向量索引不能只看查询速度。本文以 Redis 的 FLAT、HNSW 和 SVS-VAMANA 为例,拆开比较召回率、内存、写入维护与重建代价,并给出一套可复查的选型压测方法。485 收藏 -
Responses API 的 tool_choice 不只是 auto 和 required 两个开关。本文用一个订单查询工具说明如何强制调用、指定具体工具,并用响应项和业务回退做可复查验收。484 收藏 -
Responses API 接入远程 MCP 服务器时,关键不是把工具接通,而是把工具声明、审批边界、拒绝分支和错误恢复放在同一套调用约束里。本文用两个静态结构图和 Go 示例拆开这条边界。484 收藏 -
RAG 检索结果重复时,先按 source_id 做同来源去重,再保留 chunk_id、最高分和冲突标记形成证据组,避免重复上下文和来源误合并。484 收藏 -
AI 接口遇到超时不能简单重复提交。本文用 OpenAI 的 X-Client-Request-Id 和 Gemini API 的指数退避建议,拆解请求标识、可重试错误、结果去重与人工复核的完整工作流。482 收藏 -
Qdrant 中删除文档后仍被检索到,通常不是删除接口失效,而是写入确认、索引可见性、分布式顺序或应用缓存处在不同阶段。本文用一条可复查的排查链定位并修复这个问题。482 收藏 -
用 Go 实现一个请求级 AI 模型路由器,在选择上游前同时检查 token 预算、请求超时和上游降级状态,避免备用模型被误用或无限重试。481 收藏 -
本地模型选 4-bit 还是 8-bit,不能只看显存节省。本文用统一基线、固定输入和实际测量比较显存、吞吐、延迟与精度风险,并给出 Transformers 加载示例和部署决策表。481 收藏