人工智能技术文章
-
Qdrant 中删除文档后仍被检索到,通常不是删除接口失效,而是写入确认、索引可见性、分布式顺序或应用缓存处在不同阶段。本文用一条可复查的排查链定位并修复这个问题。482 收藏 -
用 Go 实现一个请求级 AI 模型路由器,在选择上游前同时检查 token 预算、请求超时和上游降级状态,避免备用模型被误用或无限重试。481 收藏 -
本地模型选 4-bit 还是 8-bit,不能只看显存节省。本文用统一基线、固定输入和实际测量比较显存、吞吐、延迟与精度风险,并给出 Transformers 加载示例和部署决策表。481 收藏 -
LLM 输出 JSON 不稳定时,不能只靠提示词要求“返回 JSON”。本文用一个工单分类小项目拆解解析、JSON Schema 校验、错误分类和有限重试,并说明为什么业务失败不该混入格式重试。480 收藏 -
模型服务的批处理不是把 batch size 调大就结束。本文用 Triton 动态批处理和 TGI 连续批处理说明如何设置排队等待上限、批量或令牌预算,并用队列长度、prefill/decode 时长与端到端 p95 验证吞吐收益。479 收藏 -
torch.compile 出现 graph break 时,先用 fullgraph=True 暴露首个断点,再用 torch._dynamo.explain 和 TORCH_LOGS 分析原因,最后决定重写、隔离还是保留。478 收藏 -
Reranker 分数不是通用的相关性刻度。本文从分数归一化、候选集标注、分层阈值和 top-k 兜底四个方面,说明如何减少相关答案被过滤的问题。477 收藏 -
避免 Chat Template 角色格式不一致的关键,是让训练、评测和推理共享同一份 role/content 消息契约,并统一交给 tokenizer.apply_chat_template 序列化。本文给出参数区别、重复特殊 token 的规避方法和集中封装示例。477 收藏 -
多智能体系统出错时,单看模型调用或 HTTP 状态往往找不到根因。本文从一次用户任务出发,拆解 agent 委派、交接、工具调用和记忆读写的追踪边界,给出可回放的链路设计与检查清单。474 收藏 -
用 Qdrant payload 保存 tenant_id 和 doc_type,通过 must 组合租户与文档类型过滤条件,并为高频字段建立 payload index,让向量检索先守住知识库权限边界。473 收藏 -
Embedding 模型切换时,旧向量不能只看维度是否相同。本文从维度、语义空间和索引元数据三个层面说明混用风险,并给出重嵌入、建新索引和灰度切换的迁移做法。473 收藏 -
分类评测集不均衡时,macro 与 micro 不是谁更高级的问题,而是按类别平均还是按样本汇总。本文用统一口径、混淆矩阵和复核清单解释两者差异。473 收藏 -
模型换版本后,先别只看几条手工对话。本文用 Go 从零做一个轻量 AI 评测样本 CLI,校验 JSONL 字段、按固定种子抽样,并把命中规则与通过率写成可复查的报告。472 收藏 -
用 TextIteratorStreamer 接收 Transformers 的增量文本,再通过 FastAPI SSE 传给浏览器,完成一个可处理异常和断开的流式生成接口。472 收藏 -
大模型回答出现整段重复时,不要只把 temperature 调高。本文按请求参数、采样范围和停止条件拆开排查,给出一个可复现的参数核对流程,并说明哪些现象属于模型能力边界,哪些是客户端拼接造成的。470 收藏