人工智能技术文章
-
模型流式输出中断时,不要直接把请求重发并拼接全文。先保存 request_id、事件序号和幂等键,重连时重放已确认事件,再按供应商能力决定是否续生成,才能避免重复展示和状态错乱。108 收藏 -
AI Agent 记忆不应把所有对话永久保存。本文用会话、任务和用户事实三层模型,说明字段设计、写入门槛、分层检索与冲突处理方法。110 收藏 -
Embedding 模型、维度或距离度量升级后,旧向量通常不能直接混用。本文说明如何判断空间兼容性,并用双写、后台回填、灰度评测和可回滚切换完成生产迁移。173 收藏 -
本地量化模型显存不足时,先拆分权重、KV cache 和计算缓冲区,再按真实输入选择上下文长度。本文给出 2048、4096、8192 的起点判断,以及上下文、KV 缓存精度、批大小和量化档位的调节顺序。258 收藏 -
用多模态模型抽取发票时,不要只保存模型返回的文本。本文用 JSON Schema 设计字段证据对象,把字段值、原图归一化坐标、证据说明和人工复核标记绑定在一起。446 收藏 -
LLM评测集不要只放正常问答。更稳妥的做法是把样本分成正常任务、明确拒答和可澄清的边界请求,为每条记录期望行为、原因标签和替代方向,再按分片统计完成率、拒答准确率、澄清率与不必要拒答率。177 收藏 -
工具调用参数校验失败时,不要直接重放可能产生副作用的工具。本文拆解 strict Schema、应用侧业务校验、tool_call_id 错误反馈、幂等键和有限重试的分工。215 收藏 -
模型返回枚举值错误时,先区分 schema 不匹配、拒答和输出不完整,再用 JSON Schema 的 enum 约束允许值,并保存脱敏原始响应。本文给出结构化输出的约束、解析、重试和监控做法。345 收藏 -
向量检索召回低时不要盲目更换嵌入模型。本文用固定评测集、Recall@k 和命中排名,分别拆分切片、嵌入模型与召回阈值问题。446 收藏 -
RAG 处理 PDF、Excel 或 Markdown 表格时,固定长度切片容易丢失表头和来源。本文用行级知识块、metadata 和检索组合保留表格关系。311 收藏 -
长上下文应用不应把全部聊天记录直接拼进请求。本文用近期消息、滚动摘要和按需检索三层结构,配合 token 预算、去重与计数,减少无关历史进入模型上下文。296 收藏 -
本地模型选 4-bit 还是 8-bit,不能只看显存节省。本文用统一基线、固定输入和实际测量比较显存、吞吐、延迟与精度风险,并给出 Transformers 加载示例和部署决策表。481 收藏 -
语音转写与说话人分离遇到重叠发言时,不要按片段顺序抢词或直接删掉重叠区;应保留普通 diarization,再用词级时间交集决定归属,无法判断的结果进入 ambiguous 复核。115 收藏 -
扩散模型固定 seed 仍有细节差异,通常不是 seed 失效,而是 Generator 状态、scheduler、精度、CUDA 后端和硬件不同。本文给出一套可复现排查清单。457 收藏 -
LLM评测不要把事实错误和表达偏差混成一个总分。本文给出分层标签、证据字段、分项统计和复核一致性的可复用设计。115 收藏