人工智能技术文章
-
RAG 处理 PDF、Excel 或 Markdown 表格时,固定长度切片容易丢失表头和来源。本文用行级知识块、metadata 和检索组合保留表格关系。311 收藏 -
长上下文应用不应把全部聊天记录直接拼进请求。本文用近期消息、滚动摘要和按需检索三层结构,配合 token 预算、去重与计数,减少无关历史进入模型上下文。296 收藏 -
本地模型选 4-bit 还是 8-bit,不能只看显存节省。本文用统一基线、固定输入和实际测量比较显存、吞吐、延迟与精度风险,并给出 Transformers 加载示例和部署决策表。481 收藏 -
语音转写与说话人分离遇到重叠发言时,不要按片段顺序抢词或直接删掉重叠区;应保留普通 diarization,再用词级时间交集决定归属,无法判断的结果进入 ambiguous 复核。115 收藏 -
扩散模型固定 seed 仍有细节差异,通常不是 seed 失效,而是 Generator 状态、scheduler、精度、CUDA 后端和硬件不同。本文给出一套可复现排查清单。457 收藏 -
LLM评测不要把事实错误和表达偏差混成一个总分。本文给出分层标签、证据字段、分项统计和复核一致性的可复用设计。115 收藏 -
LLM 输出 JSON 不稳定时,不能只靠提示词要求“返回 JSON”。本文用一个工单分类小项目拆解解析、JSON Schema 校验、错误分类和有限重试,并说明为什么业务失败不该混入格式重试。480 收藏 -
OCR 识别表格不能只保留文字,还要保存每个片段的坐标框,再通过行聚类、列排序和跨度判断重建二维结构。本文给出一套可落地的处理流程。147 收藏 -
Reranker 分数不是通用的相关性刻度。本文从分数归一化、候选集标注、分层阈值和 top-k 兜底四个方面,说明如何减少相关答案被过滤的问题。477 收藏 -
更换 embedding 模型时,先读取新旧模型的真实向量维度,再用模型版本、维度和距离度量建立双索引迁移边界,最后通过小批量回填验证后切换查询路由。498 收藏 -
RAG 文档切片的 overlap 没有固定标准。本文按独立问答、连续流程和跨段推理拆分起始比例,并用边界命中、重复率、索引规模和答案证据建立调参方法。280 收藏 -
向量索引不能只看查询速度。本文以 Redis 的 FLAT、HNSW 和 SVS-VAMANA 为例,拆开比较召回率、内存、写入维护与重建代价,并给出一套可复查的选型压测方法。485 收藏 -
图像问答不稳定,常常不是模型不会看,而是说明文字和视觉证据没有分层。本文给出冲突分类、证据优先级、结构化输入和人工复核的实用提示设计。404 收藏 -
Responses API 同时声明多个函数工具时,可用 tool_choice 的 allowed_tools 将当前轮次限制到指定子集,再用 auto、required 或 none 表达调用策略。本文给出参数结构、选择边界和服务端安全检查。463 收藏 -
结构化输出校验失败时,不要只记录 ValidationError。本文把原始响应保存、拒答与截断判断、JSON 解析、Schema 校验和业务校验拆开,给出一套可脱敏、可重放、可定位的应用层处理方式。324 收藏