人工智能技术文章
-
LLM 流式输出不能只把增量文本放在浏览器内存里。本文用 generation_id、递增序号和持久化事件日志保存检查点,说明断线后如何回放缺失事件、避免重复写入,并区分传输恢复与模型重新生成。177 收藏 -
通过最小化工具参数、固定工作区根目录、规范化路径和区分读写审批,限制 AI Agent 越权访问文件,并用结构化拒绝结果和日志保留可追踪性。261 收藏 -
OCR 结果进入 RAG 前不要只保留拼接文本。本文用统一文本块保存 source_id、页码、版面多边形和字符范围,并说明切块、向量召回与回答引用如何保持同一条证据链。233 收藏 -
Embedding 模型切换时,旧向量不能只看维度是否相同。本文从维度、语义空间和索引元数据三个层面说明混用风险,并给出重嵌入、建新索引和灰度切换的迁移做法。473 收藏 -
Gradio 长任务不要只等函数返回:用生成器 yield 阶段状态,用 gr.Progress 显示进度,再用 cancels 连接停止按钮,同时明确 UI 取消与外部作业停止的边界。197 收藏 -
量化模型精度下降时,不要只看一个总分。本文用固定输入、配对预测和分桶误差,区分评测条件不一致、长输入敏感与校准集覆盖不足,并给出可复用的对照脚本。124 收藏 -
用 PEFT 的 merge_and_unload 合并 LoRA adapter,固定 tokenizer、输入和生成参数,再通过 token 与 logits 对比判断合并前后是否一致。399 收藏 -
科技周边 · 人工智能 | 12小时前 | 性能优化 · 人工智能 · transformers · 批量推理 · Hugging Face Transformers dynamic padding attention_mask
用 DataCollatorWithPadding 让 Transformers 按 batch 内最长文本动态补齐,并配合 attention_mask、截断和长度分桶减少无效推理计算。297 收藏 -
多租户向量检索不能只依赖相似度。本文说明如何从服务端鉴权上下文得到 tenant_id,为记录建立精确过滤字段,并比较共享集合、分区键和独立集合的隔离边界。108 收藏 -
RAG 检索结果过多时,不要只调小 top_k。本文拆分候选去重、重排、上下文压缩与预算装箱,给出可落地的选择规则、Python 示例和四项排查指标。207 收藏 -
用 OpenAI Agents SDK 的 RunState、session_state 和 snapshot 区分三种恢复边界,再用工作区检查点把沙箱任务拆成可重试、可回滚的阶段。441 收藏 -
Responses API 的多轮工具调用关键在于保留 function_call 的 call_id,用 function_call_output 回传业务结果,并在后续请求中正确续接响应状态。本文用 Python 拆解完整循环、异常处理和状态保存取舍。299 收藏 -
用 FAISS 做向量检索时,不要把返回位置当成文档主键。本文用 IndexIDMap 绑定 int64 业务 ID,演示 search 结果如何安全回表,并说明 IndexIVF 的选型边界。426 收藏 -
知识库删除原文时,不能只删业务数据库记录,还要依据稳定的 doc_id 清理 Qdrant 中的全部 points。本文说明 payload 设计、按过滤器删除、wait/ordering 选择,以及如何避免并发重建任务把旧向量重新写回。335 收藏 -
用 Qdrant payload 保存 tenant_id 和 doc_type,通过 must 组合租户与文档类型过滤条件,并为高频字段建立 payload index,让向量检索先守住知识库权限边界。473 收藏