人工智能技术文章
-
Embedding 模型更换后,旧文档向量与新查询向量可能不在同一个向量空间;即使维度相同,语义方向、归一化和提示词约定也可能不同。本文给出双写、全量回填、离线验收、别名切换和回滚方案。259 收藏 -
多模态模型的图片成本不只取决于文件大小,还取决于处理器如何把像素切成视觉 token。本文以 Hugging Face Transformers 的 processor 为参照,说明服务端怎样读取 min_pixels、max_pixels,按像素预算等比例缩放,再决定压缩、裁剪和监控字段。259 收藏 -
本地量化模型显存不足时,先拆分权重、KV cache 和计算缓冲区,再按真实输入选择上下文长度。本文给出 2048、4096、8192 的起点判断,以及上下文、KV 缓存精度、批大小和量化档位的调节顺序。258 收藏 -
解释 Safetensors 如何用文件头中的 shape、dtype 与 data_offsets 定位权重切片,说明 get_slice、零拷贝、内存映射和 GPU 传输的真实边界。258 收藏 -
长文档问答不能只返回文件名。本文给出文档版本、章节锚点、内容块、引用卡片和答案断言的完整映射方法,并补充覆盖率、锚点解析、版本一致性、低证据拒答与回滚检查。257 收藏 -
本地大模型推理中,KV cache 容量和 batch size 共享显存预算。本文从输入长度、并发、TTFT、TPOT 与长尾延迟出发,给出可落地的配置起点、压测矩阵和超限回退策略。251 收藏 -
说明 PEFT LoRA 的 target_modules 如何按模型模块树、任务范围和参数预算选择,并给出默认目标、all-linear、MoE 特例与命中检查方法。251 收藏 -
科技周边 · 人工智能 | 23小时前 | JSON · python · 人工智能 · 工程实践 · 结构化输出 · Pydantic JSON Schema AI 结构化输出 模型重试 兜底解析 大模型工程
模型稳定输出 JSON 不能只靠提示词。本文用 JSON Schema、Pydantic 校验、分类重试与受控兜底解析,搭建一条可观测的结构化输出链路。250 收藏 -
bitsandbytes 4-bit 量化只压缩冻结基座权重,LoRA 参数、梯度、优化器状态、激活与 CUDA 工作区仍会占用显存。本文给出 NF4 配置、峰值测量方法和 OOM 调整顺序,说明 QLoRA 单卡训练的真实边界。249 收藏 -
用 OpenAI Structured Outputs 约束嵌套 JSON 时,关键是逐层声明 required,并在每个 object 节点关闭 additionalProperties,再用 nullable 表达业务可选值。247 收藏 -
多模态模型读图前,缩放与裁切会改变细节、图块、token和坐标关系。本文用任务分类、等比缩放、裁切偏移与对照实验说明如何在识别效果和成本之间取舍。247 收藏 -
多模态请求的图片细节等级会改变视觉输入 token,但成本不能只看 low 或 high。本文比较 low、high、original、auto 的适用场景,并给出请求写法、成本拆分和质量复核方法。246 收藏 -
PDF 表格在 RAG 中不能只靠正文抽取。本文用摄取、元素表示和检索核对三层方法,说明如何保留表格结构、图片与页码元数据。244 收藏 -
RAG 文档切片的 overlap 过大,会让相邻片段重复进入上下文,增加索引和推理成本。本文给出重叠比例、配置调整和验证指标。238 收藏 -
AI Agent 的工具调用失败可能是拒绝、超时或结果未知。本文给出失败分类、稳定幂等键、结果复用、指数退避与人工接管的完整设计,避免重复副作用。236 收藏