人工智能技术文章
-
讲清 Transformers 使用 bitsandbytes 进行 8-bit/4-bit 量化时,如何用 llm_int8_skip_modules 保留指定模块,并区分跳过量化、dtype 与 CPU float32 offload。359 收藏 -
本文说明 Accelerate 如何用 device_map=auto 将大模型按显存分配到多块 GPU,并讲清 max_memory、不可拆分层、CPU 与磁盘回退以及多卡推理的性能边界。358 收藏 -
围绕 AI 提示词缓存的稳定前缀组织请求,说明固定指令、工具 schema 与动态问题的排列方法,并用 cached_tokens、cache_write_tokens 和版本化回滚定位缓存失效。357 收藏 -
RAG 检索结果不要直接按 top_k 全量送入模型。本文用文档身份、规范化文本和语义多样性三层策略去重,再按系统指令、问题、证据与回答余量分配上下文预算,给出可迁移的 Python 实现与参数调优指标。357 收藏 -
vLLM Prefix Caching 适合重复长前缀、长文档和多轮会话,但收益集中在 prefill。本文从前缀稳定性、开启配置、测量方法、缓存容量和多租户隔离几个方面判断是否值得使用。356 收藏 -
RAG 应用不要只返回一串链接。本文用 source_id、答案段落和引用集合建立可校验的对齐关系,并给出无证据、多来源冲突与前端展示的处理方式。354 收藏 -
模型返回枚举值错误时,先区分 schema 不匹配、拒答和输出不完整,再用 JSON Schema 的 enum 约束允许值,并保存脱敏原始响应。本文给出结构化输出的约束、解析、重试和监控做法。345 收藏 -
用 JSONL 固定安全过滤回归样本的字段、动作和原因码,再按阶段定位误放行、误拦截与边界样本漂移。345 收藏 -
Hugging Face Datasets 的 streaming 模式会返回 IterableDataset,按迭代按需读取远程或本地分片。本文给出变换、缓冲区打乱、多 worker、训练轮次和检查点恢复的生产写法。337 收藏 -
讲清 Hugging Face Catalog API 的模型与配方关系,并用 huggingface_hub 完成目录筛选、精确创建、状态等待和成本控制。333 收藏 -
Tokenizers 的 offset mapping 本质是 token 到原始文本的半开字符区间。本文用 Fast Tokenizer 说明 return_offsets_mapping、特殊 token、空白、规范化和溢出窗口的定位方法。328 收藏 -
结构化输出校验失败时,不要只记录 ValidationError。本文把原始响应保存、拒答与截断判断、JSON 解析、Schema 校验和业务校验拆开,给出一套可脱敏、可重放、可定位的应用层处理方式。324 收藏 -
RAG 遇到订单号、设备编号、产品型号等精确词时,单纯向量检索可能把关键文档排到后面。本文用关键词检索加向量检索的混合召回,再用 RRF 或可解释权重合并结果。320 收藏 -
AI Agent 调用工具时经常漏传必填字段,问题通常不在提示词,而在工具契约没有收紧。本文用 JSON Schema 拆分必填、类型、额外字段和失败回传,给出可落地的校验与重试边界。316 收藏 -
排查 PyTorch DataLoader 多进程中的重复随机值与重复样本,说明 worker seed、第三方随机库、IterableDataset 分片和 generator 的正确配置。316 收藏