人工智能技术文章
-
讲清 Transformers 使用 bitsandbytes 进行 8-bit/4-bit 量化时,如何用 llm_int8_skip_modules 保留指定模块,并区分跳过量化、dtype 与 CPU float32 offload。359 收藏 -
本文说明 Transformers 在显存不足时如何启用 KV cache 卸载,并给出直接配置、OOM 回退、方案选择与风险检查清单。499 收藏 -
Transformers 的 apply_chat_template 可以通过 generation 块记录 assistant 内容,并返回与 input_ids 对齐的 assistant_masks。本文说明参数组合、模板写法、训练标签转换和全零掩码排查边界。164 收藏 -
Diffusers 单个 LoRA 融合后可先 unfuse_lora 恢复基础权重,再卸载适配器;多 LoRA 或已保存重载的融合模型应重新加载原始基础模型。291 收藏 -
Sentence Transformers 的 L2 归一化不会改变余弦方向,但会改变原始点积和部分距离。本文用对照实验说明何时开启 normalize_embeddings。372 收藏 -
减少大模型裁判的位置偏差,不能只在提示词里要求公平,而应对同一回答对同时运行 A-B 与 B-A 两种顺序,统一还原答案身份,只合并一致判定,并把翻转样本升级为不确定或人工复核。314 收藏 -
OpenAI Realtime API 可通过 session.audio.input.turn_detection 配置 server_vad、semantic_vad 或关闭 VAD。本文讲清阈值、静音时长、eagerness、自动响应与手动提交的取舍。293 收藏 -
用 OpenAI Structured Outputs 约束嵌套 JSON 时,关键是逐层声明 required,并在每个 object 节点关闭 additionalProperties,再用 nullable 表达业务可选值。247 收藏 -
PyTorch 当前 ONNX 导出器应优先用 dynamic_shapes 声明动态输入轴,旧导出路径才使用 dynamic_axes。本文给出 batch、高宽动态的最小写法、元数据检查与常见误区。194 收藏 -
GradScaler 会在反缩放后的梯度含 inf 或 NaN 时跳过对应优化器的 step。本文说明单优化器、多优化器、scale 回退与学习率调度器的判断边界。268 收藏 -
排查 PyTorch DataLoader 多进程中的重复随机值与重复样本,说明 worker seed、第三方随机库、IterableDataset 分片和 generator 的正确配置。316 收藏 -
通过 Transformers 与 Accelerate 的 device_map=auto、max_memory 和 no_split_module_classes,把大模型稳妥分配到多张 GPU,并检查 CPU 或磁盘卸载边界。150 收藏 -
Hugging Face Datasets Streaming 通过 IterableDataset 边迭代边读取超大数据集。本文给出加载、抽样、缓冲打乱、在线变换、分片与训练观测的完整用法和适用边界。148 收藏 -
说明 PEFT LoRA 的 target_modules 如何按模型模块树、任务范围和参数预算选择,并给出默认目标、all-linear、MoE 特例与命中检查方法。251 收藏 -
讲清 Hugging Face Catalog API 的模型与配方关系,并用 huggingface_hub 完成目录筛选、精确创建、状态等待和成本控制。333 收藏