人工智能技术文章
-
按 decoder-only 生成、训练、encoder-only 和 encoder-decoder 任务拆解 Tokenizer 左右填充选择,并说明 attention_mask、pad_token 与标签屏蔽。399 收藏 -
解释 Safetensors 如何用文件头中的 shape、dtype 与 data_offsets 定位权重切片,说明 get_slice、零拷贝、内存映射和 GPU 传输的真实边界。258 收藏 -
MLflow Model Alias 可以把生产代码从固定模型版本号解耦出来。本文用 champion 别名串起模型注册、加载、发布切换和回滚边界,说明 Alias URI 的写法以及不能忽略的版本验证与审计记录。360 收藏 -
拆解 FAISS Index Factory 字符串的组合规则,用 Flat、IVF、PQ、SQ、PCA 和 OPQ 示例说明粗排、压缩、训练与 nprobe 参数应如何分工。100 收藏 -
RAG 重排不要用同一个 TopK 同时控制召回和上下文。本文给出 candidate_k 与 final_top_k 的起始范围、三组评估指标、调参顺序和可直接落地的 Python 示例。468 收藏 -
知识库切片重叠率会同时影响边界语义、重复召回、索引成本和上下文长度。本文用 LangChain 与 Hugging Face 的切分思路说明参数起点、评测方法和不同语料的边界处理。268 收藏 -
介绍 PyTorch ONNX 导出时如何用 dynamic_shapes 和 torch.export.Dim 声明动态批次、动态序列长度,并比较现代 dynamo 导出器与 legacy dynamic_axes 的选择边界。206 收藏 -
no_grad 关闭反向梯度记录且更宽松;inference_mode 进一步关闭视图追踪、版本计数器更新与 forward-mode AD,但推理张量不能进入后续 autograd 计算。本文给出选择表和安全写法。458 收藏 -
torch.compile 出现 graph break 时,先用 fullgraph=True 暴露首个断点,再用 torch._dynamo.explain 和 TORCH_LOGS 分析原因,最后决定重写、隔离还是保留。478 收藏 -
避免 Chat Template 角色格式不一致的关键,是让训练、评测和推理共享同一份 role/content 消息契约,并统一交给 tokenizer.apply_chat_template 序列化。本文给出参数区别、重复特殊 token 的规避方法和集中封装示例。477 收藏 -
Transformers 量化配置选择的关键不只是显存大小,还要看推理、QLoRA 微调、精度容忍度和硬件后端。本文用 BitsAndBytesConfig 对比 int8 与 int4 的适用边界,并给出检查清单。113 收藏 -
介绍 Hugging Face Evaluate 使用 bootstrap 策略计算指标置信区间的方法,解释 confidence_level、n_resamples、random_state 以及结果中的标准误。438 收藏 -
Prompt 变化不能只靠复制文本和人工回忆。本文用模板、变量、模型配置、输入集和输出指标五类记录,搭建可重放、可比较、可回滚的版本流程。412 收藏 -
按实体和来源拆分训练、验证和测试,使用稳定的任务簇键避免评测集泄漏,让模型指标更接近真实泛化能力。233 收藏 -
RAG 应用不要只返回一串链接。本文用 source_id、答案段落和引用集合建立可校验的对齐关系,并给出无证据、多来源冲突与前端展示的处理方式。354 收藏