人工智能技术文章
-
模型路由不只是按名称转发请求,而是根据任务难度、质量门槛、延迟预算和相对成本选择模型。本文用一个 Python 小项目实现可解释分类、分档选择、失败回退、质量升级和离线评测。147 收藏 -
多模态模型读图前,缩放与裁切会改变细节、图块、token和坐标关系。本文用任务分类、等比缩放、裁切偏移与对照实验说明如何在识别效果和成本之间取舍。247 收藏 -
长文档问答不能只返回文件名。本文给出文档版本、章节锚点、内容块、引用卡片和答案断言的完整映射方法,并补充覆盖率、锚点解析、版本一致性、低证据拒答与回滚检查。257 收藏 -
工具调用型智能体会因超时、重试、工作流回放和多副本竞争重复触发有副作用的动作。本文给出稳定动作键、参数指纹、动作账本、租约、结果复用与外部幂等键的完整设计,并说明未知结果、补偿和监控边界。262 收藏 -
科技周边 · 人工智能 | 4天前 | JSON · python · 人工智能 · 工程实践 · 结构化输出 · Pydantic JSON Schema AI 结构化输出 模型重试 兜底解析 大模型工程
模型稳定输出 JSON 不能只靠提示词。本文用 JSON Schema、Pydantic 校验、分类重试与受控兜底解析,搭建一条可观测的结构化输出链路。250 收藏 -
RAG 检索结果很多却答不准时,先区分召回缺失、候选过杂和上下文丢失,再从语义切块、混合召回、元数据过滤、重排和固定评测集逐层改进。208 收藏 -
ONNX Runtime 动态量化中的 nodes_to_exclude 应按节点名称精确控制。本文给出节点清单、全量量化基线、差异定位、逐组复测和配置冻结的方法。377 收藏 -
本文介绍如何用 Sentence Transformers 的 truncate_dim 与 truncate_embeddings 缩短嵌入向量,计算理论存储节省,并通过离线检索指标选择维度,说明 Matryoshka 模型、归一化、索引迁移和推理性能的边界。165 收藏 -
本文演示 PEFT 多个 LoRA adapter 的命名加载、加权组合与推理激活,说明 linear、cat、SVD、TIES 和 DARE 的选择边界及评测方法。454 收藏 -
本文说明 Accelerate 如何用 device_map=auto 将大模型按显存分配到多块 GPU,并讲清 max_memory、不可拆分层、CPU 与磁盘回退以及多卡推理的性能边界。358 收藏 -
Tokenizers 的 offset mapping 本质是 token 到原始文本的半开字符区间。本文用 Fast Tokenizer 说明 return_offsets_mapping、特殊 token、空白、规范化和溢出窗口的定位方法。328 收藏 -
科技周边 · 人工智能 | 5天前 | python · 人工智能 · shuffle Hugging Face Datasets streaming IterableDataset buffer_size
Hugging Face Datasets 的 streaming 模式可用 IterableDataset.shuffle 在有限缓冲区内随机采样,无需下载完整数据集。本文说明 buffer_size、seed、set_epoch、分片顺序以及 take/skip 的调用边界。470 收藏 -
Diffusers 单文件模型不能靠改后缀变成组件目录。正确做法是用匹配的 Pipeline.from_single_file() 读取权重,再用 save_pretrained() 保存配置、组件子目录和权重文件;配置推断失败时显式提供 config。308 收藏 -
Diffusers 临时禁用 LoRA 不需要卸载权重,调用 disable_lora() 可回到基础模型推理,随后用 enable_lora() 恢复;本文同时区分卸载、删除和多适配器场景。309 收藏 -
Diffusers ModularPipeline 替换单个模型组件时,应先取得组件规格并加载兼容对象,再用 update_components 更新同名槽位。本文说明两种替换写法、加载顺序、配置型组件区别和排错清单。175 收藏