人工智能技术文章
-
科技周边 · 人工智能 | 1天前 | python · 人工智能 · shuffle Hugging Face Datasets streaming IterableDataset buffer_size
Hugging Face Datasets 的 streaming 模式可用 IterableDataset.shuffle 在有限缓冲区内随机采样,无需下载完整数据集。本文说明 buffer_size、seed、set_epoch、分片顺序以及 take/skip 的调用边界。470 收藏 -
RAG 重排不要用同一个 TopK 同时控制召回和上下文。本文给出 candidate_k 与 final_top_k 的起始范围、三组评估指标、调参顺序和可直接落地的 Python 示例。468 收藏 -
向量检索不应把租户、文档类型等硬约束交给 embedding 猜测。本文以 Qdrant 为例,把过滤字段写入 payload、提前建立 payload index,再用 Filter 绑定向量召回,并说明应用层后置筛选、字段选择性和索引成本的边界。467 收藏 -
Responses API 同时声明多个函数工具时,可用 tool_choice 的 allowed_tools 将当前轮次限制到指定子集,再用 auto、required 或 none 表达调用策略。本文给出参数结构、选择边界和服务端安全检查。463 收藏 -
AI 推理服务的 p95、p99 延迟突然抖动时,不要只看 GPU 利用率。本文用请求、排队、输入处理、模型计算和输出处理的分段指标,结合并发与吞吐变化,判断瓶颈究竟在调度排队还是模型计算。462 收藏 -
no_grad 关闭反向梯度记录且更宽松;inference_mode 进一步关闭视图追踪、版本计数器更新与 forward-mode AD,但推理张量不能进入后续 autograd 计算。本文给出选择表和安全写法。458 收藏 -
扩散模型固定 seed 仍有细节差异,通常不是 seed 失效,而是 Generator 状态、scheduler、精度、CUDA 后端和硬件不同。本文给出一套可复现排查清单。457 收藏 -
Transformers 批量生成时,padding_side 配错会让 decoder-only 模型把补齐 token 当成生成起点。本文用 input_ids、attention_mask 和 generate 的关系说明 left padding 的配置方法、pad_token 处理与回归检查边界。457 收藏 -
本文演示 PEFT 多个 LoRA adapter 的命名加载、加权组合与推理激活,说明 linear、cat、SVD、TIES 和 DARE 的选择边界及评测方法。454 收藏 -
Hugging Face Datasets 开启 streaming 后会返回 IterableDataset。本文用 take、skip 和 shard 解释连续取样、并行分片的差异,以及 shuffle 顺序和性能边界。449 收藏 -
以 Hugging Face InferenceClient 为例,拆解结构化输出失败的三层原因,用最小 JSON Schema 和检查清单快速定位配置、模型兼容性与解析问题。447 收藏 -
向量检索召回低时不要盲目更换嵌入模型。本文用固定评测集、Recall@k 和命中排名,分别拆分切片、嵌入模型与召回阈值问题。446 收藏 -
用多模态模型抽取发票时,不要只保存模型返回的文本。本文用 JSON Schema 设计字段证据对象,把字段值、原图归一化坐标、证据说明和人工复核标记绑定在一起。446 收藏 -
介绍 Hugging Face Evaluate 使用 bootstrap 策略计算指标置信区间的方法,解释 confidence_level、n_resamples、random_state 以及结果中的标准误。438 收藏 -
RAG 检索结果太多时,不要只提高 top_k 再把无关片段塞给模型。本文用租户、文档类型、状态和更新时间说明如何先做元数据过滤,再做向量或混合检索,并根据过滤选择性调整召回策略。437 收藏